모델부터 하드웨어까지, 하나의 스택
SDK가 모델을 컴파일해 스트리밍 스케줄로 바꾸면, 런타임이 RIGEL에서 실행합니다. 각 계층은 따로 써도 되고, 하나의 파이프라인으로 묶어도 됩니다.
모델 · LLM / 멀티모달PyTorch · Hugging Face
Tesser SDK · 컴파일러 · 런타임Serving · Quantization
커널 라이브러리BF16 · FP8 · INT8/4
RIGEL 하드웨어 · TSFPCIe · NXT Server
세 줄이면 서빙 시작
설치하고 모델을 컴파일하면 바로 토큰이 나옵니다. 코드를 바꾸지 않고 기존 파이프라인에 붙습니다.
플랫폼 구성
01
컴파일러
프레임워크 그래프를 스트리밍 스케줄로 변환하고 커널을 자동 융합합니다.
02
런타임 · 서빙
연속 배칭과 KV 캐시 관리로 동시성은 높게, 지연은 낮게 유지합니다.
03
양자화
정확도 손실을 최소한으로 줄여 FP8·INT8/4 양자화를 적용합니다.
04
오케스트레이션
멀티 카드·멀티 노드 스케줄링과 관측성 도구를 기본 제공합니다.
지원 모델
전체 모델 목록 →Qwen 3-32BLLM
Llama 3.1-70BLLM
Mixtral 8×7BMoE
Gemma 2-27BLLM
SDXLVision
Whisper LargeAudio
3단계로 시작하기
01
설치
pip 한 줄로 SDK와 런타임을 설치합니다. Linux x86-64를 지원합니다.
02
컴파일
모델과 정밀도만 정하면 스트리밍 스케줄로 변환됩니다.
03
서빙
런타임을 띄우고 토큰을 스트리밍합니다. OpenAI 호환 API를 제공합니다.
