핵심 요점
- 무료·오픈소스로 Apache 2.0 라이선스이며, UC 버클리, 스탠퍼드, LMSYS와 관련된 연구에서 탄생
- RadixAttention은 요청별 캐시 분리 대신 radix 트리를 사용해 공통 접두사를 공유하는 요청 간 KV 캐시 항목을 자동으로 재사용
- 구조화된 출력 — JSON 스키마와 정규식 제약 — 은 사후 처리 필터가 아니라 압축 유한 상태 기계를 통해 디코딩 중에 강제됨
- 여러 호출 LLM 프로그램 작성을 위한 파이썬 임베디드 프런트엔드 DSL(
sgl.gen,sgl.select,sgl.fork) 제공 python -m sglang.launch_server로 시작하는 내장 OpenAI 호환 API 서버- 연속 배칭, 텐서 병렬화, FP8·INT4·AWQ·GPTQ를 포함한 양자화 포맷 지원
- 주력이자 가장 잘 지원되는 하드웨어는 NVIDIA GPU이며, 프로젝트는 AMD·Intel 등 다른 가속기 백엔드도 문서화하지만 실제 지원 범위는 더 좁음
- 단일 사용자용 데스크톱 앱이 아님 — 그래픽 설치 프로그램이 없으며, llama.cpp나 Ollama처럼 CPU 전용이나 Apple Silicon을 중심으로 만들어지지 않음
📍 한 문장으로
SGLang은 UC 버클리, 스탠퍼드, LMSYS와 관련된 연구에서 시작된, LLM과 비전-언어 모델을 위한 무료, Apache 2.0 라이선스 서빙 프레임워크로, RadixAttention을 통해 공통 접두사를 공유하는 요청 간 KV 캐시 상태를 자동으로 재사용하고 디코딩 루프 내에서 구조화된 출력을 강제한다.
💬 쉽게 말하면
SGLang은 데스크톱 채팅 앱이 아니라, 두 가지를 동시에 해내도록 만들어진 서버 소프트웨어다. 시스템 프롬프트나 대화 이력을 반복하는 경우를 포함해 많은 동시 요청을 효율적으로 처리하는 것, 그리고 모델의 출력이 지정한 JSON 스키마나 패턴에 실제로 일치하도록 보장하는 것이다.
📌참고: 이 글은 SGLang의 공식 GitHub 저장소와 공개 문서를 기반으로 하며, 독립적인 벤치마크에 기반한 것이 아니다. SGLang 자체 자료는 특정 릴리스 벤치마크에서 RadixAttention과 JSON 디코딩에 대한 구체적인 가속 배수를 인용하지만, 이는 워크로드, 하드웨어, 테스트된 버전에 크게 좌우되며 SGLang과 vLLM 모두 자사에 유리한 벤치마크를 발표하므로 이 글에서는 그러한 수치를 보편적인 값으로 반복하지 않는다.
SGLang이란 무엇인가
SGLang은 대규모 언어 모델과 비전-언어 모델을 위한 무료, Apache 2.0 라이선스 서빙 프레임워크다. UC 버클리, 스탠퍼드, 그리고 Chatbot Arena를 운영하는 바로 그 커뮤니티인 LMSYS 조직과 관련된 연구에서 시작되었으며, 현재는 GitHub 조직 sgl-project 아래에서 개발되고 있다. 로컬에서 모델과 대화하는 단일 사용자를 위해 주로 만들어진 도구와 달리, SGLang은 서로 겹치는 두 가지 문제를 겨냥한다. 많은 동시 요청을 효율적으로 처리하는 것, 그리고 모델의 출력이 JSON과 같은 구조화된 형식을 따르도록 보장하는 것으로, 이는 함수 호출, 에이전트 파이프라인, 기타 기계가 소비하는 출력에 중요하다.
- UC 버클리, 스탠퍼드, LMSYS와 관련된 연구에서 탄생했으며, 현재는 오픈소스 조직
sgl-project아래에서 개발됨 - Apache 2.0 라이선스: 소스 코드는 라이선스 조건에 따라 사용, 수정, 재배포를 위해 공개되어 있음
- LLM 프로그램 작성을 위한 파이썬 임베디드 프런트엔드 DSL과 함께 설계된 백엔드 런타임(SGLang Runtime, 흔히 SRT로 축약됨)을 결합
- Hugging Face Transformers 호환 모델 체크포인트를 로드하며, 대부분 모델에서 별도 변환 단계 없이 Llama, Qwen, Mistral, DeepSeek 등의 모델 계열을 포괄
- 매일 대량의 토큰을 생성하는 프로덕션 배포 사례를 문서화하고 있으며, 자체 자료에서 여러 기업과 연구 기관을 채택 사례로 언급
RadixAttention이란 무엇이고 왜 중요한가
RadixAttention은 SGLang이 가장 잘 알려진 메모리 관리 기술이다. 실제 많은 LLM 워크로드는 공통 접두사를 공유하는 여러 생성 호출을 발생시킨다 — 모든 요청에서 동일한 시스템 프롬프트, 동일한 퓨샷 예시, 또는 진행 중인 대화의 이전 턴 등이다. 매 호출마다 이 공유 접두사의 어텐션 키-값(KV) 캐시를 다시 계산하는 것은 GPU 연산과 메모리를 낭비한다. RadixAttention은 대신 완료되거나 진행 중인 요청 모두의 KV 캐시 항목을, 토큰 시퀀스로 인덱싱된 트리 구조인 radix 트리에 저장한다. 이를 통해 새로운 요청은 이전 요청과 공유하는 어떤 접두사의 캐시든 자동으로 찾아 재사용할 수 있으며, 개발자가 이 재사용을 수동으로 추적하거나 관리할 필요가 없다.
- radix 트리 자료구조를 사용해 토큰 시퀀스 접두사를 공유하는 요청 간 KV 캐시 항목을 자동으로 매칭하고 재사용
- 반복되는 시스템 프롬프트, 공유되는 퓨샷 예시, 여러 턴의 대화 이력에서 나온 접두사를 포괄 — 단순히 그대로 반복되는 동일 요청뿐만이 아님
- radix 트리에 최소 최근 사용(LRU) 축출 정책을 적용해 트리가 커짐에 따라 캐시 메모리를 회수하고 재사용할 수 있게 함
- 연속 배칭 및 페이지 단위·블록 단위 KV 캐시 할당과 함께 작동하여, SGLang이 요청이 도착하고 완료됨에 따라 진행 중인 배치에 요청을 추가하고 제거할 수 있게 함
프런트엔드 DSL과 구조화된 출력은 실제로 무엇을 하는가
SGLang은 핵심 서빙 기능 외에 관련이 있지만 별개인 두 가지 기능을 제공한다. LLM 프로그램 작성을 위한 파이썬 임베디드 프런트엔드 언어와, 엔진 수준에서의 구조화된 출력 형식 강제이다.
SGLang에는 어떤 하드웨어가 필요한가
SGLang의 주력이자 가장 잘 지원되는 대상은 NVIDIA GPU이며, 프로젝트 자체 자료에 설명된 대부분의 프로덕션 배포는 NVIDIA 하드웨어에서 실행된다. 프로젝트는 추가 백엔드도 문서화하고 있지만, 지원 범위와 실제 채택 정도는 모두 동일하지는 않다.
NVIDIA GPU(CUDA)
- 세부 사항:
- 데이터센터급 GPU부터 최신 소비자용/워크스테이션 카드까지 아우르는, 주력이자 가장 성숙한 대상. 여러 NVIDIA GPU에 걸친 텐서 병렬 서빙이 잘 문서화되어 있다.
AMD GPU(ROCm)
- 세부 사항:
- ROCm을 통해 AMD Instinct급 가속기를 지원하는 백엔드로 문서화되어 있지만, 실제 채택과 커뮤니티 지원 범위는 CUDA 경로보다 좁다.
Intel Xeon CPU 및 Gaudi 가속기
- 세부 사항:
- 프로젝트가 Intel 하드웨어를 위해 문서화한 추가 백엔드. NVIDIA GPU보다 규모가 작고 검증이 덜 된 배포 경로로 간주해야 한다.
Google TPU 및 Ascend NPU
- 세부 사항:
- 이미 Google Cloud TPU나 Huawei Ascend 인프라에서 운영 중인 팀을 위해 문서화된 백엔드.
Apple Silicon(Mac)
- 세부 사항:
- 공식적으로 유지 관리되는 일급 경로가 아니다. SGLang은 단일 Mac에서의 로컬 사용이 아니라 GPU 기반 데이터센터 및 워크스테이션 하드웨어를 중심으로 만들어졌다.
단일 Mac이나 CPU 전용 머신에서 모델을 실행하는 것이 목표라면, SGLang은 그 용도로 만들어진 도구가 아니다 — llama.cpp와 이를 기반으로 만든 Ollama, LM Studio 같은 도구는 CPU와 Apple Silicon 하드웨어를 직접 겨냥하며 그런 시나리오에 더 적합하다.
SGLang은 어떤 양자화 포맷을 지원하는가
SGLang은 메모리 사용량을 줄이고 많은 경우 처리량을 높이기 위해 낮은 수치 정밀도로 모델을 서빙하는 것을 지원하며, 여러 확립된 양자화 포맷을 문서화하고 있다.
FP8
- 세부 사항:
- 하드웨어 FP8 지원이 있는 NVIDIA GPU 세대에서 지원되는 8비트 부동소수점 정밀도로, 약간의 정밀도를 FP16/BF16보다 낮은 메모리 사용량과 더 빠른 실행 속도와 교환한다.
FP4
- 세부 사항:
- 이를 지원하는 최신 세대 NVIDIA 하드웨어를 위해 프로젝트가 문서화한, 더 새롭고 정밀도가 더 낮은 부동소수점 포맷.
AWQ
- 세부 사항:
- Activation-aware Weight Quantization의 약자로, 널리 사용되는 4비트 가중치 양자화 방법이며 Hugging Face에서 커뮤니티가 공개한 사전 양자화 모델이 있다.
GPTQ
- 세부 사항:
- 일반적으로 사전 양자화된 체크포인트 형태로 배포되는 학습 후 양자화 방법으로, 이 역시 보통 4비트 정밀도로 실행된다.
INT4
- 세부 사항:
- 추가적인 메모리 절감을 위해 AWQ, GPTQ와 함께 프로젝트가 문서화한 더 낮은 정밀도의 정수 양자화 경로.
이 글에는 각 포맷에 대해 독립적으로 측정된 품질 손실 수치가 포함되어 있지 않다 — 이는 모델 아키텍처와 작업에 따라 달라지므로, 자신의 프롬프트에서 몇 가지 포맷의 출력을 비교해 보는 것이 자신의 워크로드에 맞는 트레이드오프를 판단하는 가장 신뢰할 수 있는 방법이다.
SGLang의 OpenAI 호환 서버는 무엇을 제공하는가
python -m sglang.launch_server를 실행하면 OpenAI API 프로토콜을 구현한 HTTP 서버가 시작되며, 이미 OpenAI API용으로 만들어진 애플리케이션과 SDK는 흔히 베이스 URL과 모델명만 바꿔서 자체 호스팅된 SGLang 인스턴스를 가리키게 할 수 있다.
- OpenAI API 기반 클라이언트 코드를 바로 대체할 수 있는, OpenAI 호환 채팅 완성 및 완성 엔드포인트
- 설정 가능한 호스트와 포트(프로젝트 자체 예시에서는 흔히
http://localhost:30000사용) - JSON 스키마나 정규식 제약이 있는 생성을 위한, API를 통해 노출되는 요청 단위 구조화된 출력 파라미터
- 서버 시작 시 설정하는, 텐서 병렬 크기·메모리 할당·양자화 포맷을 위한 엔진 플래그
- 하나의 로드된 기본 모델 위에서 여러 LoRA 어댑터를 서빙하는 기능 지원
SGLang을 설치하고 실행하는 방법은
SGLang은 파이썬 패키지로 배포되며, 일반적으로 NVIDIA GPU와 호환 CUDA 드라이버가 있는 파이썬 환경에 설치한다.
- 1지원되는 NVIDIA GPU와 최신 CUDA 드라이버가 설치되어 있는지 확인한다(해당 백엔드 중 하나를 대상으로 한다면 AMD/Intel/TPU 관련 설치 안내를 프로젝트 문서에서 확인한다).
- 2파이썬 가상 환경을 만든 다음 SGLang을 설치한다. 예: `pip install "sglang[all]"`.
- 3Hugging Face의 모델로 OpenAI 호환 서버를 시작한다. 예:
python -m sglang.launch_server --model-path meta-llama/Llama-3.1-8B-Instruct --host 127.0.0.1 --port 30000. - 4
base_url="http://127.0.0.1:30000/v1"을 가리키는 파이썬openai패키지 등 OpenAI API 호환 클라이언트로 기본적인 채팅 요청을 보낸다. - 5JSON으로 제약된 응답을 얻으려면 요청의 구조화된 출력 파라미터에 JSON 스키마를 전달해, 프롬프트에서 단순히 JSON을 요청하는 대신 서버가 디코딩 중에 스키마를 강제하도록 한다.
- 6다중 GPU 서빙을 위해서는 텐서 병렬 플래그를 추가한다. 예: 모델을 두 개의 GPU로 분할하는
--tp-size 2. - 7베이스 URL과 모델명만 변경해 기존 OpenAI API 클라이언트 코드를 자체 호스팅 서버로 향하게 한다.
SGLang을 실행하려면 GPU가 필요한가?
테스트 이상의 용도라면 필요하다 — SGLang의 주력이자 가장 잘 지원되는 대상은 NVIDIA GPU다. 프로젝트는 다른 가속기 백엔드도 문서화하고 있지만, 이들은 주요 배포 경로가 아니다.
SGLang에서 보장된 JSON 출력을 얻을 수 있는가?
가능하다 — 요청의 구조화된 출력 파라미터에 JSON 스키마를 전달하면, SGLang은 프롬프트에서 단순히 모델에 JSON 생성을 요청하는 대신 스키마를 위반할 토큰을 마스킹함으로써 디코딩 중에 이를 강제한다.
SGLang은 vLLM과 비교해 어떤가
SGLang과 vLLM은 가장 널리 논의되는 두 가지 오픈소스 GPU 기반 LLM 서빙 엔진으로, 둘 다 Apache 2.0 라이선스이며 단일 사용자 데스크톱 채팅이 아니라 프로덕션 다중 사용자 서빙을 겨냥한다. 두 프로젝트 모두 서로에게 유리한 비교를 보여주는 벤치마크를 발표하고 있으며, 이 글은 그 비교에 판정을 내리지 않고 각 프로젝트가 문서화한 설계와 주장을 설명한다.
대표 캐시 기술
- SGLang:
- RadixAttention — 임의의 공통 접두사를 공유하는 요청 간 radix 트리 기반 자동 KV 캐시 재사용.
- vLLM:
- PagedAttention — 과도하게 예약된 할당으로 인한 메모리 낭비를 줄이는, 페이지 크기의 비연속 KV 캐시 블록.
구조화된 출력
- SGLang:
- 엔진 수준의 JSON 스키마 및 정규식 강제는 압축 유한 상태 기계 위에 구축된, 핵심적이고 상세히 문서화된 기능이다.
- vLLM:
- 통합된 문법 백엔드를 통해 구조화된/가이드된 디코딩도 지원하지만, 대표 기능이라기보다 더 넓은 기능 세트의 일부로 문서화되어 있다.
프로그래밍 모델
- SGLang:
- API 서버 외에도 여러 호출 LLM 프로그램을 위한 파이썬 임베디드 프런트엔드 DSL(
sgl.gen,sgl.select,sgl.fork)을 제공한다. - vLLM:
- 주로 API 서버나 파이썬 라이브러리 호출로 접근하며, 이에 상응하는 프로그램 작성용 DSL은 제공하지 않는다.
기원
- SGLang:
- UC 버클리, 스탠퍼드, Chatbot Arena를 운영하는 LMSYS 조직과 관련된 연구.
- vLLM:
- UC 버클리의 Sky Computing Lab에서 시작됨.
처리량 주장
- SGLang:
- 특정 워크로드에서 RadixAttention과 JSON 디코딩의 배수를 인용하는 릴리스 벤치마크를 발표한다.
- vLLM:
- 자체 릴리스 벤치마크를 발표한다. 단일한 보편적 속도 수치보다는 PagedAttention의 메모리 효율성 근거를 설명한다.
두 엔진 중 어느 쪽의 마케팅 벤치마크도 중립적인 판정으로 받아들여서는 안 된다 — 둘 다 그 프로젝트가 선택한 워크로드에서 자사에 더 유리해 보이는 결과를 낸 해당 프로젝트 자신이 수행한 것이다. 처리량이 의사결정에 중요하다면, 자신의 모델·하드웨어·트래픽 패턴으로 두 엔진을 직접 테스트하는 것이 이 글을 포함한 어떤 단일 기사의 수치보다 신뢰할 만하다.
SGLang은 llama.cpp, TensorRT-LLM과 비교해 어떤가
SGLang, llama.cpp, TensorRT-LLM은 하드웨어 유연성과 최고 수준 최적화 사이의 스펙트럼에서 서로 다른 지점에 위치한다.
SGLang
- 세부 사항:
- Apache 2.0 라이선스, 파이썬 기반이며 RadixAttention과 엔진 수준 구조화된 출력을 중심으로 구축되었다. Hugging Face Transformers 호환 모델을 직접 로드하며, NVIDIA GPU가 주력 대상이고 추가 백엔드도 문서화되어 있다.
llama.cpp
- 세부 사항:
- MIT 라이선스의 C/C++ 추론 엔진으로, GGUF 모델 포맷을 중심으로 구축되었으며 CPU, Apple Silicon, GPU에서 동작한다. 다중 GPU 프로덕션 클러스터보다는 단일 머신 및 엣지 배포를 겨냥한다.
TensorRT-LLM
- 세부 사항:
- NVIDIA GPU 전용으로 만들어진 NVIDIA의 엔진. 모델은 대상 GPU에 최적화된 TensorRT 엔진으로 사전에 컴파일되며, 이는 그 특정 하드웨어에서 강력한 성능을 낼 수 있지만 컴파일 단계와 SGLang보다 낮은 하드웨어 간 유연성이라는 대가를 치른다.
이 글은 이 세 엔진을 서로 독립적으로 벤치마크하지 않았으며 어느 것이 보편적으로 더 빠르다고 주장하지 않는다 — 처리량은 모델, 하드웨어, 배치 특성, 각 엔진의 버전에 크게 좌우된다. vLLM, TGI, NVIDIA NIM까지 함께 다루는 배포 중심 비교는 엔터프라이즈 추론 서버 가이드를 참조하라.
SGLang은 누구에게 적합한가
SGLang은 GPU 인프라에서 많은 동시 사용자나 애플리케이션에 모델을 서빙하는 팀, 특히 반복되는 프롬프트 접두사가 있거나 구조화된 출력에 대한 엄격한 요구사항이 있는 워크로드에 적합하다. 자신의 컴퓨터에서 모델과 가장 빠르게 대화할 방법을 찾는 사람에게는 적합하지 않다.
SGLang과 대안 한눈에 비교
이 도구들은 단일 사용자 대 프로덕션 서빙 스펙트럼과, 처리량 대 구조화된 출력 강조 스펙트럼에서 서로 다른 위치에 있다.
SGLang
- 인터페이스 및 설정:
- 파이썬 패키지.
python -m sglang.launch_server로 시작하는 OpenAI 호환 API 서버. 대부분의 배포에서 NVIDIA GPU와 CUDA가 필요하다. - 가장 적합한 용도:
- 접두사 재사용이 많거나 구조화된(JSON/정규식) 출력에 대한 엄격한 요구사항이 있는 고동시성 GPU 서빙.
vLLM
- 인터페이스 및 설정:
- 파이썬 패키지.
vllm serve로 시작하는 OpenAI 호환 API 서버. 대부분의 배포에서 NVIDIA GPU와 CUDA가 필요하다. - 가장 적합한 용도:
- 구조화된 출력을 최우선으로 하는 설계에 초점을 맞추지 않은, 프로덕션 환경에서의 폭넓은 고처리량 다중 사용자 GPU 서빙.
Ollama
- 인터페이스 및 설정:
- CLI와 REST API로, 대부분의 플랫폼에서 llama.cpp를 백엔드로 사용한다고 흔히 알려져 있다. 명령어 하나로 설치하고, 명령어 하나로 모델을 내려받아 실행한다.
- 가장 적합한 용도:
- 빌드 단계나 GPU 없이 단일 사용자용으로 로컬 모델을 가장 빠르게 실행하는 방법.
llama.cpp
- 인터페이스 및 설정:
- CLI, 내장 웹 UI, llama-server를 통한 OpenAI 호환 API. 소스에서 빌드하거나 사전 빌드된 바이너리를 사용한다. CPU나 GPU에서 동작한다.
- 가장 적합한 용도:
- 엔진 수준의 직접 제어, 임베디드/엣지 배포, CPU 또는 Apple Silicon 하드웨어.
이 글은 이 도구들 간의 속도나 출력 품질을 독립적으로 벤치마크하지 않았으며 어느 하나가 기술적으로 우수하다고 주장하지 않는다 — 위 비교는 문서화된 아키텍처, 설정, 접근 모델에 관한 사실만을 다룬다. 이 셋 사이의 처리량과 설정 복잡도에 특화된 비교는 llama.cpp vs. Ollama vs. vLLM 비교를, vLLM·TGI·NVIDIA NIM을 배포 관점에서 살펴보려면 엔터프라이즈 추론 서버 가이드를 참조하라.
이 글이 다루지 않는 것
이 글은 SGLang의 공개 문서와 저장소를 바탕으로 작성된 해설 기사이며, 직접 수행한 벤치마크 보고서가 아니다.
- SGLang이나 그 비교 대상에 대해 독립적으로 측정된 처리량, 지연 시간, 초당 요청 수 수치는 없다 — 이는 GPU, 모델, 배치 구성, 버전에 크게 좌우된다
- RadixAttention이나 JSON 디코딩에 대해 SGLang 자체가 주장하는 가속 배수에 대한 독립적인 검증은 없다 — 이는 프로젝트의 릴리스 벤치마크에서 나온 것이지 제3자 측정이 아니다
- SGLang 코드베이스에 대한 한 줄 한 줄의 보안 감사는 없다 — 오픈소스이고 Apache 2.0 라이선스이므로 코드 자체는 검토가 가능하다
- 지원되는 모든 하드웨어 백엔드, 엔진 플래그, 배포 오케스트레이션 옵션(Kubernetes, 클라우드별 설정)에 대한 완전한 커버리지는 없다 — 이 글은 대부분의 팀이 가장 먼저 검토하는 개념과 플래그에 초점을 맞춘다
- SGLang 자체가 지원 계약을 맺은 벤더 제품이 아니라 커뮤니티 오픈소스 프로젝트이므로, 상업적 지원 계약이나 관리형 SGLang 호스팅 서비스에 대한 커버리지는 없다
SGLang을 시도할 때 흔한 실수
SGLang과 관련된 대부분의 마찰은 그것을 단일 사용자용 데스크톱 도구처럼 다루거나, 실제로는 접두사를 공유하지 않는 워크로드에 RadixAttention이 도움이 될 것이라 기대하는 데서 비롯된다.
자주 묻는 질문
SGLang이란 무엇인가?
SGLang은 UC 버클리, 스탠퍼드, Chatbot Arena를 운영하는 LMSYS 조직과 관련된 연구에서 시작된, 대규모 언어 모델과 비전-언어 모델을 위한 무료, Apache 2.0 라이선스 서빙 프레임워크다. 공통 접두사를 공유하는 요청 간에 KV 캐시를 자동으로 재사용하는 기술인 RadixAttention으로 가장 잘 알려져 있다.
SGLang은 무료인가?
그렇다. SGLang은 Apache 2.0 라이선스로 배포되는 무료 오픈소스 소프트웨어로, 직접 실행하는 데 구독이나 계정이 필요하지 않다.
RadixAttention이란 무엇인가?
RadixAttention은 완료되거나 진행 중인 요청의 어텐션 KV 캐시를 radix 트리에 저장하는 SGLang의 기술로, 시스템 프롬프트, 퓨샷 예시, 이전 대화 턴 등 토큰 시퀀스 접두사를 공유하는 새로운 요청이 재계산 대신 일치하는 캐시를 자동으로 재사용할 수 있게 한다.
SGLang은 유효한 JSON 출력을 보장하는가?
요청에 SGLang의 구조화된 출력 파라미터로 JSON 스키마가 포함되면, 엔진은 각 디코딩 단계마다 스키마를 위반할 토큰을 마스킹하며, 이는 사후 검증이 아니라 구조적으로 출력이 스키마를 준수하도록 설계된 것이다. 이러한 파라미터를 사용하지 않고 프롬프트 텍스트에서 단순히 JSON을 요청하는 것만으로는 이 보장을 얻을 수 없다.
SGLang에는 GPU가 필요한가?
실제 워크로드라면 필요하다 — SGLang의 주력이자 가장 잘 지원되는 대상은 NVIDIA GPU다. 프로젝트는 AMD, Intel 및 기타 가속기 백엔드도 문서화하고 있지만 이들은 주요 배포 경로가 아니며, 일급 Apple Silicon 지원도 없다.
SGLang은 어떤 양자화 포맷을 지원하는가?
SGLang은 FP8, 최신 하드웨어용 FP4, AWQ, GPTQ, INT4를 포함한 여러 포맷을 지원하며, 이러한 포맷의 사전 양자화된 모델 다수가 Hugging Face에 공개되어 있다.
SGLang이 vLLM보다 나은가?
두 프로젝트 어느 쪽의 자체 벤치마크도 이에 대한 중립적인 판정이 될 수 없다 — 둘 다 자사에 유리한 결과를 발표한다. SGLang은 RadixAttention의 접두사 기반 캐시 재사용과 엔진 수준 구조화된 출력을 대표 기능으로 강조하고, vLLM은 PagedAttention의 메모리 효율성을 강조한다. 어느 쪽이 더 적합한지는 워크로드의 접두사 공유 패턴과 구조화된 출력이 엄격한 요구사항인지에 달려 있다 — 위 비교표를 참조하라.
SGLang에는 OpenAI 호환 API가 있는가?
있다. python -m sglang.launch_server를 실행하면 OpenAI API 프로토콜을 구현한 서버가 시작되며, OpenAI API용으로 만들어진 많은 애플리케이션이 베이스 URL과 모델명만 바꿔서 자체 호스팅된 SGLang 인스턴스를 가리킬 수 있다.
SGLang의 프런트엔드 DSL은 무엇에 쓰이는가?
여러 병렬 하위 생성으로 분기하고 결과를 병합하는 것과 같은 여러 단계 LLM 프로그램을, 개별 API 호출을 수동으로 오케스트레이션하는 대신 일반 파이썬 코드로 작성하기 위한 sgl.gen, sgl.select, sgl.fork 등을 포함한 일련의 파이썬 프리미티브다.
SGLang은 누가 만들었으며, RadixArk는 무엇인가?
SGLang은 UC버클리, 스탠퍼드, 그리고 Chatbot Arena를 운영하는 LMSYS 조직을 잋는 연구에서 시작되었습니다. 2026년 SGLang 공동 개발자인 Ying Sheng과 Banghua Zhu가 AI 인프라 스타트업 RadixArk를 설립했으며, Accel 주도로 시드 자금 1억 달러를 유치해 SGLang 관련 서비스를 상용화하면서도 오픈소스 개발을 계속하고 있습니다 — 핵심 프레임워크는 여전히 Apache 2.0 라이선스의 무료 소프트웨어입니다.
