Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/SGLang explicado: RadixAttention y serving estructurado de LLM (2026)
Overview & Reference

SGLang explicado: RadixAttention y serving estructurado de LLM (2026)

·13 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

**SGLang es un framework de serving gratuito y de código abierto (Apache 2.0) para modelos de lenguaje grandes y modelos de visión-lenguaje, originado a partir de investigación vinculada a UC Berkeley, Stanford y la organización LMSYS detrás de Chatbot Arena.** Su diferenciador técnico clave es RadixAttention, que almacena la caché KV de atención de solicitudes completadas y en curso en un árbol radix, de modo que cualquier solicitud nueva que comparta un prefijo — un prompt del sistema, ejemplos few-shot o un turno anterior de la misma conversación — pueda reutilizar automáticamente las entradas de caché correspondientes en lugar de recalcularlas. SGLang también incluye un lenguaje frontend embebido en Python (sgl.gen, sgl.select y primitivas relacionadas) para escribir programas de LLM con múltiples llamadas, y aplica la salida estructurada — esquemas JSON y patrones regex — directamente dentro del bucle de decodificación en lugar de como un paso de posprocesamiento. Incluye un servidor compatible con OpenAI (python -m sglang.launch_server), documenta las GPU NVIDIA como su objetivo principal y mejor soportado, con backends adicionales de AMD, Intel y otros, y — al igual que vLLM — está construido para el serving respaldado por GPU en lugar del caso de uso de chat local de un solo usuario que apuntan herramientas como Ollama y LM Studio.

SGLang es un framework de serving gratuito y con licencia Apache 2.0 para modelos de lenguaje grandes y modelos de visión-lenguaje, originado a partir de investigación vinculada a UC Berkeley, Stanford y la organización LMSYS detrás de Chatbot Arena. Su aporte técnico principal es RadixAttention, una técnica de reutilización automática y detallada de la caché KV entre múltiples llamadas de generación que comparten un prefijo común — como un prompt del sistema repetido, ejemplos few-shot o una conversación de varios turnos. SGLang combina ese backend con un lenguaje frontend embebido en Python para escribir programas de LLM con múltiples llamadas, y con soporte de salida estructurada a nivel de motor (esquemas JSON y restricciones regex aplicadas durante la decodificación), posicionándolo tanto como un motor centrado en la generación estructurada y cargas de trabajo agénticas como en el rendimiento bruto.

SGLang explicado: RadixAttention y serving estructurado de LLM (2026)

Conclusiones clave

  • Gratuito y de código abierto con licencia Apache 2.0, originado a partir de investigación vinculada a UC Berkeley, Stanford y LMSYS
  • RadixAttention reutiliza automáticamente entradas de caché KV entre solicitudes que comparten un prefijo, usando un árbol radix en lugar de aislamiento de caché por solicitud
  • La salida estructurada — esquemas JSON y restricciones regex — se aplica durante la decodificación mediante una máquina de estados finitos comprimida, no como filtro de posprocesamiento
  • Incluye un DSL frontend embebido en Python (sgl.gen, sgl.select, sgl.fork) para escribir programas de LLM con múltiples llamadas
  • Servidor de API compatible con OpenAI integrado, iniciado con python -m sglang.launch_server
  • Soporta batching continuo, paralelismo de tensores y formatos de cuantización incluyendo FP8, INT4, AWQ y GPTQ
  • El hardware principal y mejor soportado son las GPU NVIDIA; el proyecto también documenta backends de AMD, Intel y otros con cobertura real más limitada
  • No es una app de escritorio de un solo usuario — sin instalador gráfico, y no está construido alrededor de hardware exclusivamente CPU o Apple Silicon como llama.cpp y Ollama

📍 En una frase

SGLang es un framework de serving gratuito, con licencia Apache 2.0, para LLM y modelos de visión-lenguaje, originado a partir de investigación vinculada a UC Berkeley, Stanford y LMSYS, que usa RadixAttention para reutilizar automáticamente el estado de la caché KV entre solicitudes que comparten un prefijo común y aplica salida estructurada dentro del bucle de decodificación.

💬 En términos simples

En lugar de una app de chat de escritorio, SGLang es software de servidor diseñado para dos cosas a la vez: servir eficientemente muchas solicitudes concurrentes — especialmente las que repiten un prompt del sistema o un historial de conversación — y garantizar que la salida del modelo realmente coincida con un esquema JSON o patrón especificado.

📌Nota: Este artículo se basa en el repositorio de GitHub oficial de SGLang y su documentación pública, no en benchmarks independientes. Los propios materiales de SGLang citan multiplicadores de aceleración específicos para RadixAttention y la decodificación JSON en benchmarks de versiones concretas; este artículo no los repite como cifras universales, ya que dependen de la carga de trabajo, el hardware y la versión probada, y tanto SGLang como vLLM publican benchmarks favorables a sí mismos.

¿Qué es SGLang?

SGLang es un framework de serving gratuito, con licencia Apache 2.0, para modelos de lenguaje grandes y modelos de visión-lenguaje. Se originó a partir de investigación vinculada a UC Berkeley, Stanford y la organización LMSYS — la misma comunidad detrás de Chatbot Arena — y hoy se desarrolla bajo la organización de GitHub sgl-project. A diferencia de herramientas construidas principalmente para un único usuario que conversa localmente con un modelo, SGLang apunta a dos problemas superpuestos: servir eficientemente muchas solicitudes concurrentes, y garantizar que la salida de un modelo cumpla un formato estructurado como JSON, algo relevante para function calling, pipelines de agentes y otras salidas consumidas por máquinas.

  • Originado a partir de investigación vinculada a UC Berkeley, Stanford y LMSYS; desarrollado hoy bajo la organización de código abierto sgl-project
  • Con licencia Apache 2.0: el código fuente está disponible públicamente para su uso, modificación y redistribución según los términos de la licencia
  • Combina un DSL frontend embebido en Python para escribir programas de LLM con un runtime backend codiseñado (el SGLang Runtime, a menudo abreviado SRT)
  • Carga checkpoints de modelos compatibles con Hugging Face Transformers, cubriendo familias de modelos como Llama, Qwen, Mistral y DeepSeek sin un paso de conversión separado para la mayoría de los modelos
  • Documenta despliegues en producción que generan grandes volúmenes de tokens diariamente, y menciona en sus propios materiales a varias empresas e instituciones de investigación como adoptantes

¿Qué es RadixAttention y por qué importa?

RadixAttention es la técnica de gestión de memoria por la que SGLang es más conocido. Muchas cargas de trabajo reales de LLM emiten múltiples llamadas de generación que comparten un prefijo común — el mismo prompt del sistema en cada solicitud, los mismos ejemplos few-shot, o turnos anteriores de una conversación en curso. Recalcular la caché clave-valor (KV) de atención para ese prefijo compartido en cada llamada desperdicia cómputo y memoria de GPU. RadixAttention, en cambio, almacena entradas de caché KV tanto de solicitudes completadas como en curso en un árbol radix — una estructura de árbol indexada por secuencias de tokens — de modo que una nueva solicitud pueda encontrar y reutilizar automáticamente la caché de cualquier prefijo que comparta con solicitudes anteriores, sin que un desarrollador tenga que rastrear o gestionar manualmente esa reutilización.

  • Encuentra y reutiliza automáticamente entradas de caché KV entre solicitudes que comparten un prefijo de secuencia de tokens, usando una estructura de datos de árbol radix
  • Cubre prefijos de prompts del sistema repetidos, ejemplos few-shot compartidos e historial de conversación multi-turno — no solo la misma solicitud exacta repetida literalmente
  • Aplica una política de desalojo LRU (menos usado recientemente) al árbol radix para que la memoria de caché pueda recuperarse y reutilizarse a medida que el árbol crece
  • Funciona junto con el batching continuo y la asignación de caché KV paginada por bloques, lo que permite a SGLang añadir y retirar solicitudes de un batch en curso a medida que llegan y terminan

¿Qué hacen realmente el DSL frontend y la salida estructurada?

Más allá del serving básico, SGLang incluye dos capacidades relacionadas pero distintas: un lenguaje frontend embebido en Python para escribir programas de LLM, y la aplicación a nivel de motor de formatos de salida estructurados.

¿Qué hardware necesita SGLang?

El objetivo principal y mejor soportado de SGLang son las GPU NVIDIA, y la mayoría de los despliegues en producción descritos en los propios materiales del proyecto se ejecutan en hardware NVIDIA. El proyecto también documenta backends adicionales, aunque la cobertura y adopción real no son iguales en todos ellos.

GPU NVIDIA (CUDA)

Detalles:
El objetivo principal y más maduro, desde GPU de centro de datos hasta tarjetas recientes de consumo/estación de trabajo. El serving tensor-paralelo en varias GPU NVIDIA está bien documentado.

GPU AMD (ROCm)

Detalles:
Documentado como backend soportado para aceleradores AMD Instinct vía ROCm, con adopción real y cobertura de comunidad más limitada que la vía CUDA.

CPU Intel Xeon y aceleradores Gaudi

Detalles:
Backends adicionales documentados por el proyecto para hardware Intel; considérelos una vía de despliegue más pequeña y menos probada que las GPU NVIDIA.

TPU de Google y NPU Ascend

Detalles:
Backends documentados para equipos que ya operan sobre infraestructura de Google Cloud TPU o Huawei Ascend.

Apple Silicon (Mac)

Detalles:
No es una vía de primera clase oficialmente mantenida. SGLang está construido alrededor de hardware de centro de datos y estación de trabajo respaldado por GPU, no para uso local en un solo Mac.

Si su objetivo es ejecutar un modelo en un solo Mac o una máquina exclusivamente con CPU, SGLang no es la herramienta construida para eso — llama.cpp y herramientas construidas sobre él, como Ollama y LM Studio, apuntan directamente a hardware de CPU y Apple Silicon y son mejor opción para ese escenario.

¿Qué formatos de cuantización soporta SGLang?

SGLang soporta el serving de modelos con precisión numérica reducida para bajar el uso de memoria y, en muchos casos, aumentar el rendimiento, documentando varios formatos de cuantización establecidos.

FP8

Detalles:
Precisión en punto flotante de 8 bits, soportada en generaciones de GPU NVIDIA con soporte de hardware FP8, intercambiando algo de precisión por menor uso de memoria y ejecución más rápida que FP16/BF16.

FP4

Detalles:
Un formato de punto flotante más nuevo y de precisión aún menor, documentado por el proyecto para el hardware NVIDIA de generación más reciente que lo soporta.

AWQ

Detalles:
Activation-aware Weight Quantization, un método de cuantización de pesos de 4 bits ampliamente usado, con modelos precuantizados publicados por la comunidad en Hugging Face.

GPTQ

Detalles:
Un método de cuantización posentrenamiento comúnmente distribuido como checkpoints precuantizados, también típicamente a 4 bits.

INT4

Detalles:
Una vía de cuantización entera de menor precisión, documentada por el proyecto junto a AWQ y GPTQ para una reducción de memoria adicional.

Este artículo no incluye cifras de pérdida de calidad medidas de forma independiente para cada formato — estas varían según la arquitectura del modelo y la tarea, por lo que comparar salidas de un par de formatos con sus propios prompts es la forma más fiable de juzgar la compensación para su carga de trabajo.

¿Qué ofrece el servidor de SGLang compatible con OpenAI?

Ejecutar python -m sglang.launch_server inicia un servidor HTTP que implementa el protocolo de la API de OpenAI, de modo que aplicaciones y SDK ya construidos contra la API de OpenAI a menudo pueden apuntar a una instancia de SGLang autoalojada cambiando solo la URL base y el nombre del modelo.

  • Endpoints de chat completions y completions compatibles con OpenAI, usables como reemplazo directo de código cliente basado en la API de OpenAI
  • Host y puerto configurables (comúnmente http://localhost:30000 en los propios ejemplos del proyecto)
  • Parámetros de salida estructurada a nivel de solicitud para generación restringida por esquema JSON o regex, expuestos a través de la API
  • Opciones del motor para tamaño tensor-paralelo, asignación de memoria y formato de cuantización, establecidas al iniciar el servidor
  • Soporte para servir varios adaptadores LoRA sobre un único modelo base cargado

¿Cómo instalar y ejecutar SGLang?

SGLang se distribuye como un paquete de Python y normalmente se instala en un entorno Python con una GPU NVIDIA y controladores CUDA compatibles disponibles.

  1. 1
    Confirme que tiene una GPU NVIDIA soportada con controladores CUDA actuales instalados (o revise la documentación del proyecto para instrucciones de instalación específicas de AMD/Intel/TPU si apunta a uno de esos backends).
  2. 2
    Cree un entorno virtual de Python y luego instale SGLang, por ejemplo: `pip install "sglang[all]"`.
  3. 3
    Inicie el servidor compatible con OpenAI con un modelo de Hugging Face, por ejemplo: python -m sglang.launch_server --model-path meta-llama/Llama-3.1-8B-Instruct --host 127.0.0.1 --port 30000.
  4. 4
    Envíe una solicitud de chat básica con cualquier cliente compatible con la API de OpenAI, por ejemplo el paquete de Python openai apuntando a base_url="http://127.0.0.1:30000/v1".
  5. 5
    Para una respuesta restringida por JSON, pase un esquema JSON en los parámetros de salida estructurada de la solicitud para que el servidor aplique el esquema durante la decodificación en lugar de solo pedir JSON en el prompt.
  6. 6
    Para serving multi-GPU, añada una opción tensor-paralela, por ejemplo --tp-size 2 para dividir el modelo entre dos GPU.
  7. 7
    Apunte el código cliente de API de OpenAI existente a su servidor autoalojado cambiando solo la URL base y el nombre del modelo.

¿Necesito una GPU para ejecutar SGLang?

Para cualquier cosa más allá de pruebas, sí — el objetivo principal y mejor soportado de SGLang son las GPU NVIDIA. El proyecto documenta otros backends de aceleradores, pero no son la vía de despliegue principal.

¿Puedo obtener salida JSON garantizada de SGLang?

Sí — pase un esquema JSON en los parámetros de salida estructurada de su solicitud, y SGLang lo aplica durante la decodificación enmascarando tokens que violarían el esquema, en lugar de simplemente pedirle al modelo que produzca JSON en el prompt.

¿Cómo se compara SGLang con vLLM?

SGLang y vLLM son los dos motores de serving de LLM de código abierto respaldados por GPU más discutidos, ambos con licencia Apache 2.0 y orientados al serving de producción multiusuario en lugar del chat de escritorio de un solo usuario. Ambos proyectos publican benchmarks que se comparan favorablemente entre sí; este artículo no arbitra esa comparación y en su lugar describe el diseño y las afirmaciones documentadas de cada proyecto.

Técnica de caché destacada

SGLang:
RadixAttention — reutilización automática de caché KV basada en árbol radix entre solicitudes que comparten cualquier prefijo.
vLLM:
PagedAttention — bloques de caché KV del tamaño de una página, no contiguos, que reducen el desperdicio de memoria por asignaciones sobrerreservadas.

Salida estructurada

SGLang:
La aplicación de esquema JSON y regex a nivel de motor es una característica central y muy documentada, construida sobre una máquina de estados finitos comprimida.
vLLM:
También soporta decodificación estructurada/guiada mediante backends de gramática integrados, documentada como parte de su conjunto de funciones más amplio en lugar de como característica destacada.

Modelo de programación

SGLang:
Incluye un DSL frontend embebido en Python (sgl.gen, sgl.select, sgl.fork) para programas de LLM con múltiples llamadas, además del servidor de API.
vLLM:
Se accede principalmente como servidor de API o llamada de biblioteca Python; no incluye un DSL de autoría de programas comparable.

Origen

SGLang:
Investigación vinculada a UC Berkeley, Stanford y la organización LMSYS detrás de Chatbot Arena.
vLLM:
Originado en el Sky Computing Lab de UC Berkeley.

Afirmaciones de rendimiento

SGLang:
Publica benchmarks de lanzamiento citando multiplicadores para RadixAttention y decodificación JSON en cargas de trabajo específicas.
vLLM:
Publica sus propios benchmarks de lanzamiento; describe el razonamiento de eficiencia de memoria de PagedAttention en lugar de una única cifra de velocidad universal.

Ningún benchmark de marketing de ninguno de los dos motores debe tomarse como un veredicto neutral — ambos son realizados por el proyecto cuyo resultado luce más favorable, sobre cargas de trabajo elegidas por ese proyecto. Si el rendimiento es determinante para su decisión, probar ambos motores con su propio modelo, hardware y patrón de tráfico es más fiable que la cifra de un solo artículo, incluido este.

¿Cómo se compara SGLang con llama.cpp y TensorRT-LLM?

SGLang, llama.cpp y TensorRT-LLM se ubican en puntos diferentes del espectro entre flexibilidad de hardware y optimización máxima.

SGLang

Detalles:
Con licencia Apache 2.0, basado en Python, construido alrededor de RadixAttention y la salida estructurada a nivel de motor. Carga directamente modelos compatibles con Hugging Face Transformers; las GPU NVIDIA son el objetivo principal, con backends adicionales documentados.

llama.cpp

Detalles:
Motor de inferencia en C/C++ con licencia MIT, construido alrededor del formato de modelo GGUF, que se ejecuta en CPU, Apple Silicon y GPU. Apunta al despliegue en una sola máquina y en el borde en lugar de clústeres de producción multi-GPU.

TensorRT-LLM

Detalles:
El motor de NVIDIA, construido específicamente para GPU NVIDIA. Los modelos se compilan por adelantado en un motor TensorRT optimizado para la GPU objetivo, lo que puede rendir muy bien en ese hardware específico a costa de un paso de compilación y menor flexibilidad entre hardware que SGLang.

Este artículo no ha comparado de forma independiente estos tres motores entre sí y no afirma que uno sea universalmente más rápido — el rendimiento depende en gran medida del modelo, el hardware, las características del batch y la versión de cada motor. Vea la guía de servidores de inferencia empresariales para una comparación orientada al despliegue que también cubre vLLM, TGI y NVIDIA NIM.

¿Para quién es SGLang?

SGLang encaja con equipos que sirven un modelo a muchos usuarios o aplicaciones concurrentes sobre infraestructura de GPU — particularmente cargas de trabajo con prefijos de prompt repetidos o un requisito estricto de salida estructurada —, no con personas que buscan la forma más rápida de chatear con un modelo en su propio equipo.

SGLang vs. alternativas de un vistazo

Estas herramientas se ubican en puntos diferentes del espectro de un solo usuario frente a serving en producción, y del espectro de rendimiento frente a énfasis en salida estructurada.

SGLang

Interfaz y configuración:
Paquete de Python; servidor de API compatible con OpenAI iniciado con python -m sglang.launch_server. Requiere una GPU NVIDIA y CUDA en la mayoría de los despliegues.
Mejor para:
Serving de GPU de alta concurrencia con mucha reutilización de prefijos y/o un requisito estricto de salida estructurada (JSON/regex).

vLLM

Interfaz y configuración:
Paquete de Python; servidor de API compatible con OpenAI iniciado con vllm serve. Requiere una GPU NVIDIA y CUDA en la mayoría de los despliegues.
Mejor para:
Serving de GPU de alto rendimiento multiusuario en producción, en general, sin un enfoque de diseño centrado primero en salida estructurada.

Ollama

Interfaz y configuración:
CLI y API REST, comúnmente reportado como ejecutándose sobre llama.cpp como backend en la mayoría de las plataformas. Un comando lo instala; un comando descarga y ejecuta un modelo.
Mejor para:
La vía más rápida hacia un modelo local funcionando para un solo usuario, sin paso de compilación ni GPU requerida.

llama.cpp

Interfaz y configuración:
CLI, interfaz web integrada y API compatible con OpenAI vía llama-server. Compile desde el código fuente o use un binario preconstruido; se ejecuta en CPU o GPU.
Mejor para:
Control directo a nivel de motor, despliegue embebido/en el borde, y hardware CPU o Apple Silicon.

Este artículo no ha comparado de forma independiente la velocidad ni la calidad de salida entre estas herramientas y no afirma que una sea técnicamente superior — la comparación anterior cubre solo hechos documentados de arquitectura, configuración y modelo de acceso. Vea la comparación llama.cpp vs. Ollama vs. vLLM para una comparación dedicada de rendimiento y complejidad de configuración entre esos tres, y la guía de servidores de inferencia empresariales para una mirada orientada al despliegue sobre vLLM, TGI y NVIDIA NIM.

¿Qué no cubre este artículo?

Este es un artículo explicativo construido a partir de la documentación pública y el repositorio de SGLang, no un informe de benchmark práctico.

  • Ninguna cifra de rendimiento, latencia o solicitudes por segundo medida de forma independiente para SGLang o sus comparaciones — estas dependen en gran medida de la GPU, el modelo, la composición del batch y la versión
  • Ninguna verificación independiente de los multiplicadores de aceleración que SGLang afirma para RadixAttention o la decodificación JSON — provienen de los benchmarks de lanzamiento del proyecto, no de una medición de terceros
  • Ninguna auditoría de seguridad línea por línea del código de SGLang — es de código abierto y con licencia Apache 2.0, por lo que el código en sí está disponible para revisión
  • Ninguna cobertura completa de cada backend de hardware soportado, opción de motor u orquestación de despliegue (Kubernetes, configuraciones específicas de nube) — este artículo se centra en los conceptos y opciones que la mayoría de los equipos evalúan primero
  • Ninguna cobertura de acuerdos de soporte comercial u ofertas de alojamiento gestionado de SGLang, ya que SGLang en sí es un proyecto de código abierto comunitario y no un producto de proveedor con contrato de soporte

Errores comunes al probar SGLang

La mayor parte de la fricción con SGLang proviene de tratarlo como una herramienta de escritorio de un solo usuario, o de esperar que RadixAttention ayude a una carga de trabajo que en realidad no comparte prefijos.

Preguntas frecuentes

¿Qué es SGLang?

SGLang es un framework de serving gratuito, con licencia Apache 2.0, para modelos de lenguaje grandes y modelos de visión-lenguaje, originado a partir de investigación vinculada a UC Berkeley, Stanford y la organización LMSYS detrás de Chatbot Arena. Es más conocido por RadixAttention, una técnica de reutilización automática de caché KV entre solicitudes que comparten un prefijo común.

¿SGLang es gratuito?

Sí. SGLang es software gratuito y de código abierto publicado bajo la licencia Apache 2.0, sin necesidad de suscripción ni cuenta para ejecutarlo usted mismo.

¿Qué es RadixAttention?

RadixAttention es la técnica de SGLang para almacenar la caché KV de atención de solicitudes completadas y en curso en un árbol radix, de modo que las nuevas solicitudes que comparten un prefijo de secuencia de tokens — prompt del sistema, ejemplos few-shot o turnos de conversación anteriores — puedan reutilizar automáticamente la caché correspondiente en lugar de recalcularla.

¿SGLang garantiza salida JSON válida?

Cuando una solicitud incluye un esquema JSON en los parámetros de salida estructurada de SGLang, el motor enmascara en cada paso de decodificación los tokens que violarían el esquema, lo cual está diseñado para hacer que la salida cumpla el esquema por construcción en lugar de por validación posterior. Simplemente pedir JSON en el texto del prompt sin usar estos parámetros no ofrece esta garantía.

¿SGLang necesita una GPU?

Para cualquier carga de trabajo real, sí — el objetivo principal y mejor soportado de SGLang son las GPU NVIDIA. El proyecto documenta backends de AMD, Intel y otros aceleradores, pero no son la vía de despliegue principal, y no hay soporte de Apple Silicon de primera clase.

¿Qué formatos de cuantización soporta SGLang?

SGLang soporta varios formatos incluyendo FP8, FP4 en hardware más nuevo, AWQ, GPTQ e INT4, con muchos modelos precuantizados en estos formatos publicados en Hugging Face.

¿Es SGLang mejor que vLLM?

Los benchmarks propios de ninguno de los dos proyectos son un veredicto neutral sobre esto — ambos publican resultados favorables a sí mismos. SGLang destaca la reutilización de caché basada en prefijos de RadixAttention y la salida estructurada a nivel de motor como sus características principales; vLLM destaca la eficiencia de memoria de PagedAttention. Cuál encaja mejor depende del patrón de compartición de prefijos de su carga de trabajo y de si la salida estructurada es un requisito estricto — vea la tabla comparativa anterior.

¿SGLang tiene una API compatible con OpenAI?

Sí. Ejecutar python -m sglang.launch_server inicia un servidor que implementa el protocolo de la API de OpenAI, de modo que muchas aplicaciones construidas para la API de OpenAI pueden apuntar a una instancia de SGLang autoalojada cambiando solo la URL base y el nombre del modelo.

¿Para qué se usa el DSL frontend de SGLang?

Es un conjunto de primitivas de Python — incluyendo sgl.gen, sgl.select y sgl.fork — para escribir programas de LLM de varios pasos, como ramificarse en varias sub-generaciones paralelas y combinar los resultados, como código Python normal en lugar de orquestar manualmente llamadas de API separadas.

¿Quien creo SGLang, y que es RadixArk?

SGLang surgio de investigaciones que conectan UC Berkeley, Stanford y la organizacion LMSYS detras de Chatbot Arena. En 2026, los cocreadores de SGLang Ying Sheng y Banghua Zhu fundaron RadixArk, una startup de infraestructura de IA que recaudo 100 millones de dolares en financiacion semilla liderada por Accel para comercializar servicios en torno a SGLang, mientras continua su desarrollo de codigo abierto — el framework central sigue siendo Apache 2.0 y gratuito.

Fuentes

← Volver a LLM locales avanzados