Conclusiones clave
- candle-vllm (github.com/EricLBuehler/candle-vllm) es un motor de inferencia y serving gratuito, de código abierto y nativo en Rust
- Construido sobre el framework de machine learning Candle de Hugging Face, por el desarrollador EricLBuehler
- Con licencia MIT, confirmada a través de la licencia del repositorio
- Toma su enfoque de serving —batching continuo, gestión eficiente de la caché KV— del proyecto vLLM en Python, citado a través del paper de vLLM (arxiv.org/abs/2309.06180), pero es una reimplementación en Rust construida desde cero, no un port del código Python de vLLM
- Ejecuta un servidor API compatible con OpenAI en
http://localhost:2000por defecto, con una interfaz web integrada opcional - Multiplataforma con la misma base de código: NVIDIA CUDA 11/12/13 en Linux, Apple Metal en macOS/Apple Silicon (se recomiendan 16 GB+ de memoria unificada) y fallback a CPU
- Alrededor de 728 estrellas en GitHub al momento de esta reseña
📍 En una frase
candle-vllm es un motor de serving de LLM gratuito y de código abierto (MIT), escrito de forma nativa en Rust sobre el framework Candle de Hugging Face, que ofrece un servidor API compatible con OpenAI con un comportamiento de serving al estilo vLLM tanto en NVIDIA CUDA como en Apple Metal.
💬 En términos simples
candle-vllm es un programa que ejecuta un modelo de lenguaje de IA en tu propio ordenador o servidor y permite que otras aplicaciones se comuniquen con él usando el mismo formato de solicitud que la API de OpenAI, de modo que las herramientas creadas para la API de OpenAI a menudo pueden conectarse con un pequeño cambio de configuración. Está construido enteramente en Rust en lugar de Python, algo que su autor plantea como una ventaja de seguridad y compilación nativa, y replica el diseño de serving del conocido proyecto en Python vLLM sin reutilizar literalmente su código Python.
📌Nota: Esta reseña se basa en el propio repositorio de GitHub y el README del proyecto. No presenta los benchmarks de velocidad de decodificación autoinformados por el proyecto como cifras verificadas de forma independiente, ya que PromptQuorum no ha realizado sus propias pruebas de rendimiento prácticas de candle-vllm.
¿Qué es candle-vllm?
candle-vllm es un motor de inferencia y serving de LLM gratuito y de código abierto, escrito enteramente en Rust, construido sobre el framework de machine learning Candle de Hugging Face en lugar de sobre Python. Está desarrollado por EricLBuehler y se distribuye en GitHub.
- Tipo de producto: un motor de serving / servidor API que tú mismo ejecutas, no un servicio alojado ni una app de chat de escritorio
- Creador: EricLBuehler
- Framework subyacente: Candle, el framework de machine learning nativo en Rust de Hugging Face — candle-vllm está construido sobre él, no es un fork ni un cambio de nombre de Candle en sí
- Licencia: MIT
- Financiación: no se encontró ninguna ronda de financiación, inversor ni respaldo comercial para esta reseña — trátalo como un proyecto de código abierto mantenido de forma independiente por la comunidad
- Escala: alrededor de 728 estrellas en GitHub, unos 90 forks y un historial de commits reciente y activo al momento de esta reseña
¿Qué hace candle-vllm en la práctica?
candle-vllm carga un LLM abierto y lo sirve a través de una API HTTP compatible con OpenAI, aplicando optimizaciones de serving similares en espíritu al proyecto vLLM en Python —batching continuo, gestión de memoria eficiente para la caché de atención y soporte de cuantización—, implementadas de forma nativa en Rust.
- Servidor API compatible con OpenAI: escucha en
http://localhost:2000por defecto, por lo que los clientes construidos para el formato de la API de OpenAI a menudo pueden conectarse con un cambio de URL base - Interfaz web integrada opcional: según el README del proyecto, se puede lanzar una interfaz de chat al estilo ChatGPT junto con la API, en un puerto distinto al puerto de la API
- Amplio soporte de familias de modelos según el README: Qwen, Llama, Mistral, Phi3/Phi4, DeepSeek (incluyendo V3/R1), GLM, Yi, StableLM, Gemma, QwQ y modelos de visión-lenguaje
- Soporte de formatos de modelo según la documentación del proyecto: SafeTensors, GGUF, GPTQ, AWQ, Marlin, MXFP4 y NVFP4
- Funciones de rendimiento descritas en el README: Flash Attention, una opción de backend FlashInfer, CUDA Graphs, batching continuo y prefix caching (reutilización de la caché KV entre solicitudes)
- Función de eficiencia de memoria: compresión de caché KV "TurboQuant", que el README describe como capaz de lograr una extensión sustancial de la longitud de contexto mediante variantes de cuantización de caché de 2 a 4 bits
- Soporte multi-GPU y multi-nodo: inferencia multi-GPU con paralelismo tensorial (el README recomienda el modo multiproceso) y coordinación multi-nodo basada en TCP sin dependencia de MPI
- Integración de herramientas: soporte documentado del Model Context Protocol (MCP) y llamadas a herramientas/funciones compatibles con OpenAI
Plataforma, precio y licencia
Plataforma
- Lo que indica candle-vllm:
- Un proceso de servidor autoalojado, ejecutado desde la línea de comandos o como biblioteca de Rust. Multiplataforma: Linux (CUDA 11/12/13), macOS/Apple Silicon (Metal) y fallback a CPU, misma base de código en los tres.
Costo
- Lo que indica candle-vllm:
- Gratuito y de código abierto, sin nivel de pago. Tú aportas tu propio cómputo y descargas los pesos de modelos abiertos por separado (por ejemplo, desde Hugging Face).
Licencia
- Lo que indica candle-vllm:
- Licencia MIT.
Método de instalación
- Lo que indica candle-vllm:
- Según el README del proyecto: un instalador de shell de una línea para instalaciones DEB/binarias, una compilación desde el código fuente vía
cargo installcon flags de funciones CUDA/Metal/CPU, o una imagen Docker con versión de CUDA/SM configurable.
Verifica el método de instalación recomendado actualmente y la compatibilidad de CUDA/drivers en github.com/EricLBuehler/candle-vllm antes de ejecutar cualquier comando, ya que las instrucciones de instalación y las versiones de CUDA compatibles pueden cambiar entre versiones.
Instalar candle-vllm
candle-vllm se instala de forma gratuita mediante un script de shell, cargo (compilación desde el código fuente) o Docker, y su código fuente está en GitHub.
Fuente | Link |
|---|---|
| Repositorio de GitHub (código fuente, MIT) | github.com/EricLBuehler/candle-vllm |
| Framework Candle (framework ML subyacente) | github.com/huggingface/candle |
| Entrada en el Local LLM Software Directory | Local LLM Software Directory |
candle-vllm requiere una terminal y, o bien un binario/imagen Docker preconstruido, o una cadena de herramientas de Rust (vía cargo) para compilar desde el código fuente — no hay instalador gráfico, ya que se trata de un componente de servidor/API y no de una app de escritorio para el usuario final.
candle-vllm vs. vLLM en Python
candle-vllm no es un fork ni un port del proyecto original vLLM en Python — es una implementación en Rust independiente, construida desde cero, que sigue un diseño de serving similar (batching continuo, gestión eficiente de la caché KV) y cita el paper de vLLM como su enfoque de referencia.
Lenguaje/runtime
- candle-vllm:
- Rust, no requiere runtime de Python para ejecutar el servidor
- vLLM en Python:
- Python, requiere un entorno de Python
Framework subyacente
- candle-vllm:
- Hugging Face Candle (framework ML en Rust)
- vLLM en Python:
- PyTorch
Compatibilidad de API
- candle-vllm:
- API HTTP compatible con OpenAI
- vLLM en Python:
- API HTTP compatible con OpenAI
Soporte de plataformas
- candle-vllm:
- CUDA, Apple Metal, CPU — misma base de código
- vLLM en Python:
- Enfocado principalmente en CUDA/ROCm, sin backend nativo de Apple Metal
Madurez del ecosistema
- candle-vllm:
- Comunidad más pequeña (~728 estrellas), proyecto más nuevo
- vLLM en Python:
- Grande, ampliamente desplegado en stacks de serving de LLM en producción
Esta comparación refleja la documentación propia de cada proyecto, no un benchmarking independiente de PromptQuorum. Verifica la paridad de funciones y el rendimiento actuales directamente con cada proyecto antes de elegir.
¿Quién debería usar candle-vllm?
candle-vllm es adecuado para desarrolladores que quieren un motor de serving local compatible con OpenAI sin dependencia de Python, y que valoran ejecutar la misma base de código en CUDA y Apple Metal.
Para qué no es buena opción candle-vllm
candle-vllm no es una buena opción si necesitas el ecosistema de integraciones existente más grande, un instalador gráfico sin terminal, o cifras de rendimiento verificadas de forma independiente antes de comprometerte.
- No es el ecosistema más maduro — vLLM en Python tiene una comunidad mucho más grande, más integraciones de terceros y más trayectoria en producción al momento de esta reseña
- No es una instalación gráfica o de un clic para escritorio — es un componente de servidor/API configurado mediante script de shell, compilación con cargo o Docker
- No es un reemplazo directo para cada plugin o flujo de trabajo específico de vLLM en Python — algunas herramientas construidas específicamente alrededor de los mecanismos internos de vLLM en Python no tienen un equivalente directo en Rust aquí
- No ha sido evaluado de forma independiente por PromptQuorum — esta reseña no confirma las cifras de velocidad de decodificación autoinformadas del proyecto con sus propias pruebas prácticas
- No hay una ronda de financiación o empresa que esta reseña pueda verificar — trátalo como un proyecto mantenido de forma independiente y apoyado por la comunidad
Errores comunes al evaluar candle-vllm
La mayor parte de la confusión sobre candle-vllm proviene de asumir que es un port de Python a Rust de vLLM, o de asumir que está escrito en Python por el "vllm" en su nombre.
Competidores y alternativas
Dentro de los motores de inferencia y serving de LLM locales, candle-vllm se compara sobre todo con otras plataformas de serving autoalojadas y compatibles con OpenAI — su principal diferenciador es ser nativo en Rust en lugar de basado en Python, con soporte nativo de Apple Metal junto a CUDA.
Tool | Más conocido por | Link |
|---|---|---|
| LMDeploy | Kit de serving de LLM en Python del equipo InternLM, con cuantización e inferencia de alto rendimiento | Reseña de LMDeploy |
| NVIDIA Dynamo | Framework de serving de inferencia distribuido para despliegues de LLM multi-nodo a gran escala | Reseña de Dynamo |
| LoRAX | Framework de serving multi-adaptador LoRA para ejecutar muchas variantes ajustadas desde un modelo base | Reseña de LoRAX |
Esta lista refleja herramientas que se comparan habitualmente con candle-vllm dentro del segmento de motores de inferencia/serving, no una clasificación independiente de PromptQuorum — verifica el conjunto de funciones actual de cada herramienta antes de elegir.
Preguntas frecuentes
¿Qué es candle-vllm?
candle-vllm (github.com/EricLBuehler/candle-vllm) es un motor de inferencia y serving de LLM gratuito, de código abierto y nativo en Rust, construido sobre el framework Candle de Hugging Face, que ofrece un servidor API compatible con OpenAI.
¿Está candle-vllm escrito en Python?
No. A pesar del "vllm" en su nombre, candle-vllm está escrito enteramente en Rust sobre el framework de machine learning Candle de Hugging Face. No se requiere ningún runtime de Python para ejecutar el servidor.
¿Es candle-vllm el mismo proyecto que vLLM?
No. Es una implementación en Rust independiente, construida desde cero, que sigue un diseño de serving similar (batching continuo, gestión de caché KV) al del proyecto vLLM en Python y cita su paper, pero no reutiliza el código Python de vLLM.
¿Es gratuito candle-vllm?
Sí, es gratuito y de código abierto bajo la licencia MIT, sin nivel de pago.
¿Qué plataformas admite candle-vllm?
La misma base de código funciona en NVIDIA CUDA (11/12/13) en Linux, en Apple Metal en macOS/Apple Silicon (se recomiendan 16 GB+ de memoria unificada) y en CPU como fallback.
¿Cómo instalo candle-vllm?
Según el README del proyecto: un instalador de shell de una línea para instalaciones DEB/binarias, una compilación desde el código fuente vía cargo install con los flags de CUDA/Metal/CPU adecuados, o una imagen Docker.
¿candle-vllm admite modelos cuantizados?
Sí. Según la documentación del proyecto, admite los formatos de modelo SafeTensors, GGUF, GPTQ, AWQ, Marlin, MXFP4 y NVFP4.
¿Quién creó candle-vllm?
El desarrollador EricLBuehler creó y mantiene candle-vllm, construido sobre el framework de machine learning Candle de Hugging Face.
¿Tiene candle-vllm una interfaz web?
Puede, opcionalmente, lanzar una interfaz web integrada al estilo ChatGPT junto con su servidor API, en un puerto distinto al puerto de la API, según el README del proyecto.
¿Ha verificado PromptQuorum de forma independiente las afirmaciones de rendimiento de candle-vllm?
No. Esta reseña se basa en el propio repositorio de GitHub y el README del proyecto, no en pruebas de rendimiento prácticas realizadas por PromptQuorum.