Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/Reseña de candle-vllm: serving de LLM nativo en Rust sobre CUDA y Metal
Overview & Reference

Reseña de candle-vllm: serving de LLM nativo en Rust sobre CUDA y Metal

·9 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

candle-vllm es un motor de inferencia y serving de LLM gratuito, de código abierto y nativo en Rust, construido sobre el framework de machine learning Candle de Hugging Face, que ofrece un servidor API compatible con OpenAI con funciones de serving al estilo vLLM (batching continuo, gestión de memoria similar a PagedAttention, soporte de cuantización) implementadas de forma nativa en Rust en lugar de como un port de Python. Ejecuta la misma base de código en NVIDIA CUDA (Linux) y Apple Metal (macOS/Apple Silicon), además de fallback a CPU, y admite una amplia gama de familias de modelos abiertos en formatos SafeTensors, GGUF, GPTQ, AWQ y otros.

candle-vllm (github.com/EricLBuehler/candle-vllm) es un motor de inferencia y serving de LLM gratuito, de código abierto y nativo en Rust, construido sobre el framework de machine learning Candle de Hugging Face. Ofrece un servidor API compatible con OpenAI y busca un comportamiento de serving al estilo vLLM sin necesidad de un runtime de Python. Funciona con la misma base de código tanto en NVIDIA CUDA como en Apple Metal. Esta reseña cubre qué hace, cómo se compara con el proyecto vLLM escrito en Python del que toma su modelo de serving, y para quién es adecuado.

Conclusiones clave

  • candle-vllm (github.com/EricLBuehler/candle-vllm) es un motor de inferencia y serving gratuito, de código abierto y nativo en Rust
  • Construido sobre el framework de machine learning Candle de Hugging Face, por el desarrollador EricLBuehler
  • Con licencia MIT, confirmada a través de la licencia del repositorio
  • Toma su enfoque de serving —batching continuo, gestión eficiente de la caché KV— del proyecto vLLM en Python, citado a través del paper de vLLM (arxiv.org/abs/2309.06180), pero es una reimplementación en Rust construida desde cero, no un port del código Python de vLLM
  • Ejecuta un servidor API compatible con OpenAI en http://localhost:2000 por defecto, con una interfaz web integrada opcional
  • Multiplataforma con la misma base de código: NVIDIA CUDA 11/12/13 en Linux, Apple Metal en macOS/Apple Silicon (se recomiendan 16 GB+ de memoria unificada) y fallback a CPU
  • Alrededor de 728 estrellas en GitHub al momento de esta reseña

📍 En una frase

candle-vllm es un motor de serving de LLM gratuito y de código abierto (MIT), escrito de forma nativa en Rust sobre el framework Candle de Hugging Face, que ofrece un servidor API compatible con OpenAI con un comportamiento de serving al estilo vLLM tanto en NVIDIA CUDA como en Apple Metal.

💬 En términos simples

candle-vllm es un programa que ejecuta un modelo de lenguaje de IA en tu propio ordenador o servidor y permite que otras aplicaciones se comuniquen con él usando el mismo formato de solicitud que la API de OpenAI, de modo que las herramientas creadas para la API de OpenAI a menudo pueden conectarse con un pequeño cambio de configuración. Está construido enteramente en Rust en lugar de Python, algo que su autor plantea como una ventaja de seguridad y compilación nativa, y replica el diseño de serving del conocido proyecto en Python vLLM sin reutilizar literalmente su código Python.

📌Nota: Esta reseña se basa en el propio repositorio de GitHub y el README del proyecto. No presenta los benchmarks de velocidad de decodificación autoinformados por el proyecto como cifras verificadas de forma independiente, ya que PromptQuorum no ha realizado sus propias pruebas de rendimiento prácticas de candle-vllm.

¿Qué es candle-vllm?

candle-vllm es un motor de inferencia y serving de LLM gratuito y de código abierto, escrito enteramente en Rust, construido sobre el framework de machine learning Candle de Hugging Face en lugar de sobre Python. Está desarrollado por EricLBuehler y se distribuye en GitHub.

  • Tipo de producto: un motor de serving / servidor API que tú mismo ejecutas, no un servicio alojado ni una app de chat de escritorio
  • Creador: EricLBuehler
  • Framework subyacente: Candle, el framework de machine learning nativo en Rust de Hugging Face — candle-vllm está construido sobre él, no es un fork ni un cambio de nombre de Candle en sí
  • Licencia: MIT
  • Financiación: no se encontró ninguna ronda de financiación, inversor ni respaldo comercial para esta reseña — trátalo como un proyecto de código abierto mantenido de forma independiente por la comunidad
  • Escala: alrededor de 728 estrellas en GitHub, unos 90 forks y un historial de commits reciente y activo al momento de esta reseña

¿Qué hace candle-vllm en la práctica?

candle-vllm carga un LLM abierto y lo sirve a través de una API HTTP compatible con OpenAI, aplicando optimizaciones de serving similares en espíritu al proyecto vLLM en Python —batching continuo, gestión de memoria eficiente para la caché de atención y soporte de cuantización—, implementadas de forma nativa en Rust.

  • Servidor API compatible con OpenAI: escucha en http://localhost:2000 por defecto, por lo que los clientes construidos para el formato de la API de OpenAI a menudo pueden conectarse con un cambio de URL base
  • Interfaz web integrada opcional: según el README del proyecto, se puede lanzar una interfaz de chat al estilo ChatGPT junto con la API, en un puerto distinto al puerto de la API
  • Amplio soporte de familias de modelos según el README: Qwen, Llama, Mistral, Phi3/Phi4, DeepSeek (incluyendo V3/R1), GLM, Yi, StableLM, Gemma, QwQ y modelos de visión-lenguaje
  • Soporte de formatos de modelo según la documentación del proyecto: SafeTensors, GGUF, GPTQ, AWQ, Marlin, MXFP4 y NVFP4
  • Funciones de rendimiento descritas en el README: Flash Attention, una opción de backend FlashInfer, CUDA Graphs, batching continuo y prefix caching (reutilización de la caché KV entre solicitudes)
  • Función de eficiencia de memoria: compresión de caché KV "TurboQuant", que el README describe como capaz de lograr una extensión sustancial de la longitud de contexto mediante variantes de cuantización de caché de 2 a 4 bits
  • Soporte multi-GPU y multi-nodo: inferencia multi-GPU con paralelismo tensorial (el README recomienda el modo multiproceso) y coordinación multi-nodo basada en TCP sin dependencia de MPI
  • Integración de herramientas: soporte documentado del Model Context Protocol (MCP) y llamadas a herramientas/funciones compatibles con OpenAI

Plataforma, precio y licencia

Plataforma

Lo que indica candle-vllm:
Un proceso de servidor autoalojado, ejecutado desde la línea de comandos o como biblioteca de Rust. Multiplataforma: Linux (CUDA 11/12/13), macOS/Apple Silicon (Metal) y fallback a CPU, misma base de código en los tres.

Costo

Lo que indica candle-vllm:
Gratuito y de código abierto, sin nivel de pago. Tú aportas tu propio cómputo y descargas los pesos de modelos abiertos por separado (por ejemplo, desde Hugging Face).

Licencia

Lo que indica candle-vllm:
Licencia MIT.

Método de instalación

Lo que indica candle-vllm:
Según el README del proyecto: un instalador de shell de una línea para instalaciones DEB/binarias, una compilación desde el código fuente vía cargo install con flags de funciones CUDA/Metal/CPU, o una imagen Docker con versión de CUDA/SM configurable.

Verifica el método de instalación recomendado actualmente y la compatibilidad de CUDA/drivers en github.com/EricLBuehler/candle-vllm antes de ejecutar cualquier comando, ya que las instrucciones de instalación y las versiones de CUDA compatibles pueden cambiar entre versiones.

candle-vllm vs. vLLM en Python

candle-vllm no es un fork ni un port del proyecto original vLLM en Python — es una implementación en Rust independiente, construida desde cero, que sigue un diseño de serving similar (batching continuo, gestión eficiente de la caché KV) y cita el paper de vLLM como su enfoque de referencia.

Lenguaje/runtime

candle-vllm:
Rust, no requiere runtime de Python para ejecutar el servidor
vLLM en Python:
Python, requiere un entorno de Python

Framework subyacente

candle-vllm:
Hugging Face Candle (framework ML en Rust)
vLLM en Python:
PyTorch

Compatibilidad de API

candle-vllm:
API HTTP compatible con OpenAI
vLLM en Python:
API HTTP compatible con OpenAI

Soporte de plataformas

candle-vllm:
CUDA, Apple Metal, CPU — misma base de código
vLLM en Python:
Enfocado principalmente en CUDA/ROCm, sin backend nativo de Apple Metal

Madurez del ecosistema

candle-vllm:
Comunidad más pequeña (~728 estrellas), proyecto más nuevo
vLLM en Python:
Grande, ampliamente desplegado en stacks de serving de LLM en producción

Esta comparación refleja la documentación propia de cada proyecto, no un benchmarking independiente de PromptQuorum. Verifica la paridad de funciones y el rendimiento actuales directamente con cada proyecto antes de elegir.

¿Quién debería usar candle-vllm?

candle-vllm es adecuado para desarrolladores que quieren un motor de serving local compatible con OpenAI sin dependencia de Python, y que valoran ejecutar la misma base de código en CUDA y Apple Metal.

Para qué no es buena opción candle-vllm

candle-vllm no es una buena opción si necesitas el ecosistema de integraciones existente más grande, un instalador gráfico sin terminal, o cifras de rendimiento verificadas de forma independiente antes de comprometerte.

  • No es el ecosistema más maduro — vLLM en Python tiene una comunidad mucho más grande, más integraciones de terceros y más trayectoria en producción al momento de esta reseña
  • No es una instalación gráfica o de un clic para escritorio — es un componente de servidor/API configurado mediante script de shell, compilación con cargo o Docker
  • No es un reemplazo directo para cada plugin o flujo de trabajo específico de vLLM en Python — algunas herramientas construidas específicamente alrededor de los mecanismos internos de vLLM en Python no tienen un equivalente directo en Rust aquí
  • No ha sido evaluado de forma independiente por PromptQuorum — esta reseña no confirma las cifras de velocidad de decodificación autoinformadas del proyecto con sus propias pruebas prácticas
  • No hay una ronda de financiación o empresa que esta reseña pueda verificar — trátalo como un proyecto mantenido de forma independiente y apoyado por la comunidad

Errores comunes al evaluar candle-vllm

La mayor parte de la confusión sobre candle-vllm proviene de asumir que es un port de Python a Rust de vLLM, o de asumir que está escrito en Python por el "vllm" en su nombre.

Competidores y alternativas

Dentro de los motores de inferencia y serving de LLM locales, candle-vllm se compara sobre todo con otras plataformas de serving autoalojadas y compatibles con OpenAI — su principal diferenciador es ser nativo en Rust en lugar de basado en Python, con soporte nativo de Apple Metal junto a CUDA.

Tool
Más conocido por
Link
LMDeployKit de serving de LLM en Python del equipo InternLM, con cuantización e inferencia de alto rendimientoReseña de LMDeploy
NVIDIA DynamoFramework de serving de inferencia distribuido para despliegues de LLM multi-nodo a gran escalaReseña de Dynamo
LoRAXFramework de serving multi-adaptador LoRA para ejecutar muchas variantes ajustadas desde un modelo baseReseña de LoRAX

Esta lista refleja herramientas que se comparan habitualmente con candle-vllm dentro del segmento de motores de inferencia/serving, no una clasificación independiente de PromptQuorum — verifica el conjunto de funciones actual de cada herramienta antes de elegir.

Preguntas frecuentes

¿Qué es candle-vllm?

candle-vllm (github.com/EricLBuehler/candle-vllm) es un motor de inferencia y serving de LLM gratuito, de código abierto y nativo en Rust, construido sobre el framework Candle de Hugging Face, que ofrece un servidor API compatible con OpenAI.

¿Está candle-vllm escrito en Python?

No. A pesar del "vllm" en su nombre, candle-vllm está escrito enteramente en Rust sobre el framework de machine learning Candle de Hugging Face. No se requiere ningún runtime de Python para ejecutar el servidor.

¿Es candle-vllm el mismo proyecto que vLLM?

No. Es una implementación en Rust independiente, construida desde cero, que sigue un diseño de serving similar (batching continuo, gestión de caché KV) al del proyecto vLLM en Python y cita su paper, pero no reutiliza el código Python de vLLM.

¿Es gratuito candle-vllm?

Sí, es gratuito y de código abierto bajo la licencia MIT, sin nivel de pago.

¿Qué plataformas admite candle-vllm?

La misma base de código funciona en NVIDIA CUDA (11/12/13) en Linux, en Apple Metal en macOS/Apple Silicon (se recomiendan 16 GB+ de memoria unificada) y en CPU como fallback.

¿Cómo instalo candle-vllm?

Según el README del proyecto: un instalador de shell de una línea para instalaciones DEB/binarias, una compilación desde el código fuente vía cargo install con los flags de CUDA/Metal/CPU adecuados, o una imagen Docker.

¿candle-vllm admite modelos cuantizados?

Sí. Según la documentación del proyecto, admite los formatos de modelo SafeTensors, GGUF, GPTQ, AWQ, Marlin, MXFP4 y NVFP4.

¿Quién creó candle-vllm?

El desarrollador EricLBuehler creó y mantiene candle-vllm, construido sobre el framework de machine learning Candle de Hugging Face.

¿Tiene candle-vllm una interfaz web?

Puede, opcionalmente, lanzar una interfaz web integrada al estilo ChatGPT junto con su servidor API, en un puerto distinto al puerto de la API, según el README del proyecto.

¿Ha verificado PromptQuorum de forma independiente las afirmaciones de rendimiento de candle-vllm?

No. Esta reseña se basa en el propio repositorio de GitHub y el README del proyecto, no en pruebas de rendimiento prácticas realizadas por PromptQuorum.

Fuentes

← Volver a LLM locales avanzados