Skip to main content
PromptQuorum
Início/LLMs locais avançados/Análise do candle-vllm: serving de LLM nativo em Rust no CUDA e no Metal
Overview & Reference

Análise do candle-vllm: serving de LLM nativo em Rust no CUDA e no Metal

·9 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

O candle-vllm é um mecanismo de inferência e serving de LLM gratuito, open source e nativo em Rust, construído sobre o framework de machine learning Candle da Hugging Face, que fornece um servidor de API compatível com OpenAI com recursos de serving no estilo vLLM (batching contínuo, gerenciamento de memória semelhante ao PagedAttention, suporte a quantização) implementados nativamente em Rust em vez de como uma portabilidade de Python. Ele executa a mesma base de código em NVIDIA CUDA (Linux) e Apple Metal (macOS/Apple Silicon), além de fallback para CPU, e é compatível com diversas famílias de modelos abertos nos formatos SafeTensors, GGUF, GPTQ, AWQ e outros.

O candle-vllm (github.com/EricLBuehler/candle-vllm) é um mecanismo de inferência e serving de LLM gratuito, open source e nativo em Rust, construído sobre o framework de machine learning Candle da Hugging Face. Ele oferece um servidor de API compatível com OpenAI e busca um comportamento de serving no estilo vLLM sem exigir um runtime Python. Roda a partir da mesma base de código tanto em NVIDIA CUDA quanto em Apple Metal. Esta análise cobre o que ele faz, como se compara ao projeto vLLM escrito em Python do qual herda seu modelo de serving, e para quem ele é indicado.

Principais conclusões

  • O candle-vllm (github.com/EricLBuehler/candle-vllm) é um mecanismo de inferência e serving gratuito, open source e nativo em Rust
  • Construído sobre o framework de machine learning Candle da Hugging Face, pelo desenvolvedor EricLBuehler
  • Licenciado sob MIT, confirmado pela licença do repositório
  • Segue sua abordagem de serving — batching contínuo, gerenciamento eficiente de cache KV — do projeto vLLM em Python, citado por meio do paper do vLLM (arxiv.org/abs/2309.06180), mas é uma reimplementação em Rust construída do zero, não uma portabilidade do código Python do vLLM
  • Executa um servidor de API compatível com OpenAI em http://localhost:2000 por padrão, com interface web integrada opcional
  • Multiplataforma com a mesma base de código: NVIDIA CUDA 11/12/13 no Linux, Apple Metal no macOS/Apple Silicon (recomenda-se 16 GB+ de memória unificada) e fallback para CPU
  • Cerca de 728 estrelas no GitHub no momento desta análise

📍 Em uma frase

O candle-vllm é um mecanismo de serving de LLM gratuito e open source (MIT), escrito nativamente em Rust sobre o framework Candle da Hugging Face, oferecendo um servidor de API compatível com OpenAI com comportamento de serving no estilo vLLM tanto em NVIDIA CUDA quanto em Apple Metal.

💬 Em termos simples

O candle-vllm é um programa que executa um modelo de linguagem de IA no seu próprio computador ou servidor e permite que outros aplicativos se comuniquem com ele usando o mesmo formato de solicitação da API da OpenAI — assim, ferramentas criadas para a API da OpenAI muitas vezes conseguem se conectar com uma pequena mudança de configuração. Ele é construído inteiramente em Rust em vez de Python, o que seu autor apresenta como uma vantagem de segurança e compilação nativa, e reproduz o design de serving do conhecido projeto Python vLLM sem reutilizar literalmente o código Python dele.

📌Nota: Esta análise é baseada no próprio repositório GitHub e no README do projeto. Ela não reproduz os benchmarks de velocidade de decodificação autodeclarados pelo projeto como números verificados de forma independente, já que a PromptQuorum não realizou seus próprios testes práticos de desempenho do candle-vllm.

O que é o candle-vllm?

O candle-vllm é um mecanismo de inferência e serving de LLM gratuito e open source, escrito inteiramente em Rust, construído sobre o framework de machine learning Candle da Hugging Face, em vez de sobre Python. É desenvolvido por EricLBuehler e distribuído no GitHub.

  • Tipo de produto: um mecanismo de serving / servidor de API que você mesmo executa, não um serviço hospedado nem um aplicativo de chat para desktop
  • Criador: EricLBuehler
  • Framework subjacente: Candle, o framework de machine learning nativo em Rust da Hugging Face — o candle-vllm é construído sobre ele, não é um fork nem uma renomeação do próprio Candle
  • Licença: MIT
  • Financiamento: nenhuma rodada de investimento, investidor ou apoio comercial foi encontrado para esta análise — trate-o como um projeto open source mantido de forma independente pela comunidade
  • Escala: cerca de 728 estrelas no GitHub, cerca de 90 forks e um histórico de commits recente e ativo no momento desta análise

O que o candle-vllm realmente faz?

O candle-vllm carrega um LLM aberto e o disponibiliza por meio de uma API HTTP compatível com OpenAI, aplicando otimizações de serving semelhantes em espírito ao projeto vLLM em Python — batching contínuo, gerenciamento eficiente de memória para o cache de atenção e suporte a quantização — implementadas nativamente em Rust.

  • Servidor de API compatível com OpenAI: escuta em http://localhost:2000 por padrão, então clientes construídos para o formato da API da OpenAI muitas vezes conseguem se conectar com uma mudança na URL base
  • Interface web integrada opcional: segundo o README do projeto, uma interface de chat no estilo ChatGPT pode ser lançada junto com a API, em uma porta diferente da porta da API
  • Amplo suporte a famílias de modelos segundo o README: Qwen, Llama, Mistral, Phi3/Phi4, DeepSeek (incluindo V3/R1), GLM, Yi, StableLM, Gemma, QwQ e modelos de visão-linguagem
  • Suporte a formatos de modelo segundo a documentação do projeto: SafeTensors, GGUF, GPTQ, AWQ, Marlin, MXFP4 e NVFP4
  • Recursos de desempenho descritos no README: Flash Attention, uma opção de backend FlashInfer, CUDA Graphs, batching contínuo e prefix caching (reutilização do cache KV entre solicitações)
  • Recurso de eficiência de memória: compressão de cache KV "TurboQuant", que o README descreve como capaz de proporcionar uma extensão substancial do comprimento de contexto por meio de variantes de quantização de cache de 2 a 4 bits
  • Suporte a multi-GPU e multi-nó: inferência multi-GPU com paralelismo tensorial (o README recomenda o modo multiprocesso) e coordenação multi-nó baseada em TCP sem dependência de MPI
  • Integração com ferramentas: suporte documentado ao Model Context Protocol (MCP) e chamadas de ferramentas/funções compatíveis com OpenAI

Plataforma, preço e licenciamento

Plataforma

O que o candle-vllm declara:
Um processo de servidor auto-hospedado, executado pela linha de comando ou como biblioteca Rust. Multiplataforma: Linux (CUDA 11/12/13), macOS/Apple Silicon (Metal) e fallback para CPU, mesma base de código nos três.

Custo

O que o candle-vllm declara:
Gratuito e open source, sem nível pago. Você fornece seu próprio poder computacional e baixa os pesos de modelos abertos separadamente (por exemplo, do Hugging Face).

Licenciamento

O que o candle-vllm declara:
Licença MIT.

Método de instalação

O que o candle-vllm declara:
Segundo o README do projeto: um instalador shell de uma linha para instalações DEB/binárias, uma compilação a partir do código-fonte via cargo install com flags de recursos CUDA/Metal/CPU, ou uma imagem Docker com versão CUDA/SM configurável.

Verifique o método de instalação atualmente recomendado e a compatibilidade de CUDA/driver em github.com/EricLBuehler/candle-vllm antes de executar qualquer comando, já que as instruções de instalação e as versões de CUDA suportadas podem mudar entre versões.

candle-vllm vs. vLLM em Python

O candle-vllm não é um fork nem uma portabilidade do projeto vLLM original em Python — é uma implementação em Rust independente, construída do zero, que segue um design de serving semelhante (batching contínuo, gerenciamento eficiente de cache KV) e cita o paper do vLLM como sua abordagem de referência.

Linguagem/runtime

candle-vllm:
Rust, sem necessidade de runtime Python para rodar o servidor
vLLM em Python:
Python, exige um ambiente Python

Framework subjacente

candle-vllm:
Hugging Face Candle (framework ML em Rust)
vLLM em Python:
PyTorch

Compatibilidade de API

candle-vllm:
API HTTP compatível com OpenAI
vLLM em Python:
API HTTP compatível com OpenAI

Suporte de plataforma

candle-vllm:
CUDA, Apple Metal, CPU — mesma base de código
vLLM em Python:
Focado principalmente em CUDA/ROCm, sem backend nativo para Apple Metal

Maturidade do ecossistema

candle-vllm:
Comunidade menor (~728 estrelas), projeto mais recente
vLLM em Python:
Grande, amplamente implantado em stacks de serving de LLM em produção

Esta comparação reflete a documentação própria de cada projeto, não um benchmarking independente da PromptQuorum. Verifique a paridade de recursos e o desempenho atuais diretamente com cada projeto antes de escolher.

Quem deveria usar o candle-vllm?

O candle-vllm é indicado para desenvolvedores que querem um mecanismo de serving local compatível com OpenAI sem dependência de Python, e que valorizam rodar a mesma base de código em CUDA e Apple Metal.

Para que o candle-vllm não é indicado

O candle-vllm não é uma boa opção se você precisa do maior ecossistema de integrações existente, de um instalador gráfico sem terminal, ou de números de desempenho verificados de forma independente antes de se comprometer.

  • Não é o ecossistema mais maduro — o vLLM em Python tem uma comunidade muito maior, mais integrações de terceiros e mais histórico em produção no momento desta análise
  • Não é uma instalação gráfica ou de um clique para desktop — é um componente de servidor/API configurado via script shell, compilação com cargo ou Docker
  • Não é um substituto direto para todo plugin ou fluxo de trabalho específico do vLLM em Python — algumas ferramentas construídas especificamente em torno dos mecanismos internos do vLLM em Python não têm um equivalente direto em Rust aqui
  • Não foi avaliado de forma independente pela PromptQuorum — esta análise não confirma os números de velocidade de decodificação autodeclarados do projeto com seus próprios testes práticos
  • Não há rodada de investimento ou empresa que esta análise consiga verificar — trate-o como um projeto mantido de forma independente e apoiado pela comunidade

Erros comuns ao avaliar o candle-vllm

A maior parte da confusão em torno do candle-vllm vem de supor que ele é uma portabilidade de Python para Rust do vLLM, ou de supor que ele é escrito em Python por causa do "vllm" no nome.

Concorrentes e alternativas

Entre os mecanismos de inferência e serving de LLM locais, o candle-vllm é mais comparável a outras plataformas de serving auto-hospedadas e compatíveis com OpenAI — seu principal diferencial é ser nativo em Rust em vez de baseado em Python, com suporte nativo a Apple Metal além de CUDA.

Tool
Mais conhecido por
Link
LMDeployKit de serving de LLM em Python da equipe InternLM, com quantização e inferência de alto throughputAnálise do LMDeploy
NVIDIA DynamoFramework de serving de inferência distribuída para implantações de LLM multi-nó em larga escalaAnálise do Dynamo
LoRAXFramework de serving multi-adaptador LoRA para rodar muitas variantes ajustadas a partir de um modelo baseAnálise do LoRAX

Esta lista reflete ferramentas comumente comparadas ao candle-vllm dentro do segmento de mecanismos de inferência/serving, não um ranking independente da PromptQuorum — verifique o conjunto de recursos atual de cada ferramenta antes de escolher.

Perguntas frequentes

O que é o candle-vllm?

O candle-vllm (github.com/EricLBuehler/candle-vllm) é um mecanismo de inferência e serving de LLM gratuito, open source e nativo em Rust, construído sobre o framework Candle da Hugging Face, oferecendo um servidor de API compatível com OpenAI.

O candle-vllm é escrito em Python?

Não. Apesar do "vllm" no nome, o candle-vllm é escrito inteiramente em Rust sobre o framework de machine learning Candle da Hugging Face. Nenhum runtime Python é necessário para rodar o servidor.

O candle-vllm é o mesmo projeto que o vLLM?

Não. É uma implementação em Rust independente, construída do zero, que segue um design de serving semelhante (batching contínuo, gerenciamento de cache KV) ao do projeto vLLM em Python e cita seu paper, mas não reutiliza o código Python do vLLM.

O candle-vllm é gratuito?

Sim, é gratuito e open source sob a licença MIT, sem nível pago.

Quais plataformas o candle-vllm suporta?

A mesma base de código roda em NVIDIA CUDA (11/12/13) no Linux, em Apple Metal no macOS/Apple Silicon (recomenda-se 16 GB+ de memória unificada), e em CPU como fallback.

Como instalo o candle-vllm?

Segundo o README do projeto: um instalador shell de uma linha para instalações DEB/binárias, uma compilação a partir do código-fonte via cargo install com as flags de CUDA/Metal/CPU adequadas, ou uma imagem Docker.

O candle-vllm suporta modelos quantizados?

Sim. Segundo a documentação do projeto, ele suporta os formatos de modelo SafeTensors, GGUF, GPTQ, AWQ, Marlin, MXFP4 e NVFP4.

Quem criou o candle-vllm?

O desenvolvedor EricLBuehler criou e mantém o candle-vllm, construído sobre o framework de machine learning Candle da Hugging Face.

O candle-vllm tem interface web?

Ele pode, opcionalmente, lançar uma interface web integrada no estilo ChatGPT junto com seu servidor de API, em uma porta diferente da porta da API, segundo o README do projeto.

A PromptQuorum verificou de forma independente as alegações de desempenho do candle-vllm?

Não. Esta análise é baseada no próprio repositório GitHub e no README do projeto, não em testes práticos de desempenho realizados pela PromptQuorum.

Fontes

← Voltar para LLMs locais avançados