Skip to main content
PromptQuorum
Início/LLMs locais avançados/MLC LLM 2026: compile uma vez, rode em qualquer lugar
Overview & Reference

MLC LLM 2026: compile uma vez, rode em qualquer lugar

·8 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

O MLC LLM é uma engine universal de implantação de LLM gratuita, com licença Apache 2.0, que usa compilação por aprendizado de máquina (construída sobre o Apache TVM) para compilar um modelo em um runtime otimizado para um destino específico — iOS, Android, navegadores web via WebGPU, ou GPUs de desktop via CUDA, Vulkan, Metal ou ROCm. Surgiu de uma colaboração que inclui CMU Catalyst, UW SAMPL, SJTU e OctoML, com o professor da CMU e criador do Apache TVM Tianqi Chen entre seus principais colaboradores, e conta com um projeto irmão, o WebLLM, dedicado especificamente à inferência no navegador sem necessidade de servidor.

O MLC LLM compila um modelo de linguagem em um runtime otimizado que pode rodar nativamente em um iPhone, um celular Android, um navegador web via WebGPU ou uma GPU de desktop — o mesmo modelo, compilado por máquina para cada destino, em vez de uma engine ajustada manualmente para uma única plataforma.

MLC LLM 2026: compile uma vez, rode em qualquer lugar

Principais conclusões

  • Licença Apache 2.0 — gratuita para uso pessoal e comercial
  • Cerca de 23.000+ estrelas no GitHub em setembro de 2026, repositório em github.com/mlc-ai/mlc-llm
  • Surgiu de uma colaboração que inclui CMU Catalyst, UW SAMPL, SJTU, OctoML e a comunidade MLC mais ampla
  • Tianqi Chen — professor da CMU, criador do Apache TVM, XGBoost e MXNet, e cofundador da OctoML — está entre os principais colaboradores
  • Usa compilação de ML (Apache TVM, TensorIR, MetaSchedule) para gerar um runtime otimizado por destino, em vez de uma única engine ajustada à mão
  • Roda em iOS/iPadOS, Android, navegadores web (via WebGPU) e desktop/servidor (Linux, macOS, Windows) com aceleração CUDA, Vulkan, Metal ou ROCm

📍 Em uma frase

O MLC LLM é uma engine universal de implantação de LLM gratuita, com licença Apache 2.0, que usa compilação por aprendizado de máquina, construída sobre o Apache TVM, para compilar um modelo em um runtime otimizado para iOS, Android, navegadores web via WebGPU, ou GPUs de desktop.

💬 Em termos simples

A maioria das engines de inferência é um programa escrito à mão que tenta rodar em qualquer lugar; o MLC LLM, em vez disso, compila um modelo especificamente para cada dispositivo de destino, da mesma forma que um compilador gera código de máquina diferente para arquiteturas de CPU diferentes a partir do mesmo código-fonte.

📌Nota: O WebLLM (github.com/mlc-ai/web-llm) é um projeto irmão independente dentro da mesma organização mlc-ai, dedicado especificamente a rodar modelos inteiramente dentro de um navegador web sem nenhuma inferência do lado do servidor.

O que é o MLC LLM?

O MLC LLM é uma engine gratuita e de código aberto que compila grandes modelos de linguagem em runtimes nativos otimizados para uma ampla gama de plataformas de destino, de celulares a navegadores e GPUs de desktop. Ele se descreve como uma "engine universal de implantação de LLM com compilação de ML".

O projeto está hospedado em github.com/mlc-ai/mlc-llm sob licença Apache 2.0 e já ultrapassou cerca de 23.000 estrelas no GitHub. Foi iniciado por membros da CMU Catalyst, UW SAMPL, SJTU, OctoML e da comunidade MLC — um grupo, não uma única empresa. Tianqi Chen, professor da CMU e criador do Apache TVM, XGBoost e MXNet, está entre seus principais colaboradores.

  • Compila um modelo em um runtime otimizado específico para o destino, em vez de interpretar o mesmo código genérico em cada plataforma
  • Baseia-se no Apache TVM e em pesquisas relacionadas de compiladores (TensorIR, MetaSchedule) para otimização automatizada por destino
  • Suporta iOS/iPadOS, Android, navegadores web e plataformas de desktop/servidor a partir de uma única cadeia de ferramentas
  • Tem um projeto irmão ativo, o WebLLM, dedicado especificamente à inferência inteiramente do lado do cliente, no navegador

O que realmente significa "compilação de ML" aqui?

A compilação de ML trata a implantação de um modelo em um novo dispositivo da mesma forma que um compilador tradicional trata a implantação de código em uma nova arquitetura de CPU — gerando automaticamente código otimizado e específico para o destino a partir de uma única descrição do modelo. Essa é a ideia central que permite ao MLC LLM abranger uma gama de hardware tão ampla.

  • O Apache TVM fornece a infraestrutura de compilação sobre a qual o MLC LLM é construído, traduzindo os grafos de computação do modelo em código de baixo nível otimizado por destino
  • O TensorIR é a representação intermediária usada para descrever cálculos tensoriais antes da otimização específica do destino
  • O MetaSchedule automatiza a busca por implementações de kernel de alto desempenho por destino, em vez de exigir que uma pessoa escreva e ajuste cada uma manualmente
  • O resultado é um único modelo que pode ser compilado para rodar em uma GPU NVIDIA via CUDA, uma GPU AMD via Vulkan ou ROCm, uma GPU Apple via Metal, ou um navegador via WebGPU, em grande parte a partir da mesma fonte

Como instalar e implantar o MLC LLM?

O MLC LLM é instalado como um pacote Python para uso em desktop/servidor, e oferece apps pré-compilados para iOS e Android, com o WebLLM disponível como pacote JavaScript para implantação em navegador. O caminho certo depende da plataforma de destino.

  1. 1
    Para uso em desktop/servidor: instalar o pacote Python do MLC LLM seguindo o guia oficial de instalação, que cobre configurações CUDA, Vulkan, Metal e ROCm.
  2. 2
    Escolher um modelo suportado e compilá-lo para o dispositivo de destino usando as ferramentas de conversão e compilação do MLC LLM, ou usar um modelo já compilado da comunidade MLC.
  3. 3
    Para mobile: o MLC LLM oferece projetos de exemplo de apps iOS e Android que empacotam juntos um modelo compilado e o runtime.
  4. 4
    Para implantação em navegador sem servidor: usar o WebLLM diretamente como um pacote JavaScript/TypeScript, que roda inteiramente no lado do cliente via WebGPU.
  5. 5
    Executar e testar o runtime compilado no dispositivo ou navegador de destino para confirmar que a aceleração está ativa no backend esperado (CUDA, Vulkan, Metal, ROCm ou WebGPU).

Preciso recompilar um modelo para cada plataforma?

Em geral, sim. A etapa de compilação do MLC LLM produz um runtime otimizado para um destino específico (um determinado backend de GPU, sistema operacional móvel ou navegador), então implantar em uma nova plataforma normalmente significa compilar para esse destino.

O MLC LLM consegue rodar sem GPU?

Os runtimes compilados são construídos principalmente em torno de caminhos de aceleração por GPU (CUDA, Vulkan, Metal, ROCm, WebGPU ou OpenCL mobile); a implantação focada em CPU não é o foco principal do projeto, como acontece com engines como o llama.cpp.

Quais plataformas e backends de GPU o MLC LLM suporta?

A característica definidora do MLC LLM é a amplitude do suporte a plataformas, abrangendo sistemas operacionais móveis e navegadores web ao lado das GPUs de desktop convencionais. Poucas outras engines de inferência local visam essa combinação a partir de uma única cadeia de ferramentas.

  • iOS/iPadOS — aceleração Metal em GPUs Apple da série A
  • Android — aceleração OpenCL em GPUs Adreno e Mali
  • Navegadores web — WebGPU e WASM, via o projeto irmão WebLLM, sem necessidade de servidor
  • Desktop/servidor (Linux, macOS, Windows) — CUDA (NVIDIA), Vulkan (AMD/NVIDIA/Intel), Metal (Apple) e ROCm (AMD)

Para quem é o MLC LLM?

Use o MLC LLM se o destino de implantação incluir dispositivos móveis ou navegadores web ao lado de GPUs de desktop; use uma engine mais específica se o destino for apenas um tipo de plataforma.

Como o MLC LLM se compara ao llama.cpp e a outras engines?

As comparações mais próximas do MLC LLM são outras engines voltadas a um amplo suporte de hardware, embora ele seja o único deste grupo construído em torno de uma abordagem baseada em compilador com implantação no navegador.

Ferramenta
Licença
Melhor para
MLC LLMApache 2.0Celulares, navegadores e desktop a partir de um pipeline
WebLLMApache 2.0Inferência inteiramente no lado do cliente, no navegador
llama.cppMITMaior suporte de hardware, controle direto
TensorRT-LLMApache 2.0Máximo throughput, apenas GPUs NVIDIA
OllamaMITConfiguração de desktop único mais simples

Erros comuns ao avaliar o MLC LLM

A maior parte da confusão vem de esperar uma experiência de binário plug-and-play, ou de não perceber que o WebLLM é um projeto irmão separado.

Perguntas frequentes

O que é o MLC LLM?

O MLC LLM é uma engine gratuita, com licença Apache 2.0, que usa compilação por aprendizado de máquina para implantar grandes modelos de linguagem em celulares, navegadores web e GPUs de desktop a partir de uma única cadeia de ferramentas.

Quem criou o MLC LLM?

O MLC LLM foi iniciado por membros da CMU Catalyst, UW SAMPL, SJTU, OctoML e da comunidade MLC. Tianqi Chen, professor da CMU e criador do Apache TVM, XGBoost e MXNet, está entre seus principais colaboradores.

O MLC LLM é gratuito para uso comercial?

Sim. O MLC LLM tem licença Apache 2.0, gratuita para uso pessoal e comercial.

O MLC LLM roda em um navegador web?

Sim, por meio do seu projeto irmão WebLLM, que executa modelos inteiramente no lado do cliente via WebGPU, sem necessidade de inferência do lado do servidor.

O que significa "compilação de ML" no MLC LLM?

Refere-se ao uso de técnicas de compilação (construídas sobre o Apache TVM, com TensorIR e MetaSchedule) para gerar automaticamente um runtime otimizado para um dispositivo de destino específico, em vez de depender de uma única engine ajustada à mão para cada plataforma.

O MLC LLM suporta iOS e Android?

Sim. O iOS/iPadOS é suportado via Metal em GPUs Apple da série A, e o Android via OpenCL em GPUs Adreno e Mali.

Quais backends de GPU o MLC LLM suporta no desktop?

CUDA (NVIDIA), Vulkan (AMD, NVIDIA, Intel), Metal (Apple) e ROCm (AMD).

Preciso compilar um modelo separadamente para cada plataforma?

Em geral, sim. O MLC LLM compila um modelo em um runtime otimizado para um destino específico, então implantar em uma nova plataforma (um backend de GPU diferente, um sistema operacional móvel ou o navegador) normalmente exige compilar para esse destino.

Em que o MLC LLM difere do llama.cpp?

O llama.cpp é uma engine C/C++ escrita à mão, com backends ajustados manualmente por fabricante de hardware. O MLC LLM, em vez disso, usa um compilador (Apache TVM) para gerar automaticamente código otimizado por destino, o que também permite alcançar dispositivos móveis e navegadores web via WebGPU.

O MLC LLM é adequado para serviço de produção específico da NVIDIA em grande escala?

Não é seu foco principal. Para o máximo throughput de produção específico da NVIDIA, o TensorRT-LLM ou o vLLM são ferramentas mais especializadas; o ponto forte do MLC LLM é a amplitude entre plataformas muito diferentes, não o throughput máximo em uma única.

Fontes

← Voltar para LLMs locais avançados