Principais conclusões
- 7 ferramentas, dois tipos: fine-tuning (4) e observabilidade e avaliação (3). Uma ferramenta que faz mais de uma função aparece em cada tipo a que pertence.
- A tabela é gerada a partir do registro de cada ferramenta e conferida com o README ou site oficial; um traço significa "não informado na documentação", nunca "não".
- É um grupo pequeno: o diretório ainda não tem ferramentas analisadas para as subcategorias de conjuntos de dados e hubs de modelos, por isso elas não são comparadas aqui.
- Cada nome de ferramenta na tabela leva à sua própria análise da PromptQuorum, onde estão as etapas de instalação e os limites.
📍 Em uma frase
Ferramentas locais de treinamento e operação são dois tipos diferentes de produto — ferramentas de fine-tuning e ferramentas de observabilidade e avaliação — por isso as 7 ferramentas do diretório da PromptQuorum são comparadas dentro de cada tipo, usando uma tabela gerada a partir dos mesmos dados de cada análise de ferramenta.
💬 Em termos simples
Algumas ferramentas ensinam um novo comportamento a um modelo por meio de fine-tuning com os seus dados, e outras acompanham o desempenho de uma aplicação com modelo e avaliam suas respostas. Comparar um treinador com um painel de monitoramento pelos mesmos recursos não faz sentido, por isso este guia compara coisas do mesmo tipo.
Como comparamos
Os fatos de cada ferramenta — preço, licença, plataformas, requisitos de hardware e atributos específicos da categoria — são armazenados uma única vez, no registro dessa ferramenta no diretório. A tabela comparativa abaixo é gerada a partir desses registros, e a análise da própria ferramenta usa o mesmo registro, portanto os dois não podem apresentar valores diferentes.
Os atributos específicos da categoria (por exemplo, suporte a LoRA e QLoRA ou tracing) foram retirados do README ou do site oficial de cada projeto e conferidos com a redação exata ali presente. Quando a documentação é omissa, a tabela mostra um traço em vez de adivinhar; quando uma afirmação é condicionada (apenas no roadmap, uma edição enterprise ou um pacote separado), o atributo fica de fora da tabela e é tratado na análise da ferramenta.
Somente ferramentas com análise própria da PromptQuorum estão na tabela. A comparação não classifica as ferramentas em ranking, porque a escolha certa depende da sua restrição.
Tabela comparativa
Escolha abaixo um tipo de ferramenta e leia ao longo da linha. Clique no nome de uma ferramenta para abrir a análise completa da PromptQuorum.
| Ferramenta | Preço | Licença | Plataformas | Execução | Hardware | Versão | LoRA / QLoRA | Interface web | Treinamento multi-GPU | Modo de baixa VRAM | Exportar para GGUF / Ollama | Análise | link de produto · divulgado |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| LLaMA-Factory | Gratuito | Apache-2.0 | macOS, Windows, Linux | Local | 16 GB de VRAM | v0.9.5 | Sim | Sim | Sim | Sim | Sim | Ler análise → | LLaMA-Factory |
| LoRAX | Gratuito | Apache-2.0 | Linux | Local | Varia conforme o modelo | v0.12.1 | — | — | — | — | — | Ler análise → | LoRAX |
| Second Me | Gratuito | Apache-2.0 | macOS, Windows, Linux | Local | Varia conforme o modelo | — | — | — | — | — | — | Ler análise → | Second Me |
| Unsloth | Gratuito | Apache-2.0 | macOS, Windows, Linux | Local | Varia conforme o modelo | — | Sim | Sim | Sim | Sim | Sim | Ler análise → | Unsloth |
"—" significa que a documentação do próprio projeto não informa o dado, não que o recurso não exista. Os valores vêm do README ou do site oficial de cada projeto e são conferidos novamente quando a análise de uma ferramenta é atualizada.
Ferramentas de fine-tuning: o que difere
- LoRA e QLoRA. LLaMA-Factory e Unsloth documentam fine-tuning com LoRA ou QLoRA.
- Interface web. LLaMA-Factory e Unsloth documentam uma interface web para treinamento.
- Treinamento multi-GPU. LLaMA-Factory e Unsloth documentam treinamento multi-GPU.
- Treinamento com pouca VRAM. LLaMA-Factory e Unsloth documentam um modo de pouca VRAM ou de economia de memória.
- Exportação para GGUF ou Ollama. LLaMA-Factory e Unsloth documentam a exportação de modelos para GGUF ou Ollama.
- Linhas esparsas. LoRAX e Second Me aparecem aqui por seus recursos relacionados a fine-tuning, mas a documentação deles não informa nenhum dos atributos comparados, por isso suas células são traços; veja as análises deles.
Observabilidade e avaliação: o que difere
- Tracing. Langfuse e Plano documentam o tracing de chamadas a LLMs.
- Avaliações. Langfuse documenta avaliações ou pontuação.
- Gerenciamento de prompts. Langfuse documenta o gerenciamento de prompts.
- OpenTelemetry. Plano documenta suporte a OpenTelemetry.
- Docker e auto-hospedagem. Langfuse e Mission Control documentam implantação com Docker ou auto-hospedada.
- LLMs locais. Langfuse documenta o trabalho com LLMs locais ou auto-hospedados.
O que esta comparação não pode dizer
- Ela compara capacidades documentadas, não resultados. Não diz nada sobre a qualidade de um modelo após o fine-tuning, a velocidade do treinamento no seu hardware ou a precisão de uma pontuação de avaliação — a PromptQuorum não mediu isso para as ferramentas listadas.
- Os traços são lacunas na documentação que verificamos, não achados negativos. Algumas ferramentas podem oferecer um recurso que o README não menciona.
- Os requisitos de hardware para fine-tuning dependem muito do modelo e das configurações; leia a análise da ferramenta para ver requisitos realistas antes de iniciar um treinamento.
- As ferramentas mudam rápido. A análise de cada ferramenta informa a versão em que foi verificada, e este guia é atualizado quando uma análise é atualizada.
Perguntas frequentes
Qual é a diferença entre uma ferramenta de fine-tuning e uma de observabilidade?
Uma ferramenta de fine-tuning adapta um modelo treinando-o com os seus dados, muitas vezes com métodos eficientes em parâmetros, como LoRA ou QLoRA. Uma ferramenta de observabilidade ou avaliação registra e avalia o comportamento de uma aplicação com LLM em uso, por exemplo rastreando cada requisição. Elas fazem trabalhos diferentes, por isso são comparadas separadamente.
O que significa um traço na tabela comparativa?
Significa que a própria documentação do projeto não informa esse atributo. Não significa que o recurso não exista; consulte a análise da ferramenta ou o repositório dela.
Por que há tão poucas ferramentas aqui?
O diretório tem, até agora, poucas ferramentas analisadas nesta área e nenhuma ainda para conjuntos de dados ou hubs de modelos. A comparação cobre o que foi analisado; mais ferramentas serão adicionadas conforme suas análises forem escritas.
Alguma dessas ferramentas tem link de afiliado?
Não. A PromptQuorum não tem relação de afiliação com nenhuma ferramenta desta comparação no momento da redação, e nenhum link aqui gera comissão.
Com que frequência esta comparação é atualizada?
Ela é atualizada duas vezes por ano e sempre que a análise de uma das ferramentas listadas é atualizada, porque a tabela é gerada a partir dos mesmos dados dessas análises.
Fontes
- O README ou site oficial de cada ferramenta, listado na análise da PromptQuorum dessa ferramenta (com link a partir da tabela comparativa).
- Diretório de apps de IA local da PromptQuorum — o registro a partir do qual cada linha da tabela é gerada.