Skip to main content
PromptQuorum
Início/LLMs locais/Melhor framework de fine-tuning de LLM 2026: Unsloth, Axolotl ou nuvem
Tools & Interfaces

Melhor framework de fine-tuning de LLM 2026: Unsloth, Axolotl ou nuvem

·13 min de leitura·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

Esta página contém links de referência para produtos de terceiros. O PromptQuorum não está inscrito em nenhum programa de afiliados — são links simples que não geram comissão. Clicar nos links e os próximos passos são de sua inteira responsabilidade. Estes links não representam qualquer endosso ou verificação por parte do PromptQuorum.

O Unsloth e o melhor framework de fine-tuning para a maioria dos desenvolvedores em 2026: a biblioteca Apache-2.0 e gratuita, ja cobre configuracoes multi-GPU e os backends NVIDIA, AMD, Intel, CPU e Vulkan em Windows, Linux, WSL e macOS, e traz um aplicativo de desktop. O Axolotl e a melhor escolha quando uma unica maquina deixa de bastar, porque e o unico dos tres com treino multinó e paralelismo ND, alem da mais ampla gama de metodos de alinhamento. O MLX-LM e a opcao mais enxuta em Apple Silicon, construida diretamente sobre o MLX da Apple. Se voce preferir nao executar o trabalho, a Together.ai cobra US$ 0,48 por milhao de tokens de treino para LoRA em modelos de ate 16B, com minimo de US$ 4 por job.

Key Takeaways

  • Unsloth — 75,0 mil estrelas no GitHub, Apache-2.0. O README declara suporte a configuracoes multi-GPU, GPUs NVIDIA, AMD e Intel, CPUs e o backend Vulkan, em Windows, Linux, WSL e macOS, com builds de desktop. Multi-GPU nao esta atras de barreira paga no projeto de codigo aberto.
  • Axolotl — 12,4 mil estrelas, Apache-2.0. O unico dos tres com treino multinó documentado (Torchrun, Ray) e paralelismo ND que combina paralelismo de contexto, de tensores e de dados totalmente fragmentados dentro de um nó e entre varios.
  • MLX-LM — 6,8 mil estrelas, MIT, da organizacao `ml-explore` da Apple, cujo proprio perfil descreve o trabalho como "by Apple". Suporta LoRA e fine-tuning completo, modelos quantizados e inferencia e ajuste distribuidos via `mx.distributed`.
  • Together.ai — fine-tuning supervisionado com LoRA a US$ 0,48/M tokens de treino ate 16B parametros, US$ 1,50 em 17–69B e US$ 2,90 em 70–100B. O fine-tuning supervisionado completo custa bem mais: US$ 1,20, US$ 3,75 e US$ 7,25 nas mesmas faixas. Aplica-se um minimo de US$ 4,00 por job.
  • Fireworks.ai — LoRA SFT a partir de US$ 0,50/M tokens ate 16B, subindo para US$ 10,00 acima de 300B; o DPO de parametros completos chega a US$ 40,00/M na faixa superior. A pagina de precos diz sem rodeios: "Serve fine-tuned models for the same price as base models."
  • A Predibase deixou de ser produto independente. A Rubrik anunciou a aquisicao em 25 de junho de 2025 e, em 28 de agosto de 2026, predibase.com devolve um redirecionamento HTTP 301 para a pagina Agent Cloud da Rubrik. Nao envie ninguem a um cadastro que nao existe mais.
  • Nem Together.ai nem Fireworks.ai tem programa publico de afiliados ou indicacao que tenhamos conseguido encontrar em agosto de 2026, e nenhuma delas aparece nas principais listagens do setor. Todos os links desta pagina sao nao remunerados.

🏆 A melhor escolha para o seu caso

A divisao que importa e se voce executa o treino ou paga alguem para executa-lo. Leia a lista e pare na primeira linha que descreva voce.

  • Voce tem uma GPU capaz e quer o caminho mais curto ate um ajuste funcional → Unsloth. Gratuito, Apache-2.0 e agora com multi-GPU e hardware nao NVIDIA, de modo que o antigo motivo para abandona-lo praticamente desapareceu.
  • Seu treino nao cabe mais em uma maquina → Axolotl. O multinó via Torchrun e Ray somado ao paralelismo ND e a verdadeira linha divisoria em relacao ao Unsloth em 2026.
  • Voce esta em um Mac com chip da serie M → MLX-LM se quiser a via mais enxuta e nativa de MLX, embora o Unsloth ja rode em macOS tambem, o que torna isso uma preferencia e nao mais a unica opcao.
  • Voce precisa de DPO, ORPO, KTO, GRPO ou modelagem de recompensa → Axolotl. Sua gama documentada de metodos e de longe a mais ampla dos tres.
  • Voce nao tem GPU e nao quer alugar uma → Together.ai pelos precos por token transparentes, ou Fireworks.ai se for servir o modelo ajustado depois sem sobretaxa de hospedagem.
Together.ai — ver precos de fine-tuninglink de produto · divulgadoFireworks.ai — ver precos de fine-tuninglink de produto · divulgado

Ajustar localmente ou na nuvem?

Ajuste localmente se ja tem uma GPU capaz e pretende iterar; use uma API na nuvem se nao tem hardware ou se ajusta tao raramente que a cobranca por job sai mais barata que o seu proprio tempo de configuracao. Essa pergunta vem antes de "qual framework", porque decide qual metade desta pagina se aplica a voce.

A versao honesta do trade-off e que treinar localmente e barato por execucao e caro por hora da sua atencao, enquanto uma API na nuvem inverte isso. Quem ajusta uma vez por trimestre ganha de verdade ao nao depurar incompatibilidade de driver as 23h. Quem itera duas vezes por semana sobre o mesmo conjunto de dados vera a cobranca por token ultrapassar rapidamente o custo do hardware.

Ajuste localmente quando tiver uma GPU capaz e iterar com frequencia, e use uma API de fine-tuning na nuvem quando nao tiver hardware ou treinar tao pouco que a tarifa por job custe menos que o seu proprio tempo de configuracao.

Ter o hardware torna cada execucao quase gratuita, mas custa a configuracao. Alugar o servico custa alguns dolares por execucao, mas voce comeca em minutos. Qual sai mais barato depende so da frequencia com que voce treina.

  • Treine localmente se tiver uma placa da classe RTX 3090/4090 ou superior, iterar semanalmente sobre o mesmo conjunto de dados, ou se os dados de treino nao puderem sair da sua maquina por privacidade ou propriedade intelectual.
  • Use uma API na nuvem se nao tiver GPU, precisar de um modelo maior do que seu hardware comporta mesmo em 4 bits, ou quiser serving gerenciado junto com o treino.
  • Qualquer uma serve se voce ajusta mensalmente um modelo 7B: nessa cadencia a diferenca de custo e pequena o bastante para a conveniencia decidir.

Os tres frameworks locais comparados

Unsloth, Axolotl e MLX-LM sao os tres frameworks locais de fine-tuning que valem a pena em 2026, e as fronteiras entre eles se moveram. O Unsloth ja foi a opcao CUDA de GPU unica e hoje e a mais ampla; o argumento do Axolotl e a profundidade em treino distribuido, nao o mero multi-GPU; o MLX-LM segue o mais enxuto em Apple Silicon, mas nao e mais a unica opcao para Mac. Os tres sao gratuitos e de codigo aberto, e nenhum exige que seus dados de treino saiam de casa.

Estrelas e licencas foram lidas da API do GitHub em 28 de agosto de 2026. As afirmacoes sobre capacidades vem do README de cada projeto.

CriterioUnslothAxolotlMLX-LM
Estrelas no GitHub75,0 mil12,4 mil6,8 mil
LicencaApache-2.0Apache-2.0MIT
Ideal paraO caminho mais rapido no hardware proprioEscalar alem de uma maquinaTrabalho enxuto nativo de MLX no Mac
Multi-GPUSim, no projeto de codigo abertoSim — FSDP1, FSDP2, DeepSpeedVia mx.distributed
MultinóNao documentado no READMESim — Torchrun e RayVia mx.distributed
HardwareNVIDIA, AMD, Intel, CPU, VulkanPilha CUDA principalmenteSomente Apple Silicon
Sistemas operacionaisWindows, Linux, WSL, macOSNa pratica Linux e WSLmacOS
Dificuldade de instalacaoBaixa — instalador e builds de desktopMedia — conduzido por YAMLBaixa — pip install

📌Note: Comparativos mais antigos, inclusive o rascunho que originou esta pagina, descrevem multi-GPU como recurso pago do Unsloth e o MLX-LM como projeto comunitario em vez de projeto da Apple. Ambas as afirmacoes sao contrariadas pelo README atual e pelo perfil da organizacao. Se ler isso em outro lugar, confira a data.

Unsloth: a escolha local padrao

E pelo Unsloth que a maioria deveria comecar, e os motivos aumentaram em vez de diminuir. E de longe o mais estrelado dos tres, a licenca e Apache-2.0 e sua cobertura de hardware e de sistemas e hoje a mais ampla aqui.

1

Unsloth — melhor framework local geral

Gratuito sob Apache-2.0, multi-GPU incluido, roda em NVIDIA, AMD, Intel, CPU e macOS

O Unsloth reescreve kernels de atencao e de gradientes para reduzir o uso de VRAM e acelerar o treino LoRA e QLoRA, e esse segue sendo seu apelo central. O que mudou foi o alcance. Seu README agora declara suporte a configuracoes multi-GPU em GPUs NVIDIA, AMD e Intel, CPUs e o backend Vulkan, rodando em Windows, Linux, WSL e macOS, com builds de desktop para cada um. Nada nos 22 KB do README Apache-2.0 coloca isso atras de um plano pago. O projeto tambem cresceu para alem de uma biblioteca de treino, aproximando-se de uma bancada local, com uma interface Studio e um endpoint de serving compativel com OpenAI. Existem planos pagos Pro e Enterprise, mas seus precos nao sao publicados: trate como nao verificada qualquer cifra especifica citada em outro lugar.

Vantagens

  • +Gratuito e Apache-2.0, com suporte a multi-GPU no projeto de codigo aberto
  • +A mais ampla cobertura de hardware aqui: NVIDIA, AMD, Intel, CPU e Vulkan
  • +Roda em Windows, Linux, WSL e macOS, com builds de desktop
  • +O menor esforco de instalacao dos tres — um instalador em vez de uma arvore de configuracao

Desvantagens

  • O treino multinó nao esta documentado no README; o Axolotl e mais claro aqui
  • Os precos Pro e Enterprise nao sao publicados, entao orca-los exige falar com o comercial
  • O escopo crescente significa mais superficie do que um time que so quer uma biblioteca de treino precisa
Unsloth — repositorio de codigo abertolink de produto · divulgado

Axolotl: a escolha para escalar

O Axolotl merece seu lugar pelo treino distribuido e pela amplitude de metodos, nao pelo multi-GPU em si. Agora que o Unsloth cobre varias GPUs em uma mesma caixa, a linha divisoria honesta esta no que acontece quando uma caixa nao basta.

1

Axolotl — melhor para escalar alem de uma maquina

Multinó via Torchrun e Ray, paralelismo ND e a mais ampla gama de metodos

O Axolotl e conduzido por arquivos de configuracao, que e exatamente o que se quer quando um treino precisa ser reproduzivel em um cluster em vez de reconstruido a partir de um notebook. Seu README documenta multi-GPU via FSDP1, FSDP2 e DeepSpeed, multinó via Torchrun e Ray, e paralelismo ND que combina paralelismo de contexto, de tensores e de dados totalmente fragmentados tanto dentro de um nó quanto entre varios. Ha tambem paralelismo de especialistas para treino distribuido de mistura de especialistas. A lista de metodos de treino e de longe a mais ampla dos tres: fine-tuning completo, LoRA, QLoRA, GPTQ, treino consciente de quantizacao, precisao mista FP8, ajuste por preferencia com DPO, IPO, KTO e ORPO, aprendizado por reforco com GRPO e GDPO, e modelagem de recompensa e de recompensa de processo.

Vantagens

  • +Treino multinó documentado via Torchrun e Ray
  • +Paralelismo ND combinando contexto, tensores e dados fragmentados
  • +A mais ampla gama de metodos: DPO, IPO, KTO, ORPO, GRPO, GDPO e modelagem de recompensa
  • +Execucoes conduzidas por configuracao sao reproduziveis e revisaveis, o que importa em equipe

Desvantagens

  • Curva de aprendizado mais ingreme — conte com tempo real de leitura antes do primeiro sucesso
  • Na pratica centrado em CUDA, entao nao e a resposta em hardware AMD, Intel ou Apple
  • Mais maquinario do que realmente precisa quem ajusta sozinho um unico modelo 7B
Axolotl — repositorio de codigo abertolink de produto · divulgado

MLX-LM: a escolha para Apple Silicon

O MLX-LM e a forma mais enxuta de ajustar em um Mac com chip da serie M, construida diretamente sobre o framework de arrays MLX da Apple em vez de adaptada a ele. Vale ser preciso sobre o que ele e: a organizacao `ml-explore` que o mantem se descreve como "by Apple", ou seja, e o trabalho de aprendizado de maquina da propria Apple, nao um port comunitario sem vinculo.

1

MLX-LM — melhor opcao enxuta em Apple Silicon

Licenca MIT, integracao com o Hugging Face Hub, treino distribuido via mx.distributed

O MLX-LM e um pacote Python para gerar texto e ajustar modelos de linguagem em Apple Silicon com MLX. Integra-se ao Hugging Face Hub, deixando milhares de modelos a um unico comando, permite quantizar e enviar modelos de volta ao Hub e lida tanto com ajuste de baixo posto quanto completo, inclusive em modelos quantizados. Tambem suporta inferencia e ajuste distribuidos via `mx.distributed`, o que torna desatualizada a afirmacao comum de que seria estritamente uma ferramenta de maquina unica. O que ele nao e: multiplataforma. Depende do MLX e da memoria unificada do Apple Silicon, entao em Windows ou Linux simplesmente nao e candidato.

Vantagens

  • +Construido nativamente sobre MLX e a memoria unificada do Apple Silicon
  • +Licenca MIT, a mais permissiva das tres
  • +Inferencia e ajuste distribuidos via mx.distributed
  • +Integracao com o Hugging Face Hub tanto para baixar quanto para publicar modelos

Desvantagens

  • Somente Apple Silicon — nao e opcao em Windows ou Linux
  • A menor comunidade das tres, com 6,8 mil estrelas, e portanto menos exemplos prontos
  • Nao e mais a unica opcao para Mac agora que o Unsloth publica builds de macOS
MLX-LM — repositorio de codigo abertolink de produto · divulgado

Plataformas na nuvem e precos reais

Together.ai e Fireworks.ai cobram por token de treino em vez de por hora de GPU, o que torna o custo de um job estimavel antes de inicia-lo. As tarifas abaixo foram lidas nas paginas publicas de precos de cada fornecedor em 28 de agosto de 2026. Repare na diferenca entre LoRA e fine-tuning completo: e dali que vem quase toda surpresa de custo.

Faixa e metodoTogether.aiFireworks.ai
LoRA SFT, ate 16BUS$ 0,48 / 1M tokensUS$ 0,50 / 1M tokens
SFT completo, ate 16BUS$ 1,20 / 1M tokensUS$ 1,00 / 1M tokens
LoRA SFT, faixa mediaUS$ 1,50 (17–69B)US$ 3,00 (16,1–80B)
LoRA SFT, faixa grandeUS$ 2,90 (70–100B)US$ 6,00 (80–300B)
SFT completo, faixa grandeUS$ 7,25 (70–100B)US$ 12,00 (80–300B)
Topo da tabela publicadaUS$ 8,00 DPO completo, 70–100BUS$ 40,00 DPO completo, +300B
Minimo por jobUS$ 4,00Nao publicado
Servir o modelo ajustadoCobrado a parte como inferenciaMesmo preco dos modelos base

Escolha a Together.ai pela estrutura de faixas mais clara e pela tarifa de entrada menor. Escolha a Fireworks.ai se for servir o modelo depois, ja que sua politica declarada e servir modelos ajustados a preco de modelo base.

⚠️Warning: Um numero muito copiado descreve o fine-tuning completo da Together.ai como US$ 0,54 a US$ 3,20 por milhao de tokens. Essa e, na verdade, a faixa de LoRA DPO. O fine-tuning supervisionado completo custa de US$ 1,20 a US$ 7,25 nas mesmas faixas, mais que o dobro do topo mal citado. Orce pela pagina do fornecedor, nao por um artigo comparativo.

O que aconteceu com a Predibase

A Predibase nao e mais uma plataforma independente de fine-tuning em autoatendimento, e qualquer guia que ainda o envie para se cadastrar la esta desatualizado. A Rubrik anunciou a aquisicao em 25 de junho de 2025, noticiada na epoca por TechCrunch e CNBC e confirmada pela propria sala de imprensa da Rubrik.

Em 28 de agosto de 2026, requisitar predibase.com devolve um redirecionamento permanente HTTP 301 para a pagina de produto Agent Cloud da Rubrik. Nao conseguimos ler esse destino diretamente — ele responde HTTP 403 a requisicoes automatizadas —, portanto esta pagina nao afirma nada sobre o que ele oferece hoje. Verificavel sao o redirecionamento em si e a aquisicao por tras dele. Se precisar de um servico gerenciado de fine-tuning no estilo Predibase, pergunte a Rubrik o que sobreviveu em vez de supor que o cadastro antigo ainda funciona.

💡Tip: E um lembrete util para qualquer comparativo de plataformas na nuvem: um produto que era uma recomendacao solida ha um ano e meio pode hoje ser um link morto. Reveja o status do fornecedor a cada atualizacao em vez de arrastar uma recomendacao de memoria.

Quanto custa de fato ajustar um 7B

Um trabalho realista de ajuste por instrucoes sai mais barato do que a maioria espera na nuvem e quase gratis localmente, e por isso costuma decidir o tempo de configuracao, nao a computacao. Tome 10.000 exemplos com media de 300 tokens: sao 3M de tokens de treino, ou cerca de 9M processados em tres epocas. A tabela e aritmetica sobre as tarifas publicadas acima.

RotaTarifa usadaCusto de 9M tokens
Together.ai, LoRA SFTUS$ 0,48 / 1M, ate 16BUS$ 4,32, entao o minimo de US$ 4 nao se aplica
Together.ai, SFT completoUS$ 1,20 / 1M, ate 16BUS$ 10,80
Fireworks.ai, LoRA SFTUS$ 0,50 / 1M, ate 16BUS$ 4,50
Fireworks.ai, SFT completoUS$ 1,00 / 1M, ate 16BUS$ 9,00
GPU de 24 GB alugadaAluguel por hora, varia por provedorMuitas vezes menos de uma hora, mais configuracao
GPU que voce ja temSomente eletricidade marginalPraticamente zero por execucao

Em hardware que voce ja tem, o local vence em toda execucao depois da primeira. Para execucoes ocasionais em hardware alugado, compare aluguel mais configuracao com o preco fixo por token para o tamanho real do seu conjunto de dados.

💡Tip: Os valores de nuvem aqui sao tao pequenos que, para um unico experimento, o fator decisivo quase nunca e dinheiro. E se voce prefere gastar uma noite configurando o ambiente ou cinco dolares. Conte seu proprio tempo com honestidade e a resposta costuma ficar obvia.

Quem deve usar o que

Com que frequencia voce treina e se tem hardware decidem isso, nao a contagem de estrelas. Quatro perfis cobrem a maioria dos leitores.

  • Entusiasta com um unico experimento → Together.ai para dispensar a infraestrutura por completo, ou Unsloth em uma GPU alugada. Nao compre hardware para um unico experimento.
  • Engenheiro de ML iterando toda semana → Unsloth em hardware proprio. A cobranca por token se acumula rapido em alta frequencia, e o Unsloth ja cobre multi-GPU sem plano pago.
  • Time treinando em varias maquinas → Axolotl, pelo multinó e pelo paralelismo ND, e porque execucoes conduzidas por configuracao sao reproduziveis e revisaveis como notebooks nao sao.
  • Startup levando um modelo ajustado a producao → Fireworks.ai se a economia de serving pesar mais, ja que modelos ajustados sao servidos a preco de modelo base; Together.ai se preferir a estrutura de faixas mais clara. Veja tambem executar LLMs locais em producao.

Fine-tuning na UE, no Japao e na China

O fine-tuning envia seus dados de treino para quem executa o trabalho. Isso torna a escolha entre local e nuvem uma decisao de governanca de dados em tres mercados importantes, e nao apenas uma comparacao de custos.

Erros comuns ao escolher uma pilha de fine-tuning

  1. 1
    Acreditar que multi-GPU exige o plano pago do Unsloth
    Why it matters: Isso foi muito repetido e e contrariado pelo README atual do projeto, que lista suporte a multi-GPU ao lado dos backends AMD, Intel, CPU e Vulkan sem nenhuma barreira paga no repositorio Apache-2.0. Ha times que adotaram um framework mais pesado apenas para obter um multi-GPU que ja tinham.
  2. 2
    Citar o fine-tuning completo da Together.ai como US$ 0,54 a US$ 3,20 por milhao de tokens
    Why it matters: Essa faixa e de LoRA DPO, nao de fine-tuning supervisionado completo, que na verdade custa de US$ 1,20 a US$ 7,25 nas mesmas faixas. Um orcamento montado sobre a linha errada subestima um ajuste completo grande em mais da metade.
  3. 3
    Enviar leitores para a Predibase
    Why it matters: A Rubrik a adquiriu em junho de 2025 e predibase.com agora redireciona com 301. Qualquer guia que ainda descreva um cadastro em autoatendimento na Predibase nao foi reverificado desde a aquisicao.
  4. 4
    Tratar o MLX-LM como projeto comunitario nao oficial
    Why it matters: A organizacao `ml-explore` descreve seu trabalho como "by Apple". Descarta-lo como port comunitario leva a rejeita-lo por um risco de manutencao que nao existe.
  5. 5
    Ajustar quando a recuperacao era a resposta
    Why it matters: O fine-tuning ensina formato, tom e habilidades estreitas. E um jeito ruim e caro de injetar fatos que mudam, porque atualiza-los implica treinar de novo. Fatos pertencem a uma pipeline de recuperacao — veja [RAG local sobre seus documentos](/pt/local-llms/local-rag-2026).

Pule isto se…

Se sua queixa e que o modelo nao conhece os documentos da sua empresa, o fine-tuning e a ferramenta errada e vai custar um ciclo de treino ate voce descobrir isso. Esse e um problema de recuperacao. Uma pipeline RAG bem construida responde a partir de documentos que voce pode atualizar nesta tarde, ao passo que um ajuste os assa em pesos que voce teria de retreinar para corrigir.

O fine-tuning se justifica quando voce precisa de um formato de saida consistente, um tom especifico ou uma habilidade estreita que o prompting nao produz de forma confiavel. Sao mudancas de comportamento, e comportamento e justamente o que o treino muda bem. Tente primeiro um prompt de sistema estruturado, depois recuperacao, e recorra a um treino apenas quando ambos falharem visivelmente naquilo de que voce precisa.

💡Tip: Um teste pratico: se voce consegue escrever a resposta certa e cola-la no prompt, tem um problema de recuperacao ou de prompting. Se consegue apenas descrever a forma de uma boa resposta, mas nao seu conteudo, ai sim e um problema de fine-tuning.

Perguntas frequentes

Qual e o melhor framework de fine-tuning de LLM em 2026?

Unsloth para a maioria de quem treina em hardware proprio, porque a biblioteca Apache-2.0 e gratuita e ja cobre configuracoes multi-GPU em NVIDIA, AMD, Intel, CPU e Vulkan sobre Windows, Linux, WSL e macOS. O Axolotl e melhor quando o treino abrange varias maquinas, ja que documenta treino multinó e paralelismo ND. O MLX-LM e a opcao mais enxuta em Apple Silicon.

O Unsloth e gratuito, e a versao gratuita suporta multi-GPU?

A biblioteca Unsloth e gratuita sob Apache-2.0 e seu README lista suporte a multi-GPU sem barreira paga no repositorio. Existem planos pagos Pro e Enterprise, mas seus precos nao sao publicados, entao qualquer cifra especifica citada em outro lugar deve ser tratada como nao verificada. A afirmacao comum de que multi-GPU exige plano pago e contrariada pela documentacao atual do projeto.

Quanto custa o fine-tuning na nuvem por milhao de tokens?

Na Together.ai, o fine-tuning supervisionado com LoRA custa US$ 0,48 por milhao de tokens ate 16B parametros, US$ 1,50 entre 17 e 69B e US$ 2,90 entre 70 e 100B, com minimo de US$ 4,00 por job. O fine-tuning supervisionado completo custa US$ 1,20, US$ 3,75 e US$ 7,25 nessas mesmas faixas. Na Fireworks.ai, o LoRA SFT parte de US$ 0,50 por milhao de tokens ate 16B e sobe para US$ 10,00 acima de 300B.

Posso usar o MLX-LM no Windows ou Linux?

Nao. O MLX-LM e construido sobre o framework MLX da Apple e a memoria unificada do Apple Silicon, entao nao e candidato em outras plataformas. Use Unsloth ou Axolotl no Windows ou Linux. Note que o Unsloth tambem publica builds de macOS agora, entao em um Mac voce tem uma escolha real entre os dois.

O que aconteceu com a Predibase?

A Rubrik anunciou a aquisicao da Predibase em 25 de junho de 2025. Em 28 de agosto de 2026, predibase.com devolve um redirecionamento HTTP 301 para a pagina Agent Cloud da Rubrik em vez de servir um produto independente. Confirme a disponibilidade atual diretamente com a Rubrik antes de depender disso em um projeto novo.

Together.ai ou Fireworks.ai tem programas de afiliados?

Nao encontramos programa publico de afiliados ou indicacao para nenhuma das duas em agosto de 2026, e nenhuma aparece nas principais listagens do setor. Suas paginas de parceiros descrevem integracoes empresariais, nao programas de indicacao para criadores. A PromptQuorum nao ganha nada com os links desta pagina.

O fine-tuning na nuvem e mais caro que o local?

Depende da frequencia com que voce treina. Para uma unica execucao em um conjunto pequeno, a taxa na nuvem e de poucos dolares, normalmente menos que o valor de uma noite dedicada a configurar o ambiente. Para iteracao frequente em hardware que ja possui, o local sai mais barato em toda execucao depois da primeira, porque o custo marginal de computacao e quase nulo.

Preciso de multi-GPU para ajustar um modelo 7B?

Normalmente nao. Uma unica placa da classe 24 GB lida confortavelmente com um modelo 7B usando QLoRA. Multi-GPU importa mais em modelos maiores ou em fine-tuning completo sem LoRA. Consulte o guia de requisitos de hardware para o dimensionamento de VRAM.

Veredito final

  • Use o Unsloth se treina em hardware proprio e quer o caminho mais curto ate uma execucao funcional — proximo passo: instale-o e faca um ajuste QLoRA antes de avaliar qualquer coisa mais pesada.
  • Use o Axolotl se seu treino precisa abranger varias maquinas ou voce precisa de DPO, ORPO, KTO, GRPO ou modelagem de recompensa — proximo passo: leia a documentacao de multinó antes de se comprometer, porque o sistema de configuracao e o verdadeiro custo de entrada.
  • Use o MLX-LM se esta em Apple Silicon e quer o caminho mais direto ate o MLX — proximo passo: compare-o com o build de macOS do Unsloth em vez de supor que e sua unica opcao.
  • Use Together.ai ou Fireworks.ai se prefere nao ter GPU — proximo passo: calcule seu conjunto de dados real contra as faixas publicadas por token, usando a linha de fine-tuning completo e nao a de LoRA DPO se for fazer um ajuste completo.
  • Dispense o fine-tuning se o modelo simplesmente nao conhece seus documentos — proximo passo: construa em vez disso uma pipeline de recuperacao, que voce pode corrigir sem retreinar.

Fontes

Nota sobre informações de terceiros

Este artigo faz referência a modelos de IA, benchmarks, preços e licenças de terceiros. O cenário da IA muda rapidamente. Pontuações de benchmark, termos de licença, nomes de modelos e preços de API podem mudar entre o momento em que foi escrito e quando você está lendo. Antes de tomar decisões de implantação ou conformidade com base neste artigo, verifique os dados atuais na fonte oficial de cada fornecedor: fichas de modelos do Hugging Face para licenças e benchmarks, sites dos fornecedores para preços de API e EUR-Lex para o texto atual do GDPR e da Lei de IA da UE.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs