Forma Mais Barata e Prática de Rodar um Modelo 70B Localmente em 2026

Esta página contém links de referência para produtos de terceiros. O PromptQuorum não está inscrito em nenhum programa de afiliados — são links simples que não geram comissão. Clicar nos links e os próximos passos são de sua inteira responsabilidade. Estes links não representam qualquer endosso ou verificação por parte do PromptQuorum.
Resposta rápida
Uma configuração com duas RTX 3090 usadas (~48GB de VRAM combinada) é a forma mais barata e prática de rodar um modelo 70B Q4 em velocidade utilizável. Um Mac Apple Silicon com 64GB+ de memória unificada é a alternativa de uma única máquina mais simples — sem necessidade de configuração multi-GPU. Confira os preços atuais em vez de um valor fixo — os preços de GPUs usadas variam muito.
- ▸Mais barato e prático: 2× RTX 3090 24GB usadas (~48GB de VRAM combinada) — offload Q4 completo, exige saber montar um PC
- ▸Mais simples: Mac Apple Silicon 64GB+ — o modelo inteiro cabe na memória unificada, sem configuração multi-GPU
- ▸Hardware mais barato em termos absolutos: 64–128GB de RAM, somente CPU — funciona, mas dolorosamente lento a 1–3 tok/s
- ▸Melhor desempenho: um sistema multi-GPU de alta VRAM para cargas de trabalho 70B sérias e contínuas
- ▸Novidade de agosto de 2026: o Mac mini M5 Pro (64GB, a partir de US$ 1.699) é a máquina Apple Silicon nova mais barata capaz de rodar um 70B — o Mac mini M6 básico (máx. 32GB) não consegue
Pontos principais
- ✓Um 70B em Q4 precisa de cerca de 40–48GB de memória — uma única GPU de 24GB não consegue conter o modelo completo
- ✓Mais barato e prático: 2× RTX 3090 24GB usadas, offload Q4 completo — confira os preços de usadas atuais
- ✓Mais simples: Mac Apple Silicon 64GB+ — sem necessidade de configuração multi-GPU
- ✓Hardware mais barato em termos absolutos: 64–128GB de RAM, somente CPU — utilizável mas lento (1–3 tok/s)
- ✓Uso ocasional? Alugar uma GPU na nuvem costuma ser mais barato do que comprar hardware
- ✓Atualização de agosto de 2026: o novo Mac mini M5 Pro (64GB, a partir de US$ 1.699) já consegue rodar um 70B — o Mac mini M6 básico (máx. 32GB) ainda não consegue
Mais Barato e Prático: 2× RTX 3090 Usadas
Duas placas RTX 3090 usadas (24GB de VRAM cada) somam cerca de 48GB de VRAM utilizável com o tensor-parallel do llama.cpp — suficiente para descarregar totalmente um modelo 70B Q4_K_M sem depender da CPU. Você vai precisar de uma placa-mãe com dois slots PCIe x16 e uma fonte de 1000W+.
O preço das RTX 3090 usadas varia bastante conforme o estado, a refrigeração e o vendedor — confira os anúncios atuais em vez de confiar em um número fixo. Compre de um vendedor com fotos claras da placa e, idealmente, com informações sobre o uso anterior (mineração ou jogos).
Compre se: você gosta de montar PCs e quer a melhor velocidade de inferência por real. Evite se: você quer uma máquina simples, silenciosa, em uma única caixa — veja a opção Mac abaixo.
Comparação de Hardware para 70B
Todas as opções abaixo comportam um modelo 70B Q4_K_M (~42GB) com qualidade utilizável. Confira os preços atuais de cada opção antes de decidir — os preços de GPUs usadas e RAM mudam com frequência.
| Configuração | Velocidade | Complexidade | Ideal para |
|---|---|---|---|
| CPU + 64–128GB RAM | 🐌 1–3 tok/s | ⭐ Baixa | Hardware mais barato, testes |
| 2× RTX 3090 usadas | 🏆 20–35 tok/s | ⚠️ Alta | Melhor custo-benefício |
| Mac Apple Silicon 64GB+ | ⭐⭐⭐ 12–18 tok/s | 🟢 Baixa | Simplicidade, uma máquina |
| Mac mini M5 Pro 64GB (novo) | 🆕 Ainda sem benchmarks | 🟢 Baixa | Sistema completo novo mais barato |
| RTX 4090 sozinha + offload | ⭐⭐ 8–12 tok/s | ⚠️ Média | Já tem uma 4090 |
| Mac Apple Silicon 128GB | 🚀 25–35 tok/s | 🟢 Baixa | Modelos maiores, qualidade total |
Mais Simples: Mac Apple Silicon 64GB+
Se você não quer montar um PC com duas GPUs, o Apple Silicon é muito mais simples: o modelo fica diretamente na memória unificada, então não há divisão entre RAM do sistema e VRAM, nem configuração de drivers multi-GPU. 64GB de memória unificada é o alvo para rodar 70B Q4 com conforto, sem descarregar camadas para o disco.
A atualização de hardware da Apple em 25 de agosto de 2026 também renovou o Mac mini, além do Mac Studio. O Mac mini básico com chip M6 parte de US$ 899, mas tem um limite de 32GB de memória unificada — insuficiente para um modelo 70B em Q4, então não serve para esse uso. O Mac mini com chip M5 Pro parte de US$ 1.699 com até 64GB de memória unificada, o que atinge o limite necessário — a máquina Apple Silicon nova mais barata capaz de rodar um 70B. Ambos chegam às lojas em 22 de setembro de 2026; confira o preço atual antes de comprar, já que os preços de hardware novo podem mudar.
A Apple atualizou a linha Mac Studio para M5 Max/M5 Ultra no mesmo anúncio de agosto de 2026, a partir de US$ 2.499, configurável até 128GB de memória unificada — confira o preço atual de uma configuração de 64GB em vez de confiar em um número antigo. Um MacBook Pro com 64GB+ de memória unificada é o equivalente portátil, com um valor adicional em relação ao desktop.
Se você está começando do zero — sem um PC existente para adicionar GPUs —, o Mac mini M5 Pro de US$ 1.699 costuma sair mais barato no total do que montar uma máquina com duas RTX 3090 do zero, contando placa-mãe, fonte e gabinete, não só as duas GPUs. Se você já tem um PC capaz, adicionar duas RTX 3090 usadas provavelmente ainda é o caminho mais barato e rápido.
Compre se: você valoriza simplicidade, baixo consumo de energia e operação silenciosa mais do que velocidade pura. Evite se: você quer o máximo de tokens por segundo por real — nesse quesito, a configuração com duas 3090 vence.
Hardware Mais Barato em Termos Absolutos: CPU + 64–128GB RAM
Tecnicamente, você não precisa de GPU nenhuma — um modelo 70B Q4_K_M pode rodar inteiramente na RAM do sistema. Espere cerca de 1–3 tokens por segundo, o que é utilizável para tarefas em lote ou testes, mas frustrante para um chat interativo.
Não compre uma máquina somente-CPU de 128GB especificamente para chat 70B interativo, a menos que o custo puro realmente importe mais para você do que a velocidade — as opções com duas 3090 ou Mac acima custam mais, mas são muito mais utilizáveis no dia a dia.
Uma Alternativa: Alugar em Vez de Comprar
Se você só precisa de um modelo 70B ocasionalmente, não compre hardware algum. Alugar uma GPU na nuvem costuma ser muito mais barato para uso ocasional do que uma compra de hardware de US$ 1.500–3.000 — a A40 de 48GB no Community Cloud da RunPod (a menor GPU que comporta um 70B Q4 por completo) custa cerca de US$ 0,44/hora nesta verificação, e existem APIs de inferência hospedadas para Llama 3.3 70B com cobrança por token, sem nenhum hardware.
Vale a pena dizer isso claramente em vez de deixar de lado, porque uma página que só recomenda comprar parece estar tentando vender hardware para todo mundo — para uso ocasional ou irregular, alugar é a resposta honesta.
Quantização para 70B
Para um modelo 70B, o Q4_K_M é o equilíbrio padrão entre tamanho e qualidade. As porcentagens de qualidade abaixo são aproximadas — a perda real de qualidade depende do modelo específico e de como ele é avaliado, não de uma constante universal.
| Quantização | Tamanho | Qualidade vs FP16 |
|---|---|---|
| Q4_K_M | ~42 GB | ~96% (melhor equilíbrio) |
| Q3_K_M | ~32 GB | ~90% |
| Q2_K | ~25 GB | ~82%, perda perceptível |
| FP16 (completo) | ~140 GB | 100% — pouco realista em hardware de consumo |
Não Compre uma Única GPU de 24GB Esperando Velocidade Total de 70B
- ▸Uma única placa de 24GB (RTX 3090 ou 4090) não consegue conter um modelo 70B Q4 completo — ela pode rodar um com offload para a CPU, mas a velocidade cai para cerca de 8–12 tok/s.
- ▸GPU de 24GB sozinha → offload parcial, mais lento
- ▸48GB de VRAM combinada (2× 24GB) → offload 70B Q4 completo
- ▸64GB+ de memória unificada (Mac) → confortável, sem necessidade de offload
- ▸Mac mini M6 básico (máx. 32GB) → também não consegue rodar um 70B completo, mesma categoria de uma única GPU de 24GB
Guias Relacionados
- ▸Quanta VRAM um Modelo 70B Precisa? — how much VRAM for a 70B model
- ▸Cola de VRAM para DeepSeek R1 Distill — DeepSeek R1 distill VRAM cheatsheet
- ▸Melhor DeepSeek Distill para sua GPU — best DeepSeek distill for your GPU
- ▸Custo de GPU na Nuvem por Hora 2026 — cloud GPU cost per hour
Quick Answers
Posso rodar um modelo 70B em uma única GPU de consumo?▾
Quanta RAM eu preciso para um modelo 70B só com CPU?▾
A qualidade do Q4 é boa o suficiente para um modelo 70B?▾
Qual é a forma mais barata de rodar um modelo 70B sem comprar hardware?▾
O novo Mac mini consegue rodar um modelo 70B?▾
Quer a análise completa?
Ler o guia completo →