Skip to main content
PromptQuorum
Início/LLMs locais/Quanta VRAM para um LLM local? Tabelas de 7B a 70B (2026)
GPU Buying Guides

Quanta VRAM para um LLM local? Tabelas de 7B a 70B (2026)

·7 min de leitura·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

Um modelo 7B precisa de cerca de 4 GB de VRAM em Q4 (4 bits) para os pesos; 13B precisa de cerca de 8 GB; 22B de cerca de 13 GB; 70B de cerca de 42 GB. Adicione 1-2 GB de margem para o contexto e o sistema, e 15-20% a mais para Q5 ou cerca de 75% a mais para Q8.

Um modelo 7B precisa de cerca de 4 GB de VRAM para os pesos em Q4 (4 bits); 13B precisa de cerca de 8 GB; 22B de cerca de 13 GB; 70B de cerca de 42 GB. Esses são tamanhos de pesos puros -- adicione 1-2 GB de margem para o contexto (cache KV) e o sistema, e mais se quiser uma janela de contexto longa. Em Q5 (5 bits), os números sobem cerca de 15-20%; em Q8 (8 bits), cerca de 75%. Modelos em precisão completa (FP32) precisam de 4× o tamanho em Q4 e raramente são práticos em GPUs de consumo. A fórmula: tamanho do modelo em bilhões × bytes por parâmetro (≈0,6 para Q4, ≈0,7 para Q5, ≈1,05 para Q8) -- verificado contra tamanhos reais de arquivos GGUF no Hugging Face.

Quanta VRAM para um LLM local? Tabelas de 7B a 70B (2026)

Key Takeaways

  • Modelos 7B: ~4 GB de pesos em Q4, ~5 GB em Q5, ~7 GB em Q8. Adicione 1-2 GB de margem para uma recomendação real de 6-8 GB.
  • Modelos 13B: ~8 GB de pesos em Q4, ~9 GB em Q5, ~14 GB em Q8. 12 GB de VRAM é confortável, não "mal suficiente".
  • Modelos 70B: ~42 GB de pesos em Q4, ~50 GB em Q5, ~74 GB em Q8. Reserve mais para configurações multiusuário.
  • A quantização (Q4, Q5, Q8) reduz a VRAM em 50-75% em relação à precisão completa (FP32).
  • Sempre superdimensione 1-2 GB para o overhead (cache KV, estado do otimizador, sistema operacional).
  • O batch size ≠ VRAM por inferência. A inferência única usa a mesma VRAM independentemente do batch (o batch processa sequencialmente).
  • Mais VRAM não acelera a inferência de um único prompt. Só ajuda em configurações multiusuário/multi-requisição.

Regra geral de VRAM — Referência rápida

Sem tempo para a fórmula? Use estas regras simples:

Assim que souber seu orçamento de VRAM, veja quais GPUs se encaixam em cada nível →

  • Modelos 3B (Phi, StableLM): ~2 GB de pesos em Q4, 4 GB de VRAM recomendada com margem
  • Modelos 7B (Llama, Mistral, Qwen): ~4 GB de pesos em Q4, 6-8 GB de VRAM recomendada
  • Modelos 13B (Llama 3.3, Mistral): ~8 GB de pesos em Q4, 10-12 GB de VRAM recomendada
  • Modelos 22B (Qwen3, Gemma): ~13 GB de pesos em Q4, 16 GB de VRAM recomendada
  • Modelos 70B (Llama 3.3, Qwen 3.6): ~42 GB de pesos em Q4, 48 GB de VRAM recomendada, 50+ GB em Q5
  • Modelos MoE: a VRAM escala com os pesos que você precisa manter na memória. Exemplo: Qwen 3.6 35B-A3B (3B ativos) cabe em uma pegada minúscula de ~2 GB, enquanto o Llama 4 Scout (17B ativos / 109B totais) ainda precisa de ~55 GB em Q4 porque todos os especialistas permanecem residentes
bash
# Quick VRAM formula (memorize this)
VRAM (GB) ≈ Model Size (B) × 0.6  # at Q4 quantization

# Examples:
7B × 0.6 = 4.2 GB
70B × 0.6 = 42 GB

# For other quantizations (bytes per parameter):
Q8 (8-bit): Model Size × 1.05
Q5 (5-bit): Model Size × 0.7
FP32 (full): Model Size × 4

# Verified against real GGUF file sizes (Hugging Face):
# Llama-2-7B Q4_K_M = 4.08 GB, Mistral-Small-24B Q4_K_M = 14.33 GB,
# Llama-3.3-70B Q4_K_M = 42.52 GB

Qual é a fórmula de VRAM para LLMs?

VRAM (GB) = Tamanho do modelo em bilhões × Bytes por parâmetro

  • Tamanho do modelo: Número de parâmetros (7B, 13B, 70B, etc.)
  • Bytes por parâmetro: 4,0 (FP32, precisão completa), ~1,05 (Q8, 8 bits), ~0,7 (Q5, 5 bits), ~0,6 (Q4, 4 bits)
  • Esses números foram verificados contra tamanhos reais de arquivos GGUF no Hugging Face, não apenas a largura de bits teórica -- formatos reais como Q4_K_M carregam uma pequena sobrecarga acima do mínimo teórico de 4 bits (0,5 bytes/parâmetro).

Exemplo: Llama 3.3 70B, FP32, sem quantização:

70 bilhões × 4,0 bytes = 280 GB. Impraticável em hardware de consumo.

Llama 3.3 70B, quantização Q4 (4 bits):

70 bilhões × 0,6 bytes = 42 GB. (O GGUF Q4_K_M real do Llama-3.3-70B-Instruct tem 42,52 GB.)

Modelos MoE (Esparsos): Os parâmetros ativos determinam o processamento, mas todos os especialistas precisam permanecer carregados na VRAM. Exemplo: o Llama 4 Scout tem 109B de parâmetros totais com 17B ativos por token. Em Q4 ainda precisa de ~55 GB de VRAM para manter todos os especialistas — só entra em uma GPU de 24 GB com um quant agressivo de 1.78 bits (~20 tok/s). O processamento é barato; a memória é a restrição.

Quanta VRAM cada tamanho de modelo precisa?

Tamanho do modeloFP32 (sem quantização)Q8 (8 bits)Q5 (5 bits)Q4 (4 bits)GPU recomendada
3B (Phi, StableLM)12 GB3 GB2 GB2 GBRTX 3050 4 GB ou RTX 2060 6 GB
7B (Llama 3.3, Mistral)28 GB7 GB5 GB4 GBRTX 4060 8 GB ou RTX 3060 12 GB
13B (Llama 3.3, Mistral)52 GB14 GB9 GB8 GBRTX 3060 12 GB ou RTX 4070 12 GB
22B (Qwen, Gemma)88 GB23 GB15 GB13 GBRTX 4080 16 GB ou RTX 4090 24 GB
70B (Llama 3, Qwen)280 GB74 GB50 GB42 GB2× RTX 4090 (24 GB cada), ou 1× H100 80 GB
Qwen 3.6 35B-A3B (3B ativos, MoE)*12 GB3 GB2 GB2 GBRTX 2060 6 GB ou RTX 5070 12 GB
DeepSeek V4-Flash (13B ativos / 284B total, MoE)*52 GB14 GB9 GB8 GBRTX 3060 12 GB ou RTX 5070 12 GB
Llama 4 Scout (17B ativos / 109B total, MoE)†436 GB114 GB76 GB55 GB2× RTX 4090 (48 GB) — entra em 24 GB só a 1.78 bits (~20 tok/s)
gpt-oss:20b (3.6B ativos / 21B total, MoE)*84 GB22 GB15 GB12 GBRTX 5070 12 GB ou qualquer GPU de 16 GB
Kimi K2.6 (32B ativos / 1T total, MoE)*128 GB34 GB22 GB19 GB2× RTX 4090 ou RTX 5090 32 GB (só Q4)

Os números são tamanhos de pesos puros, verificados contra tamanhos reais de arquivos GGUF no Hugging Face (ex.: Llama-2-7B Q4_K_M = 4,08 GB, Mistral-Small-24B Q4_K_M = 14,33 GB, Llama-3.3-70B Q4_K_M = 42,52 GB) -- adicione 1-2 GB de margem para contexto/cache KV. * Modelos MoE: a VRAM é calculada apenas a partir dos parâmetros ativos, não do tamanho total do modelo. † O Llama 4 Scout mantém os 109B parâmetros residentes, então precisa de ~55 GB em Q4 apesar de ter apenas 17B ativos por token.

Regra prática: divida o tamanho do modelo em bilhões por ~8 para obter a VRAM Q4 em GB.
Regra prática: divida o tamanho do modelo em bilhões por ~8 para obter a VRAM Q4 em GB.

Melhor LLM local por nível de VRAM

A maioria das pessoas já sabe quanta VRAM sua GPU tem e quer a busca inversa: "tenho 12 GB — qual é o melhor modelo?" Use esta tabela em vez da fórmula.

Combine a VRAM da sua GPU com o maior nível de modelo que ela suporta em Q4 e depois consulte a tabela acima para o modelo exato.

Se você já sabe quanta VRAM sua GPU tem, pule as contas de tamanho de modelo — encontre a VRAM da sua placa na tabela abaixo e use o nível de modelo ao lado dela.

Nível de VRAMMelhor modelo (Q4)GPUs de exemploO que cabe
4 GBLlama 3.2 3B ou Phi-3.5-mini (~1,5-2 GB)RTX 3050 4 GB, GTX 1650Só classe 3B — modelos 7B vão dar OOM
6 GBQwen3 4B, ou Llama 3.1 8B em Q4 agressivo (~3-4 GB)RTX 2060 6 GB, RTX 3050 Ti4B com folga; 8B é apertado
8 GBLlama 3.1 8B ou Qwen3 8B (~3,5-5 GB) com margem realRTX 4060 Ti 8 GB, RTX 3070O ponto ideal mais comum para 7-8B
12 GBQwen3 14B (~6,5 GB), ou 7-8B em Q5/Q8 para mais qualidadeRTX 3060 12 GB, RTX 407014B com folga, espaço para mais contexto
16 GBQwen3 14B em Q5/Q8, ou classe 22B (Gemma, Qwen) em Q4 (~11 GB)RTX 4060 Ti 16 GB, RTX 408022B é o teto prático neste nível
24 GB22-32B com folga em Q8 completo; 70B só abaixo de 4 bits com perdaRTX 4090, RTX 309070B precisa de ~42 GB reais — este nível não é suficiente
32 GB22-32B em precisão total, ou como uma placa em um setup dual-GPU para 70BRTX 5090Ainda insuficiente para um 70B Q4 sozinho (~42 GB necessários)
48 GB70B com folga em Q4 (~42 GB), apertado em Q5 (~50 GB)2× RTX 4090, RTX 6000 AdaPrimeiro nível que cabe 70B sem truques de quantização com perda
64 GB+ (memória unificada)70B com folga em Q4/Q5, sem precisar de dual-GPUMac Studio M5 Max/Ultra (128-256 GB)Única opção de consumo que cabe 70B sem GPU discreta

Estes são números-alvo de compra em Q4 com overhead realista incluído — veja a tabela acima para os mínimos de computação puros por nível de quantização. A memória unificada do Apple Silicon (Mac Studio M5 Max/Ultra) é uma alternativa à GPU discreta para os níveis de 48 GB+ — veja Rodar modelos 70B em Apple Silicon M5 Max para os tok/s exatos em cada nível de quantização.

Modelos MoE precisam de muito menos VRAM do que o tamanho sugere

Os modelos Mixture-of-Experts (MoE) distribuem seus parâmetros entre muitas sub-redes "especialistas" e ativam apenas uma fração para cada token. Os parâmetros ativos reduzem o processamento e aceleram a inferência, mas na maioria dos modelos MoE todos os especialistas precisam permanecer carregados na VRAM — então o uso de memória segue o total de parâmetros, não os ativos.

Regra para modelos densos: VRAM = parâmetros_totais × bytes_por_parâmetro

Regra para modelos MoE (processamento): os parâmetros_ativos determinam os tokens/seg — mas a VRAM ainda escala com os pesos totais residentes.

Exemplo: o Llama 4 Scout tem 109B de parâmetros totais com apenas 17B ativos por token. É rápido para o seu tamanho, mas em Q4 ainda precisa de ~55 GB de VRAM para manter todos os especialistas — fora do alcance de uma única GPU de 24 GB, salvo com um quant agressivo de 1.78 bits (~20 tok/s em uma RTX 4090).

Alguns runtimes podem transmitir ou descarregar os especialistas inativos para a RAM do sistema, sacrificando velocidade por uma pegada de VRAM menor. A conclusão-chave: não assuma que um modelo MoE cabe em uma VRAM do tamanho dos seus parâmetros ativos — verifique o tamanho real em disco para o seu nível de quantização.

Como a quantização reduz os requisitos de VRAM?

A quantização reduz o número de bits necessários para representar cada parâmetro do modelo.

  • FP32 (float de 32 bits): Precisão completa. 1 parâmetro = 4 bytes. Sem perda. Mais lento.
  • Q8 (8 bits): 1 parâmetro = 1 byte. ~6% de perda de precisão. 75% de economia de VRAM.
  • Q5 (5 bits): 1 parâmetro = 0.625 bytes. ~2% de perda de precisão. 84% de economia de VRAM.
  • Q4 (4 bits): 1 parâmetro = 0.5 bytes. ~1% de perda de precisão. 87.5% de economia de VRAM.

Para a maioria dos usuários, o Q4 é o ponto ideal: perda de precisão imperceptível, pegada de VRAM 87% menor.

A partir de abril de 2026, o Q4 é o padrão. Q5 e Q8 estão disponíveis se você tiver VRAM de sobra e quiser ganhos marginais de qualidade.

A VRAM determina o tamanho do modelo, mas o design do prompt determina a qualidade da saída. Técnicas como chain-of-thought e few-shot prompting podem fechar a diferença de qualidade entre modelos menores e maiores. Explore o completo toolkit de engenharia de prompts para extrair mais dos modelos que seu hardware suporta. Se você tem 12–16 GB de VRAM e quer uma carga de trabalho de programação concreta para testar esse toolkit, Substituir o GitHub Copilot por um LLM local mapeia o stack Continue.dev + Ollama + Qwen3-Coder exatamente para esses níveis de VRAM.

Q4 é o ponto ideal para a maioria — 87,5% menor que FP32 com apenas ~1% de perda de precisão.
Q4 é o ponto ideal para a maioria — 87,5% menor que FP32 com apenas ~1% de perda de precisão.

E quanto ao batch size e à inferência multiusuário?

O batch size afeta a vazão (tokens por segundo), não a latência de uma inferência individual.

Um único usuário que pergunta "Quanto é 2+2?" usa a mesma VRAM independentemente de o batch size ser 1 ou 32.

Batch size = 32 significa processar 32 prompts em paralelo. Isso usa ~32× mais VRAM, mas gera 32 respostas mais rápido.

Para usuário único (uso típico de LLM local): Batch size = 1. A VRAM é o tamanho do modelo + 1-2 GB de overhead.

Para servidor multiusuário: Aloque batch size × VRAM do modelo. Um modelo 70B com batch=4 precisa de ~160-192 GB (40-48 GB × 4).

Você precisa de mais VRAM que o tamanho do modelo?

Sim. Além dos pesos do modelo, adicione:

  • Cache KV (cache chave-valor para o contexto): ~5-10% de VRAM adicional.
  • Estado do otimizador (se fizer fine-tuning): 2-4× o tamanho do modelo (relevante só para treinamento, não para inferência).
  • Overhead do sistema (SO, drivers, runtime do Ollama/LM Studio): ~1-2 GB.

Regra: Um modelo 70B Q4 (40-48 GB) + cache KV (4 GB) + sistema (2 GB) = ~46-54 GB alocados.

Sempre compre GPUs com pelo menos 1-2 GB de margem acima dos mínimos teóricos.

Erros comuns sobre VRAM

  • Mais VRAM = inferência mais rápida. Falso. O tamanho da VRAM não afeta a velocidade. A largura de banda de memória (GB/seg) sim, e é fixa por GPU.
  • O batch size = limite sequencial de tokens. Falso. Batch size = requisições em paralelo. A inferência individual usa batch=1 independentemente do tamanho da VRAM.
  • Você precisa de apenas 24 GB para qualquer modelo 70B. Falso. Q4 precisa de 40-48 GB. Q8 precisa de 70 GB+. Depende da quantização.

Calculadora de VRAM

Selecione o tamanho do seu modelo e a quantização para estimar os requisitos de VRAM.

Popular Models

Base Model

6.50 GB

Context OH

1.50 GB

Batch OH

0.00 GB

System OH

1.00 GB

Total Minimum

9.00 GB

Recommended (with 25% safety margin)

11.25 GB

👉 Look for a GPU with at least 11.25 GB VRAM

Compatible GPUs

RTX 3060 (12 GB)

0.8 GB headroom

⚠️ Tight

RTX 4070 (12 GB)

0.8 GB headroom

⚠️ Tight

RTX 4070 Ti (12 GB)

0.8 GB headroom

⚠️ Tight

RTX 4080 (16 GB)

4.8 GB headroom

✅ Fits

RTX 4090 (24 GB)

12.8 GB headroom

✅ Fits

Mac mini M5 (16 GB) (16 GB)

4.8 GB headroom

✅ Fits

Mac mini M4 (16 GB) (16 GB)

4.8 GB headroom

✅ Fits

MacBook Pro (24 GB) (24 GB)

12.8 GB headroom

✅ Fits

M3 Max (36 GB) (36 GB)

24.8 GB headroom

✅ Fits

💡 Pro Tips:

  • Always use the "with safety margin" figure when buying a GPU
  • Q4 gives 90-95% quality with 25% size reduction. Q5 is better if you have room
  • Context overhead grows with conversation length. Budget 1-3 GB for typical usage
  • Batch size matters for multi-user APIs. Single-user chat can ignore batch overhead

📋 Share this configuration:

Loading...

Perguntas frequentes

Posso rodar o Mistral Small em uma GPU de 6 GB?

Não. O Mistral Small é um modelo de 22-24B -- mesmo em Q4 precisa de cerca de 13-14 GB de VRAM só para os pesos. Uma GPU de 6 GB ou 8 GB vai dar erro de OOM. Reserve 16 GB para uma margem confortável, ou use um modelo de 7B-8B para uma placa de 6-8 GB.

Quanta VRAM preciso para fazer fine-tuning de um modelo 7B?

Para LoRA: 12-16 GB. Fine-tuning completo: 28 GB+. O fine-tuning exige estado do otimizador (2-4× a VRAM do modelo), não só a inferência.

12 GB são suficientes para o Llama 3 13B?

Sim, com folga. Um modelo 13B precisa de cerca de 8 GB em Q4, então 12 GB deixa margem real. Em Q5 (~9 GB) ainda está confortável; em Q8 (~14 GB) fica apertado.

Preciso de 24 GB para um modelo 70B?

Não. Um modelo 70B precisa de 40-48 GB em Q4. Em Q5+, você precisa de 50 GB+. 24 GB não é suficiente para nenhum modelo 70B em nenhum nível de quantização.

Aumentar o batch size reduz a VRAM para inferência individual?

Não. A inferência individual sempre usa a VRAM de batch=1. O batch size só ajuda a vazão (cenários multiusuário).

Qual é a melhor quantização para a precisão?

O Q8 tem perda quase imperceptível. O Q5 tem ~2% de perda. O Q4 tem ~1% de perda. Para a maioria, o Q4 é o ponto ideal.

Posso descarregar parte da VRAM para a RAM da CPU?

Sim, via divisão de camadas (NVLink). O llama.cpp e o Ollama suportam isso. A vazão cai 30-50%, mas funciona. Menos de 8 GB de VRAM? Veja **quais modelos rodam mais rápido no seu nível exato de hardware** — benchmarks com números reais de tok/seg para apenas CPU, 4 GB, 6 GB e 8 GB de VRAM.

Qual é a fórmula de VRAM para LLMs?

VRAM (GB) = parâmetros do modelo (bilhões) × bytes por parâmetro + overhead. Em Q4 (4 bits): 7B × 0.5 bytes + 1 GB overhead ≈ 4.5 GB de pesos + 2 GB de cache KV = ~7 GB no total.

Quanto mais VRAM o Q8 precisa em relação ao Q4?

O Q8 usa o dobro da VRAM do Q4. Um modelo 7B em Q4 precisa de ~4-5 GB; em Q8, ~8-9 GB. Verifique sempre o nível de quantização antes de comprar uma GPU.

Posso rodar um modelo 70B em duas GPUs?

Sim. Duas RTX 5090 (24 GB cada) combinam 48 GB de VRAM — suficiente para um modelo 70B em Q4. O llama.cpp e o Ollama suportam várias GPUs via paralelismo tensorial e --n-gpu-layers.

Fontes

  • Documentação da arquitetura de memória CUDA e do modelo de memória compartilhada da NVIDIA
  • Documentação oficial do Ollama e do LM Studio: requisitos de VRAM para modelos e especificações de quantização
  • Projeto llama.cpp no GitHub: níveis de quantização (Q4, Q5, Q8) e cálculos de memória

Você já conhece seu orçamento de VRAM. Agora escolha a GPU certa para ele.

Melhores GPUs econômicas para LLMs locais →

Nota sobre informações de terceiros

Este artigo faz referência a modelos de IA, benchmarks, preços e licenças de terceiros. O cenário da IA muda rapidamente. Pontuações de benchmark, termos de licença, nomes de modelos e preços de API podem mudar entre o momento em que foi escrito e quando você está lendo. Antes de tomar decisões de implantação ou conformidade com base neste artigo, verifique os dados atuais na fonte oficial de cada fornecedor: fichas de modelos do Hugging Face para licenças e benchmarks, sites dos fornecedores para preços de API e EUR-Lex para o texto atual do GDPR e da Lei de IA da UE.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs