Skip to main content
PromptQuorum
Home/Local LLMs/¿Cuánta VRAM para un LLM local? Tablas 7B a 70B (2026)
GPU Buying Guides

¿Cuánta VRAM para un LLM local? Tablas 7B a 70B (2026)

·7 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

Un modelo 7B necesita unos 4 GB de VRAM en Q4 (4 bits) para sus pesos; 13B necesita unos 8 GB; 22B unos 13 GB; 70B unos 42 GB. Añade 1-2 GB de margen para el contexto y el sistema sobre esas cifras, y un 15-20% más para Q5 o un 75% más para Q8.

Un modelo 7B necesita unos 4 GB de VRAM para sus pesos en Q4 (4 bits); 13B necesita unos 8 GB; 22B unos 13 GB; 70B unos 42 GB. Son tamaños de pesos puros — añade 1-2 GB de margen para el contexto (caché KV) y el sistema, y más si quieres una ventana de contexto larga. En Q5 (5 bits), las cifras suben un 15-20%; en Q8 (8 bits), unos 75%. Los modelos en precisión completa (FP32) necesitan 4× el tamaño en Q4 y rara vez son prácticos en GPUs de consumo. La fórmula: tamaño del modelo en miles de millones × bytes por parámetro (≈0,6 para Q4, ≈0,7 para Q5, ≈1,05 para Q8) — verificado contra tamaños reales de archivos GGUF en Hugging Face.

¿Cuánta VRAM para un LLM local? Tablas 7B a 70B (2026)

Key Takeaways

  • Modelos 7B: ~4 GB de pesos en Q4, ~5 GB en Q5, ~7 GB en Q8. Añade 1-2 GB de margen para una recomendación real de 6-8 GB.
  • Modelos 13B: ~8 GB de pesos en Q4, ~9 GB en Q5, ~14 GB en Q8. 12 GB de VRAM es cómodo, no "apenas suficiente".
  • Modelos 70B: ~42 GB de pesos en Q4, ~50 GB en Q5, ~74 GB en Q8. Reserva más para configuraciones multiusuario.
  • La cuantización (Q4, Q5, Q8) reduce la VRAM un 50-75% respecto a la precisión completa (FP32).
  • Siempre sobredimensiona 1-2 GB para el overhead (caché KV, estado del optimizador, sistema operativo).
  • El batch size ≠ VRAM por inferencia. La inferencia única usa la misma VRAM sin importar el batch (el batch procesa secuencialmente).
  • Más VRAM no acelera la inferencia de un solo prompt. Solo ayuda en configuraciones multiusuario/multi-petición.

Regla general de VRAM — Referencia rápida

¿No tienes tiempo para la fórmula? Usa estas reglas simples:

Una vez que conozcas tu presupuesto de VRAM, consulta qué GPUs se adaptan a cada nivel →

  • Modelos 3B (Phi, StableLM): ~2 GB de pesos en Q4, 4 GB de VRAM recomendada con margen
  • Modelos 7B (Llama, Mistral, Qwen): ~4 GB de pesos en Q4, 6-8 GB de VRAM recomendada
  • Modelos 13B (Llama 3.3, Mistral): ~8 GB de pesos en Q4, 10-12 GB de VRAM recomendada
  • Modelos 22B (Qwen3, Gemma): ~13 GB de pesos en Q4, 16 GB de VRAM recomendada
  • Modelos 70B (Llama 3.3, Qwen 3.6): ~42 GB de pesos en Q4, 48 GB de VRAM recomendada, 50+ GB en Q5
  • Modelos MoE: la VRAM escala con los pesos que debes mantener en memoria. Ejemplo: Qwen 3.6 35B-A3B (3B activos) cabe en una huella diminuta de ~2 GB, mientras que Llama 4 Scout (17B activos / 109B totales) aún necesita ~55 GB en Q4 porque todos los expertos permanecen residentes
bash
# Quick VRAM formula (memorize this)
VRAM (GB) ≈ Model Size (B) × 0.6  # at Q4 quantization

# Examples:
7B × 0.6 = 4.2 GB
70B × 0.6 = 42 GB

# For other quantizations (bytes per parameter):
Q8 (8-bit): Model Size × 1.05
Q5 (5-bit): Model Size × 0.7
FP32 (full): Model Size × 4

# Verified against real GGUF file sizes (Hugging Face):
# Llama-2-7B Q4_K_M = 4.08 GB, Mistral-Small-24B Q4_K_M = 14.33 GB,
# Llama-3.3-70B Q4_K_M = 42.52 GB

¿Cuál es la fórmula de VRAM para LLMs?

VRAM (GB) = Tamaño del modelo en miles de millones × Bytes por parámetro

  • Tamaño del modelo: Número de parámetros (7B, 13B, 70B, etc.)
  • Bytes por parámetro: 4,0 (FP32, precisión completa), ~1,05 (Q8, 8 bits), ~0,7 (Q5, 5 bits), ~0,6 (Q4, 4 bits)
  • Estas cifras están verificadas contra tamaños reales de archivos GGUF en Hugging Face, no solo el ancho de bits teórico -- formatos reales como Q4_K_M llevan algo de overhead sobre el mínimo teórico de 4 bits (0,5 bytes/parámetro).

Ejemplo: Llama 3.3 70B, FP32, sin cuantización:

70 mil millones × 4,0 bytes = 280 GB. Impracticable en hardware de consumo.

Llama 3.3 70B, cuantización Q4 (4 bits):

70 mil millones × 0,6 bytes = 42 GB. (El GGUF Q4_K_M real de Llama-3.3-70B-Instruct pesa 42,52 GB.)

Modelos MoE (Dispersos): Los parámetros activos determinan el cómputo, pero todos los expertos deben permanecer cargados en VRAM. Ejemplo: Llama 4 Scout tiene 109B de parámetros totales con 17B activos por token. En Q4 aún necesita ~55 GB de VRAM para mantener todos los expertos — solo entra en una GPU de 24 GB con un quant agresivo de 1.78 bits (~20 tok/s). El cómputo es barato; la memoria es la restricción.

¿Cuánta VRAM necesita cada tamaño de modelo?

Tamaño del modeloFP32 (sin cuantización)Q8 (8 bits)Q5 (5 bits)Q4 (4 bits)GPU recomendada
3B (Phi, StableLM)12 GB3 GB2 GB2 GBRTX 3050 4 GB o RTX 2060 6 GB
7B (Llama 3.3, Mistral)28 GB7 GB5 GB4 GBRTX 4060 8 GB o RTX 3060 12 GB
13B (Llama 3.3, Mistral)52 GB14 GB9 GB8 GBRTX 3060 12 GB o RTX 4070 12 GB
22B (Qwen, Gemma)88 GB23 GB15 GB13 GBRTX 4080 16 GB o RTX 4090 24 GB
70B (Llama 3, Qwen)280 GB74 GB50 GB42 GB2× RTX 4090 (24 GB c/u), o 1× H100 80 GB
Qwen 3.6 35B-A3B (3B activos, MoE)*12 GB3 GB2 GB2 GBRTX 2060 6 GB o RTX 5070 12 GB
DeepSeek V4-Flash (13B activos / 284B total, MoE)*52 GB14 GB9 GB8 GBRTX 3060 12 GB o RTX 5070 12 GB
Llama 4 Scout (17B activos / 109B total, MoE)†436 GB114 GB76 GB55 GB2× RTX 4090 (48 GB) — entra en 24 GB solo a 1.78 bits (~20 tok/s)
gpt-oss:20b (3.6B activos / 21B total, MoE)*84 GB22 GB15 GB12 GBRTX 5070 12 GB o cualquier GPU de 16 GB
Kimi K2.6 (32B activos / 1T total, MoE)*128 GB34 GB22 GB19 GB2× RTX 4090 o RTX 5090 32 GB (solo Q4)

Las cifras son tamaños de pesos puros, verificados contra tamaños reales de archivos GGUF en Hugging Face (p. ej. Llama-2-7B Q4_K_M = 4,08 GB, Mistral-Small-24B Q4_K_M = 14,33 GB, Llama-3.3-70B Q4_K_M = 42,52 GB) -- añade 1-2 GB de margen para el contexto/caché KV. * Modelos MoE: la VRAM se calcula solo a partir de los parámetros activos, no del tamaño total del modelo. † Llama 4 Scout mantiene los 109B parámetros residentes, por lo que necesita ~55 GB en Q4 pese a tener solo 17B activos por token.

Regla general: divide el tamaño del modelo en miles de millones entre ~8 para obtener la VRAM Q4 en GB.
Regla general: divide el tamaño del modelo en miles de millones entre ~8 para obtener la VRAM Q4 en GB.

Mejor LLM local por nivel de VRAM

La mayoría ya sabe cuánta VRAM tiene su GPU y quiere la búsqueda inversa: "tengo 12 GB, ¿cuál es el mejor modelo?". Usa esta tabla en lugar de la fórmula.

Haz coincidir la VRAM de tu GPU con el nivel de modelo más grande que soporte en Q4, y luego consulta la tabla de arriba para el modelo exacto.

Si ya sabes cuánta VRAM tiene tu GPU, olvídate de las matemáticas: busca la VRAM de tu tarjeta en la tabla de abajo y usa el nivel de modelo indicado junto a ella.

Nivel de VRAMMejor modelo (Q4)GPUs de ejemploQué cabe
4 GBLlama 3.2 3B o Phi-3.5-mini (~1,5-2 GB)RTX 3050 4 GB, GTX 1650Solo clase 3B — los modelos 7B darán OOM
6 GBQwen3 4B, o Llama 3.1 8B en Q4 agresivo (~3-4 GB)RTX 2060 6 GB, RTX 3050 Ti4B con holgura; 8B es justo
8 GBLlama 3.1 8B o Qwen3 8B (~3,5-5 GB) con margen realRTX 4060 Ti 8 GB, RTX 3070El punto óptimo más común para 7-8B
12 GBQwen3 14B (~6,5 GB), o 7-8B en Q5/Q8 para más calidadRTX 3060 12 GB, RTX 407014B con holgura, margen para más contexto
16 GBQwen3 14B en Q5/Q8, o clase 22B (Gemma, Qwen) en Q4 (~11 GB)RTX 4060 Ti 16 GB, RTX 408022B es el techo práctico en este nivel
24 GB22-32B con holgura en Q8 completo; 70B solo por debajo de 4 bits con pérdidaRTX 4090, RTX 309070B necesita ~42 GB reales — este nivel no llega
32 GB22-32B a precisión completa, o como una tarjeta en un dual-GPU para 70BRTX 5090Aún corto para un 70B Q4 solo (~42 GB necesarios)
48 GB70B con holgura en Q4 (~42 GB), justo en Q5 (~50 GB)2× RTX 4090, RTX 6000 AdaPrimer nivel que cabe 70B sin trucos de cuantización con pérdida
64 GB+ (memoria unificada)70B con holgura en Q4/Q5, sin necesitar dual-GPUMac Studio M5 Max/Ultra (128-256 GB)Única opción de consumo que cabe 70B sin GPU discreta

Estas son cifras objetivo en Q4 con overhead realista incluido — consulta la tabla de arriba para los mínimos de cómputo puros por nivel de cuantización. La memoria unificada de Apple Silicon (Mac Studio M5 Max/Ultra) es una alternativa a la GPU discreta para los niveles de 48 GB+ — consulta Ejecutar modelos 70B en Apple Silicon M5 Max para tok/s exactos en cada nivel de cuantización.

Los modelos MoE necesitan mucha menos VRAM de lo que su tamaño sugiere

Los modelos Mixture-of-Experts (MoE) distribuyen sus parámetros entre muchas sub-redes "expertas" y activan solo una fracción para cada token. Los parámetros activos reducen el cómputo y aceleran la inferencia, pero en la mayoría de los modelos MoE todos los expertos deben permanecer cargados en VRAM — así que el uso de memoria sigue al total de parámetros, no a los activos.

Regla para modelos densos: VRAM = parámetros_totales × bytes_por_parámetro

Regla para modelos MoE (cómputo): los parámetros_activos determinan los tokens/seg — pero la VRAM aún escala con los pesos totales residentes.

Ejemplo: Llama 4 Scout tiene 109B de parámetros totales con solo 17B activos por token. Es rápido para su tamaño, pero en Q4 aún necesita ~55 GB de VRAM para mantener todos los expertos — fuera del alcance de una sola GPU de 24 GB salvo con un quant agresivo de 1.78 bits (~20 tok/s en una RTX 4090).

Algunos runtimes pueden transmitir o descargar los expertos inactivos a la RAM del sistema, sacrificando velocidad por una huella de VRAM menor. La conclusión clave: no asumas que un modelo MoE cabe en una VRAM del tamaño de sus parámetros activos — comprueba el tamaño real en disco para tu nivel de cuantización.

¿Cómo reduce la cuantización los requisitos de VRAM?

La cuantización reduce el número de bits necesarios para representar cada parámetro del modelo.

  • FP32 (float de 32 bits): Precisión completa. 1 parámetro = 4 bytes. Sin pérdida. Más lento.
  • Q8 (8 bits): 1 parámetro = 1 byte. ~6% de pérdida de precisión. 75% de ahorro de VRAM.
  • Q5 (5 bits): 1 parámetro = 0.625 bytes. ~2% de pérdida de precisión. 84% de ahorro de VRAM.
  • Q4 (4 bits): 1 parámetro = 0.5 bytes. ~1% de pérdida de precisión. 87.5% de ahorro de VRAM.

Para la mayoría de los usuarios, Q4 es el punto óptimo: pérdida de precisión imperceptible, huella de VRAM un 87% menor.

A partir de abril de 2026, Q4 es el estándar. Q5 y Q8 están disponibles si tienes VRAM de sobra y quieres ganancias marginales de calidad.

La VRAM determina el tamaño del modelo, pero el diseño del prompt determina la calidad de la salida. Técnicas como chain-of-thought y few-shot prompting pueden cerrar la brecha de calidad entre modelos más pequeños y más grandes. Explora el completo toolkit de prompt engineering para sacar más partido a los modelos que soporta tu hardware. Si tienes 12–16 GB de VRAM y quieres una carga de trabajo de programación concreta para probar ese toolkit, Reemplazar GitHub Copilot con un LLM local mapea el stack Continue.dev + Ollama + Qwen3-Coder exactamente a esos niveles de VRAM.

Q4 es el punto óptimo para la mayoría — 87,5% menor que FP32 con solo ~1% de pérdida de precisión.
Q4 es el punto óptimo para la mayoría — 87,5% menor que FP32 con solo ~1% de pérdida de precisión.

¿Qué hay del batch size y la inferencia multiusuario?

El batch size afecta el rendimiento (tokens por segundo), no la latencia de una inferencia individual.

Un solo usuario que pregunta "¿Cuánto es 2+2?" usa la misma VRAM sin importar si el batch size es 1 o 32.

Batch size = 32 significa procesar 32 prompts en paralelo. Esto usa ~32× más VRAM, pero genera 32 respuestas más rápido.

Para usuario único (uso típico de LLM local): Batch size = 1. La VRAM es el tamaño del modelo + 1-2 GB de overhead.

Para servidor multiusuario: Asigna batch size × VRAM del modelo. Un modelo 70B con batch=4 necesita ~160-192 GB (40-48 GB × 4).

¿Necesitas más VRAM que el tamaño del modelo?

Sí. Más allá de los pesos del modelo, añade:

  • Caché KV (caché clave-valor para el contexto): ~5-10% de VRAM adicional.
  • Estado del optimizador (si se hace fine-tuning): 2-4× el tamaño del modelo (solo relevante para entrenamiento, no para inferencia).
  • Overhead del sistema (SO, drivers, runtime de Ollama/LM Studio): ~1-2 GB.

Regla: Un modelo 70B Q4 (40-48 GB) + caché KV (4 GB) + sistema (2 GB) = ~46-54 GB asignados.

Siempre compra GPUs con al menos 1-2 GB de margen por encima de los mínimos teóricos.

Errores comunes sobre VRAM

  • Más VRAM = inferencia más rápida. Falso. El tamaño de VRAM no afecta la velocidad. El ancho de banda de memoria (GB/seg) sí, y es fijo por GPU.
  • El batch size = límite secuencial de tokens. Falso. Batch size = peticiones en paralelo. La inferencia individual usa batch=1 sin importar el tamaño de VRAM.
  • Necesitas solo 24 GB para cualquier modelo 70B. Falso. Q4 necesita 40-48 GB. Q8 necesita 70 GB+. Depende de la cuantización.

Calculadora de VRAM

Selecciona el tamaño de tu modelo y la cuantización para estimar los requisitos de VRAM.

Popular Models

Base Model

6.50 GB

Context OH

1.50 GB

Batch OH

0.00 GB

System OH

1.00 GB

Total Minimum

9.00 GB

Recommended (with 25% safety margin)

11.25 GB

👉 Look for a GPU with at least 11.25 GB VRAM

Compatible GPUs

RTX 3060 (12 GB)

0.8 GB headroom

⚠️ Tight

RTX 4070 (12 GB)

0.8 GB headroom

⚠️ Tight

RTX 4070 Ti (12 GB)

0.8 GB headroom

⚠️ Tight

RTX 4080 (16 GB)

4.8 GB headroom

✅ Fits

RTX 4090 (24 GB)

12.8 GB headroom

✅ Fits

Mac mini M5 (16 GB) (16 GB)

4.8 GB headroom

✅ Fits

Mac mini M4 (16 GB) (16 GB)

4.8 GB headroom

✅ Fits

MacBook Pro (24 GB) (24 GB)

12.8 GB headroom

✅ Fits

M3 Max (36 GB) (36 GB)

24.8 GB headroom

✅ Fits

💡 Pro Tips:

  • Always use the "with safety margin" figure when buying a GPU
  • Q4 gives 90-95% quality with 25% size reduction. Q5 is better if you have room
  • Context overhead grows with conversation length. Budget 1-3 GB for typical usage
  • Batch size matters for multi-user APIs. Single-user chat can ignore batch overhead

📋 Share this configuration:

Loading...

Preguntas frecuentes

¿Puedo ejecutar Mistral Small en una GPU de 6 GB?

No. Mistral Small es un modelo de 22-24B -- incluso en Q4 necesita unos 13-14 GB de VRAM solo para los pesos. Una GPU de 6 GB u 8 GB dará error de OOM. Reserva 16 GB para un margen cómodo, o baja a un modelo de 7B-8B para una tarjeta de 6-8 GB.

¿Cuánta VRAM necesito para hacer fine-tuning de un modelo 7B?

Para LoRA: 12-16 GB. Fine-tuning completo: 28 GB+. El fine-tuning requiere estado del optimizador (2-4× la VRAM del modelo), no solo la inferencia.

¿Son suficientes 12 GB para Llama 3 13B?

Sí, con margen de sobra. Un modelo 13B necesita unos 8 GB en Q4, así que 12 GB deja margen real. En Q5 (~9 GB) sigue siendo cómodo; en Q8 (~14 GB) va ajustado.

¿Necesito 24 GB para un modelo 70B?

No. Un modelo 70B necesita 40-48 GB en Q4. En Q5+, necesitas 50 GB+. 24 GB no es suficiente para ningún modelo 70B en ningún nivel de cuantización.

¿Aumentar el batch size reduce la VRAM para inferencia individual?

No. La inferencia individual siempre usa la VRAM de batch=1. El batch size solo ayuda al rendimiento (escenarios multiusuario).

¿Cuál es la mejor cuantización para la precisión?

Q8 tiene una pérdida casi imperceptible. Q5 tiene ~2% de pérdida. Q4 tiene ~1% de pérdida. Para la mayoría, Q4 es el punto óptimo.

¿Puedo descargar parte de la VRAM a la RAM de la CPU?

Sí, mediante la división de capas (NVLink). Llama.cpp y Ollama lo soportan. El rendimiento cae un 30-50% pero funciona. ¿Menos de 8 GB de VRAM? Consulta **qué modelos corren más rápido en tu nivel exacto de hardware** — benchmarks con números reales de tok/seg para solo CPU, 4 GB, 6 GB y 8 GB de VRAM.

Fuentes

  • Documentación de la arquitectura de memoria CUDA y el modelo de memoria compartida de NVIDIA
  • Documentación oficial de Ollama y LM Studio: requisitos de VRAM para modelos y especificaciones de cuantización
  • Proyecto llama.cpp en GitHub: niveles de cuantización (Q4, Q5, Q8) y cálculos de memoria

Ya conoces tu presupuesto de VRAM. Ahora elige la GPU correcta para él.

Mejores GPUs económicas para LLMs locales →

Nota sobre hechos de terceros

Este artículo hace referencia a modelos de IA, benchmarks, precios y licencias de terceros. El panorama de la IA cambia rápidamente. Las puntuaciones de benchmark, los términos de licencia, los nombres de modelos y los precios de API pueden cambiar entre el momento en que se escribió y cuando usted lo lee. Antes de tomar decisiones de despliegue o cumplimiento basadas en este artículo, verifique las cifras actuales en la fuente oficial de cada proveedor: tarjetas de modelos de Hugging Face para licencias y benchmarks, sitios web de proveedores para precios de API y EUR-Lex para el texto actualizado del RGPD y la Ley de IA de la UE.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs