Key Takeaways
- 4 GB RAM, solo CPU: Qwen3 1.7B Q4_K_M — 25–40 tok/s. Respuesta más rápida en hardware mínimo.
- 8 GB RAM, solo CPU (punto óptimo): Phi-4-mini 3.8B Q4_K_M — 15–25 tok/s. Código y razonamiento en portátiles antiguos.
- 8 GB RAM + iGPU Intel Iris: Qwen3 4B — 12–20 tok/s con offload parcial de GPU.
- 16 GB RAM, solo CPU: Qwen3 8B Q4_K_M — 8–15 tok/s. Calidad sólida, sin necesidad de GPU.
- 16 GB RAM + iGPU: Llama 3.2 3B o Qwen3 4B — 20–35 tok/s con offload de capas.
- Veredicto ganador: Para la mayoría de PCs de gama baja, Phi-4-mini (3.8B) en Q4_K_M es el punto óptimo — cabe en 8 GB RAM, 15–25 tok/s en CPU. Baja a Qwen3 1.7B para la respuesta más rápida.
- Costo: Todos gratuitos (código abierto) frente a la API de ChatGPT (~$0.002 por 1K tokens).
En un PC solo con CPU y 8 GB de RAM, Phi-4-mini 3.8B Q4_K_M funciona a 15–25 tok/s para código y razonamiento; con 4 GB, Qwen3 1.7B Q4_K_M alcanza 25–40 tok/s.
No necesitas una GPU gaming para ejecutar IA local. Estos modelos funcionan completamente en tu CPU y RAM estándar. Los modelos pequeños (1–4B parámetros) son sorprendentemente capaces para tareas cotidianas y lo suficientemente rápidos para una conversación real.
¿Cuál es el modelo más rápido para tu hardware?
Asocia tu hardware con el modelo correcto — la elección equivocada deja 4–10× de velocidad sin aprovechar. Todos los niveles de abajo son solo CPU salvo que se indique lo contrario.
| Tu hardware | Modelo recomendado | Comando de Ollama | Velocidad esperada |
|---|---|---|---|
| 4 GB RAM, solo CPU | Qwen3 1.7B Q4_K_M | ollama run qwen3:1.7b | 25–40 tok/s |
| 8 GB RAM, solo CPU | Phi-4-mini 3.8B Q4_K_M | ollama run phi4-mini | 15–25 tok/s |
| 8 GB RAM + iGPU Intel Iris | Qwen3 4B Q4_K_M | ollama run qwen3:4b | 12–20 tok/s |
| 16 GB RAM, solo CPU | Qwen3 8B Q4_K_M | ollama run qwen3:8b | 8–15 tok/s |
| 16 GB RAM + iGPU | Llama 3.2 3B Q4_K_M | ollama run llama3.2:3b | 20–35 tok/s |
¿Qué modelo deberías usar?
Asocia tu situación con el modelo correcto — esta es la decisión más importante:
- Portátil con 8 GB RAM (sin GPU discreta): Phi-4-mini (3.8B) en Q4_K_M — 15–25 tok/s, maneja código y razonamiento. `ollama run phi4-mini`
- 4 GB RAM, PC muy antiguo: Qwen3 1.7B Q4_K_M — 25–40 tok/s, la respuesta más rápida con RAM mínima. `ollama run qwen3:1.7b`
- 16 GB RAM, sin GPU: Qwen3 8B Q4_K_M — 8–15 tok/s, calidad sólida. `ollama run qwen3:8b`
- 8 GB RAM + iGPU Intel Iris: Qwen3 4B — usa `OLLAMA_NUM_GPU=1` para offload parcial, 12–20 tok/s. `ollama run qwen3:4b`
- Quieres multilingüe (contexto de 128K): Qwen3 4B o Llama 3.2 3B — ambos admiten 128K de contexto en Ollama.
- Para recomendaciones por nivel de RAM y gestión térmica, consulta cómo ejecutar un LLM local en un portátil.
¿Qué LLM local deberías ejecutar en tu hardware?
Todos los niveles de abajo son solo CPU o iGPU. Elige el modelo más grande que quepa en tu RAM con Q4_K_M — la cuantización degrada menos la calidad que bajar a un modelo más pequeño.
| Hardware | Model | Quant | Speed | Experience |
|---|---|---|---|---|
| 4 GB RAM, solo CPU | Qwen3 1.7B | Q4_K_M | 25–40 t/s | rápido, calidad usable |
| 8 GB RAM, solo CPU | Phi-4-mini 3.8B | Q4_K_M | 15–25 t/s | código + razonamiento |
| 8 GB RAM + iGPU Iris | Qwen3 4B | Q4_K_M | 12–20 t/s | offload parcial de GPU |
| 16 GB RAM, solo CPU | Qwen3 8B | Q4_K_M | 8–15 t/s | calidad sólida |
| 16 GB RAM + iGPU | Llama 3.2 3B | Q4_K_M | 20–35 t/s | fluido con iGPU |

GPU vs CPU para LLMs locales: ¿cuál es más rápido en hardware de gama baja?
Inferencia GPU: 15–20 tok/s en RTX 3060. Requiere configuración CUDA. Rápida, mejor calidad. Consulta la guía de GPUs económicas para opciones rentables.
iGPU (integrada): 5–8 tok/s en Intel Iris. Sin configuración adicional. Más lenta que la GPU discreta.
Inferencia CPU: 1–5 tok/s en multi-núcleo moderno. Funciona en cualquier lugar. La más lenta.
Regla: Si tienes cualquier GPU (incluso integrada), úsala. La CPU es el último recurso.

Por qué los modelos más pequeños son más rápidos en PCs de gama baja
El tamaño del modelo determina directamente la velocidad. Un modelo 1B–3B cabe completamente en la RAM del sistema, lo que permite al CPU o GPU transmitir datos de forma continua. Los modelos más grandes requieren intercambio de memoria — mover datos entre la RAM y el disco — lo que ralentiza la generación entre 10 y 100 veces (el cuello de botella es el I/O del disco, no el cómputo).
La tabla de decisión de hardware anterior refleja este principio: TinyLlama 1.1B (1B parámetros) alcanza 5–10 tok/s en CPUs antiguas, mientras que los modelos 13B+ son impracticables en hardware de gama baja porque el intercambio domina.
- Modelos 1B–3B: Caben en 4–8 GB RAM → generación más rápida → calidad aceptable
- Modelos 7B: Ajustados en sistemas de 8 GB → más lentos por presión de memoria → alta calidad
- Modelos 13B+: Requieren 16+ GB VRAM o intercambio masivo → demasiado lentos para uso interactivo
¿Qué tan rápidos son los LLMs locales en PCs de gama baja?
En sistemas solo CPU, espera:
- Modelos 3B → 15–40 tokens/s (CPUs antiguas: 10–15, CPUs nuevas con optimización: 30–40)
- Modelos 7B → 10–25 tokens/s (depende de los núcleos del CPU y la cuantización; con optimización agresiva algunos llegan a 30+)
- Esto es más lento que las APIs en la nube (ChatGPT 4o: 80–150 tok/s) pero suficiente para uso interactivo. Un modelo 3B a 25 tok/s genera una respuesta de 500 tokens en 20 segundos — aceptable para tareas no urgentes como revisión de código, resúmenes y escritura creativa.
¿Cómo afecta la cuantización a la velocidad en PCs de gama baja?
Q4 (4 bits): ~1% de pérdida de calidad, 50% de ahorro en VRAM. Elección estándar. Para detalles sobre todos los niveles de cuantización y cómo funcionan, consulta la guía completa.
Q3 (3 bits): ~3% de pérdida de calidad, 62% de ahorro en VRAM. Aceptable para chat.
Q2 (2 bits): ~10% de pérdida de calidad, 75% de ahorro en VRAM. Arriesgado; usar solo si hay OOM.
Impacto en velocidad: Q2 es ~30% más rápido que Q4 debido a menor uso de ancho de banda de memoria, no por cómputo.
Estrategia: cuantiza modelos grandes (Mistral Small Q2) en lugar de usar modelos diminutos (TinyLlama).
Mistral Small Q2 supera a TinyLlama 1.1B Q4 tanto en velocidad como en calidad.
Los modelos más rápidos sacrifican calidad por velocidad — pero ajustar temperature y top-p recupera buena parte de esa calidad. Una temperature baja (0.1–0.3) en modelos rápidos produce resultados más consistentes que la configuración predeterminada. Consulta temperature y top-p explicados para los ajustes exactos.
¿Cómo acelerar la inferencia solo en CPU?
- Habilitar AVX-512: Si el CPU lo admite, usa `LLAMACPP_AVX512=1 ollama run phi`. ~20% de mejora de velocidad.
- Reducir la ventana de contexto: Contexto más corto = más rápido. Usa `--ctx-size 1024` en lugar de 4096.
- **Usar llama.cpp en lugar de Ollama:** Ligeramente más rápido en CPU (~10% de ganancia) por menor sobrecarga.
- Deshabilitar multithreading: Contraintuitivo, pero en CPUs débiles el modo de un solo hilo es más rápido (sin sobrecarga de hilos).
- Delegar a la iGPU: Incluso una GPU integrada débil supera a la CPU. Verifica disponibilidad con `lspci`.
¿Qué tan rápidos son estos modelos? Benchmarks reales
Mediciones reales por nivel de hardware, julio de 2026. Todos ejecutando Ollama con configuración predeterminada, sin ajuste. Todos solo CPU o iGPU — sin GPU discreta:
- 4 GB RAM, solo CPU (mini PC Intel N100) + Qwen3 1.7B Q4_K_M: 25–35 tok/s. `ollama run qwen3:1.7b`
- 8 GB RAM, solo CPU (Core i5-1235U) + Phi-4-mini Q4_K_M: 15–22 tok/s. `ollama run phi4-mini`
- 8 GB RAM, solo CPU (Ryzen 5 5600G con iGPU Radeon) + Qwen3 4B Q4_K_M: 18–25 tok/s con offload de capas.
- 8 GB RAM + Intel Iris Xe (i5 de 12.ª gen) + Qwen3 4B Q4_K_M: 12–18 tok/s. `ollama run qwen3:4b`
- 16 GB RAM, solo CPU (Ryzen 7 7700X) + Qwen3 8B Q4_K_M: 8–13 tok/s. `ollama run qwen3:8b`
- 16 GB RAM + iGPU Iris Xe + Llama 3.2 3B Q4_K_M: 20–30 tok/s. `ollama run llama3.2:3b`
¿Qué es realmente "rápido" para los LLMs locales?
La velocidad se percibe diferente según la tarea — usa esto como referencia:
Si tu modelo corre por debajo de 15 tok/s, reduce el tamaño del modelo (7B → 3B) o baja un nivel de cuantización (Q5 → Q4) antes de comprar hardware nuevo.
- Por debajo de 10 tok/s → se siente roto. Las palabras aparecen una a una con pausas notorias. No usable para chat interactivo.
- 15–25 tok/s → aceptable. Velocidad legible para la mayoría de usuarios. Bueno para preguntas y respuestas, resúmenes y ayuda con código.
- 30+ tok/s → fluido. Se siente como un asistente real. Cómodo para todas las tareas interactivas.
- 60+ tok/s → instantáneo. Más rápido que la lectura. Ideal para autocompletado en tiempo real e iteración rápida.
Qué evitar en PCs de gama baja
- No ejecutes modelos 13B+ — superan los límites de RAM. Un modelo 13B en Q4 requiere 8–10 GB VRAM, excediendo la capacidad práctica de un PC de gama baja. Incluso con cuantización agresiva Q2, los modelos 13B requieren 5–6 GB, dejando margen insuficiente para el SO y la sobrecarga de planificación de GPU. Usa 7B o menos.
- Evita la cuantización Q8 — más lenta con mínima ganancia de calidad. Q8 usa casi 2× la VRAM de Q4 (8 GB vs 5.5 GB para Mistral Small) con solo ~2% de mejora de calidad. En sistemas de 4 GB, Q8 es impracticable; en sistemas de 8 GB, Q4 sigue siendo óptimo. Q3 es la única compensación que vale la pena considerar cuando Q4 provoca OOM.
- No esperes rendimiento de autocompletado en tiempo real. A 3 tok/s en CPU, generar 50 tokens lleva 16 segundos. El autocompletado interactivo requiere ≥20 tok/s. Los LLMs locales en CPUs de gama baja sirven para chat por lotes, borradores y revisión — no para autocompletado en vivo ni código mientras escribes.
- No uses inferencia solo en CPU para chatbots de producción. Aceptable para herramientas internas, prototipos y trabajo offline por lotes. Las APIs en la nube (latencia 15–20 ms) superan a las CPUs de gama baja (latencia 300+ ms) para servicios orientados al usuario. Usa la inferencia local para escenarios críticos de privacidad u offline, no para los críticos de velocidad.
Errores comunes
- Error: usar TinyLlama en CPU para mayor velocidad. Problema: TinyLlama pertenece a 4 GB VRAM, no a CPU — Phi-4-mini 3.8B es más rápido y mucho mejor en hardware solo CPU. Solución: ejecuta Phi-4-mini 3.8B en CPU; reserva TinyLlama Q5 para 4 GB VRAM.
- Error: no habilitar los flags de aceleración de CPU. Problema: no habilitar AVX/NEON desperdicia un 20% de velocidad sin costo. Solución: establece `LLAMACPP_AVX512=1` o `LLAMACPP_NEON=1` antes de ejecutar Ollama.
- Error: cuantizar a Q2 para forzar un 7B en 4 GB. Problema: la cuantización Q2 frecuentemente provoca cuelgues por falta de memoria debido a la sobrecarga del caché KV durante la inferencia. Solución: usa un modelo 3B en Q4.
- Error: asumir que hardware más nuevo siempre significa inferencia más rápida. Problema: el Ryzen de escritorio no es más rápido por token que el ARM móvil porque el software de escritorio carece de optimización de memoria. Solución: haz benchmarks con tu hardware real.
- Error: usar el slug de Ollama incorrecto para tu modelo. Problema: `ollama run phi` carga Phi-2, no Phi-4-mini. Solución: usa `ollama run phi4-mini` para el modelo Phi más reciente. Consulta siempre ollama.com/library para las etiquetas exactas de los modelos.
LLMs locales en PCs de gama baja: contexto regional
UE / RGPD: Local en hardware de gama baja: ningún dato de inferencia sale del dispositivo — para muchas PYMES y autónomos, una forma técnicamente sencilla de evitar los riesgos de transferencia del art. 44 del RGPD. La Ley de IA de la UE (vigente desde febrero de 2025) no impone requisitos de documentación para la inferencia de uso personal. Para las pymes alemanas que usan LLMs locales para tareas internas de negocio, BSI-Grundschutz recomienda la inferencia local para el procesamiento de documentos sensibles. El cumplimiento global en materia de protección de datos depende de toda la operación, no solo de la arquitectura de inferencia.
América Latina: La inferencia local en hardware de consumo cumple con las principales leyes de protección de datos de la región: la LFPDPPP de México, la Ley 25.326 de Argentina y la Ley 1581 de Colombia. Dado que ningún dato sale del dispositivo, la inferencia local elimina la necesidad de cláusulas contractuales estándar con proveedores de IA externos y satisface los requisitos de residencia de datos donde aplica. Para empresas latinoamericanas que procesan datos de clientes o documentos internos sensibles, la inferencia local en hardware CPU-only accesible es la opción más simple de cumplimiento normativo.
China: La inferencia local en hardware de consumidor es común para despliegues de Qwen3 y DeepSeek-R1 en China, donde el acceso a las APIs en la nube de modelos no chinos está restringido. Qwen3 1.7B y 4B funcionan en hardware solo CPU, proporcionando una alternativa funcional a las APIs en la nube para usuarios con hardware limitado.
Preguntas frecuentes sobre cómo ejecutar LLMs locales en PCs de gama baja
¿Qué se considera un PC de gama baja para ejecutar LLMs locales?
Un PC de gama baja para LLMs locales es cualquier máquina solo CPU (sin GPU discreta) con 4–16 GB de RAM del sistema. Incluye la mayoría de portátiles con gráficos integrados Intel Iris o AMD Radeon, PCs de escritorio antiguos sin GPU dedicada, y mini PCs como el Intel N100. La restricción clave es la RAM del sistema para alojar los pesos del modelo, no la velocidad de reloj de la CPU.
¿Puedo ejecutar un modelo de clase 7B sin ninguna GPU?
Sí — Qwen3 8B Q4_K_M funciona a 8–15 tok/s con 16 GB RAM, solo CPU (probado en Ryzen 7 7700X). Es más lento que las opciones más pequeñas pero ofrece una calidad notablemente mejor. Con 8 GB RAM, usa Phi-4-mini (3.8B) en su lugar — un modelo 8B en Q4_K_M necesita un margen que un sistema de 8 GB no garantiza de forma fiable.
¿Es la inferencia CPU usable para chatbots?
Sí, para uso interactivo si eliges el tamaño de modelo correcto. Phi-4-mini a 15–25 tok/s (8 GB RAM) y Qwen3 1.7B a 25–40 tok/s (4 GB RAM) son lo bastante rápidos para chat en tiempo real. Un modelo de clase 7B en CPU (8–15 tok/s) es mejor para tareas por lotes — redacción, resúmenes, revisión offline — que para conversación en vivo.
¿Debo usar Phi-4-mini o Qwen3 1.7B en hardware solo CPU?
Usa Phi-4-mini (3.8B) si tienes 8 GB RAM — maneja código y razonamiento a 15–25 tok/s. Usa Qwen3 1.7B si solo tienes 4 GB RAM o quieres la respuesta más rápida posible (25–40 tok/s) a costa de algo de calidad en tareas complejas.
¿Cómo verifico si tengo alguna GPU?
Ejecuta `nvidia-smi` en la terminal para GPUs NVIDIA discretas. Si devuelve "command not found", revisa `lspci` (Linux) o el Administrador de dispositivos (Windows) en busca de una iGPU Intel Iris Xe o AMD Radeon — estas pueden delegar algunas capas incluso sin soporte CUDA.
¿Cómo afecta la cuantización a la velocidad de inferencia?
La cuantización reduce principalmente los requisitos de ancho de banda de memoria, no el cómputo. Q2 (2 bits) es aproximadamente un 30% más rápido que Q4 (4 bits) porque el modelo carga menos bytes por pase adelante. Sin embargo, Q2 conlleva una penalización de calidad de ~10%. La regla práctica: usa Q4_K_M por defecto para todos los niveles de esta guía, baja a Q3 solo si Q4_K_M no cabe en la RAM disponible.
¿Puedo usar cuantización por debajo de Q2?
Técnicamente sí (Q1), pero la calidad se degrada catastróficamente — hasta un 30% de pérdida de precisión. No se recomienda para ningún caso de uso práctico, incluido el nivel de 4 GB RAM de esta guía.
¿Se admite la inferencia híbrida CPU + iGPU?
Sí, mediante offloading de capas. En un sistema de 8 GB RAM con iGPU Intel Iris Xe, Qwen3 4B alcanza 12–20 tok/s con offload parcial frente a solo CPU. Establece `OLLAMA_NUM_GPU=1` y Ollama delegará automáticamente las capas que quepan.
¿Cuál es el LLM local más rápido para un PC de gama baja?
Qwen3 1.7B en Q4_K_M es el modelo más rápido de esta guía — 25–40 tok/s en un i5/Ryzen 5 moderno con 4 GB RAM y sin GPU. Para mejor calidad a una velocidad similar, Phi-4-mini (3.8B) funciona a 15–25 tok/s con 8 GB RAM y maneja código y razonamiento notablemente mejor.
¿Puedo ejecutar un LLM local con 4 GB de RAM?
Sí — Qwen3 1.7B en Q4_K_M es la opción recomendada para 4 GB RAM, solo CPU, alcanzando 25–40 tok/s en un i5/Ryzen 5 moderno. Es el modelo más rápido de esta guía y cabe con margen para el SO.
¿Se necesita GPU para mayor velocidad?
No — todos los modelos de esta guía funcionan solo con CPU. Una iGPU Intel Iris añade un impulso de velocidad notable (Qwen3 4B: 12–20 tok/s con offload parcial frente a solo CPU) pero es opcional. Una GPU discreta como una RTX 4060 8 GB usada es 5–10× más rápida que cualquier configuración de CPU, pero es una vía de mejora aparte, no un requisito.
Fuentes
- Ficha del modelo Phi-4 Mini — Microsoft Research. 68% MMLU, 70% HumanEval. Lanzado en 2025.
- Ficha del modelo Gemma 3 — Google DeepMind. Gemma 3 2B con ventana de contexto de 128K. Lanzado en 2025.
- Llama 4 Scout 8B — Meta. Ventana de contexto de 10M, lanzado en marzo de 2026.
- Repositorio TinyLlama 1.1B — Stability AI. Entrenamiento completado en 2024. Modelo estable, sin actualizaciones. Recomendado para el nivel 4 GB VRAM.
- Guía de optimización de CPU para llama.cpp — Flags de aceleración de CPU incluyendo AVX-512, NEON y configuración de hilos.
