Skip to main content
PromptQuorum
Home/Local LLMs/LLMs Locales más Rápidos para PCs de Gama Baja 2026: Guía Solo CPU
Models by Use Case

LLMs Locales más Rápidos para PCs de Gama Baja 2026: Guía Solo CPU

·8 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

El LLM local más rápido en un PC de gama baja (solo CPU, 8 GB RAM) es Qwen3 1.7B en Q4_K_M — 25–40 tok/s en un i5/Ryzen 5 moderno. Para buena calidad con 8 GB, Phi-4-mini (3.8B) funciona a 15–25 tok/s y maneja bien código y razonamiento. Ningún modelo de esta guía necesita GPU.

Solo CPU, 8 GB RAM: Qwen3 1.7B Q4_K_M alcanza 25–40 tok/s en un i5/Ryzen 5 moderno. Phi-4-mini (3.8B) funciona a 15–25 tok/s y maneja código y razonamiento. Ningún modelo de esta guía necesita GPU. A partir de julio de 2026, puedes ejecutar un LLM local capaz en un portátil antiguo sin GPU dedicada. Esta guía cubre niveles de hardware desde 4 GB solo CPU hasta 16 GB con iGPU Intel Iris — con comandos de Ollama para cada nivel.

LLMs Locales más Rápidos para PCs de Gama Baja (2026)

La velocidad depende de tu nivel de hardware. Asocia tu CPU/RAM con el modelo correcto — la elección equivocada deja 4–10× de velocidad sin aprovechar.

  • 4 GB RAM, solo CPU: Qwen3 1.7B Q4_K_M — 25–40 tok/s en un i5/Ryzen 5 moderno. `ollama run qwen3:1.7b`
  • 8 GB RAM, solo CPU: Phi-4-mini (3.8B) — 15–25 tok/s, maneja código y razonamiento. `ollama run phi4-mini`
  • 8 GB RAM + iGPU Intel Iris: Qwen3 4B — 12–20 tok/s con offload parcial. `ollama run qwen3:4b`
  • 16 GB RAM, solo CPU: Qwen3 8B Q4_K_M — 8–15 tok/s, calidad sólida. `ollama run qwen3:8b`

Para la mayoría de PCs de gama baja, Phi-4-mini (3.8B) en Q4_K_M es el punto óptimo — cabe en 8 GB RAM, 15–25 tok/s en CPU. Baja a Qwen3 1.7B para la respuesta más rápida posible.

Slide Deck: LLMs Locales más Rápidos para PCs de Gama Baja 2026: Guía Solo CPU

Presentación interactiva de 14 diapositivas sobre los LLMs locales más rápidos para PCs de gama baja: 4 GB RAM solo CPU (Qwen3 1.7B, 25–40 tok/s), punto óptimo 8 GB RAM solo CPU (Phi-4-mini, 15–25 tok/s), 16 GB RAM solo CPU (Qwen3 8B, 8–15 tok/s), y niveles con impulso de iGPU. Las diapositivas incluyen tabla de decisión hardware-modelo, una recomendación por nivel con cifras exactas de RAM, guía de cuantización (Q4/Q3/Q2), umbrales de percepción de velocidad y errores comunes. Descarga el PDF como tarjeta de referencia de hardware para LLMs locales.

Browse the slides below or download as PDF for offline reference. Download Reference Card (PDF)

LLMs Locales más Rápidos para PCs de Gama Baja 2026: Guía Solo CPU

Key Takeaways

  • 4 GB RAM, solo CPU: Qwen3 1.7B Q4_K_M — 25–40 tok/s. Respuesta más rápida en hardware mínimo.
  • 8 GB RAM, solo CPU (punto óptimo): Phi-4-mini 3.8B Q4_K_M — 15–25 tok/s. Código y razonamiento en portátiles antiguos.
  • 8 GB RAM + iGPU Intel Iris: Qwen3 4B — 12–20 tok/s con offload parcial de GPU.
  • 16 GB RAM, solo CPU: Qwen3 8B Q4_K_M — 8–15 tok/s. Calidad sólida, sin necesidad de GPU.
  • 16 GB RAM + iGPU: Llama 3.2 3B o Qwen3 4B — 20–35 tok/s con offload de capas.
  • Veredicto ganador: Para la mayoría de PCs de gama baja, Phi-4-mini (3.8B) en Q4_K_M es el punto óptimo — cabe en 8 GB RAM, 15–25 tok/s en CPU. Baja a Qwen3 1.7B para la respuesta más rápida.
  • Costo: Todos gratuitos (código abierto) frente a la API de ChatGPT (~$0.002 por 1K tokens).

En un PC solo con CPU y 8 GB de RAM, Phi-4-mini 3.8B Q4_K_M funciona a 15–25 tok/s para código y razonamiento; con 4 GB, Qwen3 1.7B Q4_K_M alcanza 25–40 tok/s.

No necesitas una GPU gaming para ejecutar IA local. Estos modelos funcionan completamente en tu CPU y RAM estándar. Los modelos pequeños (1–4B parámetros) son sorprendentemente capaces para tareas cotidianas y lo suficientemente rápidos para una conversación real.

¿Cuál es el modelo más rápido para tu hardware?

Asocia tu hardware con el modelo correcto — la elección equivocada deja 4–10× de velocidad sin aprovechar. Todos los niveles de abajo son solo CPU salvo que se indique lo contrario.

Tu hardwareModelo recomendadoComando de OllamaVelocidad esperada
4 GB RAM, solo CPUQwen3 1.7B Q4_K_Mollama run qwen3:1.7b25–40 tok/s
8 GB RAM, solo CPUPhi-4-mini 3.8B Q4_K_Mollama run phi4-mini15–25 tok/s
8 GB RAM + iGPU Intel IrisQwen3 4B Q4_K_Mollama run qwen3:4b12–20 tok/s
16 GB RAM, solo CPUQwen3 8B Q4_K_Mollama run qwen3:8b8–15 tok/s
16 GB RAM + iGPULlama 3.2 3B Q4_K_Mollama run llama3.2:3b20–35 tok/s

¿Qué modelo deberías usar?

Asocia tu situación con el modelo correcto — esta es la decisión más importante:

  • Portátil con 8 GB RAM (sin GPU discreta): Phi-4-mini (3.8B) en Q4_K_M — 15–25 tok/s, maneja código y razonamiento. `ollama run phi4-mini`
  • 4 GB RAM, PC muy antiguo: Qwen3 1.7B Q4_K_M — 25–40 tok/s, la respuesta más rápida con RAM mínima. `ollama run qwen3:1.7b`
  • 16 GB RAM, sin GPU: Qwen3 8B Q4_K_M — 8–15 tok/s, calidad sólida. `ollama run qwen3:8b`
  • 8 GB RAM + iGPU Intel Iris: Qwen3 4B — usa `OLLAMA_NUM_GPU=1` para offload parcial, 12–20 tok/s. `ollama run qwen3:4b`
  • Quieres multilingüe (contexto de 128K): Qwen3 4B o Llama 3.2 3B — ambos admiten 128K de contexto en Ollama.
  • Para recomendaciones por nivel de RAM y gestión térmica, consulta cómo ejecutar un LLM local en un portátil.

¿Qué LLM local deberías ejecutar en tu hardware?

Todos los niveles de abajo son solo CPU o iGPU. Elige el modelo más grande que quepa en tu RAM con Q4_K_M — la cuantización degrada menos la calidad que bajar a un modelo más pequeño.

HardwareModelQuantSpeedExperience
4 GB RAM, solo CPUQwen3 1.7BQ4_K_M25–40 t/srápido, calidad usable
8 GB RAM, solo CPUPhi-4-mini 3.8BQ4_K_M15–25 t/scódigo + razonamiento
8 GB RAM + iGPU IrisQwen3 4BQ4_K_M12–20 t/soffload parcial de GPU
16 GB RAM, solo CPUQwen3 8BQ4_K_M8–15 t/scalidad sólida
16 GB RAM + iGPULlama 3.2 3BQ4_K_M20–35 t/sfluido con iGPU
Velocidad de LLM local por nivel de hardware (solo CPU e iGPU): 4 GB RAM (25–40 tok/s, Qwen3 1.7B), 8 GB RAM CPU (15–25 tok/s, Phi-4-mini), 8 GB + iGPU Iris (12–20 tok/s), 16 GB CPU (8–15 tok/s), 16 GB + iGPU (20–35 tok/s). Benchmarks de julio 2026.
Velocidad de LLM local por nivel de hardware (solo CPU e iGPU): 4 GB RAM (25–40 tok/s, Qwen3 1.7B), 8 GB RAM CPU (15–25 tok/s, Phi-4-mini), 8 GB + iGPU Iris (12–20 tok/s), 16 GB CPU (8–15 tok/s), 16 GB + iGPU (20–35 tok/s). Benchmarks de julio 2026.

GPU vs CPU para LLMs locales: ¿cuál es más rápido en hardware de gama baja?

Inferencia GPU: 15–20 tok/s en RTX 3060. Requiere configuración CUDA. Rápida, mejor calidad. Consulta la guía de GPUs económicas para opciones rentables.

iGPU (integrada): 5–8 tok/s en Intel Iris. Sin configuración adicional. Más lenta que la GPU discreta.

Inferencia CPU: 1–5 tok/s en multi-núcleo moderno. Funciona en cualquier lugar. La más lenta.

Regla: Si tienes cualquier GPU (incluso integrada), úsala. La CPU es el último recurso.

Comparativa de velocidad CPU vs GPU para LLMs locales: solo CPU alcanza 10–25 tok/s (modelos 3B) y 15–40 tok/s. GPU (RTX 3060, 8 GB) llega a 25–60 tok/s — entre 4 y 10 veces más rápida que la inferencia solo en CPU.
Comparativa de velocidad CPU vs GPU para LLMs locales: solo CPU alcanza 10–25 tok/s (modelos 3B) y 15–40 tok/s. GPU (RTX 3060, 8 GB) llega a 25–60 tok/s — entre 4 y 10 veces más rápida que la inferencia solo en CPU.

Por qué los modelos más pequeños son más rápidos en PCs de gama baja

El tamaño del modelo determina directamente la velocidad. Un modelo 1B–3B cabe completamente en la RAM del sistema, lo que permite al CPU o GPU transmitir datos de forma continua. Los modelos más grandes requieren intercambio de memoria — mover datos entre la RAM y el disco — lo que ralentiza la generación entre 10 y 100 veces (el cuello de botella es el I/O del disco, no el cómputo).

La tabla de decisión de hardware anterior refleja este principio: TinyLlama 1.1B (1B parámetros) alcanza 5–10 tok/s en CPUs antiguas, mientras que los modelos 13B+ son impracticables en hardware de gama baja porque el intercambio domina.

  • Modelos 1B–3B: Caben en 4–8 GB RAM → generación más rápida → calidad aceptable
  • Modelos 7B: Ajustados en sistemas de 8 GB → más lentos por presión de memoria → alta calidad
  • Modelos 13B+: Requieren 16+ GB VRAM o intercambio masivo → demasiado lentos para uso interactivo

¿Qué tan rápidos son los LLMs locales en PCs de gama baja?

En sistemas solo CPU, espera:

  • Modelos 3B → 15–40 tokens/s (CPUs antiguas: 10–15, CPUs nuevas con optimización: 30–40)
  • Modelos 7B → 10–25 tokens/s (depende de los núcleos del CPU y la cuantización; con optimización agresiva algunos llegan a 30+)
  • Esto es más lento que las APIs en la nube (ChatGPT 4o: 80–150 tok/s) pero suficiente para uso interactivo. Un modelo 3B a 25 tok/s genera una respuesta de 500 tokens en 20 segundos — aceptable para tareas no urgentes como revisión de código, resúmenes y escritura creativa.

¿Cómo afecta la cuantización a la velocidad en PCs de gama baja?

Q4 (4 bits): ~1% de pérdida de calidad, 50% de ahorro en VRAM. Elección estándar. Para detalles sobre todos los niveles de cuantización y cómo funcionan, consulta la guía completa.

Q3 (3 bits): ~3% de pérdida de calidad, 62% de ahorro en VRAM. Aceptable para chat.

Q2 (2 bits): ~10% de pérdida de calidad, 75% de ahorro en VRAM. Arriesgado; usar solo si hay OOM.

Impacto en velocidad: Q2 es ~30% más rápido que Q4 debido a menor uso de ancho de banda de memoria, no por cómputo.

Estrategia: cuantiza modelos grandes (Mistral Small Q2) en lugar de usar modelos diminutos (TinyLlama).

Mistral Small Q2 supera a TinyLlama 1.1B Q4 tanto en velocidad como en calidad.

Los modelos más rápidos sacrifican calidad por velocidad — pero ajustar temperature y top-p recupera buena parte de esa calidad. Una temperature baja (0.1–0.3) en modelos rápidos produce resultados más consistentes que la configuración predeterminada. Consulta temperature y top-p explicados para los ajustes exactos.

Compromisos de cuantización para LLMs locales: Q4 (1% de pérdida de calidad, 50% de ahorro en VRAM, 4.5 GB para Mistral Small) es el estándar. Q2 es un 30% más rápido pero con 10% de caída de calidad. Evita Q8 — costo 2× de VRAM con ganancia mínima.
Compromisos de cuantización para LLMs locales: Q4 (1% de pérdida de calidad, 50% de ahorro en VRAM, 4.5 GB para Mistral Small) es el estándar. Q2 es un 30% más rápido pero con 10% de caída de calidad. Evita Q8 — costo 2× de VRAM con ganancia mínima.

¿Cómo acelerar la inferencia solo en CPU?

  • Habilitar AVX-512: Si el CPU lo admite, usa `LLAMACPP_AVX512=1 ollama run phi`. ~20% de mejora de velocidad.
  • Reducir la ventana de contexto: Contexto más corto = más rápido. Usa `--ctx-size 1024` en lugar de 4096.
  • **Usar llama.cpp en lugar de Ollama:** Ligeramente más rápido en CPU (~10% de ganancia) por menor sobrecarga.
  • Deshabilitar multithreading: Contraintuitivo, pero en CPUs débiles el modo de un solo hilo es más rápido (sin sobrecarga de hilos).
  • Delegar a la iGPU: Incluso una GPU integrada débil supera a la CPU. Verifica disponibilidad con `lspci`.

¿Qué tan rápidos son estos modelos? Benchmarks reales

Mediciones reales por nivel de hardware, julio de 2026. Todos ejecutando Ollama con configuración predeterminada, sin ajuste. Todos solo CPU o iGPU — sin GPU discreta:

  • 4 GB RAM, solo CPU (mini PC Intel N100) + Qwen3 1.7B Q4_K_M: 25–35 tok/s. `ollama run qwen3:1.7b`
  • 8 GB RAM, solo CPU (Core i5-1235U) + Phi-4-mini Q4_K_M: 15–22 tok/s. `ollama run phi4-mini`
  • 8 GB RAM, solo CPU (Ryzen 5 5600G con iGPU Radeon) + Qwen3 4B Q4_K_M: 18–25 tok/s con offload de capas.
  • 8 GB RAM + Intel Iris Xe (i5 de 12.ª gen) + Qwen3 4B Q4_K_M: 12–18 tok/s. `ollama run qwen3:4b`
  • 16 GB RAM, solo CPU (Ryzen 7 7700X) + Qwen3 8B Q4_K_M: 8–13 tok/s. `ollama run qwen3:8b`
  • 16 GB RAM + iGPU Iris Xe + Llama 3.2 3B Q4_K_M: 20–30 tok/s. `ollama run llama3.2:3b`

¿Qué es realmente "rápido" para los LLMs locales?

La velocidad se percibe diferente según la tarea — usa esto como referencia:

Si tu modelo corre por debajo de 15 tok/s, reduce el tamaño del modelo (7B → 3B) o baja un nivel de cuantización (Q5 → Q4) antes de comprar hardware nuevo.

  • Por debajo de 10 tok/s → se siente roto. Las palabras aparecen una a una con pausas notorias. No usable para chat interactivo.
  • 15–25 tok/s → aceptable. Velocidad legible para la mayoría de usuarios. Bueno para preguntas y respuestas, resúmenes y ayuda con código.
  • 30+ tok/s → fluido. Se siente como un asistente real. Cómodo para todas las tareas interactivas.
  • 60+ tok/s → instantáneo. Más rápido que la lectura. Ideal para autocompletado en tiempo real e iteración rápida.
Umbrales de percepción de velocidad para LLMs locales: por debajo de 10 tok/s se siente roto, 15–25 tok/s es aceptable para preguntas y respuestas, 30+ tok/s es fluido para todas las tareas, 60+ tok/s habilita el autocompletado en tiempo real.
Umbrales de percepción de velocidad para LLMs locales: por debajo de 10 tok/s se siente roto, 15–25 tok/s es aceptable para preguntas y respuestas, 30+ tok/s es fluido para todas las tareas, 60+ tok/s habilita el autocompletado en tiempo real.

Qué evitar en PCs de gama baja

  • No ejecutes modelos 13B+ — superan los límites de RAM. Un modelo 13B en Q4 requiere 8–10 GB VRAM, excediendo la capacidad práctica de un PC de gama baja. Incluso con cuantización agresiva Q2, los modelos 13B requieren 5–6 GB, dejando margen insuficiente para el SO y la sobrecarga de planificación de GPU. Usa 7B o menos.
  • Evita la cuantización Q8 — más lenta con mínima ganancia de calidad. Q8 usa casi 2× la VRAM de Q4 (8 GB vs 5.5 GB para Mistral Small) con solo ~2% de mejora de calidad. En sistemas de 4 GB, Q8 es impracticable; en sistemas de 8 GB, Q4 sigue siendo óptimo. Q3 es la única compensación que vale la pena considerar cuando Q4 provoca OOM.
  • No esperes rendimiento de autocompletado en tiempo real. A 3 tok/s en CPU, generar 50 tokens lleva 16 segundos. El autocompletado interactivo requiere ≥20 tok/s. Los LLMs locales en CPUs de gama baja sirven para chat por lotes, borradores y revisión — no para autocompletado en vivo ni código mientras escribes.
  • No uses inferencia solo en CPU para chatbots de producción. Aceptable para herramientas internas, prototipos y trabajo offline por lotes. Las APIs en la nube (latencia 15–20 ms) superan a las CPUs de gama baja (latencia 300+ ms) para servicios orientados al usuario. Usa la inferencia local para escenarios críticos de privacidad u offline, no para los críticos de velocidad.

Errores comunes

  • Error: usar TinyLlama en CPU para mayor velocidad. Problema: TinyLlama pertenece a 4 GB VRAM, no a CPU — Phi-4-mini 3.8B es más rápido y mucho mejor en hardware solo CPU. Solución: ejecuta Phi-4-mini 3.8B en CPU; reserva TinyLlama Q5 para 4 GB VRAM.
  • Error: no habilitar los flags de aceleración de CPU. Problema: no habilitar AVX/NEON desperdicia un 20% de velocidad sin costo. Solución: establece `LLAMACPP_AVX512=1` o `LLAMACPP_NEON=1` antes de ejecutar Ollama.
  • Error: cuantizar a Q2 para forzar un 7B en 4 GB. Problema: la cuantización Q2 frecuentemente provoca cuelgues por falta de memoria debido a la sobrecarga del caché KV durante la inferencia. Solución: usa un modelo 3B en Q4.
  • Error: asumir que hardware más nuevo siempre significa inferencia más rápida. Problema: el Ryzen de escritorio no es más rápido por token que el ARM móvil porque el software de escritorio carece de optimización de memoria. Solución: haz benchmarks con tu hardware real.
  • Error: usar el slug de Ollama incorrecto para tu modelo. Problema: `ollama run phi` carga Phi-2, no Phi-4-mini. Solución: usa `ollama run phi4-mini` para el modelo Phi más reciente. Consulta siempre ollama.com/library para las etiquetas exactas de los modelos.

LLMs locales en PCs de gama baja: contexto regional

UE / RGPD: Local en hardware de gama baja: ningún dato de inferencia sale del dispositivo — para muchas PYMES y autónomos, una forma técnicamente sencilla de evitar los riesgos de transferencia del art. 44 del RGPD. La Ley de IA de la UE (vigente desde febrero de 2025) no impone requisitos de documentación para la inferencia de uso personal. Para las pymes alemanas que usan LLMs locales para tareas internas de negocio, BSI-Grundschutz recomienda la inferencia local para el procesamiento de documentos sensibles. El cumplimiento global en materia de protección de datos depende de toda la operación, no solo de la arquitectura de inferencia.

América Latina: La inferencia local en hardware de consumo cumple con las principales leyes de protección de datos de la región: la LFPDPPP de México, la Ley 25.326 de Argentina y la Ley 1581 de Colombia. Dado que ningún dato sale del dispositivo, la inferencia local elimina la necesidad de cláusulas contractuales estándar con proveedores de IA externos y satisface los requisitos de residencia de datos donde aplica. Para empresas latinoamericanas que procesan datos de clientes o documentos internos sensibles, la inferencia local en hardware CPU-only accesible es la opción más simple de cumplimiento normativo.

China: La inferencia local en hardware de consumidor es común para despliegues de Qwen3 y DeepSeek-R1 en China, donde el acceso a las APIs en la nube de modelos no chinos está restringido. Qwen3 1.7B y 4B funcionan en hardware solo CPU, proporcionando una alternativa funcional a las APIs en la nube para usuarios con hardware limitado.

Preguntas frecuentes sobre cómo ejecutar LLMs locales en PCs de gama baja

¿Qué se considera un PC de gama baja para ejecutar LLMs locales?

Un PC de gama baja para LLMs locales es cualquier máquina solo CPU (sin GPU discreta) con 4–16 GB de RAM del sistema. Incluye la mayoría de portátiles con gráficos integrados Intel Iris o AMD Radeon, PCs de escritorio antiguos sin GPU dedicada, y mini PCs como el Intel N100. La restricción clave es la RAM del sistema para alojar los pesos del modelo, no la velocidad de reloj de la CPU.

¿Puedo ejecutar un modelo de clase 7B sin ninguna GPU?

Sí — Qwen3 8B Q4_K_M funciona a 8–15 tok/s con 16 GB RAM, solo CPU (probado en Ryzen 7 7700X). Es más lento que las opciones más pequeñas pero ofrece una calidad notablemente mejor. Con 8 GB RAM, usa Phi-4-mini (3.8B) en su lugar — un modelo 8B en Q4_K_M necesita un margen que un sistema de 8 GB no garantiza de forma fiable.

¿Es la inferencia CPU usable para chatbots?

Sí, para uso interactivo si eliges el tamaño de modelo correcto. Phi-4-mini a 15–25 tok/s (8 GB RAM) y Qwen3 1.7B a 25–40 tok/s (4 GB RAM) son lo bastante rápidos para chat en tiempo real. Un modelo de clase 7B en CPU (8–15 tok/s) es mejor para tareas por lotes — redacción, resúmenes, revisión offline — que para conversación en vivo.

¿Debo usar Phi-4-mini o Qwen3 1.7B en hardware solo CPU?

Usa Phi-4-mini (3.8B) si tienes 8 GB RAM — maneja código y razonamiento a 15–25 tok/s. Usa Qwen3 1.7B si solo tienes 4 GB RAM o quieres la respuesta más rápida posible (25–40 tok/s) a costa de algo de calidad en tareas complejas.

¿Cómo verifico si tengo alguna GPU?

Ejecuta `nvidia-smi` en la terminal para GPUs NVIDIA discretas. Si devuelve "command not found", revisa `lspci` (Linux) o el Administrador de dispositivos (Windows) en busca de una iGPU Intel Iris Xe o AMD Radeon — estas pueden delegar algunas capas incluso sin soporte CUDA.

¿Cómo afecta la cuantización a la velocidad de inferencia?

La cuantización reduce principalmente los requisitos de ancho de banda de memoria, no el cómputo. Q2 (2 bits) es aproximadamente un 30% más rápido que Q4 (4 bits) porque el modelo carga menos bytes por pase adelante. Sin embargo, Q2 conlleva una penalización de calidad de ~10%. La regla práctica: usa Q4_K_M por defecto para todos los niveles de esta guía, baja a Q3 solo si Q4_K_M no cabe en la RAM disponible.

¿Puedo usar cuantización por debajo de Q2?

Técnicamente sí (Q1), pero la calidad se degrada catastróficamente — hasta un 30% de pérdida de precisión. No se recomienda para ningún caso de uso práctico, incluido el nivel de 4 GB RAM de esta guía.

¿Se admite la inferencia híbrida CPU + iGPU?

Sí, mediante offloading de capas. En un sistema de 8 GB RAM con iGPU Intel Iris Xe, Qwen3 4B alcanza 12–20 tok/s con offload parcial frente a solo CPU. Establece `OLLAMA_NUM_GPU=1` y Ollama delegará automáticamente las capas que quepan.

¿Cuál es el LLM local más rápido para un PC de gama baja?

Qwen3 1.7B en Q4_K_M es el modelo más rápido de esta guía — 25–40 tok/s en un i5/Ryzen 5 moderno con 4 GB RAM y sin GPU. Para mejor calidad a una velocidad similar, Phi-4-mini (3.8B) funciona a 15–25 tok/s con 8 GB RAM y maneja código y razonamiento notablemente mejor.

¿Puedo ejecutar un LLM local con 4 GB de RAM?

Sí — Qwen3 1.7B en Q4_K_M es la opción recomendada para 4 GB RAM, solo CPU, alcanzando 25–40 tok/s en un i5/Ryzen 5 moderno. Es el modelo más rápido de esta guía y cabe con margen para el SO.

¿Se necesita GPU para mayor velocidad?

No — todos los modelos de esta guía funcionan solo con CPU. Una iGPU Intel Iris añade un impulso de velocidad notable (Qwen3 4B: 12–20 tok/s con offload parcial frente a solo CPU) pero es opcional. Una GPU discreta como una RTX 4060 8 GB usada es 5–10× más rápida que cualquier configuración de CPU, pero es una vía de mejora aparte, no un requisito.

Fuentes

Nota sobre hechos de terceros

Este artículo hace referencia a modelos de IA, benchmarks, precios y licencias de terceros. El panorama de la IA cambia rápidamente. Las puntuaciones de benchmark, los términos de licencia, los nombres de modelos y los precios de API pueden cambiar entre el momento en que se escribió y cuando usted lo lee. Antes de tomar decisiones de despliegue o cumplimiento basadas en este artículo, verifique las cifras actuales en la fuente oficial de cada proveedor: tarjetas de modelos de Hugging Face para licencias y benchmarks, sitios web de proveedores para precios de API y EUR-Lex para el texto actualizado del RGPD y la Ley de IA de la UE.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs