Skip to main content
PromptQuorum

¿Los mejores modelos de Ollama ahora mismo?

¿Los mejores modelos de Ollama ahora mismo?

Respuesta rápida

Para uso general, qwen3.5:9b es la opción más sólida con 6,6 GB de descarga. Para código, qwen2.5-coder:7b con 4,7 GB hace el trabajo con mucho menos hardware del que afirman la mayoría de las guías. Para configuraciones compactas, llama3.2:3b funciona en 2,0 GB. Todos los tamaños leídos de la biblioteca de Ollama el 28 de agosto de 2026.

  • Mejor general: qwen3.5:9b — 6,6 GB
  • Mejor para código: qwen2.5-coder:7b — 4,7 GB
  • Mejor compacto: llama3.2:3b — 2,0 GB
Ollama

Puntos clave

  • Mejor uso general: qwen3.5:9b — 6,6 GB de descarga, la generación de Qwen más reciente realmente disponible en Ollama
  • Mejor para código: qwen2.5-coder:7b — 4,7 GB, y es la opción de valor porque qwen3-coder empieza en 19 GB
  • Mejor compacto: llama3.2:3b — 2,0 GB, o deepseek-r1:1.5b con 1,1 GB si quieres trazas de razonamiento
  • Atención a la cifra que comparas: estos son tamaños de descarga de la biblioteca de Ollama, no requisitos de VRAM. Deja margen por encima del tamaño de descarga para tu ventana de contexto
  • Un modelo de hace seis meses con cuantización madura suele superar a un lanzamiento completamente nuevo con soporte comunitario limitado

Los tres líderes por nivel

Para uso general la opción actual es qwen3.5:9b con 6,6 GB de descarga. Los tamaños siguientes se leyeron directamente de la biblioteca de Ollama el 28 de agosto de 2026.

"Mejor" en la práctica significa el equilibrio más alto entre calidad de salida, velocidad de inferencia y eficiencia de memoria — no solo la puntuación de referencia bruta. Un modelo 9B que realmente cabe es más útil que un modelo 30B que se desborda al disco.

Una cifra merece corrección: los modelos de código cuestan menos de lo que sugieren la mayoría de las guías. qwen2.5-coder:7b pesa 4,7 GB y maneja Python, TypeScript y Go sin prompts especiales. El más reciente qwen3-coder empieza en 19 GB, así que es otra clase de hardware por completo, no una actualización directa.

NivelModeloDescargaPor qué lidera
Compactollama3.2:3b2,0 GBMejor calidad por GB en la gama baja; 81,6 M de descargas
Generalqwen3.5:9b6,6 GBGeneración de Qwen más reciente disponible en Ollama
Códigoqwen2.5-coder:7b4,7 GBSalida de código sólida por una fracción del tamaño de qwen3-coder
Razonamientodeepseek-r1:8b5,2 GBSegundo modelo más descargado de Ollama con 92 M de descargas

Cuando lo más nuevo no es lo mejor

Un nuevo lanzamiento de modelo no se convierte automáticamente en la mejor opción de Ollama. La calidad de cuantización, los ajustes finos de la comunidad y la madurez de integración con Ollama tardan entre 4 y 8 semanas en ponerse al día con un lanzamiento reciente.

Los contadores de descargas lo demuestran mejor que cualquier benchmark. llama3.1 sigue siendo el modelo más descargado de la biblioteca con 118,9 M, y llama3.2 alcanza 81,6 M — ambos por delante de cada llegada más reciente. No es inercia: la gente elige aquello cuyas cuantizaciones están bien optimizadas y cuyo comportamiento es predecible entre distintos equipos.

Si quieres la generación reciente, gemma4 (7,2 GB) y gpt-oss:20b (14 GB, contexto 128K) merecen una prueba. Deja que un modelo mantenga la cabeza 6+ semanas antes de confiar en él en producción. Para un análisis más profundo sobre evaluar modelos para tu carga de trabajo, consulta los mejores modelos de código abierto para Ollama.

Tamaños verificados en ollama.com/library el 28 de agosto de 2026. Las etiquetas de modelos cambian a menudo — ejecuta ollama pull y comprueba el tamaño informado antes de planificar en torno a cualquier cifra de aquí.

Guías relacionadas

Respuestas rápidas sobre los modelos de Ollama

¿Debería usar siempre el modelo de Ollama más reciente?
No automáticamente. Los nuevos lanzamientos necesitan entre 4 y 8 semanas para que las cuantizaciones comunitarias, los ajustes finos y la integración con Ollama maduren — por eso llama3.1 sigue siendo el modelo más descargado de la biblioteca. Consulta la tabla anterior para ver las opciones verificadas. Para configuraciones solo con CPU, consulta los mejores modelos de Ollama para uso solo con CPU.
¿Qué modelo de Ollama es el mejor para código ahora mismo?
qwen2.5-coder:7b, con 4,7 GB de descarga. Maneja Python, TypeScript y Go sin prompts especiales y cabe con holgura en una tarjeta de 8 GB. Ten en cuenta que qwen3-coder, pese a su número de versión más alto, empieza en 19 GB — así que no es una actualización directa salvo que tengas el hardware.
¿Cuánta VRAM necesito realmente?
Los tamaños citados aquí son de descarga, no requisitos de VRAM. Como regla general, deja un par de GB por encima del tamaño de descarga para la ventana de contexto y la sobrecarga. Un modelo de 6,6 GB como qwen3.5:9b va cómodo en una tarjeta de 12 GB y es viable en 8 GB con un contexto modesto.
¿Son los modelos Qwen mejores que los modelos Llama en 2026?
Para código, la línea Qwen lidera — qwen2.5-coder y qwen3-coder no tienen equivalente Llama directo en la biblioteca. Para uso general está más reñido de lo que sugieren los números de versión: llama3.1 y llama3.2 siguen siendo los dos modelos más descargados de Ollama, por delante de todo lanzamiento más reciente, porque sus cuantizaciones son maduras y su comportamiento predecible.