¿Los mejores modelos de Ollama ahora mismo?

Respuesta rápida
Para uso general, qwen3.5:9b es la opción más sólida con 6,6 GB de descarga. Para código, qwen2.5-coder:7b con 4,7 GB hace el trabajo con mucho menos hardware del que afirman la mayoría de las guías. Para configuraciones compactas, llama3.2:3b funciona en 2,0 GB. Todos los tamaños leídos de la biblioteca de Ollama el 28 de agosto de 2026.
- ▸Mejor general: qwen3.5:9b — 6,6 GB
- ▸Mejor para código: qwen2.5-coder:7b — 4,7 GB
- ▸Mejor compacto: llama3.2:3b — 2,0 GB
Puntos clave
- ✓Mejor uso general: qwen3.5:9b — 6,6 GB de descarga, la generación de Qwen más reciente realmente disponible en Ollama
- ✓Mejor para código: qwen2.5-coder:7b — 4,7 GB, y es la opción de valor porque qwen3-coder empieza en 19 GB
- ✓Mejor compacto: llama3.2:3b — 2,0 GB, o deepseek-r1:1.5b con 1,1 GB si quieres trazas de razonamiento
- ✓Atención a la cifra que comparas: estos son tamaños de descarga de la biblioteca de Ollama, no requisitos de VRAM. Deja margen por encima del tamaño de descarga para tu ventana de contexto
- ✓Un modelo de hace seis meses con cuantización madura suele superar a un lanzamiento completamente nuevo con soporte comunitario limitado
Los tres líderes por nivel
Para uso general la opción actual es qwen3.5:9b con 6,6 GB de descarga. Los tamaños siguientes se leyeron directamente de la biblioteca de Ollama el 28 de agosto de 2026.
"Mejor" en la práctica significa el equilibrio más alto entre calidad de salida, velocidad de inferencia y eficiencia de memoria — no solo la puntuación de referencia bruta. Un modelo 9B que realmente cabe es más útil que un modelo 30B que se desborda al disco.
Una cifra merece corrección: los modelos de código cuestan menos de lo que sugieren la mayoría de las guías. qwen2.5-coder:7b pesa 4,7 GB y maneja Python, TypeScript y Go sin prompts especiales. El más reciente qwen3-coder empieza en 19 GB, así que es otra clase de hardware por completo, no una actualización directa.
| Nivel | Modelo | Descarga | Por qué lidera |
|---|---|---|---|
| Compacto | llama3.2:3b | 2,0 GB | Mejor calidad por GB en la gama baja; 81,6 M de descargas |
| General | qwen3.5:9b | 6,6 GB | Generación de Qwen más reciente disponible en Ollama |
| Código | qwen2.5-coder:7b | 4,7 GB | Salida de código sólida por una fracción del tamaño de qwen3-coder |
| Razonamiento | deepseek-r1:8b | 5,2 GB | Segundo modelo más descargado de Ollama con 92 M de descargas |
Cuando lo más nuevo no es lo mejor
Un nuevo lanzamiento de modelo no se convierte automáticamente en la mejor opción de Ollama. La calidad de cuantización, los ajustes finos de la comunidad y la madurez de integración con Ollama tardan entre 4 y 8 semanas en ponerse al día con un lanzamiento reciente.
Los contadores de descargas lo demuestran mejor que cualquier benchmark. llama3.1 sigue siendo el modelo más descargado de la biblioteca con 118,9 M, y llama3.2 alcanza 81,6 M — ambos por delante de cada llegada más reciente. No es inercia: la gente elige aquello cuyas cuantizaciones están bien optimizadas y cuyo comportamiento es predecible entre distintos equipos.
Si quieres la generación reciente, gemma4 (7,2 GB) y gpt-oss:20b (14 GB, contexto 128K) merecen una prueba. Deja que un modelo mantenga la cabeza 6+ semanas antes de confiar en él en producción. Para un análisis más profundo sobre evaluar modelos para tu carga de trabajo, consulta los mejores modelos de código abierto para Ollama.
Guías relacionadas
- ▸Mejor VPN para descargar modelos de IA -- VPN for AI downloads
- ▸Modelos Ollama con contexto de 128K -- long context models
- ▸Última versión de Ollama: ¿qué hay de nuevo? -- Ollama updates
- ▸Mistral Small 24B vs Qwen 3 14B vs Llama 3.1 8B -- model comparison