¿Mejores modelos Ollama para RTX 3060 12 GB?

Respuesta rápida
Con 12 GB de VRAM, el mejor modelo de uso general es Qwen3 8B, que entrega unos 40 tokens por segundo con 6 GB de VRAM. Para razonamiento y programación, usa Phi-4 en Q4_K_M (~9 GB de VRAM). Mistral Nemo 12B es una buena alternativa para chat con 8 GB de VRAM.
- ▸Qwen3 8B: mejor uso general en RTX 3060 — 6 GB VRAM, ~40 tok/s
- ▸Phi-4 Q4_K_M: mejor para razonamiento y programación — ~9 GB VRAM
- ▸Mistral Nemo 12B: buena alternativa para chat — 8 GB VRAM
Puntos clave
- ✓Mejor uso general: Qwen3 8B — 6 GB VRAM, ~40 tok/s, excelente calidad de chat e instrucciones
- ✓Mejor para razonamiento/código: Phi-4 en Q4_K_M — ~9 GB VRAM, mejor puntuación de razonamiento en la clase sub-10B
- ✓RTX 3060 12 GB ejecuta cualquier modelo bajo 10 GB en cuantización Q4, incluidos Qwen3 8B, Phi-4 y Mistral Nemo 12B
Top 3 modelos Ollama para RTX 3060 12 GB
A septiembre de 2026, la RTX 3060 12 GB sigue siendo la GPU con mejor relación calidad-precio para ejecutar modelos de 6–12 GB localmente. Sus 12 GB de VRAM ejecutan cualquier modelo bajo 10 GB en cuantización Q4, incluidas las generaciones actuales de Qwen3 y Phi-4. Incluso en una tarjeta de segunda mano, obtienes 30–40 tokens por segundo en los modelos recomendados a continuación.
Los tres modelos siguientes funcionan con Ollama sin configuración. Las cifras de velocidad son con contexto predeterminado de 2048 tokens en un PC de escritorio sin offloading a CPU.
| Modelo | VRAM usada | Velocidad |
|---|---|---|
| Qwen3 8B | 6,0 GB | ~40 tok/s |
| Phi-4 Q4_K_M | ~9,0 GB | ~35 tok/s |
| Mistral Nemo 12B Q4_K_M | ~8,0 GB | ~30 tok/s |
Cómo obtener el mejor rendimiento en RTX 3060
Para uso general, ejecuta Qwen3 8B con una ventana de contexto de 4096 tokens. Esto usa ~6 GB de VRAM y deja 6 GB de margen — suficiente para evitar desbordamiento al cambiar entre modelos.
Para razonamiento y programación, Phi-4 en Q4_K_M es la elección clara: cabe en ~9 GB de VRAM y maneja Python, TypeScript y Go sin ajuste fino.
Deja siempre al menos 1,5–2 GB de VRAM libres. Cargar dos modelos seguidos sin descargar el primero provoca desbordamiento de VRAM y fuerza un lento offloading a CPU. Para el contexto completo de benchmarks de GPU, consulta las mejores GPUs para LLMs locales. Si tu GPU tiene menos de 12 GB, consulta los mejores modelos para 6 GB de VRAM. Para instalar las tres mejores opciones:
ollama pull qwen3:8b
ollama pull phi4
ollama pull mistral-nemo--num-ctx 4096 si necesitas una ventana de contexto más grande.Respuestas rápidas sobre modelos para RTX 3060
¿Puede la RTX 3060 ejecutar un modelo 70B?▾
¿Es buena la RTX 3060 12 GB para LLMs locales?▾
¿Qué cuantización usar en RTX 3060 12 GB?▾
¿Ollama usa automáticamente la GPU RTX 3060?▾
ollama run nombremodelo y carga completamente en la GPU si la VRAM es suficiente.