Skip to main content
PromptQuorum

¿Mejores modelos Ollama para RTX 3060 12 GB?

¿Mejores modelos Ollama para RTX 3060 12 GB?

Respuesta rápida

Con 12 GB de VRAM, el mejor modelo de uso general es Qwen3 8B, que entrega unos 40 tokens por segundo con 6 GB de VRAM. Para razonamiento y programación, usa Phi-4 en Q4_K_M (~9 GB de VRAM). Mistral Nemo 12B es una buena alternativa para chat con 8 GB de VRAM.

  • Qwen3 8B: mejor uso general en RTX 3060 — 6 GB VRAM, ~40 tok/s
  • Phi-4 Q4_K_M: mejor para razonamiento y programación — ~9 GB VRAM
  • Mistral Nemo 12B: buena alternativa para chat — 8 GB VRAM
Quantization & VRAM

Puntos clave

  • Mejor uso general: Qwen3 8B — 6 GB VRAM, ~40 tok/s, excelente calidad de chat e instrucciones
  • Mejor para razonamiento/código: Phi-4 en Q4_K_M — ~9 GB VRAM, mejor puntuación de razonamiento en la clase sub-10B
  • RTX 3060 12 GB ejecuta cualquier modelo bajo 10 GB en cuantización Q4, incluidos Qwen3 8B, Phi-4 y Mistral Nemo 12B

Top 3 modelos Ollama para RTX 3060 12 GB

A septiembre de 2026, la RTX 3060 12 GB sigue siendo la GPU con mejor relación calidad-precio para ejecutar modelos de 6–12 GB localmente. Sus 12 GB de VRAM ejecutan cualquier modelo bajo 10 GB en cuantización Q4, incluidas las generaciones actuales de Qwen3 y Phi-4. Incluso en una tarjeta de segunda mano, obtienes 30–40 tokens por segundo en los modelos recomendados a continuación.

Los tres modelos siguientes funcionan con Ollama sin configuración. Las cifras de velocidad son con contexto predeterminado de 2048 tokens en un PC de escritorio sin offloading a CPU.

ModeloVRAM usadaVelocidad
Qwen3 8B6,0 GB~40 tok/s
Phi-4 Q4_K_M~9,0 GB~35 tok/s
Mistral Nemo 12B Q4_K_M~8,0 GB~30 tok/s

Cómo obtener el mejor rendimiento en RTX 3060

Para uso general, ejecuta Qwen3 8B con una ventana de contexto de 4096 tokens. Esto usa ~6 GB de VRAM y deja 6 GB de margen — suficiente para evitar desbordamiento al cambiar entre modelos.

Para razonamiento y programación, Phi-4 en Q4_K_M es la elección clara: cabe en ~9 GB de VRAM y maneja Python, TypeScript y Go sin ajuste fino.

Deja siempre al menos 1,5–2 GB de VRAM libres. Cargar dos modelos seguidos sin descargar el primero provoca desbordamiento de VRAM y fuerza un lento offloading a CPU. Para el contexto completo de benchmarks de GPU, consulta las mejores GPUs para LLMs locales. Si tu GPU tiene menos de 12 GB, consulta los mejores modelos para 6 GB de VRAM. Para instalar las tres mejores opciones:

ollama pull qwen3:8b
ollama pull phi4
ollama pull mistral-nemo
Cada pull descarga 4–8 GB en la primera ejecución. Las ejecuciones siguientes arrancan al instante desde la caché. Usa --num-ctx 4096 si necesitas una ventana de contexto más grande.

Respuestas rápidas sobre modelos para RTX 3060

¿Puede la RTX 3060 ejecutar un modelo 70B?
No. Un modelo 70B en Q4_K_M necesita aproximadamente 40 GB de VRAM. La RTX 3060 12 GB llega como máximo a ~14B modelos en Q4. Consulta cuánta VRAM necesita un modelo 70B para las opciones.
¿Es buena la RTX 3060 12 GB para LLMs locales?
Sí — es la mejor relación calidad-precio en este rango de VRAM. La capacidad de 12 GB permite modelos 14B en Q4, que las tarjetas de 8 GB no pueden ejecutar. El precio de segunda mano suele ser $280–$350.
¿Qué cuantización usar en RTX 3060 12 GB?
Q5_K_M para modelos 7–8B (mejor calidad dentro del presupuesto de 12 GB). Q4_K_M para modelos 13–14B (necesario para que quepan). Consulta qué significa Q4_K_M para el compromiso de calidad.
¿Ollama usa automáticamente la GPU RTX 3060?
Sí. Ollama detecta GPUs NVIDIA vía CUDA automáticamente en Windows y Linux. No se necesita configuración manual. Ejecuta ollama run nombremodelo y carga completamente en la GPU si la VRAM es suficiente.