Meilleurs modèles Ollama pour RTX 3060 12 Go ?

Points clés
- ✓Meilleur usage général : Qwen3 8B — 6 Go de VRAM, ~40 tok/s, excellente qualité chat et instructions
- ✓Meilleur pour le raisonnement/code : Phi-4 en Q4_K_M — ~9 Go de VRAM, meilleur score de raisonnement en classe sub-10B
- ✓La RTX 3060 12 Go fait tourner tout modèle de moins de 10 Go en quantisation Q4, dont Qwen3 8B, Phi-4 et Mistral Nemo 12B
Top 3 des modèles Ollama pour RTX 3060 12 Go
En septembre 2026, la RTX 3060 12 Go reste le GPU au meilleur rapport qualité-prix pour faire tourner des modèles de 6 à 12 Go localement. Ses 12 Go de VRAM font tourner tout modèle de moins de 10 Go en quantisation Q4, dont les générations actuelles de Qwen3 et Phi-4. Sur une carte d'occasion, vous obtenez 30 à 40 tokens par seconde sur les modèles ci-dessous.
Les trois modèles ci-dessous fonctionnent avec Ollama sans configuration. Les vitesses sont mesurées avec un contexte de 2 048 tokens par défaut sur un PC de bureau sans déchargement CPU.
| Modèle | VRAM utilisé | Vitesse |
|---|---|---|
| Qwen3 8B | 6,0 Go | ~40 tok/s |
| Phi-4 Q4_K_M | ~9,0 Go | ~35 tok/s |
| Mistral Nemo 12B Q4_K_M | ~8,0 Go | ~30 tok/s |
Comment obtenir les meilleures performances sur RTX 3060
Pour l'usage général, lancez Qwen3 8B avec une fenêtre de contexte de 4 096 tokens. Cela utilise ~6 Go de VRAM et laisse 6 Go de marge — suffisant pour éviter les débordements lors du changement de modèle.
Pour le raisonnement et le code, Phi-4 en Q4_K_M est le choix évident : il tient en ~9 Go de VRAM et gère Python, TypeScript et Go sans fine-tuning.
Laissez toujours au moins 1,5–2 Go de VRAM libres. Pour le contexte complet des benchmarks GPU, voir les meilleurs GPU pour LLM locaux. Si votre GPU a moins de 12 Go, voir les meilleurs modèles pour 6 Go de VRAM. Pour installer les trois meilleurs choix :
ollama pull qwen3:8b
ollama pull phi4
ollama pull mistral-nemo--num-ctx 4096 pour une fenêtre de contexte plus grande.Réponses rapides sur les modèles RTX 3060
La RTX 3060 peut-elle faire tourner un modèle 70B ?▾
La RTX 3060 12 Go est-elle bonne pour les LLM locaux ?▾
Quelle quantisation utiliser sur RTX 3060 12 Go ?▾
Ollama utilise-t-il automatiquement le GPU RTX 3060 ?▾
ollama run nomdumodele et il se charge entièrement sur le GPU si le VRAM est suffisant.