Skip to main content
PromptQuorum

Meilleurs modèles Ollama pour RTX 3060 12 Go ?

Meilleurs modèles Ollama pour RTX 3060 12 Go ?
Quantization & VRAM

Points clés

  • Meilleur usage général : Qwen3 8B — 6 Go de VRAM, ~40 tok/s, excellente qualité chat et instructions
  • Meilleur pour le raisonnement/code : Phi-4 en Q4_K_M — ~9 Go de VRAM, meilleur score de raisonnement en classe sub-10B
  • La RTX 3060 12 Go fait tourner tout modèle de moins de 10 Go en quantisation Q4, dont Qwen3 8B, Phi-4 et Mistral Nemo 12B

Top 3 des modèles Ollama pour RTX 3060 12 Go

En septembre 2026, la RTX 3060 12 Go reste le GPU au meilleur rapport qualité-prix pour faire tourner des modèles de 6 à 12 Go localement. Ses 12 Go de VRAM font tourner tout modèle de moins de 10 Go en quantisation Q4, dont les générations actuelles de Qwen3 et Phi-4. Sur une carte d'occasion, vous obtenez 30 à 40 tokens par seconde sur les modèles ci-dessous.

Les trois modèles ci-dessous fonctionnent avec Ollama sans configuration. Les vitesses sont mesurées avec un contexte de 2 048 tokens par défaut sur un PC de bureau sans déchargement CPU.

ModèleVRAM utiliséVitesse
Qwen3 8B6,0 Go~40 tok/s
Phi-4 Q4_K_M~9,0 Go~35 tok/s
Mistral Nemo 12B Q4_K_M~8,0 Go~30 tok/s

Comment obtenir les meilleures performances sur RTX 3060

Pour l'usage général, lancez Qwen3 8B avec une fenêtre de contexte de 4 096 tokens. Cela utilise ~6 Go de VRAM et laisse 6 Go de marge — suffisant pour éviter les débordements lors du changement de modèle.

Pour le raisonnement et le code, Phi-4 en Q4_K_M est le choix évident : il tient en ~9 Go de VRAM et gère Python, TypeScript et Go sans fine-tuning.

Laissez toujours au moins 1,5–2 Go de VRAM libres. Pour le contexte complet des benchmarks GPU, voir les meilleurs GPU pour LLM locaux. Si votre GPU a moins de 12 Go, voir les meilleurs modèles pour 6 Go de VRAM. Pour installer les trois meilleurs choix :

ollama pull qwen3:8b
ollama pull phi4
ollama pull mistral-nemo
Chaque pull télécharge 4 à 8 Go à la première exécution. Les exécutions suivantes démarrent instantanément depuis le cache. Utilisez --num-ctx 4096 pour une fenêtre de contexte plus grande.

Réponses rapides sur les modèles RTX 3060

La RTX 3060 peut-elle faire tourner un modèle 70B ?
Non. Un modèle 70B en Q4_K_M nécessite environ 40 Go de VRAM. La RTX 3060 12 Go est limitée aux modèles ~14B en Q4. Voir combien de VRAM un modèle 70B nécessite pour les options.
La RTX 3060 12 Go est-elle bonne pour les LLM locaux ?
Oui — c'est le meilleur rapport qualité-prix à ce niveau de VRAM. La capacité de 12 Go permet les modèles 14B en Q4, que les cartes 8 Go ne peuvent pas exécuter. Prix de revente typiquement env. 280–350 € d'occasion.
Quelle quantisation utiliser sur RTX 3060 12 Go ?
Q5_K_M pour les modèles 7–8B (meilleure qualité dans le budget 12 Go). Q4_K_M pour les modèles 13–14B (requis pour tenir). Voir ce que signifie Q4_K_M pour le compromis qualité.
Ollama utilise-t-il automatiquement le GPU RTX 3060 ?
Oui. Ollama détecte les GPU NVIDIA via CUDA automatiquement sur Windows et Linux. Aucune configuration manuelle n'est nécessaire. Lancez ollama run nomdumodele et il se charge entièrement sur le GPU si le VRAM est suffisant.