Skip to main content
PromptQuorumBuilt for humans. Structured for AI.

Peut-on exécuter Qwen 3 avec Ollama ?

Peut-on exécuter Qwen 3 avec Ollama ?

Réponse rapide

Oui — Ollama supporte toutes les tailles de Qwen 3 de 0.6B à 32B, plus la variante MoE 30B-A3B. Lancez n'importe quelle taille avec ollama run qwen3:8b. Le modèle 8B nécessite ~6 Go de VRAM en Q4.

  • ▸ollama run qwen3:0.6b — tient dans 1 Go de VRAM
  • ▸ollama run qwen3:8b — nécessite ~6 Go de VRAM
  • ▸ollama run qwen3:32b — nécessite ~21 Go de VRAM
Ollama

Points clés

  • ✓Ollama supporte toutes les tailles de Qwen 3 : 0.6B, 1.7B, 4B, 8B, 14B et 32B, plus la variante MoE 30B-A3B
  • ✓Téléchargez n'importe quelle taille avec <code>ollama run qwen3:8b</code> — remplacez le tag par la taille souhaitée
  • ✓Le modèle 8B nécessite ~6 Go de VRAM en Q4 et tourne à ~20 tok/s sur un GPU milieu de gamme
  • ✓Qwen 3 supporte nativement le tool calling via l'API Ollama standard — aucun Modelfile personnalisé requis

Oui — voici ce qui est disponible

Ollama supporte toutes les tailles majeures de Qwen 3, de 0.6B à 32B, plus la variante MoE 30B-A3B. Téléchargez n'importe quelle taille avec une seule commande : ollama run qwen3:8b. Remplacez 8b par 0.6b, 1.7b, 4b, 14b, 32b ou 30b-a3b pour d'autres tailles.

Chaque taille est disponible en plusieurs quantisations. Q4_K_M est la quantisation par défaut et recommandée — elle offre le meilleur rapport qualité/taille de fichier. Q8_0 est disponible pour les 8B et 14B si vous disposez de marge VRAM.

Le tool calling est supporté nativement sur toutes les tailles de Qwen 3 via l'API Ollama standard. Aucun Modelfile personnalisé ni template de prompt spécial n'est requis.

ollama run qwen3:8b

Quelle taille de Qwen 3 choisir

La bonne taille de Qwen 3 dépend entièrement de la VRAM disponible. Pour la plupart des utilisateurs avec un GPU milieu de gamme (6–8 Go de VRAM), le modèle 8B en Q4_K_M est le choix pratique — il nécessite ~6 Go et tourne à ~20 tok/s.

Le modèle 14B en Q4 est la référence recommandée pour le code : il surpasse le 8B en génération de code et tient confortablement dans 10–12 Go de VRAM. Pour une comparaison complète des performances de codage de Qwen 3 face aux autres modèles locaux, consultez le guide pour exécuter Qwen localement en 2026.

VRAMTaille Qwen 3Idéal pour
< 4 GB0.6B / 1.7BAppareils edge, tests, CPU uniquement
4–6 GB4BGPU entrée de gamme ou CPU faible RAM
6–12 GB8B / 14BUsage général et programmation
12–24 GB32B / 30B-A3B (MoE)Programmation et raisonnement avancés

Réponses rapides sur Qwen 3 avec Ollama

Comment installer Qwen 3 sur Ollama ?▾
Exécutez ollama run qwen3:8b dans un terminal. Ollama télécharge le modèle automatiquement au premier lancement. Remplacez 8b par la taille souhaitée : 0.6b, 1.7b, 4b, 14b, 32b ou 30b-a3b.
Qwen 3 est-il meilleur que Llama 3 pour le code ?▾
Pour le code : oui, Qwen3 14B surpasse Llama 3 8B sur les benchmarks HumanEval. Pour la conversation générale au niveau 8B : Llama 3 8B reste compétitif. Pour les meilleures recommandations Ollama toutes tâches confondues, consultez les meilleurs modèles Ollama en ce moment.
Qwen 3 supporte-t-il le tool calling sur Ollama ?▾
Oui. Qwen 3 supporte les function calls et le tool calling nativement via l'API Ollama standard. Aucun Modelfile personnalisé ni configuration spéciale n'est requis — il fonctionne avec tout client supportant le format tool-use d'Ollama.
Quel est le plus grand modèle Qwen 3 exécutable localement ?▾
Le plus grand modèle dense Qwen 3 est le 32B, qui nécessite ~21 Go de VRAM en Q4 — il tient sur une seule RTX 3090 ou RTX 4090. Pour une inférence plus rapide à qualité similaire, la variante MoE 30B-A3B ne nécessite que ~19 Go de VRAM et tourne nettement plus vite car seule une fraction des paramètres s'active par token. Les Mac Apple M-series avec 32+ Go de mémoire unifiée exécutent les deux confortablement.