Skip to main content
PromptQuorumBuilt for humans. Structured for AI.

Quels modèles Ollama supportent le contexte 128K ?

Quels modèles Ollama supportent le contexte 128K ?

Réponse rapide

Llama 3.1 8B supporte le contexte 128K sur Ollama. Qwen3-30B-A3B, un modèle mixture-of-experts, atteint 256K de contexte. Attention : le contexte complet augmente fortement la VRAM — une fenêtre 128K nécessite 3–4× plus de VRAM que la fenêtre par défaut de 4K.

  • ▸Llama 3.1 8B : contexte 128K, ~16 GB VRAM en contexte complet
  • ▸Qwen3-30B-A3B : contexte 256K, 24+ GB VRAM en contexte complet
  • ▸Définissez --num-ctx 4096 pour l'usage normal afin d'économiser la VRAM
Ollama

Points clés

  • ✓La plupart des modèles Ollama 7B annoncent 128K de contexte mais dégradent en qualité au-delà de 32K tokens
  • ✓Llama 3.1 8B et Qwen3-30B-A3B sont les deux modèles qui délivrent de façon fiable un contexte 128K+ sur Ollama
  • ✓Une fenêtre de contexte 128K peut presque tripler l'utilisation VRAM — un modèle 7B Q4 a besoin de ~15 GB à 128K contre ~5,5 GB par défaut
  • ✓Définissez <code>--num-ctx 4096</code> pour les tâches quotidiennes ; n'étendez le contexte que lorsque nécessaire

Les modèles qui atteignent vraiment 128K

La plupart des modèles Ollama annoncent 128K de contexte, mais peu délivrent une qualité de sortie utile à cette longueur. Le problème est l'effet "perdu au milieu" : les modèles entraînés sur des longueurs de documents typiques peinent à traiter des informations placées au cœur d'un long contexte.

Deux modèles délivrent de façon fiable un contexte 128K+ sur Ollama : Llama 3.1 8B (entraîné nativement à 128K) et Qwen3-30B-A3B (un modèle mixture-of-experts avec une fenêtre de 256K sur la bibliothèque officielle d'Ollama, qui n'active qu'environ 3 milliards de ses 30 milliards de paramètres par token). Les tailles denses plus petites de Qwen3 utilisent par défaut une fenêtre de 40K sur Ollama, et pour la plupart des autres modèles 7B, la qualité de sortie se dégrade aussi notablement au-delà de 32K tokens.

Si votre tâche implique des documents de plus de 20 000 mots, commencez par Llama 3.1 8B. Si vous avez besoin de la plus grande fenêtre de contexte et disposez de 20+ GB de VRAM, Qwen3-30B-A3B est le meilleur choix.

📍 En une phrase

Les deux modèles Ollama qui délivrent de façon fiable un contexte 128K+ sont Llama 3.1 8B (128K, entraîné nativement) et Qwen3-30B-A3B (256K, mixture-of-experts).

💬 En termes simples

Llama 3.1 8B a été entraîné dès le départ pour gérer 128K tokens de contexte, sa qualité de sortie reste donc stable à cette longueur. Qwen3-30B-A3B est un modèle mixture-of-experts — il n'active qu'environ 3 milliards de ses 30 milliards de paramètres par token — et Ollama le référence avec une fenêtre de 256K. La plupart des autres modèles 7B annoncent 128K, mais leur qualité de sortie chute notablement au-delà de 32K tokens.

Le coût VRAM du contexte long

L'extension de la fenêtre de contexte augmente significativement l'utilisation VRAM. Le KV-cache, qui stocke l'état d'attention pour tous les tokens en contexte, peut utiliser autant de VRAM que les poids du modèle lui-même à 128K de contexte.

Le tableau ci-dessous montre comment le VRAM du KV-cache évolue pour un modèle 7B en Q4_K_M. Ces chiffres supposent des modèles utilisant le grouped query attention (GQA) — les modèles sans GQA utilisent significativement plus de KV-cache.

Pour économiser la VRAM sur les tâches quotidiennes, définissez --num-ctx 4096 lors du lancement d'Ollama. N'étendez à 32K ou 128K que lorsque votre tâche spécifique le requiert. Pour le guide complet sur les LLMs locaux à contexte long, consultez le guide des LLMs locaux à contexte long.

Longueur de contexteKV-Cache (7B)VRAM total (7B Q4)
4K (défaut)~0,5 GB~5,5 GB
16K~1,5 GB~6,5 GB
32K~3 GB~8 GB
128K~10 GB~15 GB

Guides associés

Réponses rapides sur les modèles à contexte long

Comment activer le contexte 128K dans Ollama ?▾
Ajoutez --num-ctx 131072 à votre commande run : ollama run llama3.1:8b --num-ctx 131072. Sans ce paramètre, la spécification Modelfile d'Ollama utilise par défaut 2048 tokens, et même la valeur par défaut échelonnée selon la VRAM (4K sous 24 Gio, 32K entre 24 et 48 Gio, 256K au-delà) peut rester en dessous de la capacité maximale du modèle — définissez num_ctx explicitement pour la garantir.
Pourquoi le contexte long utilise-t-il autant de VRAM ?▾
Le KV-cache stocke l'état d'attention pour chaque token en contexte. À 128K tokens, ce cache peut être aussi volumineux que les poids du modèle. Un modèle 7B en Q4 a besoin de ~5,5 GB pour les poids mais de ~10 GB de KV-cache à 128K de contexte.
Le contexte 128K est-il utile pour le développement ?▾
Oui, pour travailler sur de grandes bases de code. Intégrer un dépôt entier ou plusieurs fichiers dans le contexte améliore considérablement le refactoring et les tâches de raisonnement inter-fichiers. Pour le développement sur de grandes bases de code à 128K+, Qwen3-30B-A3B est le modèle recommandé.
Quel modèle est le meilleur pour l'analyse de longs documents ?▾
Qwen3-30B-A3B est le premier choix pour les longs documents sur Ollama — sa fenêtre de 256K offre plus de marge que les modèles de classe 128K, et en tant que modèle mixture-of-experts, il tourne plus vite qu'un modèle dense de taille similaire. Voir les modèles vision Ollama si vous avez également besoin de compréhension d'images avec de longs documents.