Chiffres clés
- 1Fourchette habituelle du few-shot : 2 à 10 exemples ; les gains plafonnent en général au-delà de 8
- 2Origine : Brown et al. (2020), "Language Models are Few-Shot Learners" — l'article GPT-3, 175 milliards de paramètres
- 3Gain rapporté sur GPT-3 : 64,3 % en zero-shot → 71,2 % en few-shot sur TriviaQA
- 4Coût en tokens : 5 exemples d'environ 120 tokens ajoutent près de 600 tokens d'entrée à chaque requête
- 5Mise en cache des prompts : un bloc few-shot statique réduit jusqu'à 90 % le coût d'entrée répétée avec le prompt caching de Claude
- 6Seuil d'adoption : déployez le few-shot lorsqu'il apporte au moins 10 points de pourcentage sur 50 cas de test
Ce qu'est le Zero-Shot Prompting
📍 In One Sentence
Le zero-shot prompting fournit une consigne de tâche sans démonstration en contexte et repose entièrement sur le pré-entraînement et l'instruction tuning du modèle.
💬 In Plain Terms
Le zero-shot, c'est dire à quelqu'un quoi faire en pariant qu'il sait déjà comment. Aucun exemple résolu, juste la consigne.
Le zero-shot prompting demande au modèle de résoudre une tâche à partir d'une consigne claire, sans aucun exemple dans le prompt. Le modèle s'appuie sur ses connaissances générales et sur sa capacité à suivre des instructions, acquises lors du pré-entraînement et de l'alignement.
Le zero-shot se met en place rapidement puisqu'il n'y a ni conception ni maintenance de paires d'exemples. Il fonctionne bien sur des tâches larges : questions générales, classification simple, résumés ou traductions directes, où la consigne suffit le plus souvent.
Ce qu'est le Few-Shot Prompting
📍 In One Sentence
Le few-shot prompting place devant la consigne un petit ensemble de démonstrations entrée-sortie afin que le modèle infère le motif en contexte, sans mise à jour des poids.
💬 In Plain Terms
Le few-shot, c'est montrer trois exemples finis avant d'en demander un quatrième. Le modèle recopie le motif qu'il a sous les yeux.
Le few-shot prompting ajoute à la consigne quelques exemples entrée-sortie pour que le modèle déduise le motif de la tâche à partir de démonstrations concrètes. En pratique, le few-shot correspond à deux à dix exemples.
Ces exemples jouent le rôle d'un mini jeu d'entraînement à l'intérieur du prompt et orientent la façon dont le modèle interprète les tâches ambiguës, les formats spécialisés ou le vocabulaire métier. Le few-shot est particulièrement utile lorsqu'il faut un style, un schéma ou un comportement nuancé que les consignes génériques ne capturent pas.
Rien n'est entraîné. Les exemples ne vivent dans la fenêtre de contexte que le temps d'un appel, puis sont écartés : c'est pourquoi on parle d'apprentissage en contexte et non de fine-tuning.
Différences principales : Zero-Shot vs Few-Shot
Le zero-shot et le few-shot prompting diffèrent surtout par l'effort de préparation, la précision sur les tâches spécifiques et la capacité à passer à l'échelle sur de nombreux cas d'usage. Les deux reposent sur le même modèle, mais échangent un effort de conception d'exemples contre un meilleur alignement à la tâche.
Dimension | Zero-Shot | Few-Shot |
|---|---|---|
| Exemples dans le prompt | Aucun | 2 à 10+ exemples représentatifs |
| Rapidité de mise en place | Très rapide ; aucune curation | Plus lente ; les exemples doivent être choisis et maintenus |
| Besoins en données | Aucun exemple étiqueté requis | Nécessite au moins quelques exemples étiquetés |
| Précision sur les tâches pointues | Souvent plus faible ou plus générique | Généralement meilleure et plus régulière sur un domaine donné |
| Contrôle du format de sortie | Dépend de la précision de votre description du format | Fort ; les exemples constituent la spécification du format |
| Tokens d'entrée par appel | La consigne seule | La consigne plus tous les exemples, à chaque appel |
| Passage à l'échelle | Très extensible, nouvelles tâches faciles à ajouter | Moins extensible ; chaque tâche peut exiger ses propres exemples |
Quand utiliser le Zero-Shot
Utilisez le zero-shot prompting lorsque vous cherchez la rapidité, que vous n'avez pas d'exemples étiquetés et que la tâche reste assez générale. Ce schéma fonctionne bien comme première passe ou comme référence.
Scénarios zero-shot typiques :
- Questions générales, résumés simples et classification de sentiment basique.
- Expérimentation rapide tant que la forme de la tâche reste à définir.
- Nouveaux domaines ou nouvelles langues, faute d'exemples curés.
- Pipelines à fort volume et sensibles au coût, où chaque token d'entrée supplémentaire se multiplie sur des millions d'appels.
Quand utiliser le Few-Shot
Utilisez le few-shot prompting quand la tâche est spécialisée, sensible au format ou à fort enjeu, et que vous pouvez fournir de bons exemples. Dans ces cas, les exemples améliorent nettement la fiabilité par rapport aux consignes seules.
Scénarios few-shot courants :
- Classification ou extraction métier (juridique, médical, financier) où l'étiquetage et la formulation exacts comptent.
- Tâches à schéma strict, comme extraire du JSON structuré d'un texte désordonné.
- Tâches multilingues ou de localisation, où quelques exemples par langue traitent idiomes et style.
- Style et ton maison, où « écris comme ceci » se montre plus facilement qu'il ne se décrit.
- Modèles plus petits ou exécutés localement, qui s'écartent souvent du format avec les seules consignes.
Exemple : prompt Zero-Shot vs Few-Shot
La différence pratique entre zero-shot et few-shot apparaît clairement lorsqu'on compare deux prompts pour la même tâche. Nous classons ici des tickets de support par intention.
Mauvais prompt – non structuré
« Regarde ce ticket de support et dis-moi de quoi il s'agit. »
Prompt Zero-Shot
« Classe le ticket de support suivant dans l'une de ces catégories : `billing_issue`, `login_problem`, `feature_request`, `bug_report` ou `other`. Ticket : "J'ai essayé de réinitialiser mon mot de passe trois fois aujourd'hui et le lien indique toujours qu'il a expiré." Ne renvoie que le nom de la catégorie. »
Prompt Few-Shot
« Classe chaque ticket de support dans l'une de ces catégories : `billing_issue`, `login_problem`, `feature_request`, `bug_report` ou `other`. Ne renvoie que le nom de la catégorie. Exemple 1 : Ticket : "Vous m'avez facturé deux fois le même abonnement ce mois-ci." Étiquette : `billing_issue` Exemple 2 : Ticket : "Quand je clique sur 'exporter le rapport', rien ne se passe, même après avoir rechargé la page." Étiquette : `bug_report` Exemple 3 : Ticket : "Pourriez-vous ajouter l'export des rapports directement vers Google Sheets ?" Étiquette : `feature_request` Classe maintenant ce ticket : "J'ai essayé de réinitialiser mon mot de passe trois fois aujourd'hui et le lien indique toujours qu'il a expiré." »
La version few-shot montre le motif explicitement, ce qui améliore généralement la qualité de classification sur les tickets nuancés ou bruités.
La qualité des exemples détermine la performance du Few-Shot
Trois exemples bien choisis surpassent régulièrement dix quasi-doublons, car le modèle apprend les frontières de la tâche à partir de la variété qu'on lui montre, pas du volume. La plupart des résultats décevants en few-shot viennent de la sélection des exemples, pas de leur nombre.
- 1Couvrez toute l'étendue, pas seulement les cas faciles. Incluez le ticket ambigu, le très court et le mal rédigé : ce sont précisément les entrées qui échouent en production.
- 2Équilibrez les étiquettes. Si quatre exemples sur cinq sont `bug_report`, le modèle sur-prédira `bug_report`. Donnez à chaque classe une représentation comparable.
- 3Mélangez l'ordre. Les modèles pondèrent davantage les derniers exemples : évitez de regrouper des étiquettes identiques en fin de bloc.
- 4Gardez un format rigoureusement identique d'un exemple à l'autre. Espaces, guillemets ou ordre des clés incohérents apprennent au modèle que le format est négociable.
- 5Puisez vos exemples dans des entrées réelles de production. Des exemples propres écrits à la main apprennent au modèle à attendre une entrée propre qu'il ne recevra jamais.
- 6Ne collez jamais de données clients réelles dans un modèle de prompt. Anonymisez ou synthétisez : les blocs few-shot sont stockés, versionnés et partagés comme du code.
Le Few-Shot coûte des tokens à chaque appel
Les exemples few-shot ne sont pas un coût d'installation unique : ils sont renvoyés en tokens d'entrée à chaque requête. Cinq exemples d'environ 120 tokens ajoutent près de 600 tokens d'entrée par appel — négligeable en test, significatif à un million d'appels par mois.
C'est la raison pratique de mesurer d'abord la référence zero-shot. Si le zero-shot passe déjà votre seuil de précision, le few-shot ne vous apporte rien et vous facture indéfiniment.
🔍 Mettez le bloc d'exemples en cache
Un bloc few-shot inchangé d'un appel à l'autre est un candidat idéal à la mise en cache de prompt. Anthropic, OpenAI et Google appliquent une forte remise sur l'entrée mise en cache — jusqu'à 90 % avec le prompt caching de Claude — ce qui retire l'essentiel de l'argument coût contre le few-shot dans les pipelines à fort volume.
Les modèles de raisonnement ont réduit l'écart avec le Zero-Shot
Un instruction tuning solide a comblé une grande partie de l'avantage de précision que le few-shot prompting offrait auparavant sur les modèles de pointe. Sur Claude Opus 5, GPT-5.6 et Gemini 3.1 Pro, une consigne zero-shot rédigée avec précision égale désormais le few-shot sur de nombreuses tâches générales — mais cette convergence ne vaut pas pour tout le paysage des modèles.
Là où le few-shot justifie encore ses tokens, c'est sur le format et le vocabulaire : jeux d'étiquettes propriétaires, schémas internes, ton maison et cas limites jamais rencontrés au pré-entraînement. Et sur les modèles plus petits ou hébergés localement, le few-shot demeure le levier de précision le plus efficace sans fine-tuning.
Classe de modèle | Qualité en zero-shot | Le few-shot aide-t-il encore ? |
|---|---|---|
| Raisonnement de pointe (Claude Opus 5, GPT-5.6, Gemini 3.1 Pro) | Élevée sur les tâches générales | Surtout pour le format de sortie, le style maison et les étiquettes propriétaires |
| Pointe sans raisonnement (Claude Sonnet 5, Gemini 3.8 Flash) | Bonne | Oui — pour les domaines étroits et les schémas stricts |
| Petits modèles hébergés (Claude Haiku 4.5, Gemini 3.5 Flash-Lite) | Inégale sur les tâches spécialisées | Oui — généralement le plus grand gain de précision à lui seul |
| Open-weight local 7–30B (Qwen3 8B, Llama 4 Scout, Gemma 4) | Variable ; les dérives de format sont fréquentes | Oui — souvent la différence entre une sortie exploitable et inutilisable |
Erreurs fréquentes
La plupart des échecs en few-shot sont des échecs de méthode, pas des échecs de modèle. Ces cinq-là expliquent la majorité des cas où ajouter des exemples a dégradé la sortie au lieu de l'améliorer.
❌ Ajouter des exemples avant d'avoir mesuré la référence zero-shot
Why it hurts: Vous payez des tokens d'entrée indéfiniment sans savoir si les exemples ont apporté quoi que ce soit.
Fix: Passez d'abord 50 cas de test en zero-shot et notez la précision. Ensuite seulement, ajoutez des exemples et remesurez.
❌ Tous les exemples portant la même étiquette
Why it hurts: Le modèle lit ce déséquilibre comme un a priori et sur-prédit cette classe sur les entrées réelles.
Fix: Équilibrez les classes entre les exemples et mélangez-les pour que des étiquettes identiques ne se suivent pas.
❌ Des exemples qui contredisent la consigne écrite
Why it hurts: Quand consigne et démonstration divergent, le modèle suit généralement la démonstration — sans le signaler.
Fix: Relisez la consigne face à chaque exemple après chaque modification ; traitez les exemples comme la spécification.
❌ Des exemples bien plus longs ou plus propres que les entrées réelles
Why it hurts: Le modèle apprend à attendre un texte soigné et se dégrade sur le texte désordonné qu'il reçoit réellement.
Fix: Échantillonnez les exemples dans le trafic de production, y compris les plus disgracieux.
❌ Des données clients réelles laissées dans le bloc d'exemples
Why it hurts: Les modèles de prompt sont versionnés, partagés et journalisés : des données personnelles à l'intérieur deviennent une exposition RGPD.
Fix: Anonymisez ou synthétisez chaque exemple avant qu'il n'entre dans un modèle stocké.
Comment PromptQuorum vous aide à choisir
PromptQuorum est un outil de dispatch IA multi-modèles qui permet de tester des prompts zero-shot et few-shot sur plusieurs fournisseurs au même endroit. Vous pouvez envoyer le même prompt sans exemple et le même prompt enrichi d'exemples à des modèles comme GPT-5.6, Claude Opus 5 et Gemini 3.1 Pro, côte à côte.
Dans PromptQuorum, vous pouvez :
- Démarrer avec des prompts zero-shot via des frameworks comme Single Step, RTF ou CO-STAR pour obtenir des références rapides.
- Passer aux prompts few-shot en intégrant des exemples représentatifs dans des frameworks comme SPECS ou le Prompting Guide de Google lorsque vous voulez plus de contrôle.
- Enregistrer les deux versions comme modèles, puis comparer précision, latence et coûts en tokens entre modèles dans la durée.
Comment choisir entre Zero-Shot et Few-Shot Prompting
- 1Pour des tâches courantes et simples, commencez en zero-shot (sans exemple). Exemple : « Classe cet avis comme positif ou négatif. » Si la précision suffit, le zero-shot est plus rapide et moins cher.
- 2Quand la performance zero-shot est faible (moins de 80 % de précision ou de qualité), ajoutez 2 à 5 exemples few-shot. Montrez au modèle 2–3 avis positifs et 2–3 avis négatifs correctement étiquetés. Le few-shot enseigne par l'exemple.
- 3Pour les tâches à distinctions subtiles ou à motifs rares, montez à 5–10 exemples (few-shot+). S'il faut détecter l'ironie, un biais problématique ou une nuance métier, davantage d'exemples aident.
- 4Choisissez des exemples couvrant l'étendue des entrées attendues. Pour classer des avis produits, incluez des avis enthousiastes, tièdes et négatifs. Ne montrez pas uniquement des cas faciles.
- 5Mesurez le gain du few-shot sur un jeu de test avant de le mettre en production. Exécutez le même prompt avec 0 puis 5 exemples sur 50 cas. Si le few-shot apporte 10 points ou plus, gardez les exemples. Si le gain est inférieur à 5 %, restez en zero-shot.
- 6Une fois le few-shot en production, mettez le bloc d'exemples en cache et revérifiez-le chaque trimestre. Des exemples périmés encodent silencieusement des catégories et des formats que votre produit n'utilise plus.
Considérations pour les marchés francophones
En France, en Belgique et au Canada francophone, les équipes préfèrent souvent des workflows structurés et documentés. Lors de la mise en œuvre de Few-Shot Prompting dans des contextes professionnels francophones, documentez clairement vos stratégies d'exemples et vos seuils de précision. Cela facilite l'adoption et l'audit dans les organisations régies par des réglementations strictes.
Point d'attention RGPD : si vos exemples proviennent de tickets ou de messages clients réels, ils constituent des données à caractère personnel dès qu'ils entrent dans un modèle de prompt versionné. La CNIL attend une base légale et une minimisation ; anonymisez ou synthétisez les exemples avant de les stocker.
Avantages comparatifs et cas limites
Avantage Zero-Shot : idéal pour les prototypes rapides, les nouvelles langues ou domaines, et les cas où vous ne disposez pas de données étiquetées.
Avantage Few-Shot : supérieur pour les tâches sensibles (classification juridique, extraction médicale), les formats stricts (JSON structuré) et les nuances multilingues.
Cas limite : si votre domaine est très spécialisé et que le few-shot avec 5 à 10 exemples n'améliore toujours pas la précision, envisagez le fine-tuning d'un modèle sur des centaines d'exemples (au-delà du few-shot).
Questions fréquentes
Combien d'exemples faut-il pour parler de « few-shot » ?
Entre deux et une dizaine. Un seul exemple s'appelle du one-shot. Les gains plafonnent en général au-delà de huit exemples et, ensuite, vous payez surtout des tokens d'entrée pour un rendement décroissant. S'il vous faut des dizaines d'exemples pour atteindre votre objectif de précision, le fine-tuning est généralement le meilleur outil.
Le few-shot prompting équivaut-il au fine-tuning ?
Non. Le few-shot prompting relève de l'apprentissage en contexte : les exemples figurent dans le prompt le temps d'un appel et ne changent rien au modèle. Le fine-tuning met à jour les poids et persiste sur tous les appels. Le few-shot coûte des tokens d'entrée par requête ; le fine-tuning coûte un entraînement plus un modèle dédié à héberger.
Le few-shot prompting aide-t-il encore sur les modèles de raisonnement ?
Moins qu'avant pour la précision brute, plus qu'on ne le croit pour le format. Sur Claude Opus 5, GPT-5.6 et Gemini 3.1 Pro, une consigne zero-shot précise égale souvent le few-shot sur les tâches générales. Mais dès qu'il faut un schéma JSON exact, un vocabulaire d'étiquettes propriétaire ou un ton maison précis, les exemples restent le moyen le plus fiable d'y arriver.
Pourquoi ma sortie s'est-elle dégradée après l'ajout d'exemples ?
Le plus souvent à cause d'un déséquilibre d'étiquettes, d'une contradiction ou d'une dérive de format. Si la plupart des exemples partagent une étiquette, le modèle la sur-prédit. Si un exemple contredit votre consigne écrite, le modèle a tendance à suivre l'exemple. Et si les exemples sont plus propres que les entrées réelles, le modèle se dégrade sur le texte désordonné qu'il reçoit vraiment.
L'ordre des exemples few-shot a-t-il une importance ?
Oui. Les modèles pondèrent davantage les exemples tardifs, si bien qu'un bloc terminé par trois étiquettes identiques biaise la prédiction vers cette étiquette. Alternez les classes et retestez après toute réorganisation : les effets d'ordre déplacent la précision de plusieurs points.
Comment garder des prompts few-shot abordables à grande échelle ?
Avec la mise en cache de prompt. Un bloc d'exemples statique est identique à chaque appel, ce qui en fait une cible de cache idéale : Anthropic, OpenAI et Google facturent l'entrée mise en cache avec une forte remise, jusqu'à environ 90 % avec le prompt caching de Claude. Placez les exemples tout au début du prompt pour que le préfixe mis en cache reste stable.
Peut-on combiner few-shot et chain-of-thought prompting ?
Oui, et c'est l'une des combinaisons les plus puissantes qui soient. Le few-shot chain-of-thought signifie que vos exemples montrent les étapes de raisonnement, pas seulement la réponse finale. Cela coûte plus de tokens de sortie que chaque technique prise isolément, mais sur les tâches multi-étapes c'est généralement plus fiable qu'un « réfléchis étape par étape » en zero-shot.
Sources et lectures complémentaires
- Brown, T., Mann, B., Ryder, N., et al. (2020). "Language Models are Few-Shot Learners." NeurIPS 2020. arXiv:2005.14165 — l'article qui a introduit le few-shot, le one-shot et le zero-shot comme régimes de prompting.
- Zhao, Z., Wallace, E., Feng, S., Klein, D., & Singh, S. (2021). "Calibrate Before Use: Improving Few-Shot Performance of Language Models." ICML 2021. arXiv:2102.09690 — sur les biais d'étiquette majoritaire et de récence dans l'ordre des exemples.
- Lu, Y., Bartolo, M., Moore, A., Riedel, S., & Stenetorp, P. (2022). "Fantastically Ordered Prompts and Where to Find Them." ACL 2022. arXiv:2104.08786 — sur la sensibilité de la précision few-shot à l'ordre des exemples.
- Min, S., Lyu, X., Holtzman, A., et al. (2022). "Rethinking the Role of Demonstrations." EMNLP 2022. arXiv:2202.12837 — démonstration que le format et la distribution des entrées comptent davantage que l'exactitude des étiquettes.
- Anthropic. "Prompt caching." Documentation de la plateforme Claude — tarification de l'entrée mise en cache pour les préfixes de prompt statiques comme les blocs few-shot.
