Skip to main content
PromptQuorumBuilt for humans. Structured for AI.
Accueil/Prompt Engineering/Zero-Shot vs. Few-Shot Prompting
Techniques

Zero-Shot vs. Few-Shot Prompting

·9 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

Le Zero-Shot Prompting n'utilise aucun exemple dans le prompt et s'appuie entièrement sur les connaissances préalables du modèle, tandis que le Few-Shot Prompting intègre quelques exemples pour que le modèle puisse imiter un motif souhaité.

Le zero-shot prompting donne au modèle une consigne sans exemple ; le few-shot prompting ajoute 2 à 10 exemples résolus pour que le modèle en copie le motif. Le zero-shot est plus rapide et moins coûteux par appel. Le few-shot est plus fiable sur les formats stricts, les domaines pointus et les cas limites.

Zero-Shot vs. Few-Shot Prompting
  1. 1
    Le zero-shot envoie uniquement une consigne ; le few-shot envoie la même consigne accompagnée de 2 à 10 exemples étiquetés. Ni l'un ni l'autre ne modifie les poids du modèle : les deux relèvent de l'apprentissage en contexte.
  2. 2
    Commencez en zero-shot, mesurez, puis n'ajoutez des exemples que si la précision reste insuffisante. Le few-shot renvoie chaque exemple à chaque appel.
  3. 3
    Le principal gain du few-shot porte sur le contrôle du format — schémas JSON stricts, vocabulaires d'étiquettes figés, style maison — et non sur la capacité de raisonnement.
  4. 4
    La qualité des exemples prime sur leur nombre : trois exemples variés et représentatifs battent généralement dix quasi-doublons.
  5. 5
    Sur les modèles de raisonnement de pointe, l'écart avec le zero-shot s'est nettement réduit. Sur les modèles petits ou locaux, le few-shot reste souvent le plus grand gain de précision disponible.
  6. 6
    L'ordre et l'équilibre comptent. Les modèles surpondèrent le dernier exemple : mélangez les étiquettes au lieu de les regrouper par classe.
  7. 7
    Tranchez avec un jeu de test : moins de 5 points de gain, restez en zero-shot ; 10 points ou plus, déployez les exemples.

Chiffres clés

  1. 1
    Fourchette habituelle du few-shot : 2 à 10 exemples ; les gains plafonnent en général au-delà de 8
  2. 2
    Origine : Brown et al. (2020), "Language Models are Few-Shot Learners" — l'article GPT-3, 175 milliards de paramètres
  3. 3
    Gain rapporté sur GPT-3 : 64,3 % en zero-shot → 71,2 % en few-shot sur TriviaQA
  4. 4
    Coût en tokens : 5 exemples d'environ 120 tokens ajoutent près de 600 tokens d'entrée à chaque requête
  5. 5
    Mise en cache des prompts : un bloc few-shot statique réduit jusqu'à 90 % le coût d'entrée répétée avec le prompt caching de Claude
  6. 6
    Seuil d'adoption : déployez le few-shot lorsqu'il apporte au moins 10 points de pourcentage sur 50 cas de test

Ce qu'est le Zero-Shot Prompting

📍 In One Sentence

Le zero-shot prompting fournit une consigne de tâche sans démonstration en contexte et repose entièrement sur le pré-entraînement et l'instruction tuning du modèle.

💬 In Plain Terms

Le zero-shot, c'est dire à quelqu'un quoi faire en pariant qu'il sait déjà comment. Aucun exemple résolu, juste la consigne.

Le zero-shot prompting demande au modèle de résoudre une tâche à partir d'une consigne claire, sans aucun exemple dans le prompt. Le modèle s'appuie sur ses connaissances générales et sur sa capacité à suivre des instructions, acquises lors du pré-entraînement et de l'alignement.

Le zero-shot se met en place rapidement puisqu'il n'y a ni conception ni maintenance de paires d'exemples. Il fonctionne bien sur des tâches larges : questions générales, classification simple, résumés ou traductions directes, où la consigne suffit le plus souvent.

Ce qu'est le Few-Shot Prompting

📍 In One Sentence

Le few-shot prompting place devant la consigne un petit ensemble de démonstrations entrée-sortie afin que le modèle infère le motif en contexte, sans mise à jour des poids.

💬 In Plain Terms

Le few-shot, c'est montrer trois exemples finis avant d'en demander un quatrième. Le modèle recopie le motif qu'il a sous les yeux.

Le few-shot prompting ajoute à la consigne quelques exemples entrée-sortie pour que le modèle déduise le motif de la tâche à partir de démonstrations concrètes. En pratique, le few-shot correspond à deux à dix exemples.

Ces exemples jouent le rôle d'un mini jeu d'entraînement à l'intérieur du prompt et orientent la façon dont le modèle interprète les tâches ambiguës, les formats spécialisés ou le vocabulaire métier. Le few-shot est particulièrement utile lorsqu'il faut un style, un schéma ou un comportement nuancé que les consignes génériques ne capturent pas.

Rien n'est entraîné. Les exemples ne vivent dans la fenêtre de contexte que le temps d'un appel, puis sont écartés : c'est pourquoi on parle d'apprentissage en contexte et non de fine-tuning.

Différences principales : Zero-Shot vs Few-Shot

Le zero-shot et le few-shot prompting diffèrent surtout par l'effort de préparation, la précision sur les tâches spécifiques et la capacité à passer à l'échelle sur de nombreux cas d'usage. Les deux reposent sur le même modèle, mais échangent un effort de conception d'exemples contre un meilleur alignement à la tâche.

Dimension
Zero-Shot
Few-Shot
Exemples dans le promptAucun2 à 10+ exemples représentatifs
Rapidité de mise en placeTrès rapide ; aucune curationPlus lente ; les exemples doivent être choisis et maintenus
Besoins en donnéesAucun exemple étiqueté requisNécessite au moins quelques exemples étiquetés
Précision sur les tâches pointuesSouvent plus faible ou plus génériqueGénéralement meilleure et plus régulière sur un domaine donné
Contrôle du format de sortieDépend de la précision de votre description du formatFort ; les exemples constituent la spécification du format
Tokens d'entrée par appelLa consigne seuleLa consigne plus tous les exemples, à chaque appel
Passage à l'échelleTrès extensible, nouvelles tâches faciles à ajouterMoins extensible ; chaque tâche peut exiger ses propres exemples

Quand utiliser le Zero-Shot

Utilisez le zero-shot prompting lorsque vous cherchez la rapidité, que vous n'avez pas d'exemples étiquetés et que la tâche reste assez générale. Ce schéma fonctionne bien comme première passe ou comme référence.

Scénarios zero-shot typiques :

  • Questions générales, résumés simples et classification de sentiment basique.
  • Expérimentation rapide tant que la forme de la tâche reste à définir.
  • Nouveaux domaines ou nouvelles langues, faute d'exemples curés.
  • Pipelines à fort volume et sensibles au coût, où chaque token d'entrée supplémentaire se multiplie sur des millions d'appels.

Quand utiliser le Few-Shot

Utilisez le few-shot prompting quand la tâche est spécialisée, sensible au format ou à fort enjeu, et que vous pouvez fournir de bons exemples. Dans ces cas, les exemples améliorent nettement la fiabilité par rapport aux consignes seules.

Scénarios few-shot courants :

  • Classification ou extraction métier (juridique, médical, financier) où l'étiquetage et la formulation exacts comptent.
  • Tâches à schéma strict, comme extraire du JSON structuré d'un texte désordonné.
  • Tâches multilingues ou de localisation, où quelques exemples par langue traitent idiomes et style.
  • Style et ton maison, où « écris comme ceci » se montre plus facilement qu'il ne se décrit.
  • Modèles plus petits ou exécutés localement, qui s'écartent souvent du format avec les seules consignes.

Exemple : prompt Zero-Shot vs Few-Shot

La différence pratique entre zero-shot et few-shot apparaît clairement lorsqu'on compare deux prompts pour la même tâche. Nous classons ici des tickets de support par intention.

Mauvais prompt – non structuré

« Regarde ce ticket de support et dis-moi de quoi il s'agit. »

Prompt Zero-Shot

« Classe le ticket de support suivant dans l'une de ces catégories : `billing_issue`, `login_problem`, `feature_request`, `bug_report` ou `other`. Ticket : "J'ai essayé de réinitialiser mon mot de passe trois fois aujourd'hui et le lien indique toujours qu'il a expiré." Ne renvoie que le nom de la catégorie. »

Prompt Few-Shot

« Classe chaque ticket de support dans l'une de ces catégories : `billing_issue`, `login_problem`, `feature_request`, `bug_report` ou `other`. Ne renvoie que le nom de la catégorie. Exemple 1 : Ticket : "Vous m'avez facturé deux fois le même abonnement ce mois-ci." Étiquette : `billing_issue` Exemple 2 : Ticket : "Quand je clique sur 'exporter le rapport', rien ne se passe, même après avoir rechargé la page." Étiquette : `bug_report` Exemple 3 : Ticket : "Pourriez-vous ajouter l'export des rapports directement vers Google Sheets ?" Étiquette : `feature_request` Classe maintenant ce ticket : "J'ai essayé de réinitialiser mon mot de passe trois fois aujourd'hui et le lien indique toujours qu'il a expiré." »

La version few-shot montre le motif explicitement, ce qui améliore généralement la qualité de classification sur les tickets nuancés ou bruités.

La qualité des exemples détermine la performance du Few-Shot

Trois exemples bien choisis surpassent régulièrement dix quasi-doublons, car le modèle apprend les frontières de la tâche à partir de la variété qu'on lui montre, pas du volume. La plupart des résultats décevants en few-shot viennent de la sélection des exemples, pas de leur nombre.

  1. 1
    Couvrez toute l'étendue, pas seulement les cas faciles. Incluez le ticket ambigu, le très court et le mal rédigé : ce sont précisément les entrées qui échouent en production.
  2. 2
    Équilibrez les étiquettes. Si quatre exemples sur cinq sont `bug_report`, le modèle sur-prédira `bug_report`. Donnez à chaque classe une représentation comparable.
  3. 3
    Mélangez l'ordre. Les modèles pondèrent davantage les derniers exemples : évitez de regrouper des étiquettes identiques en fin de bloc.
  4. 4
    Gardez un format rigoureusement identique d'un exemple à l'autre. Espaces, guillemets ou ordre des clés incohérents apprennent au modèle que le format est négociable.
  5. 5
    Puisez vos exemples dans des entrées réelles de production. Des exemples propres écrits à la main apprennent au modèle à attendre une entrée propre qu'il ne recevra jamais.
  6. 6
    Ne collez jamais de données clients réelles dans un modèle de prompt. Anonymisez ou synthétisez : les blocs few-shot sont stockés, versionnés et partagés comme du code.

Le Few-Shot coûte des tokens à chaque appel

Les exemples few-shot ne sont pas un coût d'installation unique : ils sont renvoyés en tokens d'entrée à chaque requête. Cinq exemples d'environ 120 tokens ajoutent près de 600 tokens d'entrée par appel — négligeable en test, significatif à un million d'appels par mois.

C'est la raison pratique de mesurer d'abord la référence zero-shot. Si le zero-shot passe déjà votre seuil de précision, le few-shot ne vous apporte rien et vous facture indéfiniment.

🔍 Mettez le bloc d'exemples en cache

Un bloc few-shot inchangé d'un appel à l'autre est un candidat idéal à la mise en cache de prompt. Anthropic, OpenAI et Google appliquent une forte remise sur l'entrée mise en cache — jusqu'à 90 % avec le prompt caching de Claude — ce qui retire l'essentiel de l'argument coût contre le few-shot dans les pipelines à fort volume.

Les modèles de raisonnement ont réduit l'écart avec le Zero-Shot

Un instruction tuning solide a comblé une grande partie de l'avantage de précision que le few-shot prompting offrait auparavant sur les modèles de pointe. Sur Claude Opus 5, GPT-5.6 et Gemini 3.1 Pro, une consigne zero-shot rédigée avec précision égale désormais le few-shot sur de nombreuses tâches générales — mais cette convergence ne vaut pas pour tout le paysage des modèles.

Là où le few-shot justifie encore ses tokens, c'est sur le format et le vocabulaire : jeux d'étiquettes propriétaires, schémas internes, ton maison et cas limites jamais rencontrés au pré-entraînement. Et sur les modèles plus petits ou hébergés localement, le few-shot demeure le levier de précision le plus efficace sans fine-tuning.

Classe de modèle
Qualité en zero-shot
Le few-shot aide-t-il encore ?
Raisonnement de pointe (Claude Opus 5, GPT-5.6, Gemini 3.1 Pro)Élevée sur les tâches généralesSurtout pour le format de sortie, le style maison et les étiquettes propriétaires
Pointe sans raisonnement (Claude Sonnet 5, Gemini 3.8 Flash)BonneOui — pour les domaines étroits et les schémas stricts
Petits modèles hébergés (Claude Haiku 4.5, Gemini 3.5 Flash-Lite)Inégale sur les tâches spécialiséesOui — généralement le plus grand gain de précision à lui seul
Open-weight local 7–30B (Qwen3 8B, Llama 4 Scout, Gemma 4)Variable ; les dérives de format sont fréquentesOui — souvent la différence entre une sortie exploitable et inutilisable

Erreurs fréquentes

La plupart des échecs en few-shot sont des échecs de méthode, pas des échecs de modèle. Ces cinq-là expliquent la majorité des cas où ajouter des exemples a dégradé la sortie au lieu de l'améliorer.

❌ Ajouter des exemples avant d'avoir mesuré la référence zero-shot

Why it hurts: Vous payez des tokens d'entrée indéfiniment sans savoir si les exemples ont apporté quoi que ce soit.

Fix: Passez d'abord 50 cas de test en zero-shot et notez la précision. Ensuite seulement, ajoutez des exemples et remesurez.

❌ Tous les exemples portant la même étiquette

Why it hurts: Le modèle lit ce déséquilibre comme un a priori et sur-prédit cette classe sur les entrées réelles.

Fix: Équilibrez les classes entre les exemples et mélangez-les pour que des étiquettes identiques ne se suivent pas.

❌ Des exemples qui contredisent la consigne écrite

Why it hurts: Quand consigne et démonstration divergent, le modèle suit généralement la démonstration — sans le signaler.

Fix: Relisez la consigne face à chaque exemple après chaque modification ; traitez les exemples comme la spécification.

❌ Des exemples bien plus longs ou plus propres que les entrées réelles

Why it hurts: Le modèle apprend à attendre un texte soigné et se dégrade sur le texte désordonné qu'il reçoit réellement.

Fix: Échantillonnez les exemples dans le trafic de production, y compris les plus disgracieux.

❌ Des données clients réelles laissées dans le bloc d'exemples

Why it hurts: Les modèles de prompt sont versionnés, partagés et journalisés : des données personnelles à l'intérieur deviennent une exposition RGPD.

Fix: Anonymisez ou synthétisez chaque exemple avant qu'il n'entre dans un modèle stocké.

Comment PromptQuorum vous aide à choisir

PromptQuorum est un outil de dispatch IA multi-modèles qui permet de tester des prompts zero-shot et few-shot sur plusieurs fournisseurs au même endroit. Vous pouvez envoyer le même prompt sans exemple et le même prompt enrichi d'exemples à des modèles comme GPT-5.6, Claude Opus 5 et Gemini 3.1 Pro, côte à côte.

Dans PromptQuorum, vous pouvez :

  • Démarrer avec des prompts zero-shot via des frameworks comme Single Step, RTF ou CO-STAR pour obtenir des références rapides.
  • Passer aux prompts few-shot en intégrant des exemples représentatifs dans des frameworks comme SPECS ou le Prompting Guide de Google lorsque vous voulez plus de contrôle.
  • Enregistrer les deux versions comme modèles, puis comparer précision, latence et coûts en tokens entre modèles dans la durée.

Comment choisir entre Zero-Shot et Few-Shot Prompting

  1. 1
    Pour des tâches courantes et simples, commencez en zero-shot (sans exemple). Exemple : « Classe cet avis comme positif ou négatif. » Si la précision suffit, le zero-shot est plus rapide et moins cher.
  2. 2
    Quand la performance zero-shot est faible (moins de 80 % de précision ou de qualité), ajoutez 2 à 5 exemples few-shot. Montrez au modèle 2–3 avis positifs et 2–3 avis négatifs correctement étiquetés. Le few-shot enseigne par l'exemple.
  3. 3
    Pour les tâches à distinctions subtiles ou à motifs rares, montez à 5–10 exemples (few-shot+). S'il faut détecter l'ironie, un biais problématique ou une nuance métier, davantage d'exemples aident.
  4. 4
    Choisissez des exemples couvrant l'étendue des entrées attendues. Pour classer des avis produits, incluez des avis enthousiastes, tièdes et négatifs. Ne montrez pas uniquement des cas faciles.
  5. 5
    Mesurez le gain du few-shot sur un jeu de test avant de le mettre en production. Exécutez le même prompt avec 0 puis 5 exemples sur 50 cas. Si le few-shot apporte 10 points ou plus, gardez les exemples. Si le gain est inférieur à 5 %, restez en zero-shot.
  6. 6
    Une fois le few-shot en production, mettez le bloc d'exemples en cache et revérifiez-le chaque trimestre. Des exemples périmés encodent silencieusement des catégories et des formats que votre produit n'utilise plus.

Considérations pour les marchés francophones

En France, en Belgique et au Canada francophone, les équipes préfèrent souvent des workflows structurés et documentés. Lors de la mise en œuvre de Few-Shot Prompting dans des contextes professionnels francophones, documentez clairement vos stratégies d'exemples et vos seuils de précision. Cela facilite l'adoption et l'audit dans les organisations régies par des réglementations strictes.

Point d'attention RGPD : si vos exemples proviennent de tickets ou de messages clients réels, ils constituent des données à caractère personnel dès qu'ils entrent dans un modèle de prompt versionné. La CNIL attend une base légale et une minimisation ; anonymisez ou synthétisez les exemples avant de les stocker.

Avantages comparatifs et cas limites

Avantage Zero-Shot : idéal pour les prototypes rapides, les nouvelles langues ou domaines, et les cas où vous ne disposez pas de données étiquetées.

Avantage Few-Shot : supérieur pour les tâches sensibles (classification juridique, extraction médicale), les formats stricts (JSON structuré) et les nuances multilingues.

Cas limite : si votre domaine est très spécialisé et que le few-shot avec 5 à 10 exemples n'améliore toujours pas la précision, envisagez le fine-tuning d'un modèle sur des centaines d'exemples (au-delà du few-shot).

Questions fréquentes

Combien d'exemples faut-il pour parler de « few-shot » ?

Entre deux et une dizaine. Un seul exemple s'appelle du one-shot. Les gains plafonnent en général au-delà de huit exemples et, ensuite, vous payez surtout des tokens d'entrée pour un rendement décroissant. S'il vous faut des dizaines d'exemples pour atteindre votre objectif de précision, le fine-tuning est généralement le meilleur outil.

Le few-shot prompting équivaut-il au fine-tuning ?

Non. Le few-shot prompting relève de l'apprentissage en contexte : les exemples figurent dans le prompt le temps d'un appel et ne changent rien au modèle. Le fine-tuning met à jour les poids et persiste sur tous les appels. Le few-shot coûte des tokens d'entrée par requête ; le fine-tuning coûte un entraînement plus un modèle dédié à héberger.

Le few-shot prompting aide-t-il encore sur les modèles de raisonnement ?

Moins qu'avant pour la précision brute, plus qu'on ne le croit pour le format. Sur Claude Opus 5, GPT-5.6 et Gemini 3.1 Pro, une consigne zero-shot précise égale souvent le few-shot sur les tâches générales. Mais dès qu'il faut un schéma JSON exact, un vocabulaire d'étiquettes propriétaire ou un ton maison précis, les exemples restent le moyen le plus fiable d'y arriver.

Pourquoi ma sortie s'est-elle dégradée après l'ajout d'exemples ?

Le plus souvent à cause d'un déséquilibre d'étiquettes, d'une contradiction ou d'une dérive de format. Si la plupart des exemples partagent une étiquette, le modèle la sur-prédit. Si un exemple contredit votre consigne écrite, le modèle a tendance à suivre l'exemple. Et si les exemples sont plus propres que les entrées réelles, le modèle se dégrade sur le texte désordonné qu'il reçoit vraiment.

L'ordre des exemples few-shot a-t-il une importance ?

Oui. Les modèles pondèrent davantage les exemples tardifs, si bien qu'un bloc terminé par trois étiquettes identiques biaise la prédiction vers cette étiquette. Alternez les classes et retestez après toute réorganisation : les effets d'ordre déplacent la précision de plusieurs points.

Comment garder des prompts few-shot abordables à grande échelle ?

Avec la mise en cache de prompt. Un bloc d'exemples statique est identique à chaque appel, ce qui en fait une cible de cache idéale : Anthropic, OpenAI et Google facturent l'entrée mise en cache avec une forte remise, jusqu'à environ 90 % avec le prompt caching de Claude. Placez les exemples tout au début du prompt pour que le préfixe mis en cache reste stable.

Peut-on combiner few-shot et chain-of-thought prompting ?

Oui, et c'est l'une des combinaisons les plus puissantes qui soient. Le few-shot chain-of-thought signifie que vos exemples montrent les étapes de raisonnement, pas seulement la réponse finale. Cela coûte plus de tokens de sortie que chaque technique prise isolément, mais sur les tâches multi-étapes c'est généralement plus fiable qu'un « réfléchis étape par étape » en zero-shot.

Sources et lectures complémentaires

  • Brown, T., Mann, B., Ryder, N., et al. (2020). "Language Models are Few-Shot Learners." NeurIPS 2020. arXiv:2005.14165 — l'article qui a introduit le few-shot, le one-shot et le zero-shot comme régimes de prompting.
  • Zhao, Z., Wallace, E., Feng, S., Klein, D., & Singh, S. (2021). "Calibrate Before Use: Improving Few-Shot Performance of Language Models." ICML 2021. arXiv:2102.09690 — sur les biais d'étiquette majoritaire et de récence dans l'ordre des exemples.
  • Lu, Y., Bartolo, M., Moore, A., Riedel, S., & Stenetorp, P. (2022). "Fantastically Ordered Prompts and Where to Find Them." ACL 2022. arXiv:2104.08786 — sur la sensibilité de la précision few-shot à l'ordre des exemples.
  • Min, S., Lyu, X., Holtzman, A., et al. (2022). "Rethinking the Role of Demonstrations." EMNLP 2022. arXiv:2202.12837 — démonstration que le format et la distribution des entrées comptent davantage que l'exactitude des étiquettes.
  • Anthropic. "Prompt caching." Documentation de la plateforme Claude — tarification de l'entrée mise en cache pour les préfixes de prompt statiques comme les blocs few-shot.

Appliquez ces techniques avec un LLM local ou vos propres clés API — PromptQuorum fonctionne avec n'importe quel backend.

Essayer PromptQuorum gratuitement →

← Retour au Prompt Engineering