Kurzfakten
- 1Übliche Few-Shot-Spanne: 2–10 Beispiele; ab etwa 8 flachen die Gewinne meist ab
- 2Ursprung: Brown et al. (2020), "Language Models are Few-Shot Learners" — das GPT-3-Paper, 175 Mrd. Parameter
- 3Berichteter GPT-3-Gewinn: 64,3 % Zero-Shot → 71,2 % Few-Shot auf TriviaQA
- 4Token-Kosten: 5 Beispiele à rund 120 Tokens erhöhen jede Anfrage um etwa 600 Input-Tokens
- 5Prompt Caching: ein statischer Few-Shot-Block senkt die wiederholten Input-Kosten um bis zu 90 % beim Prompt Caching von Claude
- 6Einführungsschwelle: Few-Shot ausrollen, wenn es über 50 Testfälle mindestens 10 Prozentpunkte bringt
Was Zero-Shot Prompting ist
📍 In One Sentence
Zero-Shot Prompting liefert eine Aufgabenanweisung ohne Demonstrationen im Kontext und verlässt sich vollständig auf Pre-Training und Instruction Tuning des Modells.
💬 In Plain Terms
Zero-Shot heißt: Sie sagen jemandem, was zu tun ist, und vertrauen darauf, dass er es bereits kann. Keine Musterlösungen, nur die Anweisung.
Zero-Shot Prompting bittet das Modell, eine Aufgabe allein anhand einer klaren Anweisung und ohne Beispiele im Prompt zu lösen. Das Modell stützt sich auf sein Allgemeinwissen und die Fähigkeit, Anweisungen zu befolgen, die es im Pre-Training und Alignment gelernt hat.
Zero-Shot ist schnell aufgesetzt, weil Sie keine Beispielpaare entwerfen oder pflegen müssen. Es funktioniert gut bei breiten Aufgaben wie allgemeinen Fragen, einfacher Klassifikation, Zusammenfassungen oder unkomplizierten Übersetzungen, bei denen die Anweisung allein in der Regel genügt.
Was Few-Shot Prompting ist
📍 In One Sentence
Few-Shot Prompting stellt der Anweisung einige Eingabe-Ausgabe-Demonstrationen voran, sodass das Modell das Aufgabenmuster im Kontext ableitet — ohne Gewichtsanpassung.
💬 In Plain Terms
Few-Shot heißt: Sie zeigen jemandem drei fertige Beispiele, bevor Sie um ein viertes bitten. Das Modell kopiert das Muster, das es sieht.
Few-Shot Prompting ergänzt die Anweisung um einige Eingabe-Ausgabe-Beispiele, damit das Modell das Aufgabenmuster aus konkreten Demonstrationen ableiten kann. In der Praxis bedeutet Few-Shot meist zwei bis zehn Beispiele.
Diese Beispiele wirken wie ein Mini-Trainingsset innerhalb des Prompts und steuern, wie das Modell mehrdeutige Aufgaben, spezielle Formate oder Fachsprache interpretiert. Besonders hilfreich ist Few-Shot Prompting, wenn Sie einen bestimmten Stil, ein Schema oder ein feines Verhalten benötigen, das allgemeine Anweisungen nicht erfassen.
Trainiert wird dabei nichts. Die Beispiele leben nur für die Dauer eines einzelnen Aufrufs im Kontextfenster und werden danach verworfen — deshalb heißt die Technik In-Context Learning und nicht Fine-Tuning.
Die zentralen Unterschiede: Zero-Shot vs. Few-Shot
Zero-Shot und Few-Shot Prompting unterscheiden sich vor allem in Aufwand, Genauigkeit bei spezifischen Aufgaben und Skalierbarkeit über viele Anwendungsfälle hinweg. Beide nutzen dasselbe Modell, tauschen aber Aufwand für die Beispielgestaltung gegen bessere Aufgabenausrichtung.
Dimension | Zero-Shot | Few-Shot |
|---|---|---|
| Beispiele im Prompt | Keine | 2–10+ repräsentative Beispiele |
| Aufsetzgeschwindigkeit | Sehr schnell; keine Beispielpflege | Langsamer; Beispiele müssen ausgewählt und gepflegt werden |
| Datenbedarf | Keine beschrifteten Beispiele nötig | Mindestens einige beschriftete Beispiele nötig |
| Genauigkeit bei engen Aufgaben | Oft niedriger oder generischer | Meist höher und konsistenter in spezifischen Domänen |
| Kontrolle über das Ausgabeformat | Hängt davon ab, wie präzise Sie das Format beschreiben können | Stark; die Beispiele sind die Formatspezifikation |
| Input-Tokens pro Aufruf | Nur die Anweisung | Anweisung plus jedes Beispiel, bei jedem Aufruf |
| Skalierbarkeit über Aufgaben | Sehr skalierbar, neue Aufgaben leicht ergänzbar | Weniger skalierbar; jede Aufgabe braucht ggf. eigene Beispiele |
Wann Zero-Shot sinnvoll ist
Nutzen Sie Zero-Shot Prompting, wenn Sie Tempo brauchen, keine beschrifteten Beispiele haben und die Aufgabe hinreichend allgemein ist. Als erster Durchgang oder Baseline funktioniert dieses Muster gut.
Typische Zero-Shot-Szenarien:
- Allgemeine Fragen, einfache Zusammenfassungen und grundlegende Sentiment-Klassifikation.
- Schnelles Experimentieren, solange Sie den Zuschnitt der Aufgabe noch herausfinden.
- Neue Domänen oder Sprachen, für die Ihnen kuratierte Beispiele fehlen.
- Kostensensible Pipelines mit hohem Volumen, in denen sich jeder zusätzliche Input-Token über Millionen Aufrufe multipliziert.
Wann Few-Shot sinnvoll ist
Nutzen Sie Few-Shot Prompting, wenn die Aufgabe spezialisiert, formatsensibel oder risikoreich ist und Sie gute Beispiele liefern können. In diesen Fällen verbessern Beispiele die Zuverlässigkeit deutlich gegenüber reinen Anweisungen.
Typische Few-Shot-Szenarien:
- Domänenspezifische Klassifikation oder Extraktion (Recht, Medizin, Finanzen), bei der präzise Labels und Formulierungen zählen.
- Aufgaben mit strengen Schemata, etwa das Extrahieren von strukturiertem JSON aus unsauberem Text.
- Mehrsprachige oder Lokalisierungsaufgaben, bei denen einige Beispiele pro Sprache Idiome und Stil abfangen.
- Hausstil und Tonalität, bei denen "schreib so" leichter zu zeigen als zu beschreiben ist.
- Kleinere oder lokal betriebene Modelle, die bei reinen Anweisungen häufig vom Format abweichen.
Beispiel: Zero-Shot vs. Few-Shot Prompt
Der praktische Unterschied zwischen Zero-Shot und Few-Shot wird deutlich, wenn Sie Prompts für dieselbe Aufgabe vergleichen. Hier klassifizieren wir Support-Tickets nach Anliegen.
Schlechter Prompt – unstrukturiert
"Schau dir dieses Support-Ticket an und sag mir, worum es geht."
Zero-Shot Prompt
"Ordne das folgende Support-Ticket einer dieser Kategorien zu: `billing_issue`, `login_problem`, `feature_request`, `bug_report` oder `other`. Ticket: "Ich habe heute dreimal versucht, mein Passwort zurückzusetzen, und der Link sagt immer, er sei abgelaufen." Gib nur den Kategorienamen aus."
Few-Shot Prompt
"Ordne jedes Support-Ticket einer dieser Kategorien zu: `billing_issue`, `login_problem`, `feature_request`, `bug_report` oder `other`. Gib nur den Kategorienamen aus. Beispiel 1: Ticket: "Sie haben mir dieses Monat zweimal dasselbe Abo berechnet." Label: `billing_issue` Beispiel 2: Ticket: "Wenn ich auf 'Bericht exportieren' klicke, passiert nichts, auch nach einem Neuladen." Label: `bug_report` Beispiel 3: Ticket: "Könnten Sie den Export von Berichten direkt nach Google Sheets ergänzen?" Label: `feature_request` Klassifiziere jetzt dieses Ticket: "Ich habe heute dreimal versucht, mein Passwort zurückzusetzen, und der Link sagt immer, er sei abgelaufen."
Die Few-Shot-Variante zeigt das Muster explizit, was die Klassifikationsqualität bei feinen oder unsauberen Tickets meist verbessert.
Beispielqualität entscheidet über die Few-Shot-Leistung
Drei gut gewählte Beispiele schlagen regelmäßig zehn fast identische, weil das Modell die Grenzen der Aufgabe aus der gezeigten Vielfalt lernt und nicht aus der Menge. Die meisten enttäuschenden Few-Shot-Ergebnisse gehen auf die Beispielauswahl zurück, nicht auf die Beispielanzahl.
- 1Decken Sie die Bandbreite ab, nicht nur die einfachen Fälle. Nehmen Sie das mehrdeutige Ticket auf, das sehr kurze und das schlecht geschriebene — genau diese Eingaben scheitern im Produktivbetrieb.
- 2Halten Sie die Labels im Gleichgewicht. Sind vier von fünf Beispielen `bug_report`, sagt das Modell `bug_report` zu häufig voraus. Geben Sie jeder Klasse etwa gleich viel Raum.
- 3Mischen Sie die Reihenfolge. Modelle gewichten spätere Beispiele stärker; vermeiden Sie es, gleiche Labels am Ende des Blocks zu bündeln.
- 4Halten Sie das Format über alle Beispiele hinweg exakt identisch. Uneinheitliche Leerzeichen, Anführungszeichen oder Schlüsselreihenfolgen lehren das Modell, dass das Format verhandelbar ist.
- 5Ziehen Sie Beispiele aus echten Produktiveingaben. Handgeschriebene, saubere Beispiele bringen dem Modell bei, saubere Eingaben zu erwarten, die es real nie erhält.
- 6Fügen Sie niemals echte Kundendaten in eine Prompt-Vorlage ein. Anonymisieren oder synthetisieren Sie; Few-Shot-Blöcke werden wie Code gespeichert, versioniert und geteilt.
Few-Shot kostet Tokens bei jedem Aufruf
Few-Shot-Beispiele sind keine einmaligen Einrichtungskosten — sie werden bei jeder einzelnen Anfrage erneut als Input-Tokens übertragen. Fünf Beispiele à rund 120 Tokens ergeben etwa 600 zusätzliche Input-Tokens pro Aufruf: im Test vernachlässigbar, bei einer Million Aufrufen im Monat spürbar.
Genau deshalb sollten Sie zuerst die Zero-Shot-Baseline messen. Erreicht Zero-Shot Ihre Genauigkeitsschwelle bereits, bringt Few-Shot nichts und wird trotzdem dauerhaft abgerechnet.
🔍 Beispielblock cachen
Ein Few-Shot-Block, der zwischen den Aufrufen unverändert bleibt, ist ein idealer Kandidat für Prompt Caching. Anthropic, OpenAI und Google rabattieren zwischengespeicherten Input deutlich — bis zu 90 % beim Prompt Caching von Claude — womit das Kostenargument gegen Few-Shot in Pipelines mit hohem Volumen weitgehend entfällt.
Reasoning-Modelle haben den Zero-Shot-Abstand verkleinert
Starkes Instruction Tuning hat einen Großteil des Genauigkeitsvorsprungs eingeebnet, den Few-Shot Prompting bei Frontier-Modellen früher brachte. Auf Claude Opus 5, GPT-5.6 und Gemini 3.1 Pro erreicht eine präzise formulierte Zero-Shot-Anweisung heute bei vielen allgemeinen Aufgaben dasselbe Niveau wie Few-Shot — diese Annäherung gilt aber nicht für die gesamte Modelllandschaft.
Wo Few-Shot seine Tokens weiterhin verdient, sind Format und Vokabular: proprietäre Label-Sets, interne Schemata, Hausstil und Randfälle, die dem Modell im Pre-Training nie begegnet sind. Und bei kleineren oder lokal betriebenen Modellen bleibt Few-Shot der wirksamste Genauigkeitshebel ohne Fine-Tuning.
Modellklasse | Zero-Shot-Qualität | Bringt Few-Shot noch etwas? |
|---|---|---|
| Frontier-Reasoning (Claude Opus 5, GPT-5.6, Gemini 3.1 Pro) | Hoch bei allgemeinen Aufgaben | Vor allem für Ausgabeformat, Hausstil und proprietäre Label-Sets |
| Frontier ohne Reasoning (Claude Sonnet 5, Gemini 3.8 Flash) | Gut | Ja — bei engen Domänen und strengen Schemata |
| Kleine gehostete Modelle (Claude Haiku 4.5, Gemini 3.5 Flash-Lite) | Gemischt bei Spezialaufgaben | Ja — meist der größte einzelne Genauigkeitsgewinn |
| Lokale Open-Weight-Modelle 7–30B (Qwen3 8B, Llama 4 Scout, Gemma 4) | Schwankend; Formatabweichungen sind häufig | Ja — oft der Unterschied zwischen brauchbarer und unbrauchbarer Ausgabe |
Häufige Fehler
Die meisten Few-Shot-Fehlschläge sind Prozessfehler, keine Modellfehler. Diese fünf erklären die Mehrzahl der Fälle, in denen zusätzliche Beispiele die Ausgabe verschlechtert statt verbessert haben.
❌ Beispiele ergänzen, bevor die Zero-Shot-Baseline gemessen ist
Why it hurts: Sie zahlen dauerhaft Input-Tokens, ohne zu wissen, ob die Beispiele überhaupt etwas gebracht haben.
Fix: Erst 50 Testfälle mit Zero-Shot laufen lassen und die Genauigkeit festhalten. Danach Beispiele ergänzen und erneut messen.
❌ Alle Beispiele tragen dasselbe Label
Why it hurts: Das Modell liest das Ungleichgewicht als Vorannahme und sagt diese Klasse bei echten Eingaben zu häufig voraus.
Fix: Klassen über die Beispiele hinweg ausbalancieren und so mischen, dass gleiche Labels nicht nebeneinander stehen.
❌ Beispiele, die der schriftlichen Anweisung widersprechen
Why it hurts: Wenn Anweisung und Demonstration auseinandergehen, folgt das Modell meist der Demonstration — stillschweigend.
Fix: Nach jeder Änderung die Anweisung gegen alle Beispiele gegenlesen; die Beispiele sind die Spezifikation.
❌ Beispiele, die viel länger oder sauberer sind als reale Eingaben
Why it hurts: Das Modell lernt, ordentliche Eingaben zu erwarten, und wird bei dem unsauberen Text schlechter, den es tatsächlich bekommt.
Fix: Beispiele aus dem echten Traffic ziehen, inklusive der hässlichen Fälle.
❌ Echte Kundendaten bleiben im Beispielblock stehen
Why it hurts: Prompt-Vorlagen werden versioniert, geteilt und protokolliert — personenbezogene Daten darin werden zum Compliance-Risiko unter der DSGVO.
Fix: Jedes Beispiel anonymisieren oder synthetisieren, bevor es in eine gespeicherte Vorlage wandert.
Wie PromptQuorum bei der Wahl hilft
PromptQuorum ist ein Multi-Modell-KI-Dispatch-Tool, mit dem Sie Zero-Shot- und Few-Shot-Prompts an einem Ort über mehrere Anbieter hinweg testen. Sie können denselben reinen Anweisungs-Prompt und denselben beispielgestützten Prompt an Modelle wie GPT-5.6, Claude Opus 5 und Gemini 3.1 Pro nebeneinander schicken.
In PromptQuorum können Sie:
- Mit Zero-Shot Prompts und Frameworks wie Single Step, RTF oder CO-STAR schnelle Baselines aufbauen.
- Auf Few-Shot Prompts umstellen, indem Sie repräsentative Beispiele in Frameworks wie SPECS oder Googles Prompting Guide einbetten, wenn Sie strengere Kontrolle brauchen.
- Zero-Shot- und Few-Shot-Versionen als Vorlagen speichern und Genauigkeit, Latenz und Token-Kosten über Modelle hinweg im Zeitverlauf vergleichen.
So wählen Sie zwischen Zero-Shot und Few-Shot Prompting
- 1Bei routinemäßigen, unkomplizierten Aufgaben starten Sie mit Zero-Shot (keine Beispiele). Beispiel: "Klassifiziere diese Bewertung als positiv oder negativ." Reicht die Genauigkeit, ist Zero-Shot schneller und günstiger.
- 2Ist die Zero-Shot-Leistung schwach (unter 80 % Genauigkeit oder Qualität), ergänzen Sie 2–5 Few-Shot-Beispiele. Zeigen Sie dem Modell 2–3 positive und 2–3 negative Bewertungen mit korrekten Labels. Few-Shot lehrt durch Beispiele.
- 3Bei feinen Unterscheidungen oder seltenen Mustern nehmen Sie 5–10 Beispiele (Few-Shot+). Geht es um Sarkasmus, schädliche Verzerrungen oder fachliche Nuancen, helfen mehr Beispiele.
- 4Wählen Sie Beispiele, die die erwartete Bandbreite der Eingaben abdecken. Klassifizieren Sie Produktbewertungen, gehören begeisterte, lauwarme und negative Beispiele dazu. Zeigen Sie nicht nur einfache Fälle.
- 5Messen Sie den Few-Shot-Nutzen an einem Testset, bevor Sie ihn produktiv setzen. Lassen Sie denselben Prompt mit 0 und mit 5 Beispielen über 50 Testfälle laufen. Bringt Few-Shot 10+ Prozentpunkte, nehmen Sie die Beispiele auf. Liegt der Gewinn unter 5 %, bleiben Sie bei Zero-Shot.
- 6Sobald Few-Shot produktiv läuft, cachen Sie den Beispielblock und prüfen ihn quartalsweise. Veraltete Beispiele kodieren stillschweigend Kategorien und Formate, die Ihr Produkt längst nicht mehr verwendet.
Häufig gestellte Fragen
Wie viele Beispiele sind "Few-Shot"?
Zwei bis etwa zehn. Ein einzelnes Beispiel heißt One-Shot. Ab ungefähr acht Beispielen flachen die Gewinne meist ab, danach zahlen Sie vor allem Input-Tokens für abnehmenden Ertrag. Brauchen Sie Dutzende Beispiele, um Ihr Genauigkeitsziel zu erreichen, ist Fine-Tuning in der Regel das bessere Werkzeug.
Ist Few-Shot Prompting dasselbe wie Fine-Tuning?
Nein. Few-Shot Prompting ist In-Context Learning — die Beispiele stehen für einen Aufruf im Prompt und verändern nichts am Modell. Fine-Tuning passt die Gewichte an und wirkt über alle Aufrufe hinweg. Few-Shot kostet Input-Tokens pro Anfrage; Fine-Tuning kostet einen Trainingslauf plus ein eigenes gehostetes Modell.
Hilft Few-Shot Prompting bei Reasoning-Modellen noch?
Für reine Genauigkeit weniger als früher, für das Format mehr, als man erwarten würde. Auf Claude Opus 5, GPT-5.6 und Gemini 3.1 Pro erreicht eine präzise Zero-Shot-Anweisung bei allgemeinen Aufgaben oft dasselbe Niveau. Brauchen Sie aber ein exaktes JSON-Schema, ein proprietäres Label-Vokabular oder eine bestimmte Hausstimme, sind Beispiele weiterhin der verlässlichste Weg dorthin.
Warum wurde meine Ausgabe durch zusätzliche Beispiele schlechter?
Meist wegen Label-Ungleichgewicht, Widersprüchen oder Formatabweichungen. Tragen die meisten Beispiele ein Label, sagt das Modell es zu häufig voraus. Widerspricht ein Beispiel Ihrer schriftlichen Anweisung, folgt das Modell tendenziell dem Beispiel. Und sind die Beispiele sauberer als reale Eingaben, wird das Modell bei dem unsauberen Text schlechter, den es tatsächlich erhält.
Spielt die Reihenfolge der Few-Shot-Beispiele eine Rolle?
Ja. Modelle gewichten spätere Beispiele stärker als frühere, sodass ein Block, der mit drei gleichen Labels endet, die Vorhersage in diese Richtung verzerrt. Mischen Sie die Klassen und testen Sie nach jeder Umsortierung erneut — Reihenfolgeeffekte bewegen die Genauigkeit durchaus um mehrere Punkte.
Wie halte ich Few-Shot Prompts im großen Maßstab bezahlbar?
Mit Prompt Caching. Ein statischer Beispielblock ist bei jedem Aufruf identisch und damit ein idealer Cache-Kandidat — Anthropic, OpenAI und Google rechnen zwischengespeicherten Input stark rabattiert ab, bis zu rund 90 % günstiger beim Prompt Caching von Claude. Stellen Sie die Beispiele ganz an den Anfang des Prompts, damit das gecachte Präfix stabil bleibt.
Lässt sich Few-Shot mit Chain-of-Thought Prompting kombinieren?
Ja, und es ist eine der stärksten verfügbaren Kombinationen. Few-Shot Chain-of-Thought bedeutet, dass Ihre Beispiele die Denkschritte zeigen und nicht nur die Endantwort. Das kostet mehr Output-Tokens als jede Technik für sich, ist bei mehrstufigen Aufgaben aber meist zuverlässiger als ein Zero-Shot-"Denk Schritt für Schritt".
Wie verwalten wir Few-Shot-Beispiele in unternehmensweiten Workflows in Deutschland?
Deutsche Unternehmen sollten Few-Shot-Beispiele zentral in der Versionskontrolle ablegen und dokumentieren. Legen Sie eine Beispieldatenbank mit beschrifteten Eingaben und erwarteten Ausgaben an. Das ist wichtig für Compliance, Reproduzierbarkeit und Team-Onboarding. PromptQuorum unterstützt Vorlagenspeicherung über Modelle hinweg, was bei größeren Enterprise-Deployments in der DACH-Region hilft.
Gibt es Datenschutz- oder Compliance-Folgen, wenn Few-Shot-Beispiele Kundendaten enthalten?
Ja. Enthalten Ihre Few-Shot-Beispiele echte Kundendaten, unterliegen sie den Anforderungen der DSGVO. Verwenden Sie anonymisierte oder synthetische Beispiele, um Datenschutzverstöße zu vermeiden, und dokumentieren Sie, wie Beispiele erhoben, gespeichert und eingesetzt werden. Für deutsche Unternehmen und Behörden ist das ein kritischer Kontrollpunkt.
Quellen & weiterführende Literatur
- Brown, T., Mann, B., Ryder, N., et al. (2020). "Language Models are Few-Shot Learners." NeurIPS 2020. arXiv:2005.14165 — die Arbeit, die Few-Shot, One-Shot und Zero-Shot als Prompting-Regime eingeführt hat.
- Zhao, Z., Wallace, E., Feng, S., Klein, D., & Singh, S. (2021). "Calibrate Before Use: Improving Few-Shot Performance of Language Models." ICML 2021. arXiv:2102.09690 — zu Mehrheits-Label- und Recency-Verzerrung bei der Beispielreihenfolge.
- Lu, Y., Bartolo, M., Moore, A., Riedel, S., & Stenetorp, P. (2022). "Fantastically Ordered Prompts and Where to Find Them." ACL 2022. arXiv:2104.08786 — zur Empfindlichkeit der Few-Shot-Genauigkeit gegenüber der Beispielreihenfolge.
- Min, S., Lyu, X., Holtzman, A., et al. (2022). "Rethinking the Role of Demonstrations." EMNLP 2022. arXiv:2202.12837 — Belege dafür, dass Format und Eingabeverteilung der Beispiele stärker wirken als die Korrektheit ihrer Labels.
- Anthropic. "Prompt caching." Claude-Plattformdokumentation — Preisgestaltung für zwischengespeicherten Input bei statischen Prompt-Präfixen wie Few-Shot-Blöcken.
