Wichtigste Erkenntnisse
- Drei Generationen existieren: Idefics (2023), Idefics2 (April 2024), Idefics3 (August 2024) — jede ein eigenständiges Modell, kein einfaches Upgrade.
- Idefics3 ist heute die aktuelle Empfehlung für die meisten Aufgaben; es verbessert OCR und Dokumentenverständnis gegenüber Idefics2 erheblich.
- Die Lizenz ist über die Generationen hinweg nuanciert: das ursprüngliche Idefics hat eine reine Forschungsbeschränkung; Idefics2 ist vollständig Apache-2.0 (Mistral-7B-Basis); Idefics3 trägt zusätzlich zu seinem Apache-2.0-Repository-Tag die Bedingungen der Llama-3.1-Community-Lizenz (Llama-3.1-8B-Instruct-Basis).
- VRAM: etwa 18-20 GB in Float16 für Idefics2/3, oder 6-7 GB mit aggressiver Quantisierung — schwerer als LLaVA 7B oder MiniCPM-V.
- Zum Zeitpunkt dieses Tests nicht in Ollamas Bibliothek verpackt; offene GitHub-Issues verfolgen Schwierigkeiten bei der GGUF-Konvertierung.
- Am besten geeignet für: dokumentenlastige OCR- und Multi-Bild-Denkaufgaben mit ausreichendem GPU-Speicher, nicht für ressourcenbeschränkte oder Echtzeit-lokale Setups.
📍 In einem Satz
Idefics ist HuggingFace M4s offene Nachbildung von DeepMinds Flamingo, mittlerweile in dritter Generation (Idefics3, 8B, August 2024), mit deutlich unterschiedlichen Lizenzen und VRAM-Anforderungen über seine drei Versionen hinweg, und derzeit nicht in Ollamas Modellbibliothek verpackt.
💬 In einfachen Worten
Idefics ist eine Familie von KI-Modellen von HuggingFace, die Bilder betrachten und Fragen dazu beantworten können, ähnlich wie LLaVA — dieser Test erklärt, welche der drei Versionen tatsächlich zu verwenden ist, was sie an GPU-Speicher kostet und wo sie an ihre Grenzen stößt.
📌Hinweis: PromptQuorum hat diese Fakten direkt anhand der HuggingFace-Modellkarten für idefics-80b, idefics2-8b und Idefics3-8B-Llama3 sowie anhand von Ollamas Bibliothek und GitHub-Issue-Tracker überprüft — siehe den Abschnitt Quellen für genaue Links.
Geschichte: HuggingFace M4 und die Flamingo-Nachbildung
**Die Modellkarte des ursprünglichen Idefics besagt ausdrücklich, es handle sich um "eine offen zugängliche Nachbildung von Flamingo, einem von DeepMind entwickelten proprietären Vision-Language-Modell."** Es wurde 2023 vom HuggingFace-M4-Team in zwei Größen veröffentlicht, 9B und 80B Parameter, die einen Vision-Encoder mit einer LLaMA(1)-Sprachmodell-Basis kombinieren.
Das ursprüngliche Idefics trägt eine gemischte Lizenz, nicht eine einzige freizügige. Sein Vision-Encoder und die neu trainierten Verbindungsparameter werden unter MIT veröffentlicht, doch die LLaMA(1)-Sprachmodell-Basis erfordert die Einhaltung von Metas ursprünglicher, reiner Forschungslizenz für LLaMA ohne kommerzielle Nutzung. Dies macht das ursprüngliche Idefics in den meisten Fällen ungeeignet für kommerzielle Nutzung, unabhängig vom MIT-Tag auf Teilen des Stacks.
Idefics2 (8B), veröffentlicht um April 2024, ersetzte die LLaMA(1)-Basis durch Mistral-7B-v0.1 und kombinierte es mit einem SigLIP-Vision-Encoder. Da beide Basismodelle Apache-2.0 sind, besagt Idefics2s eigene Modellkarte, dass das gesamte Modell Apache-2.0 ist — was das Lizenzproblem des ursprünglichen Idefics löst. HuggingFace selbst schreibt Idefics2 zu, die Leistung von Idefics-80B bei etwa 10-mal kleinerer Größe zu erreichen, mit deutlich besserem OCR und Dokumentenverständnis.
Idefics3 (8B), veröffentlicht am 22. August 2024, behielt den SigLIP-Vision-Encoder bei, wechselte jedoch die Sprachbasis zu Meta-Llama-3.1-8B-Instruct. Seine eigene Modellkarte zeigt eine deutliche Verbesserung gegenüber Idefics2, insbesondere bei Dokumentenverständnis, OCR und visuellem Denken. Es wurde in Version 4.46 zu Hugging Face Transformers hinzugefügt.
Ist Idefics eine Nachbildung von DeepMinds Flamingo?
Ja. Die Modellkarte des ursprünglichen Idefics beschreibt es ausdrücklich als "eine offen zugängliche Nachbildung von Flamingo, einem von DeepMind entwickelten proprietären Vision-Language-Modell." Idefics2 und Idefics3 sind nachfolgende, unabhängig architektierte Generationen von HuggingFace M4 auf derselben Abstammungslinie.
Idefics vs Idefics2 vs Idefics3: Was sich tatsächlich geändert hat
Die drei Generationen sind eigenständige Modelle mit unterschiedlichen Basisarchitekturen — kein einzelnes Modell mit schrittweisen Versionserhöhungen. Hier ist, was sich tatsächlich unterscheidet, verifiziert anhand der jeweiligen HuggingFace-Karte jedes Modells.
Idefics (9B/80B)
- Veröffentlicht:
- 2023
- Basis:
- LLaMA(1) + eigener Vision-Encoder
- Hinweise:
- Reine Forschungslizenzbeschränkung von LLaMA(1); weitgehend überholt
Idefics2 (8B)
- Veröffentlicht:
- April 2024
- Basis:
- Mistral-7B-v0.1 + SigLIP
- Hinweise:
- Vollständig Apache-2.0; erreicht Idefics-80B bei 10-mal kleinerer Größe
Idefics3 (8B)
- Veröffentlicht:
- 22. August 2024
- Basis:
- Llama-3.1-8B-Instruct + SigLIP
- Hinweise:
- Bestes OCR/Dokumentenverständnis der drei; Llama-3.1-Lizenzbedingungen gelten
PromptQuorum fand zum Zeitpunkt dieses Tests kein öffentlich bestätigtes "Idefics4". Idefics3 ist die neueste Generation und die aktuelle Empfehlung für die meisten Aufgaben.
Lizenznuance: Es ist nicht einfach Apache-2.0
PromptQuorums Verzeichniseintrag für Idefics kennzeichnet dessen Lizenz als "Apache 2.0" — das ist korrekt für das Modell-Repository und den Code, aber unvollständig für die praktische Lizenzsituation, ähnlich wie sich LLaVAs Apache-2.0-Codelizenz nicht automatisch auf jeden Basismodell-Checkpoint erstreckt.
Idefics2 ist der klarste Fall: Sowohl seine Mistral-7B-v0.1-Sprachbasis als auch sein SigLIP-Vision-Encoder sind Apache-2.0, sodass der gesamte Modell-Stack tatsächlich Apache-2.0 ist, ohne zusätzliche Bedingungen.
Idefics3 ist nuancierter. Sein eigenes HuggingFace-Repository ist als Apache-2.0 gekennzeichnet, doch seine Sprachbasis, Meta-Llama-3.1-8B-Instruct, wird unter Metas Llama-3.1-Community-Lizenz veröffentlicht — die eine Nutzungsrichtlinie und eine Klausel enthält, wonach ein separates Lizenzabkommen mit Meta erforderlich ist, falls ein nachgelagertes Produkt 700 Millionen monatliche aktive Nutzer überschreitet. Wer Idefics3 kommerziell in großem Maßstab einsetzt, sollte Metas Llama-3.1-Lizenzbedingungen direkt lesen, nicht nur das Apache-2.0-Tag im Idefics3-Repository.
Das ursprüngliche Idefics ist am restriktivsten. Seine LLaMA(1)-Basis trägt Metas ursprüngliche, reine Forschungslizenz ohne kommerzielle Nutzung, wodurch die kommerzielle Nutzung des vollständigen 9B/80B-Modells rechtlich bestenfalls unklar und schlimmstenfalls unzulässig ist — auch wenn Vision-Encoder und Verbindungsgewichte separat unter MIT lizenziert sind.
Ist Idefics kostenlos für kommerzielle Nutzung?
Das hängt von der Generation ab. Idefics2 ist vollständig Apache-2.0 ohne zusätzliche Einschränkungen. Idefics3s eigenes Repository ist Apache-2.0, doch seine Llama-3.1-8B-Instruct-Basis trägt die Bedingungen von Metas Llama-3.1-Community-Lizenz, einschließlich einer Lizenzpflicht ab 700 Millionen monatlichen aktiven Nutzern. Das ursprüngliche Idefics trägt eine reine Forschungsbeschränkung ohne kommerzielle Nutzung von seiner LLaMA(1)-Basis.
Echtes Nutzungsbeispiel: Transformers-Bibliothek
Idefics3 wird über die Klassen AutoModelForVision2Seq und AutoProcessor von Hugging Face Transformers verwendet, dokumentiert in Transformers' Idefics3-Modelldokumentation. Transformers-Version 4.46 oder höher ist erforderlich.
- Es gibt heute keinen Ollama- oder llama.cpp-Pfad. Idefics läuft über Transformers (oder kompatible Inferenzserver wie Text Generation Inference), nicht über GGUF-basierte Runner.
- Das Reduzieren des Bildauflösungsparameters kann den GPU-Speicherverbrauch senken. Idefics2/3s Modellkarten dokumentieren das Reduzieren der Anzahl verarbeiteter Bild-Unterausschnitte (in Idefics3s Dokumentation als
Nbezeichnet) als Möglichkeit, etwas Genauigkeit gegen weniger VRAM einzutauschen.
# Erfordert transformers >= 4.46 (gemäß Hugging Face's Idefics3-Modelldokumentation)
# pip install transformers pillow torch
from transformers import AutoProcessor, AutoModelForVision2Seq
from PIL import Image
import torch
model_id = "HuggingFaceM4/Idefics3-8B-Llama3"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForVision2Seq.from_pretrained(
model_id,
torch_dtype=torch.float16,
).to("cuda")
image = Image.open("photo.jpg")
messages = [
{
"role": "user",
"content": [
{"type": "image"},
{"type": "text", "text": "What is in this image?"},
],
},
]
prompt = processor.apply_chat_template(messages, add_generation_prompt=True)
inputs = processor(text=prompt, images=[image], return_tensors="pt").to("cuda")
generated_ids = model.generate(**inputs, max_new_tokens=200)
generated_text = processor.batch_decode(generated_ids, skip_special_tokens=True)
print(generated_text[0])VRAM- und Hardwareanforderungen
Idefics2 und Idefics3 sind deutlich schwerer als vergleichbar große LLaVA- oder MiniCPM-V-Checkpoints, größtenteils aufgrund der Art, wie sie die Bildauflösung verarbeiten. Diese Zahlen stammen direkt aus Idefics2s eigener Modellkarte, die seinen VRAM-Bereich ausdrücklich dokumentiert; für Idefics3 (gleiche 8B-Parameterzahl und Vision-Encoder) wird ein ähnlicher Wert erwartet, obwohl PromptQuorum keine ebenso detaillierte veröffentlichte VRAM-Tabelle speziell für Idefics3 fand.
Konfiguration | Ca. VRAM | Hinweise |
|---|---|---|
| Float16 + Flash-Attention | ~18-20 GB | Auf Idefics2s Modellkarte als Standardkonfiguration dokumentiert |
| Ohne Optimierungen | Bis zu ~55 GB Spitzenwert | Obergrenze auf Idefics2s Modellkarte für unoptimierte Inferenz |
| Aggressive Quantisierung | ~6-7 GB | Untergrenze auf Idefics2s Modellkarte dokumentiert; erwarten Sie einen Genauigkeitskompromiss |
| LLaVA 7B (zum Vergleich) | ~6-8 GB | Siehe PromptQuorums LLaVA-Test |
📌Hinweis: PromptQuorum hat für diesen Artikel keine eigenen Hardware-Benchmarks durchgeführt; diese Zahlen stammen aus Idefics2s veröffentlichter Modellkarte. Idefics ist bei vergleichbaren Fähigkeitsstufen tatsächlich schwerer als LLaVA 7B oder MiniCPM-V — seien Sie ehrlich zu sich selbst über verfügbares VRAM, bevor Sie es für eine ressourcenbeschränkte Bereitstellung wählen.
Wofür Idefics nicht geeignet ist
Idefics3 ist ein leistungsfähiges offenes Vision-Language-Modell, aber die falsche Wahl für folgende Situationen:
- Ressourcenbeschränkte lokale Setups. Mit etwa 18-20 GB VRAM in seiner Standard-Float16-Konfiguration benötigen Idefics2/3 deutlich mehr GPU-Speicher als LLaVA 7B (~6-8 GB) oder MiniCPM-V (~5,5 GB). Wenn Ihr Hardwarebudget eine einzelne Consumer-GPU mit 8 GB VRAM oder weniger ist, ist Idefics ohne aggressive Quantisierung und einen akzeptierten Genauigkeitskompromiss keine realistische Option.
- Echtzeit- oder latenzarme Anwendungen. Ein Vision-Language-Modell mit 8B Parametern, das mehrere Bild-Unterausschnitte pro Eingabe verarbeitet, ist nicht für die schnellstmögliche Reaktionszeit gebaut. Wenn Latenz Priorität hat, reagiert ein kleineres Modell wie Moondream (1,8B) schneller, bei reduzierter Fähigkeit.
- Ein direkter Ollama- oder llama.cpp-Workflow. Idefics ist derzeit nicht in Ollamas Bibliothek verpackt, und die GGUF-Konvertierung hat offene, ungelöste Kompatibilitätsprobleme, die auf Ollamas eigenem GitHub verfolgt werden. Wenn Ihr Workflow speziell auf Ollama basiert, siehe PromptQuorums Ollama-Vision-Modelle-Leitfaden für Modelle, die heute tatsächlich abrufbar sind.
- Die Annahme einer einzigen, einheitlichen Lizenz über alle Versionen hinweg. "Idefics" als ein Produkt mit einer Lizenz zu behandeln, ist ein Fehler — überprüfen Sie, welche Generation Sie bereitstellen, und lesen Sie die spezifischen Lizenzbedingungen dieses Modells, insbesondere für Idefics3s Verpflichtungen aus der Llama-3.1-Community-Lizenz bei großem Maßstab.
Alternativen und Wettbewerber
LLaVA
- Am besten geeignet:
- Breitere Tool-Unterstützung, einschließlich Ollama- und llama.cpp-Verpackung; geringerer VRAM-Bedarf bei 7B
- Lizenz:
- Apache-2.0 (Code); basismodellabhängig für Checkpoints
Ollamas Vision-Modelle
- Am besten geeignet:
- Einfachstes lokales Setup über
ollama pull/ollama run; Idefics ist zum Zeitpunkt dieses Tests nicht darunter - Lizenz:
- Je nach Modell unterschiedlich
MLC Chat
- Am besten geeignet:
- Plattformübergreifende On-Device-Bereitstellung; zum Zeitpunkt dieses Tests hauptsächlich textfokussiert — aktuelle Vision-Unterstützung vor Verlass darauf überprüfen
- Lizenz:
- Apache-2.0
Artikel über MLC Chat (5)
- MLC Chat Review (2026): The Mobile App Built on MLC LLM, Assessed HonestlyAktualisiert 7. September 2026
- Best Local LLM Apps for iPhone in 2026 (Run AI Without WiFi)Aktualisiert 1. September 2026
- Mobile Local LLMs 2026: iPhone 16 Pro, iPad M4 & Snapdragon XAktualisiert 28. August 2026
- Best Local LLM Apps for Android in 2026: 6 Apps Compared on Real PhonesAktualisiert 24. August 2026
- Best Mobile LLM Models in 2026: Phi-4 Mini vs Gemma 3 vs SmolLMAktualisiert 14. Juli 2026
Auch erwähnt in:
- Galaxy vs iPhone On-Device AI: Samsung Galaxy AI vs Apple Intelligence (2026)Aktualisiert 29. August 2026
- Run a Local LLM on Your Tablet: iPad Pro M5, Galaxy Tab S10, OnePlus Pad 2 (2026)Aktualisiert 14. Juli 2026
- Running Local AI on the Galaxy S26: On-Device AI Explained (2026)Aktualisiert 15. Juni 2026
Cloud-VLM-APIs (GPT-4o, Claude, Gemini Vision)
- Am besten geeignet:
- Höchste verfügbare Multimodal-Fähigkeit, keine lokale Hardware oder Einrichtung nötig
- Lizenz:
- Proprietär (kostenpflichtige API)
Häufig gestellte Fragen
Was ist Idefics?
Idefics ist eine Familie offener Vision-Language-Modelle des HuggingFace-M4-Teams, ausdrücklich als offene Nachbildung von DeepMinds Flamingo konzipiert. Es existiert in drei Generationen: das ursprüngliche Idefics (2023, 9B/80B), Idefics2 (April 2024, 8B) und Idefics3 (August 2024, 8B).
Welche Version von Idefics sollte ich verwenden — Idefics, Idefics2 oder Idefics3?
Idefics3 für die meisten Aufgaben heute — es hat das stärkste OCR und Dokumentenverständnis der drei. Idefics2 bleibt relevant, wenn Sie speziell einen vollständig Apache-2.0-lizenzierten Stack ohne von Llama abgeleitete Lizenzbedingungen benötigen. Das ursprüngliche Idefics ist weitgehend überholt und trägt eine reine Forschungslizenzbeschränkung.
Ist Idefics vollständig quelloffen und kostenlos für kommerzielle Nutzung?
Das hängt von der Generation ab. Idefics2 ist vollständig Apache-2.0. Idefics3s Repository ist als Apache-2.0 gekennzeichnet, doch seine Llama-3.1-8B-Instruct-Basis trägt die Bedingungen von Metas Llama-3.1-Community-Lizenz, einschließlich Verpflichtungen ab 700 Millionen monatlichen aktiven Nutzern. Das ursprüngliche Idefics hat eine reine Forschungsbeschränkung ohne kommerzielle Nutzung von seiner LLaMA(1)-Basis.
Wie viel VRAM benötigt Idefics?
Idefics2 (und wahrscheinlich Idefics3, bei gleicher 8B-Parameterzahl und gleichem Vision-Encoder) benötigt etwa 18-20 GB VRAM in der auf Idefics2s Modellkarte dokumentierten Standard-Float16-mit-Flash-Attention-Konfiguration, oder nur 6-7 GB mit aggressiver Quantisierung und einem Genauigkeitskompromiss. Das ist deutlich schwerer als LLaVA 7B oder MiniCPM-V.
Kann ich Idefics über Ollama ausführen?
Zum Zeitpunkt dieses Tests nicht. Idefics ist derzeit nicht in Ollamas Modellbibliothek verpackt, und die GGUF-Konvertierung hat offene Kompatibilitätsprobleme, die auf Ollamas eigenem GitHub-Repository verfolgt werden. Idefics läuft stattdessen über Hugging Face Transformers.
Basiert Idefics auf DeepMinds Flamingo?
Idefics wird auf seiner eigenen Modellkarte ausdrücklich als "eine offen zugängliche Nachbildung von Flamingo, einem von DeepMind entwickelten proprietären Vision-Language-Modell" beschrieben. Idefics2 und Idefics3 sind unabhängig architektierte Nachfolger desselben HuggingFace-M4-Teams.
Fazit
Idefics ist eine tatsächlich nützliche Familie offener Vision-Language-Modelle, und Idefics3 hält sich speziell gut für dokumentenlastige OCR- und Multi-Bild-Denkaufgaben, bei denen sein VRAM-Bedarf von etwa 18-20 GB erschwinglich ist. Es ist jedoch kein direkter Ersatz für leichtere lokale Vision-Modelle: Es benötigt deutlich mehr GPU-Speicher als LLaVA 7B oder MiniCPM-V, hat zum Zeitpunkt dieses Tests keine Ollama- oder llama.cpp-Verpackung, und seine Lizenzsituation unterscheidet sich tatsächlich je nach Generation — Idefics2s sauberer Apache-2.0-Stack ist rechtlich etwas völlig anderes als Idefics3s Verpflichtungen aus der Llama-3.1-Community-Lizenz. Wählen Sie Idefics3 für Dokumentenverständnis und OCR-Qualität, wenn Sie den GPU-Speicher dafür haben; wählen Sie speziell Idefics2, wenn ein reiner Apache-2.0-Stack wichtig ist; und wählen Sie LLaVA, über PromptQuorums LLaVA-Test, oder eines der Modelle im Ollama-Vision-Modelle-Leitfaden, für leichtere lokale Hardware oder Ollama-basierte Workflows.
Quellen
- Idefics-80B-Modellkarte — Flamingo-Nachbildungsaussage, Lizenzstruktur, Modellgrößen.
- Idefics2-8b-Modellkarte — Basismodelle, Apache-2.0-Lizenz, dokumentierter VRAM-Bereich.
- Idefics3-8B-Llama3-Modellkarte — Basismodell, Lizenz-Tag, Veröffentlichungsdetails.
- Idefics3-Transformers-Dokumentation — Nutzungsbeispiel, minimale Transformers-Version.
- Meta-Llama-3.1-Community-Lizenz — Lizenzbedingungen, die von Idefics3s Sprachbasis geerbt werden.
- Ollama-GitHub-Issue #2183 und Issue #3677 — offene Feature-Anfragen, die bestätigen, dass Idefics derzeit nicht in Ollamas Bibliothek verpackt ist.
