Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/Idefics-Test (2026): HuggingFace's offene Vision-Language-Modelle, ehrlich bewertet
Voice, Speech & Multimodal

Idefics-Test (2026): HuggingFace's offene Vision-Language-Modelle, ehrlich bewertet

·11 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Idefics ist eine Familie offener Vision-Language-Modelle des HuggingFace-M4-Teams, konzipiert als ausdrückliche offene Nachbildung von DeepMinds Flamingo. Es gibt drei Generationen: das ursprüngliche Idefics (9B/80B, 2023), Idefics2 (8B, April 2024) und Idefics3 (8B, August 2024). Für die tatsächliche Nutzung heute ist Idefics3 für die meisten Aufgaben die aktuelle Empfehlung — es verbessert OCR, Dokumentenverständnis und visuelles Denken gegenüber Idefics2 erheblich, das selbst bei vergleichbarer Leistung "10-mal kleiner" als das ursprüngliche Idefics war. Die Lizenz ist nuanciert: Idefics2s Mistral-7B-v0.1-Basis hält den gesamten Stack unter Apache-2.0, während Idefics3s Llama-3.1-8B-Instruct-Basis neben dem Apache-2.0-Tag des Modell-Repositorys selbst die Bedingungen von Metas Llama-3.1-Community-Lizenz mit sich bringt. Idefics ist derzeit nicht in Ollamas Bibliothek verpackt — die GGUF-Konvertierung hat zum Zeitpunkt dieses Tests offene Kompatibilitätsprobleme. Für ein vergleichbares offenes VLM mit breiterer Tool-Unterstützung siehe PromptQuorums LLaVA-Test.

Idefics ist eine Familie offener Vision-Language-Modelle des HuggingFace-M4-Teams, die ausdrücklich als offene Nachbildung von DeepMinds Flamingo konzipiert wurde. Die Familie umfasst drei Generationen — das ursprüngliche Idefics, Idefics2 und Idefics3 — und diese sind nicht austauschbar: Sie nutzen unterschiedliche Basis-Sprachmodelle, in der Praxis unterschiedliche Lizenzen und sehr unterschiedliche Hardwareanforderungen. Dieser Test behandelt die tatsächliche Geschichte, welche Version heute wirklich zu verwenden ist, ehrliche VRAM-Zahlen und wo Idefics nicht passt, insbesondere für ressourcenbeschränkte lokale Setups. Für ein vergleichbares offenes Vision-Language-Modell mit größerer bestehender Nutzerbasis siehe PromptQuorums LLaVA-Test; für das Ausführen von Vision-Modellen speziell über Ollama (Idefics ist derzeit nicht dafür verpackt) siehe den Ollama-Vision-Modelle-Leitfaden.

Idefics-Test (2026): HuggingFace's offene Vision-Language-Modelle, ehrlich bewertet

Wichtigste Erkenntnisse

  • Drei Generationen existieren: Idefics (2023), Idefics2 (April 2024), Idefics3 (August 2024) — jede ein eigenständiges Modell, kein einfaches Upgrade.
  • Idefics3 ist heute die aktuelle Empfehlung für die meisten Aufgaben; es verbessert OCR und Dokumentenverständnis gegenüber Idefics2 erheblich.
  • Die Lizenz ist über die Generationen hinweg nuanciert: das ursprüngliche Idefics hat eine reine Forschungsbeschränkung; Idefics2 ist vollständig Apache-2.0 (Mistral-7B-Basis); Idefics3 trägt zusätzlich zu seinem Apache-2.0-Repository-Tag die Bedingungen der Llama-3.1-Community-Lizenz (Llama-3.1-8B-Instruct-Basis).
  • VRAM: etwa 18-20 GB in Float16 für Idefics2/3, oder 6-7 GB mit aggressiver Quantisierung — schwerer als LLaVA 7B oder MiniCPM-V.
  • Zum Zeitpunkt dieses Tests nicht in Ollamas Bibliothek verpackt; offene GitHub-Issues verfolgen Schwierigkeiten bei der GGUF-Konvertierung.
  • Am besten geeignet für: dokumentenlastige OCR- und Multi-Bild-Denkaufgaben mit ausreichendem GPU-Speicher, nicht für ressourcenbeschränkte oder Echtzeit-lokale Setups.

📍 In einem Satz

Idefics ist HuggingFace M4s offene Nachbildung von DeepMinds Flamingo, mittlerweile in dritter Generation (Idefics3, 8B, August 2024), mit deutlich unterschiedlichen Lizenzen und VRAM-Anforderungen über seine drei Versionen hinweg, und derzeit nicht in Ollamas Modellbibliothek verpackt.

💬 In einfachen Worten

Idefics ist eine Familie von KI-Modellen von HuggingFace, die Bilder betrachten und Fragen dazu beantworten können, ähnlich wie LLaVA — dieser Test erklärt, welche der drei Versionen tatsächlich zu verwenden ist, was sie an GPU-Speicher kostet und wo sie an ihre Grenzen stößt.

📌Hinweis: PromptQuorum hat diese Fakten direkt anhand der HuggingFace-Modellkarten für idefics-80b, idefics2-8b und Idefics3-8B-Llama3 sowie anhand von Ollamas Bibliothek und GitHub-Issue-Tracker überprüft — siehe den Abschnitt Quellen für genaue Links.

Geschichte: HuggingFace M4 und die Flamingo-Nachbildung

**Die Modellkarte des ursprünglichen Idefics besagt ausdrücklich, es handle sich um "eine offen zugängliche Nachbildung von Flamingo, einem von DeepMind entwickelten proprietären Vision-Language-Modell."** Es wurde 2023 vom HuggingFace-M4-Team in zwei Größen veröffentlicht, 9B und 80B Parameter, die einen Vision-Encoder mit einer LLaMA(1)-Sprachmodell-Basis kombinieren.

Das ursprüngliche Idefics trägt eine gemischte Lizenz, nicht eine einzige freizügige. Sein Vision-Encoder und die neu trainierten Verbindungsparameter werden unter MIT veröffentlicht, doch die LLaMA(1)-Sprachmodell-Basis erfordert die Einhaltung von Metas ursprünglicher, reiner Forschungslizenz für LLaMA ohne kommerzielle Nutzung. Dies macht das ursprüngliche Idefics in den meisten Fällen ungeeignet für kommerzielle Nutzung, unabhängig vom MIT-Tag auf Teilen des Stacks.

Idefics2 (8B), veröffentlicht um April 2024, ersetzte die LLaMA(1)-Basis durch Mistral-7B-v0.1 und kombinierte es mit einem SigLIP-Vision-Encoder. Da beide Basismodelle Apache-2.0 sind, besagt Idefics2s eigene Modellkarte, dass das gesamte Modell Apache-2.0 ist — was das Lizenzproblem des ursprünglichen Idefics löst. HuggingFace selbst schreibt Idefics2 zu, die Leistung von Idefics-80B bei etwa 10-mal kleinerer Größe zu erreichen, mit deutlich besserem OCR und Dokumentenverständnis.

Idefics3 (8B), veröffentlicht am 22. August 2024, behielt den SigLIP-Vision-Encoder bei, wechselte jedoch die Sprachbasis zu Meta-Llama-3.1-8B-Instruct. Seine eigene Modellkarte zeigt eine deutliche Verbesserung gegenüber Idefics2, insbesondere bei Dokumentenverständnis, OCR und visuellem Denken. Es wurde in Version 4.46 zu Hugging Face Transformers hinzugefügt.

Ist Idefics eine Nachbildung von DeepMinds Flamingo?

Ja. Die Modellkarte des ursprünglichen Idefics beschreibt es ausdrücklich als "eine offen zugängliche Nachbildung von Flamingo, einem von DeepMind entwickelten proprietären Vision-Language-Modell." Idefics2 und Idefics3 sind nachfolgende, unabhängig architektierte Generationen von HuggingFace M4 auf derselben Abstammungslinie.

Idefics vs Idefics2 vs Idefics3: Was sich tatsächlich geändert hat

Die drei Generationen sind eigenständige Modelle mit unterschiedlichen Basisarchitekturen — kein einzelnes Modell mit schrittweisen Versionserhöhungen. Hier ist, was sich tatsächlich unterscheidet, verifiziert anhand der jeweiligen HuggingFace-Karte jedes Modells.

Idefics (9B/80B)

Veröffentlicht:
2023
Basis:
LLaMA(1) + eigener Vision-Encoder
Hinweise:
Reine Forschungslizenzbeschränkung von LLaMA(1); weitgehend überholt

Idefics2 (8B)

Veröffentlicht:
April 2024
Basis:
Mistral-7B-v0.1 + SigLIP
Hinweise:
Vollständig Apache-2.0; erreicht Idefics-80B bei 10-mal kleinerer Größe

Idefics3 (8B)

Veröffentlicht:
22. August 2024
Basis:
Llama-3.1-8B-Instruct + SigLIP
Hinweise:
Bestes OCR/Dokumentenverständnis der drei; Llama-3.1-Lizenzbedingungen gelten

PromptQuorum fand zum Zeitpunkt dieses Tests kein öffentlich bestätigtes "Idefics4". Idefics3 ist die neueste Generation und die aktuelle Empfehlung für die meisten Aufgaben.

Lizenznuance: Es ist nicht einfach Apache-2.0

PromptQuorums Verzeichniseintrag für Idefics kennzeichnet dessen Lizenz als "Apache 2.0" — das ist korrekt für das Modell-Repository und den Code, aber unvollständig für die praktische Lizenzsituation, ähnlich wie sich LLaVAs Apache-2.0-Codelizenz nicht automatisch auf jeden Basismodell-Checkpoint erstreckt.

Idefics2 ist der klarste Fall: Sowohl seine Mistral-7B-v0.1-Sprachbasis als auch sein SigLIP-Vision-Encoder sind Apache-2.0, sodass der gesamte Modell-Stack tatsächlich Apache-2.0 ist, ohne zusätzliche Bedingungen.

Idefics3 ist nuancierter. Sein eigenes HuggingFace-Repository ist als Apache-2.0 gekennzeichnet, doch seine Sprachbasis, Meta-Llama-3.1-8B-Instruct, wird unter Metas Llama-3.1-Community-Lizenz veröffentlicht — die eine Nutzungsrichtlinie und eine Klausel enthält, wonach ein separates Lizenzabkommen mit Meta erforderlich ist, falls ein nachgelagertes Produkt 700 Millionen monatliche aktive Nutzer überschreitet. Wer Idefics3 kommerziell in großem Maßstab einsetzt, sollte Metas Llama-3.1-Lizenzbedingungen direkt lesen, nicht nur das Apache-2.0-Tag im Idefics3-Repository.

Das ursprüngliche Idefics ist am restriktivsten. Seine LLaMA(1)-Basis trägt Metas ursprüngliche, reine Forschungslizenz ohne kommerzielle Nutzung, wodurch die kommerzielle Nutzung des vollständigen 9B/80B-Modells rechtlich bestenfalls unklar und schlimmstenfalls unzulässig ist — auch wenn Vision-Encoder und Verbindungsgewichte separat unter MIT lizenziert sind.

Ist Idefics kostenlos für kommerzielle Nutzung?

Das hängt von der Generation ab. Idefics2 ist vollständig Apache-2.0 ohne zusätzliche Einschränkungen. Idefics3s eigenes Repository ist Apache-2.0, doch seine Llama-3.1-8B-Instruct-Basis trägt die Bedingungen von Metas Llama-3.1-Community-Lizenz, einschließlich einer Lizenzpflicht ab 700 Millionen monatlichen aktiven Nutzern. Das ursprüngliche Idefics trägt eine reine Forschungsbeschränkung ohne kommerzielle Nutzung von seiner LLaMA(1)-Basis.

Echtes Nutzungsbeispiel: Transformers-Bibliothek

Idefics3 wird über die Klassen AutoModelForVision2Seq und AutoProcessor von Hugging Face Transformers verwendet, dokumentiert in Transformers' Idefics3-Modelldokumentation. Transformers-Version 4.46 oder höher ist erforderlich.

  • Es gibt heute keinen Ollama- oder llama.cpp-Pfad. Idefics läuft über Transformers (oder kompatible Inferenzserver wie Text Generation Inference), nicht über GGUF-basierte Runner.
  • Das Reduzieren des Bildauflösungsparameters kann den GPU-Speicherverbrauch senken. Idefics2/3s Modellkarten dokumentieren das Reduzieren der Anzahl verarbeiteter Bild-Unterausschnitte (in Idefics3s Dokumentation als N bezeichnet) als Möglichkeit, etwas Genauigkeit gegen weniger VRAM einzutauschen.
python
# Erfordert transformers >= 4.46 (gemäß Hugging Face's Idefics3-Modelldokumentation)
# pip install transformers pillow torch

from transformers import AutoProcessor, AutoModelForVision2Seq
from PIL import Image
import torch

model_id = "HuggingFaceM4/Idefics3-8B-Llama3"

processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForVision2Seq.from_pretrained(
    model_id,
    torch_dtype=torch.float16,
).to("cuda")

image = Image.open("photo.jpg")

messages = [
    {
        "role": "user",
        "content": [
            {"type": "image"},
            {"type": "text", "text": "What is in this image?"},
        ],
    },
]
prompt = processor.apply_chat_template(messages, add_generation_prompt=True)
inputs = processor(text=prompt, images=[image], return_tensors="pt").to("cuda")

generated_ids = model.generate(**inputs, max_new_tokens=200)
generated_text = processor.batch_decode(generated_ids, skip_special_tokens=True)
print(generated_text[0])

VRAM- und Hardwareanforderungen

Idefics2 und Idefics3 sind deutlich schwerer als vergleichbar große LLaVA- oder MiniCPM-V-Checkpoints, größtenteils aufgrund der Art, wie sie die Bildauflösung verarbeiten. Diese Zahlen stammen direkt aus Idefics2s eigener Modellkarte, die seinen VRAM-Bereich ausdrücklich dokumentiert; für Idefics3 (gleiche 8B-Parameterzahl und Vision-Encoder) wird ein ähnlicher Wert erwartet, obwohl PromptQuorum keine ebenso detaillierte veröffentlichte VRAM-Tabelle speziell für Idefics3 fand.

Konfiguration
Ca. VRAM
Hinweise
Float16 + Flash-Attention~18-20 GBAuf Idefics2s Modellkarte als Standardkonfiguration dokumentiert
Ohne OptimierungenBis zu ~55 GB SpitzenwertObergrenze auf Idefics2s Modellkarte für unoptimierte Inferenz
Aggressive Quantisierung~6-7 GBUntergrenze auf Idefics2s Modellkarte dokumentiert; erwarten Sie einen Genauigkeitskompromiss
LLaVA 7B (zum Vergleich)~6-8 GBSiehe PromptQuorums LLaVA-Test

📌Hinweis: PromptQuorum hat für diesen Artikel keine eigenen Hardware-Benchmarks durchgeführt; diese Zahlen stammen aus Idefics2s veröffentlichter Modellkarte. Idefics ist bei vergleichbaren Fähigkeitsstufen tatsächlich schwerer als LLaVA 7B oder MiniCPM-V — seien Sie ehrlich zu sich selbst über verfügbares VRAM, bevor Sie es für eine ressourcenbeschränkte Bereitstellung wählen.

Wofür Idefics nicht geeignet ist

Idefics3 ist ein leistungsfähiges offenes Vision-Language-Modell, aber die falsche Wahl für folgende Situationen:

  • Ressourcenbeschränkte lokale Setups. Mit etwa 18-20 GB VRAM in seiner Standard-Float16-Konfiguration benötigen Idefics2/3 deutlich mehr GPU-Speicher als LLaVA 7B (~6-8 GB) oder MiniCPM-V (~5,5 GB). Wenn Ihr Hardwarebudget eine einzelne Consumer-GPU mit 8 GB VRAM oder weniger ist, ist Idefics ohne aggressive Quantisierung und einen akzeptierten Genauigkeitskompromiss keine realistische Option.
  • Echtzeit- oder latenzarme Anwendungen. Ein Vision-Language-Modell mit 8B Parametern, das mehrere Bild-Unterausschnitte pro Eingabe verarbeitet, ist nicht für die schnellstmögliche Reaktionszeit gebaut. Wenn Latenz Priorität hat, reagiert ein kleineres Modell wie Moondream (1,8B) schneller, bei reduzierter Fähigkeit.
  • Ein direkter Ollama- oder llama.cpp-Workflow. Idefics ist derzeit nicht in Ollamas Bibliothek verpackt, und die GGUF-Konvertierung hat offene, ungelöste Kompatibilitätsprobleme, die auf Ollamas eigenem GitHub verfolgt werden. Wenn Ihr Workflow speziell auf Ollama basiert, siehe PromptQuorums Ollama-Vision-Modelle-Leitfaden für Modelle, die heute tatsächlich abrufbar sind.
  • Die Annahme einer einzigen, einheitlichen Lizenz über alle Versionen hinweg. "Idefics" als ein Produkt mit einer Lizenz zu behandeln, ist ein Fehler — überprüfen Sie, welche Generation Sie bereitstellen, und lesen Sie die spezifischen Lizenzbedingungen dieses Modells, insbesondere für Idefics3s Verpflichtungen aus der Llama-3.1-Community-Lizenz bei großem Maßstab.

Alternativen und Wettbewerber

LLaVA

Am besten geeignet:
Breitere Tool-Unterstützung, einschließlich Ollama- und llama.cpp-Verpackung; geringerer VRAM-Bedarf bei 7B
Lizenz:
Apache-2.0 (Code); basismodellabhängig für Checkpoints

Ollamas Vision-Modelle

Am besten geeignet:
Einfachstes lokales Setup über ollama pull/ollama run; Idefics ist zum Zeitpunkt dieses Tests nicht darunter
Lizenz:
Je nach Modell unterschiedlich

MLC Chat

Am besten geeignet:
Plattformübergreifende On-Device-Bereitstellung; zum Zeitpunkt dieses Tests hauptsächlich textfokussiert — aktuelle Vision-Unterstützung vor Verlass darauf überprüfen
Lizenz:
Apache-2.0
Artikel über MLC Chat (5)

Auch erwähnt in:

Cloud-VLM-APIs (GPT-4o, Claude, Gemini Vision)

Am besten geeignet:
Höchste verfügbare Multimodal-Fähigkeit, keine lokale Hardware oder Einrichtung nötig
Lizenz:
Proprietär (kostenpflichtige API)

Häufig gestellte Fragen

Was ist Idefics?

Idefics ist eine Familie offener Vision-Language-Modelle des HuggingFace-M4-Teams, ausdrücklich als offene Nachbildung von DeepMinds Flamingo konzipiert. Es existiert in drei Generationen: das ursprüngliche Idefics (2023, 9B/80B), Idefics2 (April 2024, 8B) und Idefics3 (August 2024, 8B).

Welche Version von Idefics sollte ich verwenden — Idefics, Idefics2 oder Idefics3?

Idefics3 für die meisten Aufgaben heute — es hat das stärkste OCR und Dokumentenverständnis der drei. Idefics2 bleibt relevant, wenn Sie speziell einen vollständig Apache-2.0-lizenzierten Stack ohne von Llama abgeleitete Lizenzbedingungen benötigen. Das ursprüngliche Idefics ist weitgehend überholt und trägt eine reine Forschungslizenzbeschränkung.

Ist Idefics vollständig quelloffen und kostenlos für kommerzielle Nutzung?

Das hängt von der Generation ab. Idefics2 ist vollständig Apache-2.0. Idefics3s Repository ist als Apache-2.0 gekennzeichnet, doch seine Llama-3.1-8B-Instruct-Basis trägt die Bedingungen von Metas Llama-3.1-Community-Lizenz, einschließlich Verpflichtungen ab 700 Millionen monatlichen aktiven Nutzern. Das ursprüngliche Idefics hat eine reine Forschungsbeschränkung ohne kommerzielle Nutzung von seiner LLaMA(1)-Basis.

Wie viel VRAM benötigt Idefics?

Idefics2 (und wahrscheinlich Idefics3, bei gleicher 8B-Parameterzahl und gleichem Vision-Encoder) benötigt etwa 18-20 GB VRAM in der auf Idefics2s Modellkarte dokumentierten Standard-Float16-mit-Flash-Attention-Konfiguration, oder nur 6-7 GB mit aggressiver Quantisierung und einem Genauigkeitskompromiss. Das ist deutlich schwerer als LLaVA 7B oder MiniCPM-V.

Kann ich Idefics über Ollama ausführen?

Zum Zeitpunkt dieses Tests nicht. Idefics ist derzeit nicht in Ollamas Modellbibliothek verpackt, und die GGUF-Konvertierung hat offene Kompatibilitätsprobleme, die auf Ollamas eigenem GitHub-Repository verfolgt werden. Idefics läuft stattdessen über Hugging Face Transformers.

Basiert Idefics auf DeepMinds Flamingo?

Idefics wird auf seiner eigenen Modellkarte ausdrücklich als "eine offen zugängliche Nachbildung von Flamingo, einem von DeepMind entwickelten proprietären Vision-Language-Modell" beschrieben. Idefics2 und Idefics3 sind unabhängig architektierte Nachfolger desselben HuggingFace-M4-Teams.

Fazit

Idefics ist eine tatsächlich nützliche Familie offener Vision-Language-Modelle, und Idefics3 hält sich speziell gut für dokumentenlastige OCR- und Multi-Bild-Denkaufgaben, bei denen sein VRAM-Bedarf von etwa 18-20 GB erschwinglich ist. Es ist jedoch kein direkter Ersatz für leichtere lokale Vision-Modelle: Es benötigt deutlich mehr GPU-Speicher als LLaVA 7B oder MiniCPM-V, hat zum Zeitpunkt dieses Tests keine Ollama- oder llama.cpp-Verpackung, und seine Lizenzsituation unterscheidet sich tatsächlich je nach Generation — Idefics2s sauberer Apache-2.0-Stack ist rechtlich etwas völlig anderes als Idefics3s Verpflichtungen aus der Llama-3.1-Community-Lizenz. Wählen Sie Idefics3 für Dokumentenverständnis und OCR-Qualität, wenn Sie den GPU-Speicher dafür haben; wählen Sie speziell Idefics2, wenn ein reiner Apache-2.0-Stack wichtig ist; und wählen Sie LLaVA, über PromptQuorums LLaVA-Test, oder eines der Modelle im Ollama-Vision-Modelle-Leitfaden, für leichtere lokale Hardware oder Ollama-basierte Workflows.

Quellen

← Zurück zu Lokale LLMs Pro