Skip to main content
PromptQuorum
Startseite/Das vollständige lokale LLM Software-Verzeichnis: 224 Tools für KI auf eigener Hardware (2026)
Overview & Reference

Das vollständige lokale LLM Software-Verzeichnis: 224 Tools für KI auf eigener Hardware (2026)

·28 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Dieses aktualisierte 2026-Verzeichnis (zuletzt aktualisiert im August 2026) erfasst 224 lokale LLM-Tools, Deployment-Tools, Frameworks und visuelle KI-Systeme in zehn Schichten. Das lokale LLM-Ökosystem 2026 gliedert sich klar in zehn Schichten. Laufzeitumgebungen (Ollama, llama.cpp, vLLM) führen Token durch das Modell; Desktop-Apps (LM Studio, Jan, GPT4All) kapseln eine Laufzeit in einer Chat-Oberfläche; Web-UIs (Open WebUI, LibreChat) tun dasselbe im Browser; IDE-Integrationen (Continue.dev, PearAI, Windsurf) binden ein lokales Modell in Ihren Code-Editor ein; Terminal-Tools (Aider, ShellGPT, aichat) übernehmen Kommandozeilen-Workflows; RAG-Systeme (AnythingLLM, PrivateGPT) zeigen es auf Ihre eigenen Dokumente; Agenten-Frameworks (LangChain, CrewAI, LangGraph, SuperAGI) verketten Aufrufe zu mehrstufigen Workflows; Sprach- und Audio-Stacks (Whisper.cpp, Piper, XTTS) erweitern es über Text hinaus; Mobile-Clients (MLC Chat, PocketPal AI) bringen es aufs Smartphone; spezialisierte Produktivitäts-Plugins (Obsidian, Logseq, AutoGPT) betten es in bereits genutzte Werkzeuge ein; und Bildgenerierungs-Systeme (Stable Diffusion, ComfyUI, Invoke AI) übernehmen visuelle KI-Aufgaben. Wählen Sie zuerst eine Laufzeitumgebung (Ollama für fast alle), und fügen Sie dann eine oder zwei Schichten darüber hinzu. Das Verzeichnis unten listet jedes erwähnenswerte Projekt je Schicht mit seiner Lizenz auf, damit Sie einen Stack planen können, der bei Bedarf von Anfang bis Ende quelloffen ist.**

224 lokale LLM-Tools über 7 Kategorien — Run & Serve, Chat & Assistants, Code & Development, Knowledge & Retrieval, Voice & Audio, Images & Video und Train & Operate. Filtern, suchen und vergleichen Sie unten.

224 Tools

Vollständig lokal: 121Hybrid: 103Cloud: 0

Ollama

Inferenz-Engines
100 % lokal

Einfachster Einstieg — Ein-Befehl-Installation, OpenAI-kompatible API, umfangreiche Modellbibliothek

Läuft mit eigener EngineKostenlos
Hängt vom verwendeten Modell ab
KommandozeileDesktop-AppmacOSWindowsLinux
180,722283 Artikel
Ausführlicher Test

llama.cpp

Inferenz-Engines
100 % lokal

Grundlegende C++-Engine hinter den meisten anderen Tools, läuft überall einschließlich Apple Silicon

Läuft mit eigener EngineKostenlos
Hängt vom verwendeten Modell ab
KommandozeileBibliothek / SDKmacOSWindowsLinux
126,800150 Artikel
Ausführlicher Test

vLLM

Inferenz-Engines
100 % lokal

Hochdurchsatz-Serving für Multi-User-GPU-Deployments

Läuft mit eigener EngineKostenlos
Hängt vom verwendeten Modell ab
KommandozeileBibliothek / SDKLinux
90,80091 Artikel
Ausführlicher Test

text-generation-webui

Inferenz-Engines
100 % lokal

Power-User-UI mit umfangreichem Plugin-Ökosystem

Läuft mit eigener EngineKostenlos
Hängt vom verwendeten Modell ab
Web-AppKommandozeileWindowsLinuxmacOS
47,60015 Artikel
Ausführlicher Test

exo

Inferenz-Engines
100 % lokal

Verteilte Inferenz – große Modelle ausführen, indem Rechenleistung mehrerer alltäglicher Geräte gebündelt wird

Läuft mit eigener EngineKostenlos
Hängt vom verwendeten Modell ab
KommandozeilemacOSLinux
47,2602 Artikel
Ausführlicher Test

SGLang

Inferenz-Engines
100 % lokal

Strukturiertes Inferenz-Serving für Agenten-Pipelines

Läuft mit eigener EngineKostenlos
Hängt vom verwendeten Modell ab
KommandozeileBibliothek / SDKLinux
33,5009 Artikel
Ausführlicher Test

Llamafile

Inferenz-Engines
100 % lokal

Portable Ein-Datei-LLM-Ausführung von Mozilla

Läuft mit eigener EngineKostenlos
Hängt vom verwendeten Modell ab
KommandozeilemacOSWindowsLinux
25,9006 Artikel
Ausführlicher Test

MLC LLM

Inferenz-Engines
100 % lokal

Laufzeitumgebung für Mobile- und Edge-Geräte

Läuft mit eigener EngineKostenlos
Hängt vom verwendeten Modell ab
Bibliothek / SDKMobile AppmacOSWindowsLinuxiOSAndroid
23,1346 Artikel
Ausführlicher Test

oMLX

Inferenz-Engines
100 % lokal

MLX-basierter lokaler Inferenzserver für Apple Silicon mit seitenweisem SSD-Caching, entwickelt zum Antrieb lokaler Coding-Agenten

Läuft mit eigener EngineKostenlos
Claude CodeCursorOpenClaw
Hängt vom verwendeten Modell ab
Desktop-AppKommandozeilemacOS
21,8596 Artikel
Ausführlicher Test

TensorRT-LLM

Inferenz-Engines
100 % lokal

NVIDIA-optimierte Inferenz für Enterprise-GPU-Setups

Läuft mit eigener EngineKostenlos
Hängt vom verwendeten Modell ab
KommandozeileBibliothek / SDKWindowsLinux
14,50010 Artikel
Ausführlicher Test

OpenLLM

Inferenz-Engines
Hybrid

Selbst hostbarer Inferenzserver, der Open-Source-LLMs wie DeepSeek und Llama hinter einer OpenAI-kompatiblen API bereitstellt

Läuft mit eigener EngineKostenlos
LlamaDeepSeekQwen
Hängt vom verwendeten Modell ab
KommandozeileBibliothek / SDK
12,5351 Artikel
Ausführlicher Test

KoboldCpp

Inferenz-Engines
100 % lokal

Schlanker llama.cpp-Wrapper mit integrierter Benutzeroberfläche

Läuft mit eigener EngineKostenlos
Hängt vom verwendeten Modell ab
KommandozeileWeb-AppWindowsLinuxmacOS
11,60013 Artikel
Ausführlicher Test

MLX-LM

Inferenz-Engines
100 % lokal

Apple-Silicon-native Laufzeitumgebung von Apple Research

Läuft mit eigener EngineKostenlos
Hängt vom verwendeten Modell ab
KommandozeileBibliothek / SDKmacOS
8,90010 Artikel
Ausführlicher Test

NVIDIA Dynamo

Inferenz-Engines
100 % lokal

Selbst gehostetes, für Rechenzentren skaliertes Framework für verteilte Inferenz-Bereitstellung großer LLM-Deployments über mehrere GPUs und Knoten

Benötigt Ollama/LM StudioKostenlos
vLLMTensorRT-LLMSGLangKubernetes
Hängt vom verwendeten Modell ab
KommandozeileBibliothek / SDKLinux
8,1133 Artikel
Ausführlicher Test

LMDeploy

Inferenz-Engines
100 % lokal

Selbst gehostetes Toolkit zum Komprimieren, Quantisieren und Bereitstellen von LLMs mit einer durchsatzstarken, OpenAI-kompatiblen Inferenz-Engine

Läuft mit eigener EngineKostenlos
InternLMLlamaQwenBaichuanDeepSeek
Hängt vom verwendeten Modell ab
KommandozeileBibliothek / SDKLinux
8,0805 Artikel
Ausführlicher Test

TurboFieldfare

Inferenz-Engines
100 % lokal

Native Swift- und Metal-Laufzeitumgebung, die Gemma 4 26B-A4B lokal mit rund 2 GB RAM auf jedem M-Series-MacBook ausführt

Läuft mit eigener EngineKostenlos
Gemma
Mind. 2 GB RAM
Desktop-AppKommandozeilemacOS
6,7682 Artikel
Ausführlicher Test

Shimmy

Inferenz-Engines
100 % lokal

Einzelbinärer, reiner Rust-Inferenzserver mit OpenAI-Kompatibilität, der lokale GGUF- und SafeTensors-Modelle ohne Python- oder llama.cpp-Abhängigkeit bereitstellt

Läuft mit eigener EngineKostenlos
GGUFSafeTensors
Hängt vom verwendeten Modell ab
KommandozeilemacOSWindowsLinux
5,8902 Artikel
Ausführlicher Test

ExLlamaV2

Inferenz-Engines
100 % lokal

Schnelle quantisierte Inferenz, optimiert für RTX-GPUs

Läuft mit eigener EngineKostenlos
Mind. 8 GB VRAM
KommandozeileBibliothek / SDKWindowsLinux
4,6004 Artikel
Ausführlicher Test

LoRAX

Inferenz-Engines
100 % lokal

Selbst gehosteter Inferenz-Server, der Tausende feingetunte LoRA-Adapter auf einer einzigen GPU bereitstellt, ohne Kosten pro Adapter

Eigene Engine + externKostenlos
HuggingFacePEFTLudwigDocker
Hängt vom verwendeten Modell ab
KommandozeileBibliothek / SDKLinux
3,8322 Artikel
Ausführlicher Test

Rapid-MLX

Inferenz-Engines
100 % lokal

OpenAI-kompatible lokale Inferenz-Engine für Apple Silicon, als direkt einsetzbares Backend für Claude Code, Cursor und Aider gebaut

Läuft mit eigener EngineKostenlos
Claude CodeCursorAiderCline
Mind. 8 GB RAM
KommandozeilemacOS
3,7734 Artikel
Ausführlicher Test

claude-code-local

Inferenz-Engines
100 % lokal

MLX-native lokale Server-Lösung, mit der Claude Code zu 100% auf dem Gerät unter Apple Silicon läuft — ohne Cloud oder API-Gebühren

Läuft mit eigener EngineKostenlos
Claude Code
Hängt vom verwendeten Modell ab
KommandozeilemacOS
3,3141 Artikel
Ausführlicher Test

Lucebox

Inferenz-Engines
100 % lokal

Lokaler LLM-Inferenz-Server mit handoptimierten Kernels und spekulativem Decoding für bestimmte Consumer-GPUs

Läuft mit eigener EngineKostenlos
Claude CodeCodexOpenCodeOpen WebUIGGUF
Hängt vom verwendeten Modell ab
KommandozeileBibliothek / SDKLinux
2,8671 Artikel
Ausführlicher Test

vllm-mlx

Inferenz-Engines
100 % lokal

OpenAI- und Anthropic-kompatibler Inferenz-Server, der vLLM-artiges kontinuierliches Batching per nativem MLX auf Apple Silicon bringt.

Läuft mit eigener EngineKostenlosUnterstützt MCP
Claude CodeOpenAI APIAnthropic API
Hängt vom verwendeten Modell ab
KommandozeilemacOS
1,5803 Artikel
Ausführlicher Test

mlx-serve

Inferenz-Engines
100 % lokal

Nativer Zig-Inferenz-Server für Apple Silicon, der MLX- und GGUF-Modelle über OpenAI- und Anthropic-kompatible APIs bereitstellt, inklusive macOS-Menüleisten-App.

Läuft mit eigener EngineKostenlosUnterstützt MCP
Claude CodeContinueCursorOpen WebUI
Hängt vom verwendeten Modell ab
KommandozeileDesktop-AppmacOS
1,3731 Artikel
Ausführlicher Test

Diese Seite enthält Verweislinks zu Produkten von Drittanbietern. PromptQuorum ist an keinem Partnerprogramm beteiligt — es sind reine Referenzlinks, die keine Provision erzielen. Das Anklicken von Links und Ihre nächsten Schritte liegen in Ihrer eigenen Verantwortung. Diese Links stellen keine Billigung oder Verifizierung durch PromptQuorum dar.

Praktische Einsatz-Stacks

Für Leserinnen und Leser, die nicht alle neun Kategorien durcharbeiten möchten: Wählen Sie den nächstpassenden Stack und übernehmen Sie ihn. Jede Zeile verbindet ein konkretes Ziel mit einer bewährten Kombination und der tatsächlichen Hardware-Mindestanforderung.

Ziel
Stack
Hardware-Mindestanforderung
Einfacher ChatLM Studio standalone16 GB RAM, keine GPU erforderlich
Bestes Gleichgewicht für Power-UserOllama + Open WebUI16 GB RAM, GPU optional
Dokumenten-ChatOllama + AnythingLLM16 GB RAM, GPU optional
CodingOllama + Continue.dev16 GB RAM + GPU empfohlen
Rollenspiel / Kreatives SchreibenKoboldCpp + SillyTavern16 GB RAM, GPU empfohlen
Datenschutz-kritischer EinsatzOllama + Open WebUI + PrivateGPT32 GB RAM + 12 GB VRAM
Mobile / UnterwegsMLC Chat oder PocketPal AIiPhone 13+ / Pixel 7+
Apple SiliconOllama (MLX-Backend) oder LM StudioM2/M3/M4/M5 mit 16+ GB Unified Memory
Multi-User-TeamvLLM + Open WebUI32+ GB RAM + mehrere GPUs
9 bewährte lokale LLM-Stacks nach Anwendungsziel: von LM Studio standalone (16 GB RAM, ohne GPU) bis vLLM + Open WebUI für Teams (32 GB RAM + Multi-GPU), mit Ollama + Open WebUI als empfohlenem Standardsetup mit 16 GB RAM.
9 bewährte lokale LLM-Stacks nach Anwendungsziel: von LM Studio standalone (16 GB RAM, ohne GPU) bis vLLM + Open WebUI für Teams (32 GB RAM + Multi-GPU), mit Ollama + Open WebUI als empfohlenem Standardsetup mit 16 GB RAM.

Wichtigste Erkenntnisse

  • Zehn Schichten, 224 Projekte, eine Übersichtskarte. Laufzeitumgebungen, Desktop-Apps, Web-UIs, IDE-Integrationen, Terminal-Tools, RAG-Systeme, Agenten-Frameworks, Sprache/Audio/Vision, Mobile-Clients, spezialisierte Produktivitäts-Plugins und Bildgenerierung — fast jedes bekannte Projekt aus 2026 lässt sich exakt einer dieser Schichten zuordnen.
  • Wählen Sie zuerst eine Laufzeitumgebung. Ollama ist für ~95 % der Leserinnen und Leser die richtige Standardwahl; llama.cpp ist die grundlegende Engine hinter den meisten anderen Tools; vLLM ist die Produktionsalternative für Multi-User-Setups auf echten GPUs.
  • Die meisten Schichten oberhalb der Laufzeitumgebung sind optional. Eine Desktop-App ODER ein Web-UI reicht für den Chat aus. Fügen Sie eine IDE-Integration nur dann hinzu, wenn Sie Code-Unterstützung wünschen; Terminal-Tools nur dann, wenn Sie CLI-Workflows möchten; ein RAG-System nur dann, wenn Sie mit eigenen Dokumenten chatten möchten; ein Agenten-Framework nur dann, wenn One-Shot-Aufrufe nicht mehr ausreichen; Bildgenerierung nur dann, wenn Sie visuelle Ausgaben benötigen.
  • Lizenzen sind relevant für den kommerziellen Einsatz. MIT und Apache 2.0 dominieren das Ökosystem. AGPL findet sich bei einigen UIs (text-generation-webui, KoboldCpp, Jan, SillyTavern) — für den Privatgebrauch unproblematisch, bei kommerziellen Deployments sorgfältig prüfen. Die Spalte „Lizenz" unten benennt jede Lizenz explizit.
  • Multi-Tool-Stacks sind die Norm. Ollama + Open WebUI + AnythingLLM + Continue.dev + Stable Diffusion ist ein Single-Machine-Setup, das Chat, RAG, Coding und Bildgenerierung ohne Kompromisse abdeckt. Die Tabelle „Praktische Einsatz-Stacks" unten nennt die Rezepte, die in 2026 tatsächlich funktionieren.
Die 10 Schichten eines lokalen LLM-Stacks: 224 aktiv gepflegte Projekte von Laufzeiten (Ollama, llama.cpp, vLLM) über Desktop-Apps (LM Studio, Jan, GPT4All), Web-UIs, IDE-Editoren, Terminal-Tools, RAG-Systeme, Agenten-Frameworks, Sprache/Audio, Mobile-Clients, spezialisierte Produktivitäts-Tools und Bildgenerierung (Stable Diffusion, ComfyUI).
Die 10 Schichten eines lokalen LLM-Stacks: 224 aktiv gepflegte Projekte von Laufzeiten (Ollama, llama.cpp, vLLM) über Desktop-Apps (LM Studio, Jan, GPT4All), Web-UIs, IDE-Editoren, Terminal-Tools, RAG-Systeme, Agenten-Frameworks, Sprache/Audio, Mobile-Clients, spezialisierte Produktivitäts-Tools und Bildgenerierung (Stable Diffusion, ComfyUI).

Aktualität des Verzeichnisses

Dieses Verzeichnis wird alle drei Monate überprüft und zwischen den Überprüfungen mit gezielten monatlichen Updates aktualisiert — zuletzt aktualisiert im August 2026, nächste planmäßige Aktualisierung November 2026. Die Erweiterung im August 2026 hat 72+ neue Tools über alle Schichten hinweg ergänzt, Sprache/Multimodal in drei fokussierte Schichten aufgeteilt (STT, TTS, Vision), Coding-Assistenten in IDE-Integrationen (4a) und Terminal-Tools (4b) aufgeteilt und eine vollständig neue Bildgenerierungs-Schicht hinzugefügt. Alle Links und Lizenzen wurden erneut geprüft; neue Einträge (PearAI, Windsurf, Sourcegraph Cody, SuperAGI, Leon AI, Draw Things, Fooocus, StableSwarmUI und weitere) wurden auf aktive Pflege verifiziert. Aufnahmekriterien: Das Projekt wird aktiv gepflegt (Commits in den letzten 90 Tagen), verfügt über eine nachweisbare Open-Source-Lizenz oder eine klare Aussage zur kommerziellen Nutzbarkeit, und hat entweder einen relevanten Nutzeranteil im Jahr 2026 oder füllt eine Schicht aus, die sonst leer bliebe. Projekte, die länger als zwei Release-Zyklen inaktiv bleiben, werden entfernt; neue Einträge, die die Kriterien erfüllen, werden bei der nächsten Überprüfung aufgenommen. Einen Vorschlag für die Aufnahme können Sie über ein Issue oder einen Pull Request im PromptQuorum-Repository einreichen — bitte Projekt-URL, Lizenz und eine Kurzbeschreibung im Format der Tabellen oben beifügen.

Hinweis für DACH-Unternehmen: Für Organisationen in Deutschland, Österreich und der Schweiz empfiehlt sich der Einsatz von Tools mit MIT- oder Apache-2.0-Lizenz, da diese die klarste Rechtsgrundlage für den kommerziellen Einsatz bieten. Bei der Verarbeitung personenbezogener Daten ist zu prüfen, ob lokale Inferenz als Auftragsverarbeitung im Sinne von Art. 28 DSGVO einzustufen ist — in der Regel liegt sie außerhalb des Anwendungsbereichs, solange keine Daten das lokale System verlassen. Der BSI-Grundschutz-Katalog (insbesondere die Bausteine SYS und APP) bietet einen praxisnahen Rahmen für die Absicherung von Self-Hosted-LLM-Infrastruktur in deutschen Unternehmen. Diese Einschätzung ersetzt keine Rechtsberatung — für eine rechtsverbindliche Bewertung Ihrer konkreten Verarbeitungssituation konsultieren Sie einen auf DSGVO spezialisierten Rechtsanwalt oder Ihren Datenschutzbeauftragten.

Quellen

Häufig gestellte Fragen

Was ist der Unterschied zwischen einer lokalen LLM-Laufzeitumgebung und einer Desktop-App?

Eine Laufzeitumgebung (Ollama, llama.cpp, vLLM) ist die Engine, die Modellgewichte lädt und eine API bereitstellt — typischerweise OpenAI-kompatibel. Eine Desktop-App (LM Studio, Jan, GPT4All) ist eine Chat-Oberfläche, die im Hintergrund eine Laufzeitumgebung aufruft. Manche Apps bündeln ihre eigene Laufzeit (LM Studio enthält llama.cpp), andere setzen eine separate Installation voraus (Open WebUI ruft Ollama auf). Die Laufzeitumgebung entscheidet, was technisch möglich ist; die App entscheidet, was bequem nutzbar ist.

Kann ich mehrere Tools aus dieser Liste gleichzeitig verwenden?

Ja — die meisten Stacks kombinieren 2–4 Tools. Ein verbreitetes Setup: Ollama als Laufzeitumgebung, Open WebUI für den Chat, AnythingLLM für den Dokumenten-Chat und Continue.dev für das Coding — alle vier laufen gegen dieselbe Ollama-Instanz auf einem einzigen Rechner. Die Tabelle „Praktische Einsatz-Stacks" oben nennt die Rezepte, die konfliktfrei funktionieren.

Welche Tools funktionieren vollständig offline ohne Telemetrie?

Ollama, llama.cpp, vLLM, Jan, GPT4All, Open WebUI, AnythingLLM, PrivateGPT, Continue.dev, Aider, KoboldCpp, Llamafile, MLX-LM und die meisten AGPL/MIT-lizenzierten Apps in diesem Verzeichnis sind nach dem Modell-Download vollständig offline nutzbar. LM Studio und einige proprietäre Tools verfügen über optionale Analysefunktionen, die in den Einstellungen deaktiviert werden können — überprüfen Sie dies durch einen Paketmitschnitt nach der Installation. Browser-basierte UIs (Open WebUI, LibreChat) sind lokal, wenn sie mit einem lokalen Backend konfiguriert sind.

Sind einige dieser Tools kommerziell lizenziert (nicht frei für kommerzielle Nutzung)?

Eine Handvoll: LM Studio, Msty, Backyard AI, Layla und Cursor sind proprietär — in der Regel kostenlos nutzbar, aber nicht weiterverteilbar; kommerzielle Konditionen variieren je Anbieter. Private LLM ist kostenpflichtig. AGPL-lizenzierte Tools (Jan, KoboldCpp, text-generation-webui, SillyTavern, Khoj, Copilot for Obsidian) sind für jeden Zweck einschließlich kommerzieller Nutzung frei, die AGPL-Bedingungen verlangen jedoch Quelloffenlegung, wenn Sie sie modifiziert öffentlich hosten. Apache-2.0- und MIT-Projekte (die Mehrheit) sind in jedem Kontext einschließlich kommerzieller Nutzung ohne wesentliche Auflagen verwendbar.

Welche Tools unterstützen Apple Silicon (M-Serie) nativ?

Ollama, llama.cpp, MLX-LM, LM Studio, Jan, Enchanted, GPT4All, MLC Chat, AnythingLLM und die meisten Electron/Tauri-Apps laufen nativ auf Apple Silicon und nutzen das Metal-Backend. MLX-LM ist Apple-spezifisch und auf M-Series-Geräten für große Modelle am schnellsten. vLLM, TensorRT-LLM und ExLlamaV2 sind NVIDIA-fokussiert und laufen auf Apple Silicon entweder nicht oder nur eingeschränkt — für Apple-Nutzer ist Ollama mit Metal-Backend die Standardempfehlung.

Unterstützen alle diese Tools das GGUF-Modellformat?

GGUF ist das native Format für llama.cpp und alle Tools, die darauf aufbauen (Ollama, LM Studio, Jan, GPT4All, KoboldCpp, Llamafile). vLLM und TensorRT-LLM verwenden eigene optimierte Formate (typischerweise AWQ oder FP16) für höheren Durchsatz. ExLlamaV2 nutzt EXL2-Quantisierung. MLX-LM verwendet MLX-konvertierte Gewichte. Die meisten aufgeführten Tools akzeptieren GGUF; einige (vLLM, TensorRT-LLM, ExLlamaV2, MLX-LM) erfordern einen einmaligen Konvertierungsschritt aus den originalen Hugging Face-Gewichten.

Welche Tools eignen sich für Nutzerinnen und Nutzer ohne Programmiererfahrung?

GPT4All bietet die einfachste Installation (ein Klick, läuft ab 8 GB RAM), auch wenn die eigenen Updates zuletzt seltener geworden sind. LM Studio ist das funktionsreichste Tool ohne Terminal-Nutzung. Jan ist die datenschutzfreundlichste No-Code-Option. Für Dokumenten-Chat ohne Kommandozeile ist AnythingLLM am einfachsten. Alle vier sind in der Kategorie Desktop-GUI-Anwendungen oben aufgeführt.

Kann ich diese Tools auf einem Server betreiben und remote darauf zugreifen?

Die meisten Server-fähigen Tools (Ollama, vLLM, LocalAI, Open WebUI, LibreChat, PrivateGPT, AnythingLLM) stellen eine HTTP-API bereit und binden an eine in den Einstellungen konfigurierbare Netzwerkschnittstelle. Standardmuster: Ollama auf einem Heimserver oder VPS betreiben, eine UI auf Laptop oder Smartphone, die auf die Server-IP zeigt. Behandeln Sie die API wie jeden Webdienst — binden Sie sie an localhost hinter einem Reverse-Proxy oder an ein privates Netzwerk mit geeigneter Authentifizierung. Open WebUI enthält Multi-User-Unterstützung von Haus aus.

Welche Tools unterstützen Multi-User- / Team-Setups?

Open WebUI, LibreChat, h2oGPT, AnythingLLM (mit aktivierten Admin-Funktionen) und Dify sind für den Multi-User-Einsatz ausgelegt, mit rollenbasiertem Zugriff und nutzerspezifischem Gesprächsverlauf. vLLM ist die richtige Serving-Schicht darunter, wenn gleichzeitige Inferenz relevant ist — es bündelt Anfragen mehrerer Nutzer für einen Durchsatz, der mit Ollama bei mehr als ~3 gleichzeitigen Anfragen nicht erreichbar ist.

Wie häufig wird dieses Verzeichnis aktualisiert?

Alle drei Monate, mit gezielten monatlichen Updates dazwischen — zuletzt überprüft im Juli 2026, die nächste planmäßige Aktualisierung ist im November 2026. Monatliche Änderungen (ein Projekt wird inaktiv, ein neues Tool gewinnt relevanten Marktanteil, eine Lizenz ändert sich) werden als Patch in den bestehenden Eintrag eingepflegt. Vollständig neue Kategorien oder Schichten warten auf die vierteljährliche Überarbeitung, um die Struktur stabil zu halten.

Kann ich Bildgenerierung lokal ohne Cloud-Aufrufe durchführen?

Ja — Stable Diffusion, ComfyUI, Invoke AI, AUTOMATIC1111 WebUI und weitere Tools aus Schicht 10 laufen vollständig auf lokaler Hardware. Stable Diffusion benötigt mindestens 6 GB VRAM (RTX 3060, RTX 4060 oder vergleichbar); Fooocus und andere optimierte UIs laufen bereits auf Karten mit 4–6 GB. Real-ESRGAN vergrößert generierte Bilder; ControlNet ergänzt räumliche Steuerung (Kanten, Posen, Tiefenkarten); AnimateDiff generiert Video aus Text. Alle laufen, ohne Daten an externe Server zu senden.

Muss ich bei der Verwendung dieser Tools die DSGVO beachten?

Das hängt davon ab, welche Daten Sie verarbeiten. Lokale Inferenz — d. h. Modell und Daten verbleiben auf Ihrem eigenen System — ist datenschutzrechtlich grundsätzlich vorteilhaft, weil keine personenbezogenen Daten an externe Server übertragen werden. Verarbeiten Sie dennoch personenbezogene Daten (z. B. Kundendokumente, Mitarbeiterdaten), gelten die DSGVO-Grundsätze (Art. 5–11) sowie ggf. Art. 28 (Auftragsverarbeitung), falls ein Dienstleister die Infrastruktur betreibt. Der BSI-Grundschutz-Katalog (Bausteine SYS.1.1 und APP.3.1) bietet einen praxisnahen Sicherheitsrahmen für Self-Hosted-LLM-Systeme in deutschen Organisationen. Für eine rechtsverbindliche Einschätzung sollten Sie einen auf DSGVO spezialisierten Rechtsanwalt oder Datenschutzbeauftragten hinzuziehen.

Sind diese Tools für den deutschen Mittelstand geeignet?

Ja — für mittelständische Unternehmen in Deutschland, Österreich und der Schweiz bieten lokale LLM-Stacks konkrete Vorteile: Datensouveränität (keine Cloud-Abhängigkeit, keine Datenübermittlung an US-Anbieter), planbare Kosten (keine token-basierten Nutzungsgebühren) und Anpassbarkeit (Feinabstimmung auf Branchensprache möglich). Empfohlene Einstiegskonfiguration für den Mittelstand: Ollama als Laufzeitumgebung, Open WebUI für den Team-Chat, AnythingLLM für interne Wissensdatenbanken. Für IT-Sicherheitsanforderungen nach BSI-Grundschutz empfiehlt sich der Einsatz von Tools mit MIT- oder Apache-2.0-Lizenz und eine Netzwerksegmentierung des LLM-Servers vom Produktionsnetz.

Folien unten ansehen oder als PDF herunterladen. Präsentation herunterladen (PDF)

About this data

This directory is compiled with AI-assisted research from public sources (project READMEs, official sites, GitHub repositories). It is not exhaustive and may contain errors — hardware requirements, pricing, and platform support change frequently and some fields have not been independently verified yet.

Most entries carry no status badge: they are listed from public sources but not independently reviewed. A "Verified" badge means core facts (license, platforms, pricing) have been manually checked. A "PromptQuorum-tested" badge is only shown for tools PromptQuorum has actually installed and run — most entries do not have this badge yet.

The "PromptQuorum-tested" badge is reserved for tools we have personally installed and run — an untested tool never carries it, regardless of popularity or stars.

Spotted something wrong? Email hello@promptquorum.com and we will correct it.

← Zurück zu Lokale LLMs Pro