Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/Das vollständige lokale LLM Software-Verzeichnis: 88 Tools für KI auf eigener Hardware (2026)
Overview & Reference

Das vollständige lokale LLM Software-Verzeichnis: 88 Tools für KI auf eigener Hardware (2026)

·20 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Dieses aktualisierte 2026-Verzeichnis (zuletzt aktualisiert im Juli 2026) erfasst 88 lokale LLM-Tools, Deployment-Tools und Frameworks in neun Schichten. Das lokale LLM-Ökosystem 2026 gliedert sich klar in diese Schichten. Laufzeitumgebungen (Ollama, llama.cpp, vLLM) führen Token durch das Modell; Desktop-Apps (LM Studio, Jan, GPT4All) kapseln eine Laufzeit in einer Chat-Oberfläche; Web-UIs (Open WebUI, LibreChat) tun dasselbe im Browser; Coding-Assistenten (Continue.dev, Cline, Aider) binden ein lokales Modell in Ihren Editor ein; RAG-Systeme (AnythingLLM, PrivateGPT) zeigen es auf Ihre eigenen Dokumente; Agenten-Frameworks (LangChain, CrewAI, LangGraph) verketten Aufrufe zu mehrstufigen Workflows; Sprach- und Multimodal-Stacks (Whisper.cpp, Piper, LLaVA) erweitern es über Text hinaus; Mobile-Clients (MLC Chat, PocketPal AI) bringen es aufs Smartphone; und spezialisierte Produktivitäts-Plugins (Obsidian, Logseq, AutoGPT) betten es in bereits genutzte Werkzeuge ein. Wählen Sie zuerst eine Laufzeitumgebung (Ollama für fast alle), und fügen Sie dann eine oder zwei Schichten darüber hinzu. Das Verzeichnis unten listet jedes erwähnenswerte Projekt je Schicht mit seiner Lizenz auf, damit Sie einen Stack planen können, der bei Bedarf von Anfang bis Ende quelloffen ist.**

Dies ist ein aktualisiertes 2026-Verzeichnis von 88 lokalen LLM-Tools, Apps, Frameworks und Deployment-Software — zuletzt aktualisiert im Juli 2026. Das lokale LLM-Ökosystem ist 2026 so groß geworden, dass die falsche Tool-Wahl am Anfang Stunden, nicht Minuten kostet. Dieses Verzeichnis katalogisiert 88 aktiv gepflegte Projekte in neun Schichten — Laufzeitumgebungen, Desktop-Apps, Web-UIs, Coding-Assistenten, RAG-Systeme, Agenten-Frameworks, Sprache und Multimodal, Mobile-Clients und spezialisierte Produktivitäts-Plugins — jeweils mit Beschreibung, Lizenz und primärer URL. Ob Sie lokale LLM-Tools, Deployment-Tools für Mehrbenutzer-Serving oder Frameworks zum Bau von Agenten auswählen — nutzen Sie es als Übersichtskarte des Ist-Zustands, bevor Sie sich für einen Stack entscheiden; jede Kategorie endet mit einem Link zum vertiefenden PromptQuorum-Vergleichsartikel für diese Schicht.

Diese Seite enthält Verweislinks zu Produkten von Drittanbietern. PromptQuorum ist an keinem Partnerprogramm beteiligt — es sind reine Referenzlinks, die keine Provision erzielen. Das Anklicken von Links und Ihre nächsten Schritte liegen in Ihrer eigenen Verantwortung. Diese Links stellen keine Billigung oder Verifizierung durch PromptQuorum dar.

Präsentation: Das vollständige lokale LLM Software-Verzeichnis: 88 Tools für KI auf eigener Hardware (2026)

Die Präsentation zeigt: eine 9-Schichten-Übersicht des lokalen LLM-Stacks (von Laufzeitumgebungen bis spezialisierte Plugins); 6-Tool-Vergleichstabellen für Laufzeitumgebungen (Ollama/llama.cpp/vLLM), Desktop-Apps, Web-UIs, Coding-Assistenten, RAG-Systeme und Agenten-Frameworks; eine 9-Zeilen-Stacks-Tabelle (Ziel, Stack, Hardware-Minimum); eine 5-Schritte-Stack-Auswahlhilfe; sowie FAQ. Als PDF-Referenzkarte für lokale LLM-Software herunterladen.

Folien unten ansehen oder als PDF herunterladen. Präsentation herunterladen (PDF)

Wichtigste Erkenntnisse

  • Neun Schichten, 88 Projekte, eine Übersichtskarte. Laufzeitumgebungen, Desktop-Apps, Web-UIs, Coding-Assistenten, RAG-Systeme, Agenten-Frameworks, Sprache/Multimodal, Mobile-Clients und spezialisierte Produktivitäts-Plugins — fast jedes bekannte Projekt aus 2026 lässt sich exakt einer dieser Schichten zuordnen.
  • Wählen Sie zuerst eine Laufzeitumgebung. Ollama ist für ~95 % der Leserinnen und Leser die richtige Standardwahl; llama.cpp ist die grundlegende Engine hinter den meisten anderen Tools; vLLM ist die Produktionsalternative für Multi-User-Setups auf echten GPUs.
  • Die meisten Schichten oberhalb der Laufzeitumgebung sind optional. Eine Desktop-App ODER ein Web-UI reicht für den Chat aus. Fügen Sie eine Coding-Integration nur dann hinzu, wenn Sie IDE-Integration benötigen; ein RAG-System nur dann, wenn Sie mit eigenen Dokumenten chatten möchten; ein Agenten-Framework nur dann, wenn One-Shot-Aufrufe nicht mehr ausreichen.
  • Lizenzen sind relevant für den kommerziellen Einsatz. MIT und Apache 2.0 dominieren das Ökosystem. AGPL findet sich bei einigen UIs (text-generation-webui, KoboldCpp, Jan, SillyTavern) — für den Privatgebrauch unproblematisch, bei kommerziellen Deployments sorgfältig prüfen. Die Spalte „Lizenz" unten benennt jede Lizenz explizit.
  • Multi-Tool-Stacks sind die Norm. Ollama + Open WebUI + AnythingLLM + Continue.dev ist ein Single-Machine-Setup, das Chat, RAG und Coding ohne Kompromisse abdeckt. Die Tabelle „Praktische Einsatz-Stacks" unten nennt die Rezepte, die in 2026 tatsächlich funktionieren.
Die 9 Schichten eines lokalen LLM-Stacks: 88 aktiv gepflegte Projekte von Laufzeiten (Ollama, llama.cpp, vLLM) über Desktop-Apps, Web-UIs und Coding-Assistenten bis zu RAG-Systemen, Agenten-Frameworks, Sprache & Multimodal, Mobile-Clients und spezialisierten Produktivitäts-Tools.
Die 9 Schichten eines lokalen LLM-Stacks: 88 aktiv gepflegte Projekte von Laufzeiten (Ollama, llama.cpp, vLLM) über Desktop-Apps, Web-UIs und Coding-Assistenten bis zu RAG-Systemen, Agenten-Frameworks, Sprache & Multimodal, Mobile-Clients und spezialisierten Produktivitäts-Tools.

1. Lokale LLM-Laufzeitumgebungen & Inferenz-Engines

Eine Laufzeitumgebung ist die Engine, die Modellgewichte in den Speicher lädt und Eingaben in Token umwandelt. Sie ist die erste Entscheidung in einem lokalen LLM-Stack und schränkt alles darüber ein — jede Desktop-App, jedes Web-UI und jede Coding-Integration ruft letztlich eine Laufzeitumgebung auf. Ollama dominiert 2026 den nutzerseitigen Marktanteil, weil es eine OpenAI-kompatible API und eine Ein-Befehl-Installation mitbringt; llama.cpp ist die C++-Engine unter den meisten anderen Tools; vLLM ist die richtige Wahl, wenn Sie gleichzeitige Anfragen mehrerer Nutzer auf einer echten GPU bedienen müssen.

Ollama

Beschreibung:
Einfachster Einstieg — Ein-Befehl-Installation, OpenAI-kompatible API, umfangreiche Modellbibliothek
Lizenz:
MIT

llama.cpp

Beschreibung:
Grundlegende C++-Engine hinter den meisten anderen Tools, läuft überall einschließlich Apple Silicon
Lizenz:
MIT

vLLM

Beschreibung:
Hochdurchsatz-Serving für Multi-User-GPU-Deployments
Lizenz:
Apache 2.0

LocalAI

Beschreibung:
Drop-in-Ersatz für die OpenAI API, unterstützt mehrere Backends
Lizenz:
MIT

TensorRT-LLM

Beschreibung:
NVIDIA-optimierte Inferenz für Enterprise-GPU-Setups
Lizenz:
Apache 2.0

MLC LLM

Beschreibung:
Laufzeitumgebung für Mobile- und Edge-Geräte
Lizenz:
Apache 2.0

SGLang

Beschreibung:
Strukturiertes Inferenz-Serving für Agenten-Pipelines
Lizenz:
Apache 2.0

ExLlamaV2

Beschreibung:
Schnelle quantisierte Inferenz, optimiert für RTX-GPUs
Lizenz:
MIT

KoboldCpp

Beschreibung:
Schlanker llama.cpp-Wrapper mit integrierter Benutzeroberfläche
Lizenz:
AGPL 3.0

Llamafile

Beschreibung:
Portable Ein-Datei-LLM-Ausführung von Mozilla
Lizenz:
Apache 2.0

MLX-LM

Beschreibung:
Apple-Silicon-native Laufzeitumgebung von Apple Research
Lizenz:
MIT

Vertiefender Vergleich: llama.cpp vs Ollama vs vLLM

Ollama vs llama.cpp vs vLLM im Vergleich: Ollama mit MIT-Lizenz und Ein-Befehl-Installation sowie OpenAI-kompatibler API; llama.cpp als grundlegender MIT-lizenzierter C++-Motor; vLLM als Apache-2.0-Option für GPU-Mehrbenutzer-Deployments.
Ollama vs llama.cpp vs vLLM im Vergleich: Ollama mit MIT-Lizenz und Ein-Befehl-Installation sowie OpenAI-kompatibler API; llama.cpp als grundlegender MIT-lizenzierter C++-Motor; vLLM als Apache-2.0-Option für GPU-Mehrbenutzer-Deployments.

2. Desktop-GUI-Anwendungen

Desktop-Apps kapseln eine Laufzeitumgebung in einer Chat-Oberfläche und einem Modell-Browser. Hier steigen die meisten nicht-technischen Anwenderinnen und Anwender ein, weil kein Terminal-Schritt nötig ist — herunterladen, klicken, chatten. LM Studio, Jan und GPT4All halten 2026 den Großteil der Nutzerbasis; AnythingLLM fungiert gleichzeitig als Desktop-App und RAG-Schicht; Open Interpreter ist der Sonderfall, der einem lokalen Modell erlaubt, Ihren Computer zu steuern.

LM Studio

Beschreibung:
Ausgereifteste GUI, integrierter HuggingFace-Modell-Browser, Server-Modus
Lizenz:
Kostenlos (proprietär)

Atomic Chat

Beschreibung:
Offline-Chat-App für Desktop und Mobilgeräte mit lokalen Ein-Klick-Agenten
Lizenz:
Apache 2.0

Jan

Link:
jan.ai
Beschreibung:
Datenschutzorientierter Offline-ChatGPT-Klon, vollständig quelloffen
Lizenz:
AGPL 3.0

GPT4All

Beschreibung:
Einsteigerfreundlich mit starker CPU-only-Unterstützung
Lizenz:
MIT

AnythingLLM

Beschreibung:
RAG und Dokumenten-Chat mit integriertem Vektorspeicher
Lizenz:
MIT

Msty

Beschreibung:
Übersichtliche Consumer-UX, Multi-Provider-Unterstützung
Lizenz:
Kostenlos (proprietär)

Cherry Studio

Beschreibung:
Multi-Provider-Desktop-KI mit umfangreicher Anpassbarkeit
Lizenz:
AGPL 3.0

Backyard AI

Beschreibung:
Desktop-Client für Charakter-Chat und Rollenspiel
Lizenz:
Kostenlos (proprietär)

Enchanted

Beschreibung:
Nativer macOS/iOS-Minimal-Client für Ollama
Lizenz:
Apache 2.0

h2oGPT

Beschreibung:
Funktionsreiche Enterprise-Desktop- und Serveranwendung
Lizenz:
Apache 2.0

Open Interpreter

Beschreibung:
Erlaubt einem lokalen LLM, Ihren Computer zu steuern und Code auszuführen
Lizenz:
AGPL 3.0

Vertiefender Vergleich: LM Studio vs Jan vs GPT4All

Msty-Preise prüfenProduktlink · offengelegtAnythingLLM-Cloud-Preise prüfenProduktlink · offengelegt

3. Web-UIs & Browser-Frontends

Web-UIs sind selbst gehostete ChatGPT-Klone — gleiche Konversationsoberfläche, aber Sie richten sie auf eine Laufzeitumgebung auf Ihrem eigenen Rechner oder LAN. Sie sind die natürliche Wahl, wenn Sie Multi-Geräte-Zugriff (Laptop, Smartphone, Tablet auf einem Server) oder Team-Nutzung wünschen. Open WebUI dominiert 2026 das Self-Hosting-Segment; LibreChat ist die Team-Feature-Alternative; SillyTavern ist das dedizierte Rollenspiel-UI.

Open WebUI

Beschreibung:
Beliebtestes selbst gehostetes ChatGPT-ähnliches UI mit integriertem RAG
Lizenz:
BSD 3-Clause

LibreChat

Beschreibung:
Multi-Modell-ChatGPT-Alternative mit Team-Funktionen
Lizenz:
MIT

text-generation-webui

Beschreibung:
Power-User-UI mit umfangreichem Plugin-Ökosystem
Lizenz:
AGPL 3.0

SillyTavern

Beschreibung:
Rollenspiel und Charakter-Chat mit Lorebooks
Lizenz:
AGPL 3.0

LobeChat

Beschreibung:
Moderne, übersichtliche UI mit Plugin-Marktplatz
Lizenz:
MIT

Big-AGI

Beschreibung:
Erweitertes Multi-Provider-Frontend mit Personas
Lizenz:
MIT

NextChat

Beschreibung:
Schlanker Web-Chat, einfaches Deployment
Lizenz:
MIT

Page Assist

Beschreibung:
Browser-Sidebar-KI für Chrome und Firefox
Lizenz:
MIT

Chatbox

Beschreibung:
Plattformübergreifender Desktop- und Web-Client
Lizenz:
GPLv3

Vertiefender Vergleich: SillyTavern vs Agnai vs RisuAI

4. Coding-Assistenten & IDE-Integrationen

Coding-Assistenten verbinden ein lokales LLM über OpenAI-kompatible APIs mit Ihrem Editor oder Terminal. Die Wahl hängt hauptsächlich vom bevorzugten Arbeitsablauf ab: Autovervollständigung im Editor (Continue.dev), autonome Agenten-Edits (Cline, OpenHands) oder git-natives Diff-Editing im Terminal (Aider). Alle drei Muster funktionieren mit jeder Laufzeitumgebung, die das OpenAI Chat Completions-Protokoll unterstützt — Ollama ist 2026 das verbreitetste Backend.

Continue.dev

Beschreibung:
VS Code- und JetBrains-Autovervollständigung und Chat mit lokalen Modellen
Lizenz:
Apache 2.0

Aider

Beschreibung:
Terminal-Pair-Programmer mit Multi-Datei-Bearbeitungsunterstützung
Lizenz:
Apache 2.0

Cline

Beschreibung:
Autonomer Coding-Agent für VS Code
Lizenz:
Apache 2.0

Tabby

Beschreibung:
Selbst gehostete GitHub Copilot-Alternative
Lizenz:
Apache 2.0

CodeGPT

Beschreibung:
IDE-Integrationen für mehrere Editoren
Lizenz:
MIT

OpenHands

Beschreibung:
KI-Software-Entwickler-Agent (ehemals OpenDevin)
Lizenz:
MIT

Cursor (lokaler Modus)

Beschreibung:
KI-first Code-Editor mit Unterstützung lokaler Modelle
Lizenz:
Kostenlos (proprietär)

Twinny

Beschreibung:
Kostenlose Copilot-Alternative für VS Code
Lizenz:
MIT

Vertiefender Vergleich: Continue.dev vs Cline vs Aider

3 lokale LLM Coding-Muster: Continue.dev für Inline-Autovervollständigung in VS Code und JetBrains, Cline für autonome Agenten-Dateibearbeitung, Aider für Git-native Terminal-Diffs — alle verbinden sich über die OpenAI-kompatible API mit Ollama.
3 lokale LLM Coding-Muster: Continue.dev für Inline-Autovervollständigung in VS Code und JetBrains, Cline für autonome Agenten-Dateibearbeitung, Aider für Git-native Terminal-Diffs — alle verbinden sich über die OpenAI-kompatible API mit Ollama.
Cursor-Preise prüfenProduktlink · offengelegt

5. RAG- & Dokumenten-Chat-Systeme

RAG (Retrieval-Augmented Generation)-Systeme verbinden ein lokales LLM mit einem Embedding-Modell und einem Vektorspeicher, damit das Modell aus Ihren eigenen Dokumenten antworten kann.** Die Unterscheidung liegt zwischen schlüsselfertigen Apps (AnythingLLM, PrivateGPT, Quivr, Khoj), die „einfach funktionieren", und Framework-Bibliotheken (LlamaIndex, Haystack, txtai), auf denen Sie aufbauen. RAGFlow hat 2026 Marktanteile gewonnen, speziell für Dokumente, die zitiergenaue Extraktion erfordern.

AnythingLLM

Beschreibung:
Einfachstes All-in-One-Personal-RAG mit Arbeitsbereichen
Lizenz:
MIT

PrivateGPT

Beschreibung:
Vollständig offline betreibbares, enterprise-orientiertes RAG
Lizenz:
Apache 2.0

Quivr

Beschreibung:
Selbst gehosteter persönlicher Wissensassistent
Lizenz:
Apache 2.0

Khoj

Beschreibung:
Persönliches KI-Second-Brain, synchronisiert mit Obsidian und Notion
Lizenz:
AGPL 3.0

Dify

Link:
dify.ai
Beschreibung:
KI-Workflow-Builder mit RAG- und Agenten-Unterstützung
Lizenz:
Modified Apache 2.0

Flowise

Beschreibung:
Visueller LangChain-Workflow-Builder
Lizenz:
Apache 2.0

Langflow

Beschreibung:
Visuelle KI-Orchestrierung mit RAG-Komponenten
Lizenz:
MIT

LlamaIndex

Beschreibung:
RAG-Framework / Python-Bibliothek — Grundlage für eigene Entwicklungen
Lizenz:
MIT

Haystack

Beschreibung:
Such- und RAG-Framework von deepset
Lizenz:
Apache 2.0

RAGFlow

Beschreibung:
Tiefes Dokumentenverständnis für RAG mit Zitat-Extraktion
Lizenz:
Apache 2.0

txtai

Beschreibung:
Eingebettete Vektor- und LLM-Datenbank in einer Bibliothek
Lizenz:
Apache 2.0

Vertiefender Vergleich: AnythingLLM vs PrivateGPT vs Open WebUI

Lokales RAG: Fertiglösungen (AnythingLLM, PrivateGPT, Quivr, RAGFlow, Khoj) für codefreien Dokumenten-Chat vs. Framework-Bibliotheken (LlamaIndex, Haystack, Dify, Flowise, txtai) für eigene Pipelines.
Lokales RAG: Fertiglösungen (AnythingLLM, PrivateGPT, Quivr, RAGFlow, Khoj) für codefreien Dokumenten-Chat vs. Framework-Bibliotheken (LlamaIndex, Haystack, Dify, Flowise, txtai) für eigene Pipelines.

6. Agenten-Frameworks & Orchestrierung

Agenten-Frameworks verwandeln One-Shot-LLM-Aufrufe in mehrstufige Workflows — planen, handeln, beobachten, wiederholen. LangChain bleibt der allgemeine Standard; CrewAI und AutoGen sind auf rollenbasierte Multi-Agenten-Setups spezialisiert; LangGraph ist die richtige Wahl, wenn Zustandsverwaltung über langläufige Abläufe hinweg wichtig ist. Alle acht Frameworks unten laufen problemlos mit einem lokalen Ollama-Backend.

LangChain

Beschreibung:
Universelles LLM-Anwendungsframework
Lizenz:
MIT

LlamaIndex

Beschreibung:
RAG-fokussiertes Agenten- und Daten-Framework
Lizenz:
MIT

CrewAI

Beschreibung:
Rollenbasierte Multi-Agenten-Workflows
Lizenz:
MIT

AutoGen

Beschreibung:
Microsoft Multi-Agenten-Orchestrierungsframework
Lizenz:
CC-BY-4.0 / MIT

Semantic Kernel

Beschreibung:
Microsoft Enterprise-Orchestrierungs-SDK für C#/Python/Java
Lizenz:
MIT

LangGraph

Beschreibung:
Zustandsbasierte Graph-Agenten-Workflows
Lizenz:
MIT

Letta (ehemals MemGPT)

Beschreibung:
Agenten mit Langzeitgedächtnis
Lizenz:
Apache 2.0

Pydantic AI

Beschreibung:
Typsicheres Agenten-Framework auf Basis von Pydantic
Lizenz:
MIT

Vertiefender Artikel: Lokale KI-Agenten mit MCP

7. Sprache, Spracherkennung & Multimodal

Sprach- und Multimodal-Stacks erweitern ein lokales LLM über Text hinaus — Spracheingabe (STT), Sprachausgabe (TTS) und Bildverständnis. Whisper.cpp und faster-whisper beherrschen die lokale STT-Schicht; Piper und Coqui teilen sich die TTS-Schicht, wobei XTTS v2 beim Voice-Cloning dominiert; LLaVA und Ollama Vision-Modelle decken die Bildseite ab. Ein vollständig offline betriebener Sprachassistent lässt sich aus dieser Schicht plus einem kleinen Chat-Modell aufbauen.

Whisper.cpp

Beschreibung:
Lokale Spracherkennung, läuft auf CPU oder GPU
Lizenz:
MIT

faster-whisper

Beschreibung:
Schnelle Whisper-Transkription via CTranslate2
Lizenz:
MIT

Piper TTS

Beschreibung:
Schlanke lokale Text-to-Speech-Lösung
Lizenz:
MIT

Coqui TTS

Beschreibung:
Open-Source-Sprachsynthese mit mehreren Modelloptionen
Lizenz:
MPL 2.0

XTTS v2

Beschreibung:
Voice-Cloning mit mehrsprachiger Unterstützung
Lizenz:
CPML

Bark

Beschreibung:
Generative Sprachsynthese mit Nicht-Sprach-Tönen
Lizenz:
MIT

StyleTTS 2

Beschreibung:
Hochwertige, natürlich klingende TTS
Lizenz:
MIT

LLaVA

Beschreibung:
Lokales Vision-und-Sprache-Modell
Lizenz:
Apache 2.0

Ollama Vision-Modelle

Beschreibung:
Lokales Vision via Ollama (Llama 3.2 Vision, Llava u. a.)
Lizenz:
Verschiedene

Vertiefender Artikel: Lokalen Sprachassistenten auf dem Smartphone aufbauen

8. Mobile & Edge-Clients

Mobile-Clients führen ein quantisiertes Modell direkt auf dem Smartphone aus — über Apple Neural Engine, Qualcomm NPU oder reine CPU-Inferenz. Das MLC LLM-Projekt ist die grundlegende Schicht; Consumer-Apps (PocketPal AI, Private LLM, LLM Farm, Layla) kapseln sie in einer Chat-Oberfläche. Aktuelle Flagship-Smartphones führen 2026 2-4B-Modelle mit praxistauglichen Geschwindigkeiten (8–15 Token/Sek.) aus; 7B liegt an der Machbarkeitsgrenze für Spitzengeräte.

MLC Chat

Beschreibung:
Plattformübergreifende Mobile-LLM-Laufzeitumgebung
Lizenz:
Apache 2.0

PocketPal AI

Beschreibung:
Kostenloser iOS- und Android-Client für lokale LLMs
Lizenz:
MIT

Private LLM

Beschreibung:
Ausgereifte iOS- und macOS-App für lokale LLMs
Lizenz:
Kostenpflichtig (proprietär)

LLM Farm

Beschreibung:
iOS-Client für lokale LLMs mit Modell-Browser
Lizenz:
MIT

Layla

Beschreibung:
Android-first App für lokale LLMs
Lizenz:
Kostenlos (proprietär)

Maid

Beschreibung:
Open-Source-Flutter-App für mobile LLMs
Lizenz:
MIT

Enchanted

Beschreibung:
Nativer iOS/macOS-Client für Ollama
Lizenz:
Apache 2.0

Chapper

Beschreibung:
Nativer Mobile-Client für Ollama und LM Studio
Lizenz:
Kostenlos

RikkaHub

Beschreibung:
Open-Source Android-App für lokale KI
Lizenz:
MIT

AnythingLLM Mobile

Beschreibung:
Fernzugriff auf Ihren lokalen AnythingLLM-Arbeitsbereich
Lizenz:
MIT

Vertiefender Artikel: Die besten lokalen LLM-Apps für iPhone in 2026

9. Spezialisierte & Produktivitätswerkzeuge

Spezialisierte Tools betten lokale LLMs in bereits genutzte Anwendungen ein — Notiz-Plattformen (Obsidian, Logseq, Joplin), autonome Aufgaben-Agenten (AutoGPT, BabyAGI, MetaGPT) und Rollenspiel-Frontends (Agnai, RisuAI). Dies sind keine generischen Chat-Oberflächen; es handelt sich um workflow-spezifische Integrationen, die voraussetzen, dass Sie bereits über eine Host-Anwendung und eine Laufzeitumgebung verfügen.

Smart Connections

Beschreibung:
Obsidian-Plugin für semantische Suche und Chat
Lizenz:
GPL 3.0

Copilot for Obsidian

Beschreibung:
Obsidian-Plugin für lokalen LLM-Chat
Lizenz:
AGPL 3.0

Text Generator

Beschreibung:
Obsidian-Plugin zur Inhaltsgenerierung
Lizenz:
MIT

logseq-copilot

Beschreibung:
Logseq-Plugin für lokalen und Cloud-LLM-Chat, gleicher Autor wie Obsidian Copilot
Lizenz:
AGPL 3.0

BMO Chatbot

Beschreibung:
Obsidian-Chatbot mit lokalem LLM
Lizenz:
MIT

Joplin AI

Beschreibung:
Joplin-Notizen mit lokalen KI-Integrationen
Lizenz:
MIT

AutoGPT (lokal)

Beschreibung:
Autonomer Aufgaben-Agent mit Ollama-Unterstützung
Lizenz:
MIT

BabyAGI

Beschreibung:
Schlanker autonomer Agent
Lizenz:
MIT

MetaGPT

Beschreibung:
Multi-Agenten-Simulation eines Software-Unternehmens
Lizenz:
MIT

Agnai

Beschreibung:
Rollenspiel-Frontend mit Charakter-Karten
Lizenz:
MIT

RisuAI

Beschreibung:
Mobilfreundliches Rollenspiel-Frontend
Lizenz:
GPL 3.0

Vertiefender Artikel: Lokale LLMs mit Obsidian in 2026

Praktische Einsatz-Stacks

Für Leserinnen und Leser, die nicht alle neun Kategorien durcharbeiten möchten: Wählen Sie den nächstpassenden Stack und übernehmen Sie ihn. Jede Zeile verbindet ein konkretes Ziel mit einer bewährten Kombination und der tatsächlichen Hardware-Mindestanforderung.

ZielStackHardware-Mindestanforderung
Einfacher ChatLM Studio standalone16 GB RAM, keine GPU erforderlich
Bestes Gleichgewicht für Power-UserOllama + Open WebUI16 GB RAM, GPU optional
Dokumenten-ChatOllama + AnythingLLM16 GB RAM, GPU optional
CodingOllama + Continue.dev16 GB RAM + GPU empfohlen
Rollenspiel / Kreatives SchreibenKoboldCpp + SillyTavern16 GB RAM, GPU empfohlen
Datenschutz-kritischer EinsatzOllama + Open WebUI + PrivateGPT32 GB RAM + 12 GB VRAM
Mobile / UnterwegsMLC Chat oder PocketPal AIiPhone 13+ / Pixel 7+
Apple SiliconOllama (MLX-Backend) oder LM StudioM2/M3/M4/M5 mit 16+ GB Unified Memory
Multi-User-TeamvLLM + Open WebUI32+ GB RAM + mehrere GPUs
9 bewährte lokale LLM-Stacks nach Anwendungsziel: von LM Studio standalone (16 GB RAM, ohne GPU) bis vLLM + Open WebUI für Teams (32 GB RAM + Multi-GPU), mit Ollama + Open WebUI als empfohlenem Standardsetup mit 16 GB RAM.
9 bewährte lokale LLM-Stacks nach Anwendungsziel: von LM Studio standalone (16 GB RAM, ohne GPU) bis vLLM + Open WebUI für Teams (32 GB RAM + Multi-GPU), mit Ollama + Open WebUI als empfohlenem Standardsetup mit 16 GB RAM.

Aktualität des Verzeichnisses

Dieses Verzeichnis wird alle sechs Monate überprüft und zwischen den Durchgängen aktualisiert — zuletzt im Juli 2026, nächste Aktualisierung November 2026. Beim jüngsten Durchgang wurden alle Links erneut geprüft und mehrere Projektnamen und Lizenzen korrigiert: Faraday heißt jetzt Backyard AI, der gepflegte Coqui-TTS-Fork wird von Idiap betreut und Cherry Studio steht unter AGPL 3.0. Aufnahmekriterien: Das Projekt wird aktiv gepflegt (Commits in den letzten 90 Tagen), verfügt über eine nachweisbare Open-Source-Lizenz oder eine klare Aussage zur kommerziellen Nutzbarkeit, und hat entweder einen relevanten Nutzeranteil im Jahr 2026 oder füllt eine Schicht aus, die sonst leer bliebe. Projekte, die länger als zwei Release-Zyklen inaktiv bleiben, werden entfernt; neue Einträge, die die Kriterien erfüllen, werden bei der nächsten Überprüfung aufgenommen. Einen Vorschlag für die Aufnahme können Sie über ein Issue oder einen Pull Request im PromptQuorum-Repository einreichen — bitte Projekt-URL, Lizenz und eine Kurzbeschreibung im Format der Tabellen oben beifügen.

Hinweis für DACH-Unternehmen: Für Organisationen in Deutschland, Österreich und der Schweiz empfiehlt sich der Einsatz von Tools mit MIT- oder Apache-2.0-Lizenz, da diese die klarste Rechtsgrundlage für den kommerziellen Einsatz bieten. Bei der Verarbeitung personenbezogener Daten ist zu prüfen, ob lokale Inferenz als Auftragsverarbeitung im Sinne von Art. 28 DSGVO einzustufen ist — in der Regel liegt sie außerhalb des Anwendungsbereichs, solange keine Daten das lokale System verlassen. Der BSI-Grundschutz-Katalog (insbesondere die Bausteine SYS und APP) bietet einen praxisnahen Rahmen für die Absicherung von Self-Hosted-LLM-Infrastruktur in deutschen Unternehmen.

Quellen

Häufig gestellte Fragen

Was ist der Unterschied zwischen einer lokalen LLM-Laufzeitumgebung und einer Desktop-App?

Eine Laufzeitumgebung (Ollama, llama.cpp, vLLM) ist die Engine, die Modellgewichte lädt und eine API bereitstellt — typischerweise OpenAI-kompatibel. Eine Desktop-App (LM Studio, Jan, GPT4All) ist eine Chat-Oberfläche, die im Hintergrund eine Laufzeitumgebung aufruft. Manche Apps bündeln ihre eigene Laufzeit (LM Studio enthält llama.cpp), andere setzen eine separate Installation voraus (Open WebUI ruft Ollama auf). Die Laufzeitumgebung entscheidet, was technisch möglich ist; die App entscheidet, was bequem nutzbar ist.

Kann ich mehrere Tools aus dieser Liste gleichzeitig verwenden?

Ja — die meisten Stacks kombinieren 2–4 Tools. Ein verbreitetes Setup: Ollama als Laufzeitumgebung, Open WebUI für den Chat, AnythingLLM für den Dokumenten-Chat und Continue.dev für das Coding — alle vier laufen gegen dieselbe Ollama-Instanz auf einem einzigen Rechner. Die Tabelle „Praktische Einsatz-Stacks" oben nennt die Rezepte, die konfliktfrei funktionieren.

Welche Tools funktionieren vollständig offline ohne Telemetrie?

Ollama, llama.cpp, vLLM, Jan, GPT4All, Open WebUI, AnythingLLM, PrivateGPT, Continue.dev, Aider, KoboldCpp, Llamafile, MLX-LM und die meisten AGPL/MIT-lizenzierten Apps in diesem Verzeichnis sind nach dem Modell-Download vollständig offline nutzbar. LM Studio und einige proprietäre Tools verfügen über optionale Analysefunktionen, die in den Einstellungen deaktiviert werden können — überprüfen Sie dies durch einen Paketmitschnitt nach der Installation. Browser-basierte UIs (Open WebUI, LibreChat) sind lokal, wenn sie mit einem lokalen Backend konfiguriert sind.

Sind einige dieser Tools kommerziell lizenziert (nicht frei für kommerzielle Nutzung)?

Eine Handvoll: LM Studio, Msty, Backyard AI, Layla und Cursor sind proprietär — in der Regel kostenlos nutzbar, aber nicht weiterverteilbar; kommerzielle Konditionen variieren je Anbieter. Private LLM ist kostenpflichtig. AGPL-lizenzierte Tools (Jan, KoboldCpp, text-generation-webui, SillyTavern, Khoj, Open Interpreter, Copilot for Obsidian) sind für jeden Zweck einschließlich kommerzieller Nutzung frei, die AGPL-Bedingungen verlangen jedoch Quelloffenlegung, wenn Sie sie modifiziert öffentlich hosten. Apache-2.0- und MIT-Projekte (die Mehrheit) sind in jedem Kontext einschließlich kommerzieller Nutzung ohne wesentliche Auflagen verwendbar.

Welche Tools unterstützen Apple Silicon (M-Serie) nativ?

Ollama, llama.cpp, MLX-LM, LM Studio, Jan, Enchanted, GPT4All, MLC Chat, AnythingLLM und die meisten Electron/Tauri-Apps laufen nativ auf Apple Silicon und nutzen das Metal-Backend. MLX-LM ist Apple-spezifisch und auf M-Series-Geräten für große Modelle am schnellsten. vLLM, TensorRT-LLM und ExLlamaV2 sind NVIDIA-fokussiert und laufen auf Apple Silicon entweder nicht oder nur eingeschränkt — für Apple-Nutzer ist Ollama mit Metal-Backend die Standardempfehlung.

Unterstützen alle diese Tools das GGUF-Modellformat?

GGUF ist das native Format für llama.cpp und alle Tools, die darauf aufbauen (Ollama, LM Studio, Jan, GPT4All, KoboldCpp, Llamafile). vLLM und TensorRT-LLM verwenden eigene optimierte Formate (typischerweise AWQ oder FP16) für höheren Durchsatz. ExLlamaV2 nutzt EXL2-Quantisierung. MLX-LM verwendet MLX-konvertierte Gewichte. Die meisten aufgeführten Tools akzeptieren GGUF; einige (vLLM, TensorRT-LLM, ExLlamaV2, MLX-LM) erfordern einen einmaligen Konvertierungsschritt aus den originalen Hugging Face-Gewichten.

Welche Tools eignen sich für Nutzerinnen und Nutzer ohne Programmiererfahrung?

GPT4All bietet die einfachste Installation (ein Klick, läuft ab 8 GB RAM). LM Studio ist das funktionsreichste Tool ohne Terminal-Nutzung. Jan ist die datenschutzfreundlichste No-Code-Option. Für Dokumenten-Chat ohne Kommandozeile ist AnythingLLM am einfachsten. Alle vier sind in der Kategorie Desktop-GUI-Anwendungen oben aufgeführt.

Kann ich diese Tools auf einem Server betreiben und remote darauf zugreifen?

Die meisten Server-fähigen Tools (Ollama, vLLM, LocalAI, Open WebUI, LibreChat, PrivateGPT, AnythingLLM) stellen eine HTTP-API bereit und binden an eine in den Einstellungen konfigurierbare Netzwerkschnittstelle. Standardmuster: Ollama auf einem Heimserver oder VPS betreiben, eine UI auf Laptop oder Smartphone, die auf die Server-IP zeigt. Behandeln Sie die API wie jeden Webdienst — binden Sie sie an localhost hinter einem Reverse-Proxy oder an ein privates Netzwerk mit geeigneter Authentifizierung. Open WebUI enthält Multi-User-Unterstützung von Haus aus.

Welche Tools unterstützen Multi-User- / Team-Setups?

Open WebUI, LibreChat, h2oGPT, AnythingLLM (mit aktivierten Admin-Funktionen) und Dify sind für den Multi-User-Einsatz ausgelegt, mit rollenbasiertem Zugriff und nutzerspezifischem Gesprächsverlauf. vLLM ist die richtige Serving-Schicht darunter, wenn gleichzeitige Inferenz relevant ist — es bündelt Anfragen mehrerer Nutzer für einen Durchsatz, der mit Ollama bei mehr als ~3 gleichzeitigen Anfragen nicht erreichbar ist.

Wie häufig wird dieses Verzeichnis aktualisiert?

Alle sechs Monate — zuletzt überprüft im Juli 2026, die nächste planmäßige Aktualisierung ist im November 2026. Zwischenzeitliche Änderungen (ein Projekt wird inaktiv, ein neues Tool gewinnt relevanten Marktanteil, eine Lizenz ändert sich) werden als Patch in den bestehenden Eintrag eingepflegt. Vollständig neue Kategorien oder Schichten warten auf die Überarbeitung, um die Struktur stabil zu halten.

Muss ich bei der Verwendung dieser Tools die DSGVO beachten?

Das hängt davon ab, welche Daten Sie verarbeiten. Lokale Inferenz — d. h. Modell und Daten verbleiben auf Ihrem eigenen System — ist datenschutzrechtlich grundsätzlich vorteilhaft, weil keine personenbezogenen Daten an externe Server übertragen werden. Verarbeiten Sie dennoch personenbezogene Daten (z. B. Kundendokumente, Mitarbeiterdaten), gelten die DSGVO-Grundsätze (Art. 5–11) sowie ggf. Art. 28 (Auftragsverarbeitung), falls ein Dienstleister die Infrastruktur betreibt. Der BSI-Grundschutz-Katalog (Bausteine SYS.1.1 und APP.3.1) bietet einen praxisnahen Sicherheitsrahmen für Self-Hosted-LLM-Systeme in deutschen Organisationen. Für eine rechtsverbindliche Einschätzung sollten Sie einen auf DSGVO spezialisierten Rechtsanwalt oder Datenschutzbeauftragten hinzuziehen.

Sind diese Tools für den deutschen Mittelstand geeignet?

Ja — für mittelständische Unternehmen in Deutschland, Österreich und der Schweiz bieten lokale LLM-Stacks konkrete Vorteile: Datensouveränität (keine Cloud-Abhängigkeit, keine Datenübermittlung an US-Anbieter), planbare Kosten (keine token-basierten Nutzungsgebühren) und Anpassbarkeit (Feinabstimmung auf Branchensprache möglich). Empfohlene Einstiegskonfiguration für den Mittelstand: Ollama als Laufzeitumgebung, Open WebUI für den Team-Chat, AnythingLLM für interne Wissensdatenbanken. Für IT-Sicherheitsanforderungen nach BSI-Grundschutz empfiehlt sich der Einsatz von Tools mit MIT- oder Apache-2.0-Lizenz und eine Netzwerksegmentierung des LLM-Servers vom Produktionsnetz.

← Zurück zu Lokale LLMs Pro