Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/MLC-Chat-Test (2026): Die mobile App auf Basis von MLC LLM, ehrlich bewertet
Voice, Speech & Multimodal

MLC-Chat-Test (2026): Die mobile App auf Basis von MLC LLM, ehrlich bewertet

·10 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

MLC Chat ist eine kostenlose, plattformübergreifende Chat-App zum Ausführen großer Sprachmodelle direkt auf dem eigenen Gerät, entwickelt vom MLC-AI-Team auf Basis des eigenen MLC LLM-Compilers und der Laufzeitumgebung, veröffentlicht unter der Apache-2.0-Lizenz. Sie ist im iOS App Store verfügbar und als direkt herunterladbare Android-APK über MLCs eigene GitHub-Releases; die Desktop-Nutzung erfolgt über MLC LLMs Python-, REST- und CLI-Schnittstellen statt über eine separat verpackte Desktop-App. Ihr Alleinstellungsmerkmal ist GPU-beschleunigte Inferenz auf dem Gerät, erreicht durch Machine-Learning-Kompilierung — ein Modell wird im Voraus für ein bestimmtes Hardware-Ziel kompiliert (Metal auf Apple-GPUs, OpenCL auf Android-GPUs, Vulkan/CUDA/ROCm auf dem Desktop) — statt sich auf eine einzige generische Laufzeitumgebung zu verlassen. Zum Zeitpunkt dieses Tests unterstützt MLC Chat offiziell keine Vision-Language-Modelle (Bildeingabe). Für die tiefere technische Erklärung, wie der zugrunde liegende Compiler funktioniert, siehe PromptQuorums MLC LLM erklärt.

MLC Chat ist die für Endnutzer gedachte Chat-App, die auf dem MLC LLM-Compiler und der zugehörigen Laufzeitumgebung aufbaut — dem Projekt, das PromptQuorum ausführlich in MLC LLM erklärt behandelt. Dieser Test konzentriert sich speziell auf das App-Erlebnis: echte Download-Kanäle, tatsächliche Einrichtungsschritte, mit welchen Modellen sie ausgeliefert wird, und ehrliche Einschränkungen, statt die zugrunde liegende Kompilierungstechnologie erneut zu erklären. Wer das tiefere technische Bild davon möchte, wie MLC LLM Modelle für GPU-beschleunigte Inferenz plattformübergreifend kompiliert, sollte zuerst MLC LLM erklärt lesen; dieser Artikel setzt diesen Kontext voraus und konzentriert sich auf die App selbst.

MLC-Chat-Test (2026): Die mobile App auf Basis von MLC LLM, ehrlich bewertet

Wichtigste Erkenntnisse

  • iOS: direkt im App Store verfügbar; Android: kein bestätigter Google-Play-Eintrag, APK direkt von MLCs GitHub-Releases herunterladen.
  • Alleinstellungsmerkmal: Modelle werden im Voraus für ein bestimmtes Hardware-Ziel kompiliert (Metal, OpenCL, Vulkan, CUDA, ROCm) mittels Machine-Learning-Kompilierung, statt über einen generischen Interpreter zu laufen.
  • Lizenz: Apache-2.0, gemäß dem GitHub-Repository mlc-ai/mlc-llm.
  • Zum Zeitpunkt dieses Tests keine offizielle Unterstützung für Vision-Language-Modelle (Bildeingabe) — nur Text-Chat, mit inoffiziellen Community-Workarounds, die nicht offiziell unterstützt werden.
  • Der Android-Build ist von OpenCL-GPU-Unterstützung abhängig, auf manchen Geräten bestätigt funktionierend, auf anderen nicht zuverlässig.
  • Dies ist der letzte Teil von PromptQuorums elfteiliger Testreihe zu lokalen KI-Tools.

📍 In einem Satz

MLC Chat ist eine kostenlose, Apache-2.0-lizenzierte Chat-App auf Basis des MLC-LLM-Compilers, die große Sprachmodelle lokal auf iOS (über den App Store), Android (über eine direkt herunterladbare APK) und Desktop (über MLC LLMs Python-/REST-/CLI-Schnittstellen) ausführt, mit GPU-beschleunigter Kompilierung auf dem Gerät statt einer generischen Laufzeitumgebung, und die zum Zeitpunkt dieses Tests offiziell keine Vision-Language-Modelle unterstützt.

💬 In einfachen Worten

MLC Chat ist eine kostenlose App, mit der Sie ohne Internetverbindung direkt auf Ihrem Smartphone oder Computer mit KI-Modellen chatten können, indem diese Modelle speziell für den Grafikchip Ihres Geräts kompiliert werden — dieser Test behandelt die echten Download-Links, Einrichtungsschritte und wo sie gut und wo weniger gut funktioniert.

📌Hinweis: Dieser Test konzentriert sich speziell auf die App MLC Chat. Für die tiefere technische Erklärung des MLC-LLM-Compilers und der TVM-basierten Laufzeitumgebung dahinter siehe PromptQuorums eigenen Artikel MLC LLM erklärt, den dieser Test bewusst nicht dupliziert.

Geschichte: MLC LLM und Machine-Learning-Kompilierung

**MLC Chat baut auf MLC LLM auf**, das im eigenen Repository des Projekts als "universelle LLM-Bereitstellungs-Engine mit ML-Kompilierung" beschrieben wird, die die Entwicklung, Optimierung und Bereitstellung von KI-Modellen plattformübergreifend ermöglicht. Die eigene Dokumentation des MLC-LLM-Repositorys zitiert grundlegende Forschung von Apache TVM (2018) und verwandte Compiler-Arbeiten (TensorIR, MetaSchedule) als technische Abstammungslinie — TVM ist der Deep-Learning-Compiler-Stack, auf dem das MLC-Projekt seine Machine-Learning-Kompilierungstechniken aufbaut.

Die Unterscheidung zwischen "MLC LLM" und "MLC Chat" ist wichtig und wird oft verwischt. MLC LLM ist der zugrunde liegende Compiler und die Laufzeit-Engine — das, was PromptQuorum ausführlich in MLC LLM erklärt behandelt. MLC Chat ist die darauf aufbauende, für Endnutzer gedachte Anwendung, speziell für iOS und Android verpackt, mit der ein technisch nicht versierter Nutzer ein Modell herunterladen und ohne direkten Kontakt mit dem Compiler chatten kann.

MLC Chat wird vom selben MLC-AI-Team gepflegt (GitHub-Organisation mlc-ai), das auch das MLC-LLM-Projekt selbst pflegt, und ist unter Apache-2.0 lizenziert, derselben Lizenz wie das zugrunde liegende MLC-LLM-Repository.

Ist MLC Chat dasselbe wie MLC LLM?

Nein, obwohl beide eng verwandt sind und oft synonym verwendet werden. MLC LLM ist der zugrunde liegende Compiler und die Laufzeit-Engine, die Modelle für GPU-beschleunigte Inferenz auf dem Gerät plattformübergreifend kompiliert — siehe PromptQuorums eigenen Artikel MLC LLM erklärt. MLC Chat ist die für Endnutzer gedachte App, vom selben Team auf Basis dieser Engine entwickelt, speziell für iOS und Android verpackt.

Was MLC Chat auszeichnet

Die meisten lokalen LLM-Chat-Apps verlassen sich auf eine einzige, universelle Inferenz-Laufzeitumgebung (wie llama.cpp), die eine Modelldatei zur Laufzeit auf der jeweils vorgefundenen Hardware interpretiert. Die zugrunde liegende MLC-LLM-Engine von MLC Chat verfolgt einen anderen Ansatz: Sie kompiliert ein Modell im Voraus für ein bestimmtes Hardware-Ziel mittels Machine-Learning-Kompilierungstechniken und liefert dann dieses kompilierte Artefakt zur Ausführung auf dem Zielgerät.

Laut MLC LLMs eigener Projektdokumentation adressiert dieser Kompilierungsansatz je nach Plattform eine breite Palette an GPU-Backends: Metal für Apple Silicon und mobile Apple-GPUs, OpenCL für Android-GPUs (Adreno und Mali) sowie Vulkan, CUDA oder ROCm auf Desktop-Linux und -Windows. Das Projekt dokumentiert außerdem WebGPU- und WebAssembly-Unterstützung zum Ausführen von Modellen im Browser, und MLCEngine — die Laufzeitkomponente — stellt eine OpenAI-kompatible API über REST-, Python-, JavaScript-, iOS- und Android-Schnittstellen bereit.

Der praktische Nutzen speziell für MLC Chat: Da die zugrunde liegende Kompilierung hardware-zielspezifisch ist, kann die App GPU-Beschleunigung auf mobilen Chips erreichen, die eine generischere Laufzeitumgebung möglicherweise nicht vollständig ausnutzen würde — auf Kosten der Notwendigkeit eines kompilierten Builds für jede spezifische Hardware-/Modell-Kombination, statt einer einzigen universellen Binärdatei, die überall funktioniert.

Was unterscheidet MLC Chat von einem generischen lokalen LLM-Runner?

Die zugrunde liegende MLC-LLM-Engine von MLC Chat kompiliert ein Modell im Voraus für ein bestimmtes Hardware-Ziel (je nach Plattform Metal, OpenCL, Vulkan, CUDA oder ROCm) mittels Machine-Learning-Kompilierung, statt das Modell zur Laufzeit generisch zu interpretieren. Dies wird in MLC LLMs eigenen Projektmaterialien als zentraler Unterscheidungsansatz dokumentiert.

Echte Einrichtungsschritte: iOS, Android und Desktop

Diese Schritte spiegeln wider, was PromptQuorum direkt überprüft hat — die tatsächliche Präsenz von MLC Chat im App Store, den Android-APK-Vertriebskanal und MLC LLMs dokumentierten Schnellstart-Pfad für die Desktop-Nutzung.

  1. 1
    iOS: aus dem App Store herunterladen.
    Why it matters: MLC Chat ist direkt im [Apple App Store](https://apps.apple.com/us/app/mlc-chat/id6448482937) gelistet — eine Standardinstallation, kein Sideloading erforderlich.
  2. 2
    Android: die APK direkt von GitHub herunterladen.
    Why it matters: MLC pflegt derzeit keinen bestätigten Google-Play-Store-Eintrag. Der Android-Build wird als direkter APK-Download über [MLCs eigene GitHub-Releases](https://github.com/mlc-ai/binary-mlc-llm-libs/releases/download/Android/mlc-chat.apk) vertrieben, was das Aktivieren von "Installation aus unbekannten Quellen" in den Android-Einstellungen erfordert.
  3. 3
    Android-GPU-Kompatibilität prüfen, bevor Sie sich darauf verlassen.
    Why it matters: Der Android-Build ist von OpenCL-GPU-Unterstützung abhängig. Dies wurde auf manchen Geräten (etwa bestimmten Samsung-Galaxy-Modellen) als funktionierend bestätigt, jedoch nicht zuverlässig auf anderen (etwa manchen Google-Pixel-Modellen mit eingeschränkter OpenCL-Unterstützung) — überprüfen Sie Ihr spezifisches Gerät, bevor Sie von voller GPU-Beschleunigung ausgehen.
  4. 4
    Desktop: MLC LLMs Python-Paket, REST-Server oder CLI direkt nutzen.
    Why it matters: Es gibt keine separat verpackte MLC-Chat-Desktop-Anwendung. Desktop-Nutzer installieren das `mlc-llm`-Python-Paket in einer Conda-Umgebung und interagieren über die `chat.completions.create()`-API von `MLCEngine`, einen REST-Server oder die Kommandozeile, gemäß [MLC LLMs Schnellstart-Dokumentation](https://llm.mlc.ai/docs/get_started/quick_start.html).
  5. 5
    Ein kompiliertes Modell wählen, das zu Ihrer Hardware passt.
    Why it matters: MLC LLMs Schnellstart-Dokumentation demonstriert den Arbeitsablauf anhand von `Llama-3-8B-Instruct-q4f16_1-MLC`, einem int4-quantisierten Build, und dokumentiert einen Bedarf von mindestens 6 GB freiem VRAM dafür — eine nützliche Ausgangsbasis, um Hardwareanforderungen einzuschätzen, bevor Sie sich für ein größeres Modell entscheiden.

Lizenz und welche Modelle unterstützt werden

Lizenz: Apache-2.0. Sowohl die App MLC Chat als auch das zugrunde liegende MLC-LLM-Repository sind unter der Apache-2.0-Lizenz veröffentlicht, direkt bestätigt im GitHub-Repository mlc-ai/mlc-llm.

Die Modellunterstützung ist breiter als jedes einzelne Schnellstart-Beispiel. MLC LLMs eigene Schnellstart-Dokumentation demonstriert den Arbeitsablauf mit Llama-3-8B-Instruct-q4f16_1-MLC, doch die Modellbibliothek des Projekts erstreckt sich auf weitere Open-Weight-Modellfamilien, kompiliert für seine unterstützten Hardware-Ziele — PromptQuorum empfiehlt, MLC LLMs eigene Modellliste direkt für den aktuellen Stand zu prüfen, da sich die Verfügbarkeit kompilierter Modelle mit neuen Releases ändert, statt sich auf eine einzelne zwischengespeicherte Liste zu verlassen.

Keine offizielle Unterstützung für Vision-Language-Modelle. Zum Zeitpunkt dieses Tests unterstützt MLC LLM offiziell keine Vision-Language-Modelle (Bildeingabe) — es stellt keine eingebauten Module zur gemeinsamen Verarbeitung von Bild- und Texteingaben in der Chat-App bereit. Es existieren Community-Projekte, die Vision-Language-Modell-Code an MLC LLMs Kompilierungs-Pipeline anpassen, doch diese werden nicht offiziell vom MLC-AI-Team gepflegt oder unterstützt, und PromptQuorum hat deren aktuelle Zuverlässigkeit nicht überprüft.

Welche Lizenz verwendet MLC Chat?

Apache-2.0, direkt bestätigt im GitHub-Repository mlc-ai/mlc-llm, das sowohl die MLC-LLM-Engine als auch die darauf aufbauende App MLC Chat abdeckt.

Unterstützt MLC Chat Vision-Modelle wie LLaVA?

Nein, zum Zeitpunkt dieses Tests nicht offiziell. MLC LLM bietet keine offizielle Unterstützung für Vision-Language-Modelle (Bildeingabe). Es existieren von der Community entwickelte Workarounds, die Vision-Language-Modell-Code an MLC LLMs Pipeline anpassen, doch diese sind inoffiziell, und ihre aktuelle Zuverlässigkeit wurde für diesen Test nicht überprüft. Für Vision-fähige lokale Modelle siehe stattdessen PromptQuorums LLaVA-Test, Idefics-Test oder Ollama-Vision-Modelle-Leitfaden.

Wofür MLC Chat nicht geeignet ist

MLC Chat ist eine tatsächlich nützliche plattformübergreifende Chat-App auf dem Gerät, aber die falsche Wahl für folgende Situationen:

  • Desktop-Nutzer, die die einfachstmögliche Einrichtung wünschen. MLC Chat hat keine verpackte Desktop-Anwendung — Desktop-Nutzung bedeutet, ein Python-Paket zu installieren und mit einem REST-Server, einer CLI oder einer Python-API zu arbeiten. Nutzer, die ein Ein-Klick-Desktop-Erlebnis wünschen, finden Ollama oder LM Studio deutlich bequemer, auch wenn MLC Chats Vorteil der mobilen GPU-Kompilierung auf dem Desktop nicht in gleicher Weise gilt.
  • Vision- oder Bildeingabe-Aufgaben. MLC LLM unterstützt offiziell keine Vision-Language-Modelle. Wenn Ihr Anwendungsfall das Ausführen eines Modells umfasst, das Bilder betrachten kann, siehe stattdessen PromptQuorums LLaVA-Test, Idefics-Test oder Ollama-Vision-Modelle-Leitfaden.
  • Die größten verfügbaren Modelle. Mobile Hardware bringt reale Einschränkungen mit sich — MLC LLMs eigenes Schnellstart-Beispiel benötigt mindestens 6 GB freies VRAM für ein 8B-Parameter-Modell bei int4-Quantisierung, und Telefon-GPUs und -Speicher sind begrenzter als eine Desktop-GPU. Nutzer, die die größten verfügbaren Open-Weight-Modelle lokal ausführen möchten, sind mit Desktop-Tools mit mehr VRAM-Spielraum besser bedient.
  • Android-Nutzer mit Hardware mit eingeschränkter OpenCL-Unterstützung. Die GPU-Beschleunigung des Android-Builds hängt von OpenCL ab, das auf manchen Geräten bestätigt funktioniert, auf anderen jedoch nicht zuverlässig — überprüfen Sie Ihr spezifisches Gerätemodell, bevor Sie ein reibungsloses Erlebnis erwarten.

Alternativen und Wettbewerber

Ollama

Am besten geeignet:
Desktop-orientierte Einfachheit über ollama pull/ollama run; breitere Vision-Modell-Unterstützung als MLC Chat
Lizenz:
MIT

LM Studio

Am besten geeignet:
GUI-orientiertes Desktop-Erlebnis mit eingebautem Modell-Browser
Lizenz:
Kostenlos, proprietäre Anwendung

llama.cpp direkt

Am besten geeignet:
Maximale Low-Level-Kontrolle über die Inferenz ohne vorab kompilierten Schritt
Lizenz:
MIT

PocketPal AI

Am besten geeignet:
Eine weitere dedizierte mobile lokale LLM-App; siehe PromptQuorums eigenen Test für einen direkten Vergleich
Lizenz:
Unterschiedlich — siehe PromptQuorums PocketPal-AI-Test

Häufig gestellte Fragen

Was ist MLC Chat?

MLC Chat ist eine kostenlose, plattformübergreifende Chat-App zum Ausführen großer Sprachmodelle direkt auf dem eigenen Gerät, entwickelt vom MLC-AI-Team auf Basis des eigenen MLC-LLM-Compilers und der Laufzeitumgebung, lizenziert unter Apache-2.0.

Wo kann ich MLC Chat herunterladen?

Auf iOS laden Sie sie direkt aus dem App Store herunter. Auf Android listet MLC sie derzeit nicht im Google Play Store — laden Sie die APK direkt von MLCs eigenen GitHub-Releases herunter, was das Aktivieren von Installationen aus unbekannten Quellen erfordert. Auf dem Desktop gibt es keine separat verpackte App; nutzen Sie stattdessen MLC LLMs Python-Paket, REST-Server oder Kommandozeilenschnittstelle.

Ist MLC Chat kostenlos?

Ja. Die App und die zugrunde liegende MLC-LLM-Engine sind unter der Open-Source-Lizenz Apache-2.0 veröffentlicht.

Unterstützt MLC Chat Vision-Modelle?

Nein, zum Zeitpunkt dieses Tests nicht offiziell. MLC LLM unterstützt offiziell keine Vision-Language-Modelle (Bildeingabe). Es existieren inoffizielle Community-Workarounds, die für diesen Test jedoch nicht überprüft wurden.

Was unterscheidet MLC Chat von Ollama oder llama.cpp?

Die zugrunde liegende MLC-LLM-Engine von MLC Chat kompiliert Modelle im Voraus für ein bestimmtes Hardware-Ziel (mittels Techniken aus der Apache-TVM-Compiler-Abstammungslinie), statt ein Modell zur Laufzeit generisch zu interpretieren, was das Projekt als Vorteil speziell für GPU-Beschleunigung auf mobilen Chips positioniert. Ollama und llama.cpp verfolgen einen eher universellen Laufzeitansatz und bieten im Fall von Ollama derzeit breitere Vision-Modell-Unterstützung.

Ist dies der letzte Artikel in PromptQuorums Serie zu lokalen KI-Tools?

Ja. Dieser MLC-Chat-Test ist der letzte Teil einer elfteiligen Serie, die Whisper.cpp, faster-whisper, Piper TTS, Coqui TTS, XTTS v2, Bark, StyleTTS 2, LLaVA, Ollama-Vision-Modelle, Idefics und MLC Chat behandelt.

Fazit: Der letzte Teil dieser Serie

MLC Chat löst ein tatsächlich unverwechselbares Versprechen ein: plattformübergreifenden, GPU-beschleunigten LLM-Chat auf dem Gerät, erreicht durch Machine-Learning-Kompilierung statt einer Einheitslösung für alle, mit einer echten Präsenz im iOS App Store und einer direkt herunterladbaren Android-APK, alles unter einer freizügigen Apache-2.0-Lizenz. Es ist jedoch nicht die bequemste Wahl für Desktop-Nutzer — dieser Workflow bedeutet ein Python-Paket und eine REST-/CLI-Schnittstelle statt einer verpackten App — und es unterstützt derzeit überhaupt keine Vision-Language-Modelle, offiziell. Wählen Sie MLC Chat speziell für mobilen Chat auf dem Gerät, wo sich sein kompilierter, hardware-zielspezifischer Ansatz auszahlt; wählen Sie Ollama oder LM Studio für das einfachste Desktop-Erlebnis, und PromptQuorums LLaVA- oder Idefics-Tests stattdessen für Vision-fähige lokale Modelle. Für das tiefere technische Bild des Compilers hinter MLC Chat siehe PromptQuorums MLC LLM erklärt. Dieser Test schließt PromptQuorums elfteilige Serie zu lokalen KI-Tools ab — von Spracherkennung (Whisper.cpp, faster-whisper) und Sprachsynthese (Piper, Coqui TTS, XTTS v2, Bark, StyleTTS 2) über Vision-Language-Modelle (LLaVA, Ollama-Vision-Modelle, Idefics) bis zu diesem letzten Teil über plattformübergreifende Kompilierung auf dem Gerät.

Quellen

  • MLC Chat im App Store — bestätigte iOS-Verfügbarkeit.
  • MLC-Chat-Android-APK — der direkte Android-Download-Kanal, gehostet auf MLCs eigenen GitHub-Releases.
  • mlc-ai/mlc-llm auf GitHub — Lizenz (Apache-2.0), Plattformunterstützung, TVM-Abstammungsdokumentation.
  • MLC-LLM-Schnellstart-Dokumentation — Desktop-Einrichtungsschritte, Beispielmodell, VRAM-Anforderung.
  • MLC-LLM-Android-SDK-Dokumentation — Android-OpenCL-Abhängigkeit und Hinweise zur Gerätekompatibilität.
  • PromptQuorum-Recherche zur Vision-Language-Modell-Unterstützung von MLC LLM, die keine offizielle VLM-Unterstützung und die Existenz inoffizieller Community-Workarounds (z. B. MLC-VLM-template) zum Zeitpunkt dieses Tests bestätigt.

← Zurück zu Lokale LLMs Pro