Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/Foundry Local Review 2026: Microsofts On-Device-KI-Laufzeitumgebung
Overview & Reference

Foundry Local Review 2026: Microsofts On-Device-KI-Laufzeitumgebung

·11 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Foundry Local (github.com/microsoft/Foundry-Local) ist Microsofts On-Device-KI-Inferenz-Tool — eine durchgängige lokale KI-Lösung zum Bauen von Anwendungen, die vollständig auf dem Gerät des Nutzers laufen, mit nativen SDKs für C#, JavaScript, Rust und Python, automatischer Erkennung der Hardware-Beschleunigung (es wählt NPU, GPU oder CPU je nach Gerät) und einem kuratierten Modellkatalog, in einem leichtgewichtigen Paket (rund 20 MB). Es unterscheidet sich von Azure AI Foundry, Microsofts cloudbasierter Plattform zum Bauen und Bereitstellen von KI in großem Maßstab: Foundry Local läuft vollständig auf dem Gerät und benötigt für die reine lokale Nutzung kein Azure-Abonnement, während Azure AI Foundry ein eigenständiges Cloud-Produkt ist; beide sind für ein Zusammenspiel in Hybrid-Workflows konzipiert, sind aber nicht dasselbe. Die Lizenzierung ist geteilt: Das SDK ist MIT-lizenziert, während die CLI unter Microsofts eigenen proprietären Microsoft Software License Terms vertrieben wird — es ist nicht korrekt, das gesamte Produkt als "Open Source" zu bezeichnen. Installiert wird es über die CLI (von GitHub Releases), pip install foundry-local-sdk für Python oder npm install foundry-local-sdk für JavaScript/Node, und läuft laut offiziellem README unter Windows, macOS (Apple Silicon) und Linux. Das GitHub-Repository zeigte laut den eigenen Verzeichnisdaten dieser Seite Stand 5. September 2026 2.541 Sterne.

Foundry Local (github.com/microsoft/Foundry-Local, foundrylocal.ai) ist Microsofts On-Device-KI-Inferenz-Tool: eine durchgängige lokale KI-Lösung zum Bauen von Anwendungen, die vollständig auf dem Gerät des Nutzers laufen, mit nativen SDKs für C#, JavaScript, Rust und Python, automatischer Erkennung der Hardware-Beschleunigung und einem kuratierten Modellkatalog, verpackt in einer leichtgewichtigen Installation (rund 20 MB). Diese Review behandelt, was Foundry Local tatsächlich ist, wie es sich von Microsofts cloudbasiertem Azure AI Foundry unterscheidet, seine duale Lizenzstruktur, wie man es installiert und wo es sich im Vergleich zu anderen lokalen Inferenz-Tools einordnet.

Foundry Local Review 2026: Microsofts On-Device-KI-Laufzeitumgebung

Wichtigste Erkenntnisse

  • Foundry Local ist Microsofts On-Device-KI-Inferenz-Tool; Quellcode unter github.com/microsoft/Foundry-Local, Projektseite foundrylocal.ai
  • Native SDKs für C#, JavaScript, Rust und Python, plus automatische Erkennung der Hardware-Beschleunigung, die den optimalen Ausführungspfad — NPU, GPU oder CPU — je nach Gerät wählt
  • Läuft laut offiziellem README unter Windows, macOS (Apple Silicon) und Linux; Leser sollten das offizielle Repository für die vollständige Plattformabdeckung bei jeder konkreten Geräteklasse direkt prüfen
  • Leichtgewichtiges Paket, rund 20 MB
  • Lizenz ist geteilt: Das SDK ist MIT-lizenziert, während die CLI unter Microsofts eigenen proprietären Microsoft Software License Terms vertrieben wird — kein vollständig quelloffenes Produkt
  • Unterscheidet sich von Azure AI Foundry: Foundry Local läuft auf dem Gerät und benötigt für die reine lokale Nutzung kein Azure-Abonnement, während Azure AI Foundry Microsofts eigenständige Cloud-Plattform zum Bauen und Bereitstellen von KI in großem Maßstab ist; beide sind für ein Zusammenspiel in Hybrid-Workflows konzipiert
  • Kuratierter Modellkatalog umfasst Modellfamilien wie Qwen, DeepSeek, Mistral, Phi und GPT-OSS sowie Whisper für Audiotranskription — jedes heruntergeladene Modell hat eigene, separate Lizenzbedingungen
  • Bietet eine OpenAI-kompatible API (einschließlich der Anfrage-/Antwortformate der OpenAI Responses API) über einen lokalen Webserver und nutzt ONNX Runtime für die Inferenz
  • GitHub-Repository zeigt 2.541 Sterne, geprüft gegen github.com/microsoft/Foundry-Local am 5. September 2026

📍 In einem Satz

Foundry Local ist Microsofts On-Device-KI-Inferenz-Tool — native SDKs für C#, JavaScript, Rust und Python, automatische Erkennung der Hardware-Beschleunigung und ein kuratierter Modellkatalog — und ein eigenständiges Produkt neben dem cloudbasierten Azure AI Foundry.

💬 In einfachen Worten

Mit Foundry Local kann ein Entwickler eine App bauen, die KI-Modelle direkt auf dem Windows-, Mac- oder Linux-Rechner eines Nutzers ausführt und dabei automatisch den Chip (NPU, GPU oder CPU) wählt, der auf diesem Gerät am schnellsten arbeitet — ohne dass für die lokale Nutzung ein Cloud-Konto nötig ist. Es ist nicht dasselbe wie Azure AI Foundry, Microsofts Cloud-Plattform — beide können zusammenarbeiten, aber der ganze Sinn von Foundry Local ist, offline und auf dem Gerät zu laufen.

📌Hinweis: Diese Review ist die vertiefende Ergänzung zum Eintrag von Foundry Local im Local LLM Software Directory — dort finden Sie, wie Foundry Local im Vergleich zu Dutzenden anderer lokaler KI-Tools abschneidet.

Was ist Foundry Local?

Foundry Local ist Microsofts On-Device-KI-Inferenz-Tool — eine durchgängige lokale KI-Lösung zum Bauen von Anwendungen, die vollständig auf dem Gerät des Nutzers laufen. Das GitHub-Repository beschreibt es als Kombination aus nativen SDKs, automatischer Hardware-Beschleunigung und einem kuratierten Modellkatalog in einem leichtgewichtigen Paket für Entwickler, deren Inferenz auf dem Gerät selbst und nicht auf einem entfernten Server laufen muss.

  • Kernfunktion: KI-Modell-Inferenz lokal auf einem Gerät ausführen, wobei die Laufzeitumgebung automatisch die beste verfügbare Hardware-Beschleunigung erkennt und nutzt
  • Native SDKs: C#, JavaScript, Rust und Python, sodass Entwickler lokale Inferenz in Anwendungen dieser Sprachen integrieren können, ohne einen separaten Wrapper zu schreiben
  • Automatische Erkennung der Hardware-Beschleunigung: Die Laufzeitumgebung wählt den optimalen Ausführungspfad — NPU, GPU oder CPU — für das jeweilige Gerät, statt dass der Entwickler diese Wahl fest verdrahten muss
  • Modellkatalog: eine kuratierte Auswahl von Modellen, kein offenes, unbeschränktes Upload-System
  • Entwickler: Microsoft; die GitHub-Organisation, die den Code hostet, ist microsoft
  • Kanonisches Repository: github.com/microsoft/Foundry-Local; Projektseite: foundrylocal.ai

Foundry Local vs. Azure AI Foundry

Dies ist die wichtigste Unterscheidung bei Foundry Local: Foundry Local ist nicht dasselbe Produkt wie Azure AI Foundry, Microsofts cloudbasierte Plattform zum Bauen und Bereitstellen von KI in großem Maßstab. Microsoft selbst positioniert Foundry Local als "die leistungsstarke lokale KI-Laufzeit-Stack, die die Leistungsfähigkeit von Azure AI Foundry auf Client-Geräte bringt" — eine Formulierung, die eine bewusste Beziehung zwischen beiden signalisiert, nicht identische Produkte.

Wo die Inferenz läuft

Foundry Local:
Vollständig auf dem eigenen Gerät des Nutzers
Azure AI Foundry:
Microsofts Cloud-Infrastruktur

Azure-Konto nötig

Foundry Local:
Nein, für reine lokale Nutzung
Azure AI Foundry:
Ja, es ist ein Azure-Cloud-Dienst

Offline-Fähigkeit

Foundry Local:
Ja, sobald Modelle heruntergeladen sind
Azure AI Foundry:
Nein, es ist eine gehostete Cloud-Plattform

Hauptzweck

Foundry Local:
On-Device-Inferenz für Client-Anwendungen
Azure AI Foundry:
Bauen und Bereitstellen von KI-Lösungen im Cloud-Maßstab

Die beiden Produkte sind für ein Zusammenspiel in Hybrid-Workflows konzipiert — ein Entwickler könnte lokal mit Foundry Local prototypisieren und testen und eine Arbeitslast dann auf die Cloud-Endpunkte von Azure AI Foundry skalieren, wenn mehr Kapazität benötigt wird, als ein einzelnes Gerät bieten kann —, bleiben aber eigenständige Produkte, und Foundry Local benötigt für die reine lokale Nutzung kein Azure-Abonnement. Gehen Sie nicht davon aus, dass die beiden Namen dasselbe bezeichnen oder dass die Installation von Foundry Local eine Abhängigkeit von einem Azure-Konto erzeugt.

Meilensteine von Foundry Local

Microsoft veröffentlichte Foundry Local als On-Device-Pendant zu seiner breiteren Azure-AI-Foundry-Plattform, gerichtet an Entwickler, deren Inferenz auf Client-Hardware statt in der Cloud laufen muss.

  1. 1
    Erste Veröffentlichung — On-Device-Inferenz-Tool
    Why it matters: Foundry Local startete explizit als das lokale Client-Geräte-Pendant zu Azure AI Foundry, nicht als eigenständiges, von Microsofts Cloud-KI-Strategie losgelöstes Produkt.
  2. 2
    Laufend — Erweiterung der nativen SDKs (C#, JavaScript, Rust, Python)
    Why it matters: Mehrere native SDKs bedeuten, dass Entwickler in verschiedenen Sprach-Ökosystemen On-Device-Inferenz integrieren können, ohne eigene Bindings um eine einzelne Referenzimplementierung schreiben zu müssen.
  3. 3
    Laufend — ONNX Runtime als Inferenz-Engine
    Why it matters: Der Aufbau auf ONNX Runtime statt einer projektspezifischen Inferenz-Engine lässt Foundry Local vom eigenen Hardware-Beschleunigungs- und Ausführungspfad-Ökosystem von ONNX Runtime profitieren.
  4. 4
    Laufend — Erweiterung des kuratierten Modellkatalogs
    Why it matters: Der Katalog ist um Modellfamilien wie Qwen, DeepSeek, Mistral, Phi und GPT-OSS sowie Whisper für Audiotranskription gewachsen und erweitert, was ein Entwickler über dieselbe SDK-Oberfläche lokal ausführen kann.
  5. 5
    Laufend — OpenAI-kompatible API-Oberfläche
    Why it matters: Eine OpenAI-kompatible API, einschließlich der Anfrage-/Antwortformate der OpenAI Responses API, senkt die Integrationskosten für Anwendungen, die bereits gegen diese API-Form gebaut sind.

Was können Sie mit Foundry Local tun?

Der Funktionsumfang von Foundry Local konzentriert sich laut GitHub-README darauf, On-Device-Inferenz für Entwickler einfach integrierbar zu machen.

  • Native SDKs — C#-, JavaScript-, Rust- und Python-SDKs zur direkten Integration lokaler Inferenz in Anwendungen dieser Sprachen
  • Automatische Erkennung der Hardware-Beschleunigung — die Laufzeitumgebung wählt den optimalen Ausführungspfad (NPU, GPU oder CPU) je nach Gerät, statt dass der Entwickler dies manuell erkennen und konfigurieren muss
  • Kuratierter Modellkatalog — Modellfamilien wie Qwen, DeepSeek, Mistral, Phi und GPT-OSS sowie Whisper für Audiotranskription; der Katalog ist kuratiert statt ein offenes Upload-System, und jedes Modell hat eigene, separate Lizenzbedingungen
  • OpenAI-kompatible API — ein lokaler Webserver, der OpenAI-Anfrage- und -Antwortformate unterstützt, einschließlich des OpenAI-Responses-API-Formats, für Anwendungen, die bereits gegen diese API-Form integriert sind
  • ONNX-Runtime-Inferenz — Modelle laufen über ONNX Runtime, das die tatsächliche Ausführung über den erkannten Hardware-Beschleunigungspfad übernimmt
  • Leichtgewichtiger Fußabdruck — eine Installation von rund 20 MB für die Laufzeitumgebung selbst, Modelle werden separat aus dem Katalog heruntergeladen
  • CLI für Modellverwaltung — Befehle wie foundry model run <model-name> und foundry model list zum Ausführen und Auflisten von Modellen im Terminal
  • Plattformübergreifende Unterstützung — Windows, macOS (Apple Silicon) und Linux, laut offiziellem README

Anwendungsbeispiele: Drei Wege, Foundry Local zu nutzen

Diese Workflows basieren auf der dokumentierten CLI und den SDKs von Foundry Local oben — keine hypothetischen Anwendungsfälle.

Installation und erste Schritte

Foundry Local ist ein CLI- und SDK-Entwickler-Tool, keine einzelne Verbraucher-App mit Download-Buttons pro Betriebssystem, daher erfolgt die Installation über GitHub Releases und Sprach-Paketmanager statt über einen signierten Installer von einer Marketing-Seite.

  1. 1
    Laden Sie den CLI-Installer für Ihre Plattform von GitHub Releases herunter — Release-Tags folgen einem Muster wie cli-preview-0.10.0; prüfen Sie die Releases-Seite direkt auf die aktuelle Version, statt eine bestimmte Nummer anzunehmen.
  2. 2
    Für die Python-Entwicklung installieren Sie das SDK von PyPI: pip install foundry-local-sdk.
  3. 3
    Für die JavaScript/Node-Entwicklung installieren Sie das SDK von npm: npm install foundry-local-sdk.
  4. 4
    Führen Sie ein Modell aus dem Katalog aus, um die Installation zu bestätigen: foundry model run qwen2.5-0.5b.
  5. 5
    Listen Sie jederzeit verfügbare Modelle mit foundry model list auf.
  6. 6
    Auf unterstützter Hardware wählt die automatische Erkennung der Hardware-Beschleunigung von Foundry Local NPU, GPU oder CPU für Sie aus; für den Standardpfad ist keine manuelle Konfiguration des Ausführungspfads nötig.

Foundry Local Preise und Lizenzierung

Foundry Local ist kostenlos zu installieren und zu nutzen, ohne Abonnement für reine lokale Inferenz. Die Lizenzierung ist jedoch differenzierter als ein einziger pauschaler Begriff: Das SDK ist MIT-lizenziert, während die CLI unter Microsofts eigenen proprietären Microsoft Software License Terms vertrieben wird — bestätigt durch die eigene LICENSE-Datei des Projekts. Es ist nicht korrekt, das gesamte Produkt als "Open Source" oder vollständig "MIT-lizenziert" zu bezeichnen.

Foundry Local vs. Ollama

Foundry Local und Ollama werden verglichen, weil beide es einem Entwickler ermöglichen, Modelle lokal über eine CLI und eine API auszuführen — der eigentliche Unterschied für einen Leser, der sich zwischen beiden entscheidet, liegt in der darunterliegenden Inferenz-Engine und darin, welches Ökosystem (Microsofts SDKs vs. eine hardware-unabhängige, llama.cpp-basierte Laufzeitumgebung) zur Zielanwendung passt.

Hauptzweck

Foundry Local:
On-Device-Inferenz-Tool mit nativen SDKs zum Bauen von Anwendungen
Ollama:
Universelle lokale Modell-Laufzeitumgebung und API

Inferenz-Engine

Foundry Local:
ONNX Runtime, mit automatischer NPU/GPU/CPU-Auswahl je nach Gerät
Ollama:
Eingebaute, llama.cpp-basierte Engine

Native SDKs

Foundry Local:
C#, JavaScript, Rust, Python
Ollama:
Keine First-Party-SDKs; Community-Bibliotheken für mehrere Sprachen vorhanden

Modellkatalog

Foundry Local:
Kuratierter Katalog (Qwen, DeepSeek, Mistral, Phi, GPT-OSS, Whisper)
Ollama:
Große, weitgehend offene Modellbibliothek

Lizenz

Foundry Local:
Dual: SDK ist MIT, CLI ist Microsofts proprietäre Lizenzbedingungen
Ollama:
MIT (Open Source)

Plattformen

Foundry Local:
Windows, macOS (Apple Silicon), Linux, laut offiziellem README
Ollama:
Läuft auf jedem Mac-, Windows- oder Linux-Rechner

Wenn ein Entwickler speziell eine automatische Hardware-Beschleunigungsauswahl über NPU, GPU und CPU mit nativen C#-, JavaScript-, Rust- oder Python-SDKs möchte — etwa beim Bau einer Windows- oder plattformübergreifenden Client-Anwendung —, passt das Design von Foundry Local direkt zu diesem Anwendungsfall. Wenn ein Entwickler die breitestmögliche Modellbibliothek und eine vollständig quelloffene Laufzeitumgebung möchte, ist der Workflow von Ollama die direktere Wahl. Details finden Sie in der vollständigen Ollama-Review.

Für wen eignet sich Foundry Local?

Ob sich Foundry Local lohnt, hängt vor allem davon ab, ob Sie eine Anwendung bauen (statt nur eine Chat-Oberfläche zu wollen) und ob Microsofts SDK-Sprachen und der Hardware-Beschleunigungsansatz zu Ihrem Projekt passen.

Foundry Local vs. andere lokale KI-Tools

Foundry Local ist im Segment Laufzeitumgebungen und Manager angesiedelt, neben anderen Tools, die Modelle lokal über eine CLI oder API ausführen. Den vollständigen Katalog finden Sie im Local LLM Software Directory.

  • Ollama — eine universelle lokale Modell-Laufzeitumgebung und API auf Basis von llama.cpp, vollständig MIT-lizenziert, mit einer größeren und offeneren Modellbibliothek und ohne Microsoft-spezifische SDK-Anforderung. Die direktere Wahl, wenn Sie die breitestmögliche Hardware-Kompatibilität und Modellauswahl statt nativer C#/JavaScript/Rust/Python-SDKs wollen. Details in der vollständigen Ollama-Review.
  • LM Studio — eine GUI-orientierte Desktop-App für lokale Inferenz mit eingebautem Modell-Browser und Dokument-Chat-Funktion, gerichtet an Endnutzer statt an Entwickler, die ein SDK integrieren. Eine engere Wahl als Foundry Local, wenn Sie eine ausgereifte grafische App statt eines CLI- und SDK-Entwickler-Tools wollen. Details in der vollständigen LM-Studio-Review.
  • Docker Model Runner — eine CLI- und API-Funktion, gebündelt mit Docker Desktop/Engine, für Entwickler, die bereits in einem Docker-basierten Workflow arbeiten — eine weitere Option, die Sie gegen den nativen SDK-Ansatz von Foundry Local abwägen können, wenn Ihr Stack containerzentriert ist. Details in der vollständigen Docker-Model-Runner-Review.

Häufige Fehler bei der Bewertung von Foundry Local

Die meiste Verwirrung um Foundry Local entsteht durch die Vermischung mit Azure AI Foundry oder die Annahme, das gesamte Produkt sei Open Source.

Häufig gestellte Fragen

Was ist Foundry Local?

Foundry Local (github.com/microsoft/Foundry-Local) ist Microsofts On-Device-KI-Inferenz-Tool — eine durchgängige lokale KI-Lösung zum Bauen von Anwendungen, die vollständig auf dem Gerät des Nutzers laufen, mit nativen SDKs für C#, JavaScript, Rust und Python.

Ist Foundry Local dasselbe wie Azure AI Foundry?

Nein. Foundry Local ist ein eigenständiges On-Device-Produkt, das vollständig auf dem Gerät eines Nutzers läuft und für die reine lokale Nutzung kein Azure-Abonnement benötigt. Azure AI Foundry ist Microsofts cloudbasierte Plattform zum Bauen und Bereitstellen von KI in großem Maßstab. Beide sind für ein Zusammenspiel in Hybrid-Workflows konzipiert, aber kein identisches Produkt.

Ist Foundry Local Open Source?

Teilweise. Das SDK ist MIT-lizenziert, aber die CLI wird laut LICENSE-Datei des Projekts unter Microsofts eigenen proprietären Microsoft Software License Terms vertrieben. Es ist nicht korrekt, das gesamte Produkt als Open Source zu bezeichnen.

Ist Foundry Local kostenlos?

Ja, Foundry Local selbst ist kostenlos zu installieren und für reine lokale Inferenz zu nutzen, ohne Abonnement. Einzelne heruntergeladene Modelle haben eigene, separate Lizenzbedingungen, und jede Nutzung von Azure AI Foundry daneben in einem Hybrid-Workflow fällt unter Azures eigene, separate Abrechnung.

Wie installiere ich Foundry Local?

Laden Sie den CLI-Installer von GitHub Releases herunter, installieren Sie das Python-SDK mit pip install foundry-local-sdk, oder installieren Sie das JavaScript/Node-SDK mit npm install foundry-local-sdk.

Welche Plattformen unterstützt Foundry Local?

Windows, macOS (Apple Silicon) und Linux, laut offiziellem README. Prüfen Sie das offizielle Repository direkt auf vollständige Plattform- und Geräteabdeckung, bevor Sie eine bestimmte Geräteklasse als unterstützt annehmen.

Welche Modelle sind im Katalog von Foundry Local verfügbar?

Der Katalog ist kuratiert und umfasst Modellfamilien wie Qwen, DeepSeek, Mistral, Phi und GPT-OSS sowie Whisper für Audiotranskription. Jedes Modell hat eigene, separate Lizenzbedingungen.

Bietet Foundry Local eine OpenAI-kompatible API?

Ja. Foundry Local stellt einen lokalen Webserver bereit, der OpenAI-Anfrage- und -Antwortformate unterstützt, einschließlich des OpenAI-Responses-API-Formats, sodass Anwendungen, die gegen diese API-Form gebaut sind, mit minimalen Änderungen integriert werden können.

Welche Inferenz-Engine nutzt Foundry Local?

Foundry Local nutzt ONNX Runtime für die Inferenz, mit automatischer Erkennung der Hardware-Beschleunigung, die den optimalen Ausführungspfad — NPU, GPU oder CPU — je nach Gerät wählt.

Wie viele GitHub-Sterne hat Foundry Local?

Das Repository von Foundry Local (github.com/microsoft/Foundry-Local) zeigte laut Verzeichnisprüfung dieser Seite Stand 5. September 2026 2.541 Sterne. Prüfen Sie das Repository direkt auf eine aktuelle Zahl, da sie sich im Lauf der Zeit ändert.

Quellen

← Zurück zu Lokale LLMs Pro