Skip to main content
PromptQuorum
/고급 로컬 LLM/Foundry Local 리뷰 2026: Microsoft의 온디바이스 AI 런타임
Overview & Reference

Foundry Local 리뷰 2026: Microsoft의 온디바이스 AI 런타임

·읽는 시간: 11분·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

Foundry Local(github.com/microsoft/Foundry-Local)은 Microsoft의 온디바이스 AI 추론 도구입니다 — 사용자의 기기에서 완전히 실행되는 애플리케이션을 구축하기 위한 엔드투엔드 로컬 AI 솔루션으로, C#, JavaScript, Rust, Python용 네이티브 SDK, 자동 하드웨어 가속 감지(기기별로 NPU, GPU, CPU 중 선택), 엄선된 모델 카탈로그를 경량(약 20MB) 패키지로 제공합니다. 이는 Azure AI Foundry와는 별개입니다 — Azure AI Foundry는 대규모로 AI를 구축하고 배포하기 위한 Microsoft의 클라우드 기반 플랫폼입니다. Foundry Local은 완전히 기기에서 실행되며 로컬 전용 사용에는 Azure 구독이 필요하지 않은 반면, Azure AI Foundry는 별도의 클라우드 제품입니다. 두 제품은 하이브리드 워크플로에서 상호 연동되도록 설계되었지만 동일한 제품은 아닙니다. 라이선스는 분리되어 있습니다: SDK는 MIT 라이선스이지만, CLI는 Microsoft 자체의 독점적인 Microsoft 소프트웨어 사용권 조항(Microsoft Software License Terms)으로 배포됩니다 — 제품 전체를 "오픈소스"라고 설명하는 것은 정확하지 않습니다. 설치는 CLI(GitHub Releases에서), Python용 pip install foundry-local-sdk, 또는 JavaScript/Node용 npm install foundry-local-sdk를 통해 이루어지며, 공식 README에 따르면 Windows, macOS(Apple Silicon), Linux에서 실행됩니다. 이 사이트 자체 디렉터리 데이터에 따르면 GitHub 저장소는 2026년 9월 5일 기준 2,541개의 스타를 기록했습니다.

Foundry Local(github.com/microsoft/Foundry-Local, foundrylocal.ai)은 Microsoft의 온디바이스 AI 추론 도구로, 사용자의 기기에서 완전히 실행되는 애플리케이션을 구축하기 위한 엔드투엔드 로컬 AI 솔루션입니다. C#, JavaScript, Rust, Python용 네이티브 SDK, 자동 하드웨어 가속 감지, 엄선된 모델 카탈로그를 제공하며, 경량(약 20MB) 패키지로 배포됩니다. 이 리뷰는 Foundry Local이 실제로 무엇인지, Microsoft의 클라우드 기반 Azure AI Foundry와 어떻게 다른지, 이중 라이선스 구조, 설치 방법, 다른 로컬 추론 도구와의 위치를 다룹니다.

Foundry Local 리뷰 2026: Microsoft의 온디바이스 AI 런타임

핵심 요점

  • Foundry Local은 Microsoft의 온디바이스 AI 추론 도구; 소스는 github.com/microsoft/Foundry-Local, 프로젝트 사이트는 foundrylocal.ai
  • C#, JavaScript, Rust, Python용 네이티브 SDK와, 기기별로 최적의 실행 프로바이더(NPU, GPU, CPU)를 선택하는 자동 하드웨어 가속 감지
  • 공식 README에 따르면 Windows, macOS(Apple Silicon), Linux에서 실행됨; 독자는 특정 기기 클래스에 대한 전체 플랫폼 지원 여부를 공식 저장소에서 직접 확인해야 함
  • 경량 패키지, 약 20MB
  • 라이선스는 분리되어 있음: SDK는 MIT 라이선스이지만, CLI는 Microsoft 자체의 독점적인 Microsoft 소프트웨어 사용권 조항으로 배포 — 완전한 오픈소스 제품은 아님
  • Azure AI Foundry와는 별개: Foundry Local은 기기에서 실행되며 로컬 전용 사용에는 Azure 구독이 필요하지 않은 반면, Azure AI Foundry는 대규모로 AI를 구축하고 배포하기 위한 Microsoft의 별도 클라우드 플랫폼임; 두 제품은 하이브리드 워크플로에서 상호 연동되도록 설계됨
  • 엄선된 모델 카탈로그에는 Qwen, DeepSeek, Mistral, Phi, GPT-OSS 등의 모델 계열과 음성 텍스트 변환용 Whisper가 포함됨 — 다운로드한 각 모델은 자체적인 별도 라이선스 조건을 가짐
  • 로컬 웹 서버를 통해(OpenAI Responses API 형식을 포함한) OpenAI 호환 API를 제공하며, 추론에는 ONNX Runtime을 사용
  • GitHub 저장소는 2,541개의 스타를 표시, 2026년 9월 5일 github.com/microsoft/Foundry-Local에서 확인

📍 한 문장으로

Foundry Local은 Microsoft의 온디바이스 AI 추론 도구로, C#, JavaScript, Rust, Python용 네이티브 SDK, 자동 하드웨어 가속 감지, 엄선된 모델 카탈로그를 제공하며, 클라우드 기반의 Azure AI Foundry와는 별개의 제품이다.

💬 쉽게 말하면

Foundry Local을 사용하면 개발자는 사용자의 Windows, Mac, Linux 기기에서 직접 AI 모델을 실행하는 애플리케이션을 구축할 수 있으며, 해당 기기에서 가장 빠른 칩(NPU, GPU, CPU)을 자동으로 선택하고, 로컬 사용에는 클라우드 계정이 필요하지 않다. 이는 Microsoft의 클라우드 플랫폼인 Azure AI Foundry와는 다르다 — 두 제품은 함께 작동할 수 있지만, Foundry Local의 전체 요점은 오프라인, 기기 상에서 실행되는 것이다.

📌참고: 이 리뷰는 로컬 LLM 소프트웨어 디렉터리에 있는 Foundry Local 항목을 심층적으로 보완합니다 — Foundry Local이 다른 수십 가지 로컬 AI 도구와 한눈에 어떻게 비교되는지는 해당 페이지를 참조하세요.

Foundry Local이란?

Foundry Local은 Microsoft의 온디바이스 AI 추론 도구입니다 — 사용자의 기기에서 완전히 실행되는 애플리케이션을 구축하기 위한 엔드투엔드 로컬 AI 솔루션입니다. GitHub 저장소는 이를 네이티브 SDK, 자동 하드웨어 가속, 엄선된 모델 카탈로그를 경량 패키지에 결합한 것으로 설명하며, 원격 서버가 아닌 기기 자체에서 추론이 이루어져야 하는 개발자를 대상으로 합니다.

  • 핵심 기능: 런타임이 사용 가능한 최상의 하드웨어 가속을 자동으로 감지하고 사용하면서 기기에서 로컬로 AI 모델 추론을 실행
  • 네이티브 SDK: C#, JavaScript, Rust, Python으로, 개발자는 별도의 래퍼 없이 각 언어로 작성된 애플리케이션에 로컬 추론을 통합할 수 있음
  • 자동 하드웨어 가속 감지: 런타임은 개발자가 해당 선택을 하드코딩하도록 요구하는 대신, 실행 중인 기기에 최적인 실행 프로바이더(NPU, GPU, CPU)를 선택함
  • 모델 카탈로그: 개방적이고 무제한적인 업로드 시스템이 아니라 엄선된 모델 집합
  • 개발사: Microsoft; 코드를 호스팅하는 GitHub 조직은 microsoft
  • 정식 저장소: github.com/microsoft/Foundry-Local; 프로젝트 사이트: foundrylocal.ai

Foundry Local vs. Azure AI Foundry

Foundry Local에 대해 가장 중요하게 짚어야 할 구분점입니다: Foundry Local은 대규모로 AI를 구축하고 배포하기 위한 Microsoft의 클라우드 기반 플랫폼인 Azure AI Foundry와 동일한 제품이 아닙니다. Microsoft 자체 포지셔닝에 따르면 Foundry Local은 "Azure AI Foundry의 성능을 클라이언트 기기로 가져오는 고성능 로컬 AI 런타임 스택"이며, 이 표현은 두 제품이 동일한 것이 아니라 의도적인 관계에 있음을 나타냅니다.

추론 실행 위치

Foundry Local:
사용자 자신의 기기에서 완전히 실행
Azure AI Foundry:
Microsoft의 클라우드 인프라

Azure 계정 필요 여부

Foundry Local:
로컬 전용 사용에는 불필요
Azure AI Foundry:
필요함(Azure 클라우드 서비스이므로)

오프라인 사용 가능 여부

Foundry Local:
모델을 다운로드하면 가능
Azure AI Foundry:
불가능(호스팅된 클라우드 플랫폼이므로)

주요 목적

Foundry Local:
클라이언트 애플리케이션을 위한 온디바이스 추론
Azure AI Foundry:
클라우드 규모로 AI 솔루션 구축 및 배포

두 제품은 하이브리드 워크플로에서 상호 연동되도록 설계되었습니다 — 개발자는 Foundry Local로 로컬에서 프로토타입을 만들고 테스트한 다음, 단일 기기가 제공할 수 있는 것보다 더 많은 용량이 필요할 때 Azure AI Foundry의 클라우드 엔드포인트로 워크로드를 확장할 수 있습니다 — 그러나 이들은 여전히 별개의 제품이며, Foundry Local은 로컬 전용 사용에 Azure 구독이 필요하지 않습니다. 두 이름이 같은 것을 가리킨다거나, Foundry Local을 설치하면 Azure 계정에 대한 어떤 의존성이 생긴다고 가정하지 마세요.

Foundry Local의 주요 이정표

Microsoft는 Foundry Local을 더 폭넓은 Azure AI Foundry 플랫폼의 온디바이스 대응 제품으로 출시했습니다. 클라우드가 아닌 클라이언트 하드웨어에서 추론이 실행되어야 하는 개발자를 대상으로 합니다.

  1. 1
    초기 출시 — 온디바이스 추론 도구
    Why it matters: Foundry Local은 Microsoft의 전반적인 클라우드 AI 전략과 무관한 독립 제품이 아니라, Azure AI Foundry의 로컬 클라이언트 기기 대응 제품으로 구체적으로 포지셔닝되어 출시되었다.
  2. 2
    진행 중 — 네이티브 SDK 확장(C#, JavaScript, Rust, Python)
    Why it matters: 여러 네이티브 SDK가 있다는 것은, 서로 다른 언어 생태계에서 작업하는 개발자들이 단일 참조 구현을 중심으로 자체 바인딩을 작성하지 않고도 온디바이스 추론을 통합할 수 있음을 의미한다.
  3. 3
    진행 중 — 추론 엔진으로서의 ONNX Runtime
    Why it matters: 프로젝트 전용 추론 엔진이 아닌 ONNX Runtime을 기반으로 구축함으로써, Foundry Local은 ONNX Runtime 자체의 하드웨어 가속 및 실행 프로바이더 생태계로부터 이점을 얻을 수 있다.
  4. 4
    진행 중 — 엄선된 모델 카탈로그 확장
    Why it matters: 카탈로그는 Qwen, DeepSeek, Mistral, Phi, GPT-OSS 등의 모델 계열과 음성 텍스트 변환용 Whisper를 포함하도록 확장되어, 개발자가 동일한 SDK 표면을 통해 로컬로 실행할 수 있는 범위를 넓혔다.
  5. 5
    진행 중 — OpenAI 호환 API 표면
    Why it matters: OpenAI Responses API 형식을 포함한 OpenAI 호환 API를 제공함으로써, 이미 해당 API 형태에 맞춰 구축된 애플리케이션의 통합 비용을 낮춘다.

Foundry Local로 무엇을 할 수 있나?

GitHub README에 따르면, Foundry Local의 기능 집합은 개발자가 온디바이스 추론을 쉽게 통합할 수 있도록 하는 데 중점을 둡니다.

  • 네이티브 SDK — C#, JavaScript, Rust, Python SDK를 통해 각 언어로 작성된 애플리케이션에 로컬 추론을 직접 통합
  • 자동 하드웨어 가속 감지 — 개발자가 수동으로 감지하고 구성할 필요 없이 런타임이 기기별로 최적의 실행 프로바이더(NPU, GPU, CPU)를 선택
  • 엄선된 모델 카탈로그 — Qwen, DeepSeek, Mistral, Phi, GPT-OSS 등의 모델 계열과 음성 텍스트 변환용 Whisper; 카탈로그는 개방된 업로드 시스템이 아니라 엄선되어 있으며, 각 모델은 자체적인 별도 라이선스 조건을 가짐
  • OpenAI 호환 API — OpenAI Responses API 형식을 포함한 OpenAI 요청 및 응답 형식을 지원하는 로컬 웹 서버로, 이미 해당 API 형태로 통합된 애플리케이션에 대응
  • ONNX Runtime을 통한 추론 — 모델은 ONNX Runtime을 통해 실행되며, 이는 감지된 하드웨어 가속 경로에서 실제 실행을 처리함
  • 경량 사용 공간 — 런타임 자체는 약 20MB의 설치 용량이며, 모델은 카탈로그에서 별도로 다운로드됨
  • 모델 관리용 CLIfoundry model run <model-name>, foundry model list와 같은 명령으로 터미널에서 모델을 실행하고 나열
  • 크로스플랫폼 지원 — 공식 README에 따르면 Windows, macOS(Apple Silicon), Linux

사용 예시: Foundry Local을 사용하는 세 가지 방법

이는 위에서 문서화된 Foundry Local의 CLI 및 SDK를 기반으로 한 워크플로이며, 가상의 사용 사례가 아닙니다.

설치 및 시작하기

Foundry Local은 CLI 및 SDK 개발자 도구이지, OS별 다운로드 버튼이 있는 단일 소비자용 앱이 아닙니다. 따라서 설치는 마케팅 페이지의 서명된 설치 프로그램이 아니라 GitHub Releases와 언어별 패키지 매니저를 통해 이루어집니다.

  1. 1
    GitHub Releases에서 플랫폼에 맞는 CLI 설치 프로그램을 다운로드하세요 — 릴리스 태그는 cli-preview-0.10.0과 같은 패턴을 따르므로, 특정 버전 번호를 가정하지 말고 Releases 페이지에서 현재 버전을 직접 확인하세요.
  2. 2
    Python 개발의 경우 PyPI에서 SDK를 설치하세요: pip install foundry-local-sdk.
  3. 3
    JavaScript/Node 개발의 경우 npm에서 SDK를 설치하세요: npm install foundry-local-sdk.
  4. 4
    설치가 제대로 작동하는지 확인하려면 카탈로그의 모델을 실행하세요: foundry model run qwen2.5-0.5b.
  5. 5
    언제든지 foundry model list로 사용 가능한 모델을 나열할 수 있습니다.
  6. 6
    지원되는 하드웨어에서는 Foundry Local의 자동 하드웨어 가속 감지가 NPU, GPU, CPU 중에서 자동으로 선택합니다; 기본 경로에서는 실행 프로바이더를 수동으로 구성할 필요가 없습니다.

Foundry Local 가격 및 라이선스

Foundry Local은 설치와 사용이 무료입니다. 로컬 전용 추론에는 구독이 필요하지 않습니다. 하지만 라이선스는 단일한 포괄적 용어보다 더 세밀합니다: SDK는 MIT 라이선스이지만, CLI는 Microsoft 자체의 독점적인 Microsoft 소프트웨어 사용권 조항으로 배포됩니다 — 이는 프로젝트 자체의 LICENSE 파일을 통해 확인되었습니다. 제품 전체를 "오픈소스" 또는 완전히 "MIT 라이선스"로 설명하는 것은 정확하지 않습니다.

Foundry Local vs. Ollama

Foundry Local과 Ollama가 비교되는 이유는 둘 다 개발자가 CLI와 API를 통해 로컬에서 모델을 실행할 수 있게 해주기 때문입니다 — 둘 중 무엇을 선택할지 고민하는 독자에게 진짜 차이점은 그 이면의 추론 엔진과, 대상 애플리케이션에 어떤 생태계(Microsoft의 SDK 대 하드웨어에 구애받지 않는 llama.cpp 기반 런타임)가 맞는지에 있습니다.

주요 목적

Foundry Local:
애플리케이션 구축을 위한 네이티브 SDK를 갖춘 온디바이스 추론 도구
Ollama:
범용 로컬 모델 런타임 및 API

추론 엔진

Foundry Local:
ONNX Runtime, 기기별로 NPU/GPU/CPU 자동 선택
Ollama:
내장된 llama.cpp 기반 엔진

네이티브 SDK

Foundry Local:
C#, JavaScript, Rust, Python
Ollama:
공식 SDK 없음; 여러 언어를 위한 커뮤니티 라이브러리 존재

모델 카탈로그

Foundry Local:
엄선된 카탈로그(Qwen, DeepSeek, Mistral, Phi, GPT-OSS, Whisper)
Ollama:
대규모의 폭넓게 개방된 모델 라이브러리

라이선스

Foundry Local:
이중: SDK는 MIT, CLI는 Microsoft의 독점 라이선스 조항
Ollama:
MIT(오픈소스)

플랫폼

Foundry Local:
공식 README에 따르면 Windows, macOS(Apple Silicon), Linux
Ollama:
모든 Mac, Windows, Linux 기기에서 실행

개발자가 Windows나 크로스플랫폼 클라이언트 애플리케이션 구축 등을 위해 C#, JavaScript, Rust, Python 네이티브 SDK로 NPU, GPU, CPU 간의 자동 하드웨어 가속 선택을 특별히 원한다면, Foundry Local의 설계가 해당 사용 사례에 직접 맞습니다. 개발자가 가장 폭넓은 모델 라이브러리와 완전한 오픈소스 런타임을 원한다면, Ollama의 워크플로가 더 직접적인 선택입니다. 자세한 내용은 Ollama 리뷰 전문을 참조하세요.

Foundry Local은 누구에게 적합한가?

Foundry Local을 도입할 가치가 있는지는 주로 여러분이 애플리케이션을 구축하고 있는지(단순히 채팅 인터페이스를 원하는 것이 아니라), 그리고 Microsoft의 SDK 언어와 하드웨어 가속 접근 방식이 여러분의 프로젝트에 맞는지에 달려 있습니다.

Foundry Local vs. 다른 로컬 AI 도구

Foundry Local은 CLI나 API를 통해 로컬로 모델을 실행하는 다른 도구들과 함께 런타임 및 관리자 부문에 속합니다. 전체 카탈로그는 로컬 LLM 소프트웨어 디렉터리를 참조하세요.

  • Ollama — llama.cpp 기반의 범용 로컬 모델 런타임 및 API로, 완전히 MIT 라이선스이며, 더 크고 개방적인 모델 라이브러리를 갖추고 있고 Microsoft 전용 SDK 요구 사항이 없습니다. C#/JavaScript/Rust/Python 네이티브 SDK보다 가장 폭넓은 하드웨어 호환성과 모델 선택지를 원하는 경우 더 직접적으로 맞는 선택지입니다. 자세한 내용은 Ollama 리뷰 전문을 참조하세요.
  • LM Studio — 로컬 추론을 위한 GUI 우선 데스크톱 앱으로, 내장 모델 브라우저와 문서 채팅 기능을 갖추고 있으며 SDK를 통합하는 개발자가 아닌 최종 사용자를 대상으로 합니다. CLI 및 SDK 개발자 도구가 아니라 세련된 그래픽 앱을 원한다면 Foundry Local보다 더 가까운 선택지입니다. 자세한 내용은 LM Studio 리뷰 전문을 참조하세요.
  • Docker Model Runner — 이미 Docker 기반 워크플로에서 작업 중인 개발자를 위해 Docker Desktop/Engine에 번들로 제공되는 CLI 및 API 기능으로, 스택이 컨테이너 중심이라면 Foundry Local의 네이티브 SDK 접근 방식과 비교해볼 만한 또 다른 옵션입니다. 자세한 내용은 Docker Model Runner 리뷰 전문을 참조하세요.

Foundry Local 평가 시 흔한 실수

Foundry Local에 대한 혼란의 대부분은 이를 Azure AI Foundry와 혼동하거나, 제품 전체가 오픈소스라고 가정하는 데서 비롯됩니다.

자주 묻는 질문

Foundry Local이란 무엇인가요?

Foundry Local(github.com/microsoft/Foundry-Local)은 Microsoft의 온디바이스 AI 추론 도구로, 사용자의 기기에서 완전히 실행되는 애플리케이션을 구축하기 위한 엔드투엔드 로컬 AI 솔루션이며 C#, JavaScript, Rust, Python용 네이티브 SDK를 제공합니다.

Foundry Local은 Azure AI Foundry와 같은 것인가요?

아닙니다. Foundry Local은 로컬 전용 사용에는 Azure 구독이 필요하지 않으며 사용자의 기기에서 완전히 실행되는 별개의 온디바이스 제품입니다. Azure AI Foundry는 대규모로 AI를 구축하고 배포하기 위한 Microsoft의 클라우드 기반 플랫폼입니다. 두 제품은 하이브리드 워크플로에서 상호 연동되도록 설계되어 있지만 동일한 제품은 아닙니다.

Foundry Local은 오픈소스인가요?

부분적으로 그렇습니다. SDK는 MIT 라이선스이지만, 프로젝트의 LICENSE 파일에 따르면 CLI는 Microsoft 자체의 독점적인 Microsoft 소프트웨어 사용권 조항으로 배포됩니다. 제품 전체를 오픈소스라고 부르는 것은 정확하지 않습니다.

Foundry Local은 무료인가요?

네, Foundry Local 자체는 로컬 전용 추론에 대해 구독 없이 설치와 사용이 무료입니다. 다운로드한 개별 모델은 자체적인 별도 라이선스 조건을 가지며, 하이브리드 워크플로에서 Azure AI Foundry를 함께 사용하는 경우 Azure 자체의 별도 청구가 발생합니다.

Foundry Local은 어떻게 설치하나요?

GitHub Releases에서 CLI 설치 프로그램을 다운로드하거나, pip install foundry-local-sdk로 Python SDK를 설치하거나, npm install foundry-local-sdk로 JavaScript/Node SDK를 설치하세요.

Foundry Local은 어떤 플랫폼을 지원하나요?

공식 README에 따르면 Windows, macOS(Apple Silicon), Linux입니다. 특정 기기 클래스가 지원된다고 가정하기 전에 공식 저장소에서 전체 플랫폼 및 기기 지원 범위를 직접 확인하세요.

Foundry Local의 카탈로그에는 어떤 모델이 있나요?

카탈로그는 엄선되어 있으며 Qwen, DeepSeek, Mistral, Phi, GPT-OSS 등의 모델 계열과 음성 텍스트 변환용 Whisper를 포함합니다. 각 모델은 자체적인 별도 라이선스 조건을 가집니다.

Foundry Local은 OpenAI 호환 API를 제공하나요?

네. Foundry Local은 OpenAI Responses API 형식을 포함한 OpenAI 요청 및 응답 형식을 지원하는 로컬 웹 서버를 제공하여, 해당 API 형태로 구축된 애플리케이션이 최소한의 변경으로 통합될 수 있습니다.

Foundry Local은 어떤 추론 엔진을 사용하나요?

Foundry Local은 추론에 ONNX Runtime을 사용하며, 기기별로 최적의 실행 프로바이더(NPU, GPU, CPU)를 선택하는 자동 하드웨어 가속 감지 기능을 갖추고 있습니다.

Foundry Local의 GitHub 스타 수는 얼마나 되나요?

이 사이트 자체 디렉터리 검증에 따르면 Foundry Local의 저장소(github.com/microsoft/Foundry-Local)는 2026년 9월 5일 기준 2,541개의 스타를 표시했습니다. 시간이 지나면서 수치가 변하므로 현재 수치는 저장소에서 직접 확인하세요.

출처

← 고급 로컬 LLM으로 돌아가기