Skip to main content
PromptQuorum
/고급 로컬 LLM/MLC LLM 해설 2026: 한 번 컴파일하면 어디서든 실행
Overview & Reference

MLC LLM 해설 2026: 한 번 컴파일하면 어디서든 실행

·9분 읽기·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

MLC LLM은 머신러닝 컴파일(Apache TVM 기반)을 사용해 모델을 특정 대상 — iOS, Android, WebGPU를 통한 웹 브라우저, 또는 CUDA·Vulkan·Metal·ROCm을 통한 데스크톱 GPU — 에 맞춘 최적화된 런타임으로 컴파일하는 무료 Apache 2.0 라이선스의 범용 LLM 배포 엔진이다. CMU Catalyst, UW SAMPL, SJTU, OctoML 등이 참여한 협업에서 시작되었으며, CMU 교수이자 Apache TVM 개발자인 티안치 첸(Tianqi Chen)이 주요 기여자 중 한 명이다. 서버 없이 브라우저 내 추론에 특화된 자매 프로젝트 WebLLM도 보유하고 있다.

MLC LLM은 언어 모델을 최적화된 런타임으로 컴파일하여 아이폰, 안드로이드 폰, WebGPU를 통한 웹 브라우저, 데스크톱 GPU에서 네이티브로 실행할 수 있게 한다 — 단일 플랫폼에 수동으로 맞춘 하나의 엔진이 아니라, 동일한 모델을 각 대상마다 기계적으로 컴파일하는 방식이다.

MLC LLM 해설 2026: 한 번 컴파일하면 어디서든 실행

핵심 요점

  • Apache 2.0 라이선스 — 개인 및 상업적 사용 모두 무료
  • 2026년 9월 기준 약 23,000개 이상의 GitHub 스타, 저장소는 github.com/mlc-ai/mlc-llm
  • CMU Catalyst, UW SAMPL, SJTU, OctoML, 그리고 더 넓은 MLC 커뮤니티의 협업에서 시작됨
  • CMU 교수이자 Apache TVM·XGBoost·MXNet 개발자, OctoML 공동 창립자인 티안치 첸이 주요 기여자 중 한 명
  • 단일 수작업 엔진 대신 ML 컴파일(Apache TVM, TensorIR, MetaSchedule)을 사용해 대상별 최적화된 런타임 생성
  • iOS/iPadOS, Android, 웹 브라우저(WebGPU 경유), 데스크톱/서버(Linux, macOS, Windows, CUDA·Vulkan·Metal·ROCm 가속)에서 실행

📍 한 문장으로

MLC LLM은 Apache TVM 기반의 머신러닝 컴파일을 사용해 모델을 iOS, Android, WebGPU를 통한 웹 브라우저, 데스크톱 GPU에 맞춘 최적화된 런타임으로 컴파일하는 무료 Apache 2.0 라이선스의 범용 LLM 배포 엔진이다.

💬 쉽게 말하면

대부분의 추론 엔진은 어디서나 동작하려는 하나의 수작업 프로그램이지만, MLC LLM은 각 대상 기기에 맞춰 모델을 개별적으로 컴파일한다 — 컴파일러가 동일한 소스 코드로부터 서로 다른 CPU 아키텍처에 맞는 서로 다른 기계어를 만들어내는 것과 같은 방식이다.

📌참고: WebLLM(github.com/mlc-ai/web-llm)은 동일한 mlc-ai 조직 내 별도의 자매 프로젝트로, 서버 측 추론 없이 웹 브라우저 내에서 모델을 완전히 실행하는 데 특화되어 있다.

MLC LLM이란 무엇인가

MLC LLM은 휴대폰부터 브라우저, 데스크톱 GPU에 이르기까지 다양한 대상 플랫폼에 맞춰 대형 언어 모델을 최적화된 네이티브 런타임으로 컴파일하는 무료 오픈소스 엔진이다. 스스로를 "ML 컴파일을 갖춘 범용 LLM 배포 엔진"이라고 설명한다.

이 프로젝트는 github.com/mlc-ai/mlc-llm에서 Apache 2.0 라이선스로 호스팅되며 약 23,000개의 GitHub 스타를 넘어섰다. CMU Catalyst, UW SAMPL, SJTU, OctoML, MLC 커뮤니티의 구성원들이 시작했다 — 단일 기업이 아닌 그룹에 의한 것이다. CMU 교수이자 Apache TVM·XGBoost·MXNet의 개발자인 티안치 첸이 주요 기여자 중 한 명이다.

  • 각 플랫폼에서 동일한 범용 코드를 해석하는 대신, 대상에 특화된 최적화 런타임으로 모델을 컴파일
  • Apache TVM 및 관련 컴파일러 연구(TensorIR, MetaSchedule)를 기반으로 대상별 자동 최적화 구현
  • 하나의 툴체인에서 iOS/iPadOS, Android, 웹 브라우저, 데스크톱/서버 플랫폼 지원
  • 브라우저 내 완전한 클라이언트 측 추론에 특화된 활발한 자매 프로젝트 WebLLM 보유

여기서 "ML 컴파일"이 실제로 의미하는 것은 무엇인가

ML 컴파일은 새로운 기기에 모델을 배포하는 것을 전통적인 컴파일러가 새로운 CPU 아키텍처에 코드를 배포하는 것과 같은 방식으로 다룬다 — 단일 모델 설명으로부터 최적화된, 대상에 특화된 코드를 자동으로 생성한다. 이것이 MLC LLM이 이토록 다양한 하드웨어를 아우를 수 있게 하는 핵심 발상이다.

  • Apache TVM은 MLC LLM이 구축되는 컴파일러 인프라를 제공하며, 모델 연산 그래프를 대상별로 최적화된 저수준 코드로 변환한다
  • TensorIR은 대상별 최적화 이전에 텐서 연산을 기술하는 데 사용되는 중간 표현이다
  • MetaSchedule은 사람이 각각을 수동으로 작성하고 조정하는 대신, 대상별 고성능 커널 구현을 자동으로 탐색한다
  • 결과적으로 거의 동일한 소스로부터, CUDA를 통해 NVIDIA GPU에서, Vulkan이나 ROCm을 통해 AMD GPU에서, Metal을 통해 Apple GPU에서, WebGPU를 통해 브라우저에서 실행되도록 컴파일할 수 있는 단일 모델이 만들어진다

MLC LLM을 설치하고 배포하는 방법

MLC LLM은 데스크톱/서버 용도로 Python 패키지로 설치되며, iOS와 Android용 사전 빌드된 앱을 제공한다. WebLLM은 브라우저 배포를 위한 JavaScript 패키지로 제공된다. 올바른 경로는 대상 플랫폼에 따라 다르다.

  1. 1
    데스크톱/서버 용도: CUDA, Vulkan, Metal, ROCm 설정을 다루는 공식 설치 가이드에 따라 MLC LLM Python 패키지를 설치한다.
  2. 2
    지원되는 모델을 선택하고 MLC LLM의 변환·컴파일 도구로 대상 기기에 맞게 컴파일하거나, MLC 커뮤니티의 이미 컴파일된 모델을 사용한다.
  3. 3
    모바일용: MLC LLM은 컴파일된 모델과 런타임을 함께 묶은 iOS·Android 예제 앱 프로젝트를 제공한다.
  4. 4
    서버 없는 브라우저 배포용: WebLLM을 JavaScript/TypeScript 패키지로 직접 사용한다. WebGPU를 통해 완전히 클라이언트 측에서 실행된다.
  5. 5
    대상 기기나 브라우저에서 컴파일된 런타임을 실행하고 테스트하여 예상 백엔드(CUDA, Vulkan, Metal, ROCm, WebGPU)에서 가속이 활성화되어 있는지 확인한다.

플랫폼마다 모델을 다시 컴파일해야 하는가?

일반적으로 그렇다. MLC LLM의 컴파일 단계는 특정 대상(특정 GPU 백엔드, 모바일 OS, 브라우저)에 맞춰 최적화된 런타임을 생성하므로, 새 플랫폼에 배포하려면 보통 해당 대상에 맞춰 컴파일해야 한다.

MLC LLM은 GPU 없이 실행될 수 있는가?

컴파일된 런타임은 주로 GPU 가속 경로(CUDA, Vulkan, Metal, ROCm, WebGPU, 모바일 OpenCL)를 중심으로 구축되어 있으며, llama.cpp 같은 엔진과 달리 CPU 중심 배포는 이 프로젝트의 주된 초점이 아니다.

MLC LLM은 어떤 플랫폼과 GPU 백엔드를 지원하는가

MLC LLM의 대표적 특징은 일반적인 데스크톱 GPU뿐 아니라 모바일 운영체제와 웹 브라우저까지 아우르는 플랫폼 지원의 폭이다. 이 조합을 하나의 툴체인에서 지원하는 로컬 추론 엔진은 거의 없다.

  • iOS/iPadOS — Apple A 시리즈 GPU에서의 Metal 가속
  • Android — Adreno 및 Mali GPU에서의 OpenCL 가속
  • 웹 브라우저 — 자매 프로젝트 WebLLM을 통한 WebGPU 및 WASM, 서버 불필요
  • 데스크톱/서버(Linux, macOS, Windows) — CUDA(NVIDIA), Vulkan(AMD/NVIDIA/Intel), Metal(Apple), ROCm(AMD)

MLC LLM은 누구에게 적합한가

배포 대상이 데스크톱 GPU 외에 모바일 기기나 웹 브라우저를 포함한다면 MLC LLM을 사용하라. 대상이 단일 플랫폼 유형뿐이라면 더 좁은 범위의 엔진을 사용하라.

MLC LLM은 llama.cpp 및 다른 엔진과 어떻게 비교되는가

MLC LLM과 가장 가까운 비교 대상은 폭넓은 하드웨어 지원을 지향하는 다른 엔진들이지만, 이 그룹 중 컴파일러 기반 접근 방식과 브라우저 내 배포를 결합한 것은 MLC LLM뿐이다.

도구
라이선스
최적 용도
MLC LLMApache 2.0하나의 파이프라인으로 폰·브라우저·데스크톱 지원
WebLLMApache 2.0완전히 클라이언트 측인 브라우저 내 추론
llama.cppMIT가장 폭넓은 하드웨어 지원, 직접 제어
TensorRT-LLMApache 2.0최대 처리량, NVIDIA GPU 전용
OllamaMIT가장 단순한 단일 데스크톱 구성

MLC LLM을 평가할 때 흔한 오해

대부분의 혼란은 플러그 앤 플레이 바이너리 경험을 기대하거나, WebLLM이 별도의 자매 프로젝트라는 점을 인지하지 못하는 데서 비롯된다.

자주 묻는 질문

MLC LLM이란 무엇인가?

MLC LLM은 머신러닝 컴파일을 사용해 대형 언어 모델을 하나의 툴체인에서 휴대폰, 웹 브라우저, 데스크톱 GPU에 배포하는 무료 Apache 2.0 라이선스 엔진이다.

MLC LLM은 누가 만들었는가?

MLC LLM은 CMU Catalyst, UW SAMPL, SJTU, OctoML, MLC 커뮤니티의 구성원들이 시작했다. CMU 교수이자 Apache TVM·XGBoost·MXNet의 개발자인 티안치 첸이 주요 기여자 중 한 명이다.

MLC LLM은 상업적 이용이 무료인가?

그렇다. MLC LLM은 Apache 2.0 라이선스로, 개인 및 상업적 사용 모두 무료다.

MLC LLM은 웹 브라우저에서 실행될 수 있는가?

그렇다. 자매 프로젝트 WebLLM을 통해 서버 측 추론 없이 WebGPU로 완전히 클라이언트 측에서 모델을 실행할 수 있다.

MLC LLM에서 "ML 컴파일"이란 무엇을 의미하는가?

각 플랫폼마다 수동으로 조정된 단일 엔진에 의존하는 대신, 컴파일 기술(Apache TVM 기반, TensorIR 및 MetaSchedule 사용)을 이용해 특정 대상 기기에 맞춰 최적화된 런타임을 자동으로 생성하는 것을 뜻한다.

MLC LLM은 iOS와 Android를 지원하는가?

그렇다. iOS/iPadOS는 Apple A 시리즈 GPU의 Metal을 통해, Android는 Adreno 및 Mali GPU의 OpenCL을 통해 지원된다.

MLC LLM이 데스크톱에서 지원하는 GPU 백엔드는?

CUDA(NVIDIA), Vulkan(AMD, NVIDIA, Intel), Metal(Apple), ROCm(AMD)이다.

플랫폼마다 모델을 따로 컴파일해야 하는가?

일반적으로 그렇다. MLC LLM은 특정 대상에 맞춰 최적화된 런타임으로 모델을 컴파일하므로, 새 플랫폼(다른 GPU 백엔드, 모바일 OS, 브라우저)에 배포하려면 보통 해당 대상에 맞춰 컴파일해야 한다.

MLC LLM은 llama.cpp와 어떻게 다른가?

llama.cpp는 하드웨어 제조사별로 수동 조정된 백엔드를 가진 수작업 C/C++ 엔진이다. MLC LLM은 대신 컴파일러(Apache TVM)를 사용해 대상별로 최적화된 코드를 자동 생성하며, 이를 통해 모바일 기기와 WebGPU를 통한 웹 브라우저까지 도달할 수 있다.

MLC LLM은 대규모 NVIDIA 특화 프로덕션 서빙에 적합한가?

주된 초점은 아니다. NVIDIA 특화 최대 프로덕션 처리량을 원한다면 TensorRT-LLM이나 vLLM이 더 특화된 도구다. MLC LLM의 강점은 단일 플랫폼에서의 최대 처리량이 아니라 매우 다른 플랫폼 간의 폭넓음에 있다.

출처

← 고급 로컬 LLM으로 돌아가기