Skip to main content
PromptQuorum
/고급 로컬 LLM/LocalAI 완벽 해설: 셀프호스팅 OpenAI API 대안 (2026)
Overview & Reference

LocalAI 완벽 해설: 셀프호스팅 OpenAI API 대안 (2026)

·12분 소요·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

LocalAI는 독립적으로 로드되는 여러 추론 백엔드 앞단에 OpenAI 호환 API(그리고 Anthropic·ElevenLabs 호환 엔드포인트)를 제공하는 무료, MIT 라이선스, 셀프호스팅 AI 엔진입니다. 하나의 고정된 추론 엔진을 내장하는 대신, 코어가 각 요청을 교체 가능한 백엔드 프로세스로 라우팅합니다—텍스트용 llama.cppvLLM, 이미지 생성용 diffusers 기반 백엔드, 음성 인식용 whisper.cpp 기반 백엔드, 그리고 음성 합성·임베딩용 다른 백엔드들이 그 예입니다. 이 덕분에 하나의 셀프호스팅 인스턴스가 원래라면 별도의 도구가 필요했을 여러 모달리티를 처리할 수 있습니다. GPU 없이 CPU만으로 동작하거나 NVIDIA CUDA, AMD ROCm, Intel, Vulkan 가속을 사용할 수 있으며, Docker 이미지, macOS 설치 파일, CLI 바이너리 형태로 배포됩니다.

LocalAI는 Ettore Di Giacinto("mudler")가 만들고 github.com/mudler/LocalAI에서 오픈소스 커뮤니티가 유지·관리하는 무료, MIT 라이선스, 셀프호스팅 AI 엔진입니다. 독립적으로 로드되는 모듈형 백엔드 앞단에 드롭인 방식의 OpenAI 호환 API(그리고 Anthropic·ElevenLabs 호환 엔드포인트)를 제공하므로, 하나의 인스턴스만으로 텍스트 생성, 이미지 생성, 음성 인식, 음성 합성, 임베딩을 모두 처리할 수 있어 모달리티마다 별도의 도구가 필요하지 않습니다. LocalAI는 llama.cppvLLM 같은 엔진을 대체하지 않습니다—오히려 이 둘(과 다른 엔진들)을 백엔드로 로드할 수 있으며, 경쟁하는 원시 추론 엔진이 아니라 오케스트레이션 겸 API 호환 계층으로 동작합니다.

LocalAI 완벽 해설: 셀프호스팅 OpenAI API 대안 (2026)

핵심 요점

  • 무료이며 MIT 라이선스, Ettore Di Giacinto("mudler")가 만들고 github.com/mudler/LocalAI에서 유지·관리
  • 드롭인 방식의 OpenAI 호환 API, 그리고 Anthropic·ElevenLabs 호환 엔드포인트
  • 고정된 추론 엔진을 내장하는 대신 경량 코어가 독립적으로 로드되는 백엔드로 요청을 라우팅
  • 프로젝트가 문서화한 백엔드에는 텍스트용 llama.cpp와 vLLM, 이미지 생성용 diffusers 기반 백엔드, 음성 인식용 whisper.cpp 기반 백엔드가 포함됨
  • 하나의 실행 중인 인스턴스에서 텍스트 생성, 이미지 생성, 전사, 음성 합성, 임베딩을 처리
  • GPU 없이 CPU만으로 동작하거나 NVIDIA CUDA, AMD ROCm, Intel, Vulkan 가속으로 동작
  • Docker 이미지(CPU·GPU 버전), macOS 설치 파일, CLI 바이너리로 배포되며 Kubernetes 배포도 문서화되어 있음
  • 경쟁하는 원시 추론 엔진이 아님—llama.cpp나 vLLM 같은 엔진을 대체하는 대신 백엔드로 로드함

📍 한 문장으로

LocalAI는 llama.cpp, vLLM, diffusers, whisper.cpp를 포함한 교체 가능한 백엔드 앞단에 OpenAI 호환 API를 제공하는 무료, MIT 라이선스 셀프호스팅 엔진으로, 하나의 인스턴스에서 텍스트·이미지·오디오를 모두 처리한다.

💬 쉽게 말하면

채팅용 앱, 이미지 생성용 앱, 음성 전사용 앱을 따로 쓰는 대신, LocalAI는 OpenAI와 동일한 API를 말하는 단일 셀프호스팅 서버여서 기존 OpenAI 클라이언트 코드가 그대로 이를 가리킬 수 있고, 그 뒤에서는 각 요청이 실제로 그 작업을 처리하는 엔진으로 조용히 위임된다.

📌참고: 이 글은 LocalAI의 공식 GitHub 저장소와 공개 문서를 바탕으로 작성되었으며, 독자적인 벤치마크에 기반한 것은 아닙니다. LocalAI가 자주 릴리스되고 이 글을 위해 버전별 기능 주장이나 성능 수치를 독립적으로 측정하지 않았으므로, 이러한 내용은 의도적으로 포함하지 않았습니다.

LocalAI란 무엇인가?

LocalAI는 자신의 하드웨어에서 OpenAI API와 호환되는 텍스트·이미지·오디오 모델을 실행할 수 있게 해주는 무료, MIT 라이선스, 셀프호스팅 AI 엔진입니다. GitHub에서 "mudler"라는 이름으로 활동하는 Ettore Di Giacinto가 만들었으며, 현재는 오픈소스 커뮤니티가 유지·관리하고 있습니다. 이 프로젝트는 GPU가 반드시 필요하지 않은 상태로 여러 모달리티에 걸쳐 모델을 어떤 하드웨어에서든 실행하는 것을 목표로 삼고 있습니다.

  • Ettore Di Giacinto("mudler")가 만듦; 소스 코드와 문서는 github.com/mudler/LocalAI에 있음
  • MIT 라이선스: 라이선스 조건 범위 내에서 상업적 용도를 포함해 자유롭게 사용, 수정, 셀프호스팅 가능
  • OpenAI API 호환 서버를 제공하며, 문서화된 Anthropic·ElevenLabs 호환 엔드포인트도 갖추고 있어 해당 API용으로 작성된 기존 클라이언트 코드가 종종 셀프호스팅된 LocalAI 인스턴스를 그대로 가리킬 수 있음
  • 단일 모달리티에서의 최고 속도보다는 모달리티의 폭넓음을 중심으로 포지셔닝—하나의 배포에서 텍스트, 이미지, 오디오를 처리
  • 단일 추론 엔진과는 다름: 자체 코어가 요청 라우팅과 API 호환성을 담당하고, 실제 모델 실행은 별도의 백엔드 프로세스에서 이루어짐

LocalAI의 백엔드 아키텍처는 어떻게 작동하는가?

LocalAI의 코어는 경량 라우터이지 단일 거대 추론 엔진이 아닙니다—OpenAI 호환 요청을 받아 어떤 모델과 백엔드에 대응하는지 판단한 뒤, 실제로 추론을 수행하는 별도의 백엔드 프로세스와 통신합니다.

  • 핵심 프로세스는 API 호환성, 요청 라우팅, 모델 구성을 담당한 뒤 gRPC를 통해 백엔드 프로세스와 통신함
  • 프로젝트가 문서화한 백엔드에는 텍스트 생성용 llama.cppvLLM, 이미지 생성용 diffusers 기반 백엔드, 음성 인식용 whisper.cpp 기반 백엔드가 포함됨
  • 백엔드는 모델/백엔드 갤러리에서 설치하거나, 특정 백엔드와 모델을 지정하는 YAML 파일로 수동 구성할 수 있음
  • 백엔드가 독립적으로 설치 가능한 구성 요소이기 때문에, 배포는 실제로 필요한 백엔드만 로드하면 되고 기본적으로 모든 가능한 엔진을 함께 실을 필요가 없음
  • 프로젝트는 기존 엔진을 감싸는 것 외에도 일부 네이티브 백엔드를 직접 개발함

LocalAI는 텍스트 생성 외에 무엇을 할 수 있는가?

LocalAI가 문서화한 범위는 llama.cpp나 vLLM 같은 텍스트 전용 엔진보다 더 많은 모달리티를 다루며, 이것이 이러한 도구들과의 주된 차이점입니다.

텍스트 생성

대표 백엔드:
llama.cpp, vLLM — chat/completions 엔드포인트

이미지 생성

대표 백엔드:
diffusers 기반 백엔드 (Stable Diffusion 계열)

음성 인식(STT)

대표 백엔드:
whisper.cpp 기반 백엔드

음성 합성(TTS)

대표 백엔드:
프로젝트가 문서화한 전용 TTS 백엔드

임베딩

대표 백엔드:
전용 임베딩 모델 백엔드

위 표의 각 행은 해당 모달리티가 작동하려면 설치해야 하는 별도의 백엔드입니다—LocalAI만 설치한다고 모든 모달리티가 자동으로 활성화되지는 않습니다. 정확한 백엔드 이름과 지원 범위는 릴리스마다 달라지므로, 고정된 목록이 아니라 프로젝트 자체 갤러리를 최신 정보원으로 삼아야 합니다.

LocalAI에는 어떤 하드웨어가 필요한가?

LocalAI의 문서화된 포지셔닝은 GPU가 반드시 필요하지는 않으며 어떤 하드웨어에서든 동작한다는 것입니다—동일한 인스턴스가 가벼운 작업에는 CPU만으로 실행되거나, 더 큰 모델에는 GPU가 있을 경우 가속을 사용할 수 있습니다.

CPU 전용

세부 사항:
GPU 없이도 완전히 지원된다고 문서화되어 있으며, 텍스트에는 llama.cpp 같은 CPU 최적화 백엔드를 사용함.

NVIDIA GPU (CUDA)

세부 사항:
전용 CUDA 지원 Docker 이미지가 배포되며, 지원되는 GPU가 있을 때 호환 백엔드가 가속을 사용함.

AMD GPU (ROCm)

세부 사항:
문서화된 AMD 가속 경로로서 ROCm/hipBLAS 지원 Docker 이미지가 배포됨.

Intel GPU (oneAPI)

세부 사항:
Intel GPU 가속을 위한 전용 Intel 지원 Docker 이미지가 배포됨.

Vulkan

세부 사항:
벤더 중립적인 GPU 가속 옵션으로 Vulkan 지원 Docker 이미지가 배포됨.

Apple Silicon (Mac)

세부 사항:
네이티브 macOS 설치 파일이 배포되며, Apple Silicon Mac에서는 Metal 가속 백엔드가 문서화되어 있음.

실제로 사용 가능한 모델 크기와 속도는 여전히 사용 가능한 RAM/VRAM과 특정 모델이 사용하는 백엔드에 좌우됩니다—이는 llama.cpp나 vLLM을 직접 사용할 때와 동일합니다. LocalAI의 "GPU 불필요" 포지셔닝은 CPU 전용 경로가 완전히 지원된다는 의미이지, 모든 모델이나 백엔드가 GPU 없이도 동일하게 잘 동작한다는 뜻은 아닙니다.

LocalAI는 어떻게 설치하고 실행하는가?

LocalAI가 문서화한 가장 빠른 경로는 Docker이며, CPU 전용 이미지와 하드웨어별로 구분된 GPU 가속 이미지 태그가 제공됩니다.

  1. 1
    Docker가 아직 없다면 설치한 뒤, 자신의 하드웨어에 맞는 CPU 전용 이미지 또는 GPU 이미지 태그를 선택합니다.
  2. 2
    CPU 전용으로 사용하려면 다음을 실행합니다: docker run -p 8080:8080 --name local-ai -ti localai/localai:latest.
  3. 3
    NVIDIA GPU라면 대신 CUDA 이미지를 사용합니다. 예: localai/localai:latest-gpu-nvidia-cuda-12이며, Docker 명령어에 --gpus all을 추가합니다.
  4. 4
    AMD, Intel, Vulkan GPU라면 프로젝트가 문서화한 해당 -gpu-hipblas, -gpu-intel, -gpu-vulkan 이미지 태그를 사용합니다.
  5. 5
    컨테이너가 실행되면 LocalAI는 기본적으로 포트 8080에서 대기합니다.
  6. 6
    CLI(local-ai models install <name>)나 웹 UI의 모델 갤러리로 모델을 설치하거나, local-ai run <name>으로 직접 실행하면 필요 시 먼저 다운로드됩니다.
  7. 7
    OpenAI 호환 엔드포인트로 첫 요청을 보냅니다: `curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "<설치된-모델-이름>", "messages": [{"role": "user", "content": "안녕하세요!"}]}'`.
  8. 8
    기존 OpenAI API 클라이언트 코드는 기본 URL과 모델 이름만 바꿔서 셀프호스팅 인스턴스를 가리키게 합니다.

LocalAI를 실행하는 데 GPU가 필요한가요?

아니요—LocalAI는 GPU 없이 CPU만으로 실행 가능하다고 문서화되어 있으며, GPU가 있는 환경을 위해 NVIDIA, AMD, Intel, Vulkan 하드웨어용 GPU 가속 Docker 이미지 태그도 별도로 배포합니다.

LocalAI의 모델은 어디서 가져오나요?

프로젝트는 여러 소스를 문서화하고 있습니다: CLI나 웹 UI로 설치 가능한 자체 모델 갤러리, Hugging Face 저장소, Ollama 형식 참조, 직접 지정하는 YAML 구성 URL, OCI 이미지입니다.

LocalAI는 Ollama와 어떻게 다른가?

LocalAI와 Ollama 모두 간단한 API 뒤에서 모델을 셀프호스팅하기 쉽게 해주지만, 대상 범위가 다릅니다. Ollama는 텍스트(및 일부 비전) 모델을 위한 빠르고 최소한의 단일 사용자용 경로를 중심으로 만들어진 반면, LocalAI는 텍스트·이미지·오디오에 걸친 더 폭넓은 모달리티 지원과 OpenAI/Anthropic/ElevenLabs API 호환성을 중심으로 만들어졌습니다.

  • Ollama는 주로 텍스트(및 일부 비전) 모델에 초점을 맞추며, 매우 단순한 한 줄 설치 및 모델 풀 워크플로로 빠른 단일 사용자 설정을 목표로 함
  • LocalAI는 모달리티마다 다른 백엔드를 로드함으로써 하나의 배포 안에서 더 폭넓은 모달리티 지원—텍스트, 이미지 생성, 전사, 음성 합성—을 문서화함
  • LocalAI는 OpenAI, Anthropic, ElevenLabs 세 가지 API 형식에 대한 드롭인 호환성을 문서화함; Ollama의 주 인터페이스는 자체 API이며 별도의 OpenAI 호환 계층이 있음
  • LocalAI는 자체 갤러리, Hugging Face, YAML 구성과 나란히 Ollama 형식 모델 참조(ollama://)를 지원되는 모델 소스 중 하나로 로드할 수 있음
  • Ollama의 설정 범위는 의도적으로 최소화되어 있음; LocalAI는 그 대신 더 폭넓은 범위를 얻는 대가로 더 많은 설정(백엔드 선택, YAML 모델 구성, 다양한 배포 대상)을 노출함

LocalAI는 llama.cpp, vLLM과 어떻게 다른가?

LocalAI는 llama.cppvLLM과 경쟁하는 원시 추론 엔진이 아닙니다—문서화된 아키텍처상 텍스트 생성을 위해 이 둘을 교체 가능한 백엔드로 로드하며, 이미지와 오디오를 위한 별도의 백엔드도 함께 갖추고 있습니다.

llama.cpp

역할:
CPU/GPU 친화적인 텍스트 추론 엔진; LocalAI가 로드할 수 있는 텍스트 백엔드 중 하나.

vLLM

역할:
높은 처리량의 GPU 서빙 엔진; LocalAI가 로드할 수 있는 또 다른 텍스트 백엔드로 문서화됨.

LocalAI

역할:
이러한 백엔드들 위에 있는 라우팅 겸 API 호환 계층으로, 텍스트 외에 이미지·오디오·임베딩 백엔드를 추가함.
LocalAI 관련 문서 (3개)

기타 언급:

이들 프로젝트 사이의 선택은 보통 "둘 중 하나"의 문제가 아닙니다—LocalAI 배포는 텍스트 요청을 위해 내부적으로 llama.cpp나 vLLM을 실행하고 있을 수 있습니다. 결정해야 할 것은 그 엔진에 직접 접근할 것인지(llama.cpp, vLLM), 아니면 이미지와 오디오 요청도 라우팅할 수 있는 더 넓은 멀티모달 API 계층(LocalAI)을 통할 것인지입니다.

LocalAI는 누구에게 적합한가?

LocalAI는 여러 모달리티를 아우르는 하나의 셀프호스팅 API 표면을 원하는 사람에게 적합하며, 자신의 컴퓨터에서 단일 텍스트 모델로 가는 가장 빠른 경로만을 찾는 사람에게는 적합하지 않습니다.

LocalAI와 대안 도구 한눈에 비교

이 도구들은 일부 겹치지만 범위와 설정 노력에서 차이가 있습니다.

LocalAI

범위:
교체 가능한 백엔드를 통한 텍스트, 이미지, 오디오, 임베딩. Docker, macOS 설치 파일, 또는 CLI 바이너리.
가장 적합한 경우:
OpenAI/Anthropic/ElevenLabs와 호환되는 하나의 셀프호스팅 멀티모달 API.

Ollama

범위:
주로 텍스트(및 일부 비전) 모델. 한 줄 명령으로 설치 및 모델 다운로드.
가장 적합한 경우:
단일 사용자를 위한 로컬 텍스트 모델로 가는 가장 빠른 경로.

llama.cpp

범위:
CPU와 GPU용 텍스트 추론 엔진. CLI, 내장 웹 UI, OpenAI 호환 서버.
가장 적합한 경우:
텍스트 추론에 대한 엔진 수준의 직접적인 제어—흔히 Ollama와 LocalAI 이면의 백엔드.

vLLM

범위:
높은 처리량의 GPU 텍스트 서빙 라이브러리. Python 패키지, OpenAI 호환 서버.
가장 적합한 경우:
텍스트만을 위한 최대 동시 GPU 처리량.

이 글은 이 도구들을 서로 독립적으로 벤치마크하지 않았으며 어느 하나가 기술적으로 우월하다고 주장하지 않습니다—비교는 문서화된 범위, 설정, 아키텍처 사실만을 다룹니다.

이 글이 다루지 않는 것은?

이 글은 LocalAI의 공개 문서와 저장소를 바탕으로 작성된 해설 기사이며, 직접 수행한 벤치마크나 보안 감사가 아닙니다.

  • Ollama, llama.cpp, vLLM 대비 독립적으로 측정한 처리량, 지연 시간, 출력 품질 비교는 포함하지 않음—이는 LocalAI가 어떤 백엔드와 모델을 사용하도록 구성되었는지와 하드웨어에 따라 달라짐
  • 프로젝트가 지원하는 모든 백엔드의 완전한 목록은 아님—백엔드 생태계는 시간에 따라 변하므로 현재 지원 범위에 대해서는 프로젝트 자체 갤러리와 문서가 공식적인 정보원임
  • 코드에 대한 한 줄 한 줄의 보안 감사는 하지 않음—오픈소스이며 MIT 라이선스이므로 소스 코드 자체는 독립적인 검토를 위해 공개되어 있음
  • 모든 배포 대상(Kubernetes 매니페스트, 클라우드별 설정)을 다루지 않음—이 글은 대부분의 셀프호스터가 가장 먼저 시도하는 Docker와 CLI 경로에 초점을 맞춤
  • 프로젝트가 문서화한 범위를 넘어서는 멀티유저 또는 엔터프라이즈 기능(API 키, 쿼터, 인증)에 대한 독립적인 검증은 하지 않음—프로덕션 환경의 접근 제어를 위해 의존하기 전에 공식 문서로 현재 기능을 확인할 것

LocalAI를 사용해 볼 때 흔한 실수

LocalAI를 사용하며 겪는 마찰의 대부분은 그것을 별도 백엔드들 앞의 라우터가 아니라 하나의 고정된 엔진처럼 취급하는 데서 비롯됩니다.

자주 묻는 질문

LocalAI란 무엇인가요?

LocalAI는 Ettore Di Giacinto("mudler")가 만든 무료, MIT 라이선스, 셀프호스팅 AI 엔진으로, 텍스트·이미지·오디오 모델용 교체 가능한 백엔드 앞단에 OpenAI 호환 API를 제공합니다.

LocalAI는 무료인가요?

네. LocalAI는 MIT 라이선스로 배포되는 무료 오픈소스 소프트웨어이며, 셀프호스팅에 구독이나 계정이 필요하지 않습니다.

LocalAI에 GPU가 필요한가요?

아니요—LocalAI는 GPU 없이 CPU만으로 실행 가능하다고 문서화되어 있습니다. NVIDIA CUDA, AMD ROCm, Intel, Vulkan 하드웨어용 GPU 가속 Docker 이미지도 별도로 배포됩니다.

LocalAI는 llama.cpp와 같은 것인가요?

아닙니다. llama.cpp는 텍스트 추론 엔진이고, LocalAI는 llama.cpp(또는 vLLM, 다른 엔진들)를 여러 백엔드 중 하나로 로드할 수 있는 라우팅 겸 API 호환 계층이며, 여기에 이미지와 오디오 백엔드도 추가합니다.

LocalAI가 Ollama보다 나은가요?

"더 낫다"는 범위에 따라 다릅니다: Ollama는 최소한의 설정으로 주로 텍스트 모델에 초점을 맞춘 더 단순하고 좁은 도구인 반면, LocalAI는 더 많은 설정을 대가로 하나의 API 뒤에서 더 폭넓은 모달리티(텍스트, 이미지, 오디오)를 다룹니다.

LocalAI는 어떤 API를 지원하나요?

LocalAI는 OpenAI API에 대한 드롭인 호환성과 함께 Anthropic·ElevenLabs 호환 엔드포인트를 문서화하고 있어, 이러한 API용 기존 클라이언트 코드가 기본 URL만 바꾸면 셀프호스팅된 LocalAI 인스턴스에서 작동하는 경우가 많습니다.

LocalAI는 채팅뿐 아니라 이미지 생성이나 오디오 전사도 할 수 있나요?

네. LocalAI가 문서화한 백엔드에는 이미지 생성을 위한 diffusers 기반 백엔드와 음성 인식을 위한 whisper.cpp 기반 백엔드가 포함되며, 음성 합성과 임베딩용 백엔드도 있습니다.

LocalAI는 모바일 앱 "Loci"와 관련이 있나요?

아니요. Loci는 기기 내 오프라인 채팅을 위한 별도의, 관련 없는 모바일 앱입니다. LocalAI는 github.com/mudler/LocalAI에 있는 셀프호스팅 서버 프로젝트로, Loci와 코드, 회사, 그 어떤 관계도 공유하지 않습니다.

LocalAI는 기본적으로 어떤 포트를 사용하나요?

문서화된 Docker 이미지로 실행할 경우 LocalAI는 기본적으로 포트 8080에서 대기합니다.

LocalAI는 모델을 어디에서 가져올 수 있나요?

프로젝트는 여러 모델 소스를 문서화하고 있습니다: 설치 가능한 자체 갤러리, Hugging Face 저장소, Ollama 형식 참조, 직접 지정하는 YAML 구성 URL, OCI 이미지입니다.

출처

← 고급 로컬 LLM으로 돌아가기