Skip to main content
PromptQuorum
/고급 로컬 LLM/Ollama 리뷰 2026: 명령어 하나로 끝나는 로컬 LLM 런타임
Overview & Reference

Ollama 리뷰 2026: 명령어 하나로 끝나는 로컬 LLM 런타임

·13분 소요·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

Ollama는 llama.cpp 기반 엔진, 로컬 REST API, 공식 데스크톱 앱을 통해 오픈 웨이트 AI 모델을 로컬에서 다운로드하고 실행하는 무료 오픈소스 명령줄 도구(ollama.com, 소스 코드는 github.com/ollama/ollama)입니다. 핵심 소프트웨어는 MIT 라이선스이며 무료로, 저장소의 라이선스 파일에서 확인됩니다. GitHub API에 따르면 2026년 9월 12일 기준 GitHub 저장소는 180,722개의 스타를 기록하고 있습니다. Ollama는 macOS(14 Sonoma 이상), Windows, Linux에서 실행되며, 터미널 명령어 하나로 설치되고, http://localhost:11434/v1에서 OpenAI 호환 API를 제공하며, 자신의 컴퓨터가 아닌 Ollama 자체의 호스팅 인프라에서 더 큰 모델을 실행할 수 있는 선택적 유료 클라우드 계층(월 20달러부터)을 별도로 제공합니다.

Ollama(ollama.com, 소스 코드는 github.com/ollama/ollama)는 단일 명령줄 인터페이스, 로컬 REST API, 그리고 2025년 7월부터 제공되는 공식 데스크톱 앱을 통해 자신의 컴퓨터에서 오픈 웨이트 AI 모델을 다운로드하고 실행할 수 있는 무료 오픈소스 도구입니다. llama.cpp 기반 추론을 Docker와 유사한 워크플로(ollama pull, ollama run) 뒤에 패키징했기 때문에 모델을 실행하는 데 컴파일이나 수동 서버 설정이 필요하지 않습니다. 이 리뷰는 Ollama가 실제로 무엇을 하는지, 설치 방법, Modelfile 및 API 시스템, 선택적 유료 클라우드 계층, 그리고 다른 로컬 추론 도구들과의 비교 위치를 다룹니다.

Ollama 리뷰 2026: 명령어 하나로 끝나는 로컬 LLM 런타임

핵심 요점

  • Ollama는 무료이며 오픈소스입니다. 공식 GitHub LICENSE는 MIT 라이선스입니다
  • 내장된 llama.cpp 기반 엔진을 통해 로컬 모델을 실행합니다 — 별도의 컴파일이나 서버 설정이 필요하지 않습니다
  • macOS/Linux에서는 명령어 하나(curl -fsSL https://ollama.com/install.sh | sh), Windows에서는 명령어 하나(irm https://ollama.com/install.ps1 | iex)로 설치되며, 서명된 설치 프로그램, Docker 이미지, 여러 패키지 관리자(Homebrew, Pacman, Nix 등) 빌드도 제공됩니다
  • 커스텀 모델은 FROM, PARAMETER, TEMPLATE, SYSTEM, ADAPTER, LICENSE, MESSAGE 지시어를 사용하는 Modelfile로 정의됩니다
  • 네이티브 REST API(/api/chat, /api/generate)와 http://localhost:11434/v1의 OpenAI 호환 API(/v1/chat/completions, /v1/completions, /v1/models, /v1/embeddings)를 모두 제공합니다
  • ollama.com/library에 모델 라이브러리가 있으며, 현재 공식 문서에는 llama3.2, gemma4, qwen3.5, gpt-oss 같은 모델 이름이 표시됩니다
  • ollama launch는 Claude Code, Codex, VS Code, OpenCode, Droid 같은 코딩 도구에 로컬 모델을 직접 연결합니다
  • 2023년 Jeffrey Morgan과 Michael Chiang이 설립한 캘리포니아주 팔로알토 소재 기업 Ollama Inc.가 개발합니다
  • macOS, Windows, Linux에서 사용 가능하며, Docker Hub(ollama/ollama)와 Homebrew, Pacman, Nix, Guix를 포함한 패키지 관리자로도 이용할 수 있습니다

📍 한 문장으로

Ollama는 llama.cpp 기반 엔진을 통해 자신의 컴퓨터에서 오픈 웨이트 AI 모델을 다운로드하고 실행하는 무료 오픈소스(MIT 라이선스) 명령줄 도구이자 로컬 API이며, 호스팅 추론을 위한 선택적 유료 클라우드 계층도 제공합니다.

💬 쉽게 말하면

추론 엔진을 직접 컴파일하고 그 주위에 서버를 작성하는 대신, Ollama는 모델을 pull한 다음 run하는 두 개의 명령어를 제공하고 나머지는 알아서 처리합니다. AI 모델을 위한 Docker처럼 작동합니다: 하나의 명령어가 모델을 다운로드하고, 다른 명령어가 그것을 실행하며, 로컬 웹 주소를 통해 다른 프로그램이 OpenAI의 API와 대화하듯 그것과 대화할 수 있습니다.

📌참고: 이 리뷰는 로컬 AI 소프트웨어 디렉터리에 있는 Ollama 항목의 심층 보완 자료입니다 — Ollama가 수십 개의 다른 로컬 AI 도구와 한눈에 어떻게 비교되는지는 해당 페이지를 참고하세요.

Ollama란 무엇인가

Ollama는 자신의 하드웨어에서 오픈 웨이트 AI 모델을 실행하기 위한 명령줄 도구, 로컬 API 서버, 그리고 (2025년 7월부터는) 데스크톱 앱입니다. GitHub 저장소는 이를 대규모 언어 모델을 로컬에서 "바로 시작"할 수 있게 해주는 소프트웨어로 설명합니다. 설계는 의도적으로 Docker의 워크플로를 모방했습니다 — 두 공동 창업자는 이전에 2015년 Docker가 인수한 Docker용 GUI인 Kitematic을 만든 바 있으며, 이 때문에 ollama pullollama rundocker pull, docker run과 매우 유사하게 작동합니다.

  • 핵심 기능: 오픈 웨이트 모델을 다운로드하여 내장 추론 엔진을 통해 로컬에서 실행. CLI, 로컬 API, 데스크톱 채팅 인터페이스가 모두 동일한 백그라운드 서비스와 통신
  • 로컬 추론 엔진: Ollama 자체 문서에 따르면 llama.cpp와 GGML 위에 구축되어, Ollama 자체 라이브러리 또는 가져온 GGUF/Safetensors 파일에서 GGUF 형식으로 패키징된 모델을 실행
  • 인터페이스: 터미널 CLI(ollama run <모델>), 파일 및 이미지 드래그 앤 드롭 입력을 지원하는 macOS/Windows용 공식 데스크톱 앱, 그리고 프로그래밍 방식 사용을 위한 REST API
  • 개발사: 캘리포니아주 팔로알토 소재 기업 Ollama Inc. 코드를 호스팅하는 GitHub 조직은 ollama입니다
  • 정식 저장소: github.com/ollama/ollama. 저장소의 LICENSE 파일에 따라 MIT 라이선스

Ollama의 회사 배경과 주요 이정표

Ollama는 2023년 Jeffrey Morgan과 Michael Chiang이 설립했습니다. 두 사람은 워털루 대학교에서 만났으며, 이전에 2015년 Docker가 인수한(이후 Docker Desktop에 통합된) 오픈소스 Docker GUI Kitematic을 만든 바 있습니다. Ollama Inc.는 캘리포니아주 팔로알토에 본사를 두고 있으며, 공개된 스타트업 투자 추적 사이트에 따르면 Benchmark와 Theory Ventures 등의 투자자로부터 벤처 투자를 유치했습니다. PromptQuorum은 1차 출처를 통해 정확한 투자 총액을 독립적으로 확인하지 못했으며, 최신 수치는 Ollama의 공식 발표를 확인할 것을 권장합니다.

  1. 1
    2023년 — 프로젝트 출시
    Why it matters: Ollama의 GitHub 저장소와 초기 공개 릴리스는 오늘날까지 핵심 상호작용 모델로 남아 있는 `pull`/`run` CLI 워크플로를 확립했습니다.
  2. 2
    2025년 7월 — 공식 데스크톱 앱 출시
    Why it matters: 모델 다운로드, 채팅, 파일/이미지 드래그 앤 드롭 입력, 조정 가능한 컨텍스트 길이를 갖춘 macOS 및 Windows용 네이티브 GUI가 추가되었습니다 — 이전에는 CLI와 Open WebUI 같은 서드파티 GUI만이 유일한 인터페이스였습니다.
  3. 3
    2025~2026년 — OpenAI 호환 API 확장
    Why it matters: Ollama는 `/v1`에서 OpenAI 호환 엔드포인트를 추가하고 확장하여 채팅 완성, 완성, 임베딩, 모델 목록 조회를 포괄하게 되었으며, 이미 OpenAI SDK를 기반으로 구축된 도구들을 위한 즉시 대체 가능한 백엔드가 되었습니다.
  4. 4
    2026년 — ollama launch 통합 기능
    Why it matters: [공식 CLI 레퍼런스](https://docs.ollama.com)에 따르면, Claude Code, Codex, VS Code, OpenCode, Droid 같은 코딩 도구가 로컬에서 실행 중인 모델을 가리키도록 설정하는 원 커맨드 설정 기능이 추가되었습니다.
  5. 5
    2026년 — 클라우드 계층 도입
    Why it matters: Ollama Inc.는 자체 하드웨어로는 감당할 수 없는 더 큰 모델을 실행하고 싶은 사용자를 위해, 무료 로컬 소프트웨어와 함께 선택할 수 있는 옵션으로 자체 인프라([ollama.com](https://ollama.com)에 따르면 미국, 유럽, 싱가포르 등의 지역 포함)에서 유료 호스팅 추론을 제공하기 시작했습니다.

Ollama로 할 수 있는 일

Ollama의 기능 구성은 로컬 모델 추론을 연구 프로젝트가 아닌 패키지 관리자처럼 느껴지게 만드는 데 초점을 맞추고 있습니다. 다음은 Ollama의 공식 문서GitHub README에 따라 각 부분이 실제로 수행하는 기능입니다.

  • 모델 라이브러리 — 단일 명령어 ollama pull <모델>ollama.com/library에서 바로 실행 가능한 모델을 pull합니다. 현재 문서에는 Llama, Gemma, Qwen, gpt-oss, DeepSeek, 그리고 nomic-embed-text, embeddinggemma 같은 전용 임베딩 모델 예시가 나와 있습니다
  • Modelfile 커스터마이징FROM(기본 모델, 필수), PARAMETER(온도, 컨텍스트 길이 등 런타임 설정), TEMPLATE(프롬프트 형식), SYSTEM(시스템 프롬프트), ADAPTER(LoRA 어댑터), LICENSE, MESSAGE(사전 설정 대화 기록) 지시어를 사용하는 Modelfile로 커스텀 모델 구성을 정의한 다음, ollama create <이름> -f Modelfile로 빌드합니다
  • 로컬 REST APIhttp://localhost:11434의 네이티브 API에는 /api/generate, /api/chat, /api/embeddings, /api/pull, /api/create 등의 엔드포인트가 있으며, 공식 API 레퍼런스에 문서화되어 있습니다
  • OpenAI 호환 APIhttp://localhost:11434/v1의 두 번째 엔드포인트는 /v1/chat/completions, /v1/completions, /v1/models, /v1/embeddings를 구현하여, OpenAI SDK를 대상으로 작성된 애플리케이션이 기본 URL만 변경하면 Ollama를 가리킬 수 있게 합니다
  • 코딩 도구 통합(ollama launch) — 현재 CLI 문서에 언급된 Claude Code, Codex, VS Code, OpenCode, Droid 같은 외부 도구를 로컬에서 실행 중인 Ollama 모델을 백엔드로 사용하도록 설정하는 대화형 명령어
  • 멀티모달 및 임베딩 지원ollama run은 멀티모달 모델을 위한 이미지 입력을 받아들이며(CLI 문서는 llava를 예시로 듦), 검색/RAG 파이프라인을 위해 전용 임베딩 모델을 실행할 수도 있습니다
  • 데스크톱 앱 — CLI와 함께, 터미널 없이 모델을 다운로드하고 채팅할 수 있는 네이티브 GUI(macOS 및 Windows, 2025년 7월 출시)
  • 선택적 클라우드 계층 — Ollama Inc.는 로컬 하드웨어가 처리할 수 없는 더 큰 모델을 실행하기 위한 별도의 유료 옵션으로 자체 서버에서의 호스팅 추론을 판매합니다. 이는 위의 어떤 로컬 기능에도 필수가 아닙니다

사용 예시: Ollama를 사용하는 세 가지 방법

다음은 위에서 설명한 Ollama의 문서화된 명령어와 API를 바탕으로 한 구체적인 워크플로이며, 가상의 사용 사례가 아닙니다.

Ollama 가격: 무료 소프트웨어, 선택적 유료 클라우드

Ollama 소프트웨어 — CLI, 로컬 API, 데스크톱 앱 — 은 무료이며 오픈소스입니다. GitHub LICENSE 파일은 표준 MIT 라이선스이며, 결제 뒤에 잠긴 기능은 없습니다. 별도로 Ollama Inc.는 ollama.com에서 로컬 머신 대신 자체 서버에서 더 큰 모델을 실행할 수 있는 호스팅 클라우드 서비스를 판매합니다.

로컬 소프트웨어

가격:
무료
포함 내용:
CLI, 로컬 REST/OpenAI 호환 API, 데스크톱 앱, Modelfile 커스터마이징, 그리고 전체 모델 라이브러리 — 완전히 자신의 하드웨어에서 실행

클라우드(무료)

가격:
무료
포함 내용:
ollama.com의 현재 가격 페이지에 따른 클라우드 모델에 대한 제한적 호스팅 접근

클라우드 Pro

가격:
월 20달러부터
포함 내용:
Ollama 자체 서버(Ollama 자체 사이트에 따르면 미국, 유럽, 싱가포르 등의 지역 포함)에서의 호스팅 추론 크레딧과 더 높은 사용 한도 — 무료 로컬 소프트웨어와는 별개인 유료 제품

가격과 클라우드 계층 세부 사항은 변경될 수 있습니다. 구매 결정을 내리기 전에 항상 ollama.com의 가격 페이지를 직접 확인하세요. 유료 클라우드 계층은 Ollama의 무료 로컬 소프트웨어를 설치하고 사용하는 데 전혀 필요하지 않습니다 — 클라우드 서비스는 특정 머신의 RAM/VRAM으로는 감당할 수 없는 너무 큰 모델을 위해 존재합니다.

Ollama vs. LM Studio

Ollama와 LM Studio는 로컬 AI 모델을 실행하기 위해 가장 흔히 추천되는 도구 중 두 가지입니다. 둘 다 llama.cpp 기반 추론을 더 쉬운 인터페이스 뒤에 감싸고 있기 때문에 끊임없이 비교됩니다. 가장 명확한 차이는 CLI 우선이냐 GUI 우선이냐, 그리고 오픈소스냐 클로즈드소스냐입니다.

주요 인터페이스

Ollama:
처음에는 명령줄 중심이었으나 2025년 7월 공식 데스크톱 GUI가 추가됨
LM Studio:
처음부터 그래픽 데스크톱 앱; CLI 우선 워크플로 없음

라이선스

Ollama:
MIT(완전 오픈소스)
LM Studio:
독점 소프트웨어 — 자체 서비스 약관에 따르면 개인 및 비즈니스 사용 모두 무료이지만 오픈소스는 아님

로컬 API

Ollama:
네이티브 REST API에 더해 :11434/v1의 OpenAI 호환 엔드포인트
LM Studio:
OpenAI 호환 REST 엔드포인트에 더해 별도의 베타 버전 LM Studio REST API

모델 형식

Ollama:
자체 라이브러리와 Modelfile 시스템을 통한 GGUF
LM Studio:
GGUF(llama.cpp 경유)와 MLX(Apple Silicon)

내장 문서 채팅(RAG)

Ollama:
내장 기능 아님 — Open WebUI나 AnythingLLM 같은 클라이언트와 조합해야 함
LM Studio:
내장된 "Chat with Documents" 기능 제공

선택적 클라우드 계층

Ollama:
있음, 호스팅 추론 월 20달러부터
LM Studio:
있음, 호스팅 모델과 더 높은 한도를 위한 "Bionic+" 월 20달러부터, "Pro" 월 100달러부터

다른 애플리케이션이 백엔드로 호출할 수 있는 스크립트 가능하고 터미널 중심인 도구를 원한다면 Ollama의 워크플로가 더 직접적으로 맞습니다. 터미널을 전혀 사용하지 않고 내장 모델 브라우저와 문서 채팅 기능을 갖춘 하나의 완성도 높은 GUI를 원한다면 lmstudio.ai에서 LM Studio를 직접 평가해 보세요 — 자세한 내용은 LM Studio 리뷰 전문을 참고하세요. 둘 다 핵심 로컬 기능은 무료입니다. 결정을 내리기 전에 각 프로젝트의 공식 사이트에서 최신 기능을 확인하세요.

Ollama는 누구에게 적합한가

Ollama가 적합한지는 터미널 중심 워크플로에 익숙한지, 그리고 다른 도구가 호출할 수 있는 스크립트 가능한 백엔드가 필요한지에 달려 있습니다.

Ollama와 다른 로컬 런타임 비교

Ollama는 로컬 모델 추론을 더 간단한 인터페이스 뒤에 감싼 여러 도구 중 하나입니다. 이 영역에서 다른 옵션들과 비교해 Ollama가 어떻게 자리매김하는지 살펴보세요 — 전체 카탈로그는 로컬 AI 소프트웨어 디렉터리를, 가장 근접한 정면 비교는 위의 Ollama vs. LM Studio 비교를 참고하세요.

  • LM Studio — 내장 모델 브라우저와 문서 채팅 기능을 갖추고 유사한 영역(로컬 추론, OpenAI 호환 API)을 다루는 GUI 우선 데스크톱 앱. 직접적인 비교는 LM Studio 리뷰와 위의 비교 섹션을 참고하세요.
  • llama.cpp — Ollama 자체가 구축된 기반이 되는 오픈소스 추론 엔진. 직접 사용하면 Ollama의 패키지 관리자 같은 편리함을 대가로 더 낮은 수준의 제어(커스텀 빌드 플래그, GGUF 직접 로딩)가 가능합니다. llama.cpp 해설을 참고하세요.
  • KoboldCpp — 내장 웹 UI를 갖춘, 역사적으로 창작 글쓰기와 롤플레이 용도로 인기 있는 또 다른 llama.cpp 기반 런타임. KoboldCpp 리뷰를 참고하세요.
  • LocalAI — 단일 서버에서 llama.cpp를 넘어선 더 폭넓은 모델 백엔드(이미지와 오디오 모델 포함)를 지원하는 오픈소스이자 OpenAI API 호환 런타임. LocalAI 해설을 참고하세요.

Ollama 평가 시 흔한 오해

Ollama에 대한 대부분의 혼란은 무료 로컬 소프트웨어와 별개의 유료 클라우드 제품을 혼동하거나, 설계상 포함되지 않은 기능(내장 RAG 등)을 기대하는 데서 비롯됩니다.

자주 묻는 질문

Ollama란 무엇인가요?

Ollama(ollama.com, 소스 코드는 github.com/ollama/ollama)는 내장된 llama.cpp 기반 엔진을 통해 자신의 컴퓨터에서 오픈 웨이트 AI 모델을 다운로드하고 실행하는 무료 오픈소스 명령줄 도구, 로컬 API, 데스크톱 앱입니다.

Ollama는 무료인가요?

네. 핵심 소프트웨어 — CLI, 로컬 API, 데스크톱 앱 — 은 MIT 라이선스이며 무료로, 결제 뒤에 잠긴 기능이 없습니다. Ollama Inc.는 자체 서버에서의 호스팅 추론을 위한 선택적 유료 클라우드 계층(월 20달러부터)을 별도로 판매하지만, 이 클라우드 제품은 무료 로컬 소프트웨어를 사용하는 데 필요하지 않습니다.

Ollama는 오픈소스인가요? 어떤 라이선스를 사용하나요?

네. Ollama의 GitHub LICENSE 파일은 표준 MIT 라이선스로, 카피레프트 의무가 없는 가장 관대한 오픈소스 라이선스 중 하나입니다.

Ollama는 어떤 플랫폼을 지원하나요?

공식 다운로드 페이지에 따르면 macOS(14 Sonoma 이상), Windows, Linux입니다. Docker 이미지(ollama/ollama)로도 배포되며 Homebrew, Pacman, Nix, Guix를 포함한 패키지 관리자를 통해서도 이용할 수 있습니다.

Ollama에는 그래픽 인터페이스가 있나요, 아니면 CLI 전용인가요?

둘 다입니다. Ollama는 명령줄 도구로 시작했고 여전히 CLI가 중심이지만, Ollama Inc.는 2025년 7월 macOS와 Windows용 공식 데스크톱 앱을 출시해 터미널 워크플로에 더해 그래픽 채팅 인터페이스를 추가했습니다.

Ollama에는 OpenAI 호환 API가 있나요?

네. http://localhost:11434의 네이티브 REST API에 더해, Ollama는 http://localhost:11434/v1에서 /v1/chat/completions, /v1/completions, /v1/models, /v1/embeddings를 포괄하는 OpenAI 호환 엔드포인트를 제공합니다.

Modelfile이란 무엇인가요?

Modelfile은 커스텀 Ollama 모델을 빌드하는 데 사용되는 텍스트 구성 파일입니다. FROM(기본 모델, 필수), PARAMETER, TEMPLATE, SYSTEM, ADAPTER, LICENSE, MESSAGE 지시어를 지원하며, ollama create <이름> -f Modelfile로 실행 가능한 모델로 빌드됩니다.

Ollama는 GitHub 스타가 몇 개인가요?

GitHub API를 통해 직접 검증한 결과, Ollama의 저장소(github.com/ollama/ollama)는 2026년 9월 12일 기준 180,722개의 스타를 기록했습니다. 매일 변동하므로 최신 수치는 저장소에서 직접 확인하세요.

Ollama는 누가 개발하나요?

캘리포니아주 팔로알토에 본사를 둔 기업 Ollama Inc.입니다. 2023년 Jeffrey Morgan과 Michael Chiang이 설립했으며, 두 사람은 이전에 2015년 Docker가 인수한 Docker용 GUI Kitematic을 만든 바 있습니다.

Ollama에는 검색 증강 생성(RAG)이나 문서 채팅 기능이 포함되어 있나요?

내장되어 있지 않습니다. Ollama는 추론 엔진과 API를 제공하며, 문서 채팅과 RAG 기능은 일반적으로 그 위에 구축된 별도의 클라이언트 계층 — 예를 들어 Open WebUI나 AnythingLLM — 에서 제공됩니다. 둘 다 Ollama의 API에 연결할 수 있습니다.

출처

← 고급 로컬 LLM으로 돌아가기