핵심 요점
- OlliteRT(github.com/NightMean/OlliteRT)는 LLM을 로컬로 실행하고 HTTP로 제공하는 무료 오픈소스 안드로이드 앱입니다 — 채팅 앱이 아닙니다
- 개발자 NightMean이 제작; 저장소는 2026년 4월 6일 생성
- Apache-2.0 라이선스, GitHub 저장소의 라이선스 메타데이터를 통해 확인됨
- Google의 LiteRT-LM 런타임을 통해 온디바이스에서 완전히 실행되며,
.litertlm모델 파일만 배타적으로 사용 — GGUF를 지원하지 않음 - 로컬 네트워크상의 다른 기기가 호출할 수 있는 OpenAI 호환 HTTP API(chat completions, completions)와 Anthropic Messages API 호환 엔드포인트 제공
- GitHub 스타 350개 이상, 포크 47개; 최신 태그 릴리스는 v0.9.6-beta.1(2026년 6월 6일)로, 아직 1.0 릴리스에 도달하지 못함
📍 한 문장으로
OlliteRT는 개발자 NightMean이 만든 무료 오픈소스(Apache-2.0) 안드로이드 앱으로, Google의 LiteRT-LM 런타임을 사용해 폰을 완전 로컬, OpenAI 호환 LLM 추론 서버로 만들며, 이 리뷰 작성 시점 기준 GitHub 스타 350개 이상을 보유하고 있습니다.
💬 쉽게 말하면
폰에서 채팅 앱을 실행하는 대신, OlliteRT는 폰 자체를 작은 서버로 바꿉니다. 모델을 로드하고 서버를 시작하면, 노트북, 스크립트, 홈 오토메이션 도구 등 홈 네트워크상의 다른 기기가 텍스트를 보내고 응답을 받을 수 있습니다. OpenAI API와 대화하는 것과 같은 방식이지만, 모든 것이 폰에서 실행됩니다.
📌참고: 이 리뷰는 OlliteRT 자체 GitHub 저장소, README, 릴리스 이력을 기반으로 합니다. PromptQuorum이 특정 폰 모델에서 실제 처리량이나 배터리 소모 벤치마크를 실행했다고 주장하지 않습니다.
OlliteRT란 무엇인가?
OlliteRT는 실행되는 폰을 로컬 LLM 추론 서버로 바꾸는 안드로이드 애플리케이션으로, 자체 GitHub 저장소 설명에서는 "안드로이드 폰을 OpenAI 호환 LLM 추론 서버로 바꾸기 — 완전 로컬, 프라이빗, 오픈소스"라고 표현합니다. 자체 채팅 창은 없으며, 목적은 추론을 실행하고 다른 소프트웨어의 HTTP 요청에 응답하는 것입니다.
- 제품 유형: 채팅 클라이언트가 아닌 안드로이드 백엔드 서버 애플리케이션 — 채팅 UI 없음
- 제작자: 개발자 NightMean; GitHub 저장소는 github.com/NightMean/OlliteRT에서 호스팅됨
- GitHub 저장소 메타데이터에 따르면 저장소는 2026년 4월 6일 생성됨 — 이 리뷰 작성 시점 기준 신생 프로젝트
- 라이선스: Apache-2.0, GitHub 저장소의 라이선스 메타데이터를 통해 확인됨
- 추론 엔진: Google의 LiteRT-LM 온디바이스 런타임으로, Google이 자체 안드로이드 도구에서 온디바이스 AI 기능에 사용하는 것과 동일한 기반 기술
- 규모: 이 리뷰 작성 시점 기준 GitHub 스타 350개 이상, 포크 47개
프로젝트 역사와 버전 이정표
OlliteRT의 GitHub 저장소는 2026년 4월 6일에 생성되었으며, 그 이후 1.0 이전 태그 릴리스 세 건을 출시했고 모두 여전히 베타로 표시되어 있습니다.
- 12026년 4월 6일: 저장소 생성
Why it matters: GitHub 저장소 메타데이터에 따라 프로젝트의 시작을 나타냅니다. - 2v0.9.0-beta.1 — 2026년 4월 24일
Why it matters: 프로젝트의 GitHub 릴리스 페이지에서 발견된 첫 번째 태그 릴리스입니다. - 3v0.9.5-beta.1 — 2026년 4월 30일
Why it matters: 첫 태그로부터 약 일주일 후의 후속 베타 릴리스입니다. - 4v0.9.6-beta.1 — 2026년 6월 6일
Why it matters: 이 리뷰 작성 시점 기준 가장 최신 태그 릴리스; 프로젝트는 아직 1.0을 출시하지 않았습니다.
OlliteRT는 실제로 무엇을 하는가?
OlliteRT는 폰에 .litertlm 모델 파일을 로드하고, 폰 자체의 CPU와 GPU를 사용해 Google의 LiteRT-LM 런타임을 통해 추론을 실행한 다음, 같은 네트워크상의 다른 기기가 호출할 수 있는 OpenAI 호환 HTTP API로 결과를 제공합니다.
- 온디바이스 추론: Google의 LiteRT-LM 런타임만 배타적으로 사용 — 클라우드 폴백 없음, 다른 백엔드 엔진 없음
- 모델 형식:
.litertlm파일만 지원; llama.cpp 기반 도구가 사용하는 GGUF 형식은 지원하지 않음 - 모델 확보: 프로젝트 README에 따르면 지원되는 모델을 HuggingFace에서 원탭으로 직접 다운로드
- API 호환성: 로컬 네트워크에서 HTTP를 통해 OpenAI 호환 chat-completions 및 completions 엔드포인트와 Anthropic Messages API 호환 엔드포인트를 제공
- 멀티모달 지원: README에 따르면 기반 모델 자체가 해당 모드를 지원하는 경우 비전, 오디오, "사고"(추론) 모델을 지원함
- 하드웨어 가속: 모델별로 구성 가능한 GPU 또는 CPU 가속 설정
- 운영 도구: 내장 벤치마킹 도구, JSON 하이라이팅이 있는 활동 로깅, 서버 모니터링 대시보드, Prometheus 메트릭 통합, Home Assistant REST API 통합
- 단일 모델, 순차 처리 설계: README는 한 번에 하나의 모델만 로드되고 요청이 병렬이 아닌 순차적으로 처리된다고 문서화함
사용 예시: OlliteRT를 사용하는 두 가지 방법
이는 위에서 문서화된 프로젝트 기능을 기반으로 한 구체적인 워크플로입니다.
OlliteRT 설치
OlliteRT는 GitHub 릴리스에서 APK로 무료 설치되며, 소스 코드는 GitHub에 있습니다.
소스 | 링크 |
|---|---|
| GitHub 릴리스(APK 다운로드) | github.com/NightMean/OlliteRT/releases |
| GitHub 저장소(소스 코드, Apache-2.0) | github.com/NightMean/OlliteRT |
이 리뷰 작성 시점 기준, OlliteRT는 GitHub 릴리스에서 직접 APK 다운로드로만 배포됩니다 — 이 리뷰는 Google Play나 F-Droid 등재를 찾지 못했습니다. 안드로이드 12 이상이 설치된 arm64-v8a 기기가 필요합니다. Google Play 외부에서 APK를 설치하려면 안드로이드 설정에서 "알 수 없는 소스에서 설치"를 활성화해야 하며, 공식 GitHub 릴리스 페이지에서만 APK를 다운로드하세요.
플랫폼, 가격, 라이선스
플랫폼
- OlliteRT가 명시한 내용:
- 안드로이드 전용(arm64-v8a 기기, 안드로이드 12+). iOS, 데스크톱, 웹 버전 없음.
비용
- OlliteRT가 명시한 내용:
- 무료 오픈소스. README에서 계정, 구독, 인앱 구매가 발견되지 않음.
라이선스
- OlliteRT가 명시한 내용:
- Apache-2.0, GitHub 저장소의 라이선스 메타데이터를 통해 확인됨.
최소 하드웨어
- OlliteRT가 명시한 내용:
- README에 따르면 최소 6GB RAM; 8GB+ 권장, Gemma 4 E4B(12GB RAM 필요)와 같은 더 크거나 멀티모달 모델은 더 많이 필요.
설치 방법
- OlliteRT가 명시한 내용:
- GitHub 릴리스 페이지에서 직접 APK 다운로드; 이 리뷰 작성 시점 기준 Google Play나 F-Droid 등재 없음.
폰이나 모델을 선택하기 전에 GitHub에서 현재 하드웨어 권장 사항과 지원 모델 목록을 직접 확인하세요. 프로젝트(아직 1.0 이전)가 성숙해짐에 따라 둘 다 변경될 수 있습니다.
OlliteRT vs. PocketPal AI
OlliteRT와 PocketPal AI는 둘 다 폰에서 LLM을 로컬로 실행하지만, 목적이 다릅니다. OlliteRT는 다른 기기가 대화하는 헤드리스 서버인 반면, PocketPal AI는 폰에서 직접 사용하는 채팅 앱입니다.
항목 | OlliteRT | PocketPal AI |
|---|---|---|
| 주요 용도 | 네트워크상의 다른 기기를 위한 헤드리스 추론 서버 | 폰에서 직접 사용하는 온디바이스 채팅 앱 |
| 채팅 인터페이스 | 포함 안 됨 | 내장 채팅 UI |
| 추론 엔진 | Google LiteRT-LM | llama.cpp 기반(GGUF 모델) |
| 모델 형식 | .litertlm만 | GGUF |
| 플랫폼 | 안드로이드 전용 | 안드로이드 및 iOS |
| API 서버 | OpenAI 호환 HTTP API, 핵심 기능 | 핵심 기능이 아님 |
노트북, 스크립트, 스마트 홈 허브에서 서버 역할을 하는 폰으로 요청을 보내고 싶다면 OlliteRT가 그것을 위해 만들어졌습니다. 폰 자체 화면에서 직접 로컬 모델과 채팅하고 싶다면 PocketPal AI 같은 채팅 우선 앱이 더 적합합니다 — 자세한 내용은 PocketPal AI 리뷰를 참고하세요.
OlliteRT는 누구에게 적합한가?
OlliteRT는 폰 자체에서 모델과 채팅하기보다는, 안드로이드 폰을 다른 기기를 위한 전용 완전 로컬 LLM 서버로 재활용하고 싶은 개발자와 애호가에게 적합합니다.
OlliteRT가 적합하지 않은 경우
OlliteRT는 채팅 인터페이스, GGUF 모델 지원, 병렬 요청 처리, 또는 오래 확립된 안정적인 릴리스 이력이 필요한 경우 적합하지 않습니다.
- 채팅 앱이 아님 — 내장 채팅 창이 없으며, 다른 소프트웨어의 HTTP API 요청에만 응답함
- GGUF 호환 아님 —
.litertlm모델 파일로만 작동하므로, 별도의 변환 단계 없이는 llama.cpp, Ollama, 또는 대부분의 다른 로컬 LLM 도구가 사용하는 GGUF 모델을 로드할 수 없음 - 동시 부하를 위해 만들어지지 않음 — README는 순차적으로 처리되는 단일 로드 모델을 문서화하므로, 다중 사용자나 고처리량 서버로 설계되지 않음
- iOS 호환 아님 — 안드로이드 전용이며, 구체적으로 arm64-v8a 기기
- 성숙한 1.0 릴리스가 아님 — 이 리뷰 작성 시점 기준 저장소는 약 5개월 되었으며, 최신 태그 버전(v0.9.6-beta.1)도 여전히 베타 라벨을 달고 있음
OlliteRT 평가 시 흔한 실수
OlliteRT에 대한 대부분의 혼란은 채팅 앱이라고 가정하거나, 모델 형식을 GGUF와 혼동하거나, 신생 프로젝트 상태를 놓치는 데서 비롯됩니다.
경쟁 제품 및 대안
OlliteRT는 다른 안드로이드/모바일 로컬 LLM 앱과 가장 자주 비교됩니다 — 주요 차별점은 폰 내 채팅 클라이언트가 아니라 헤드리스, OpenAI 호환 서버라는 점입니다.
도구 | 가장 잘 알려진 점 | 링크 |
|---|---|---|
| PocketPal AI | 안드로이드와 iOS용 온디바이스 채팅 앱, llama.cpp를 통한 GGUF 모델 | PocketPal AI 리뷰 |
| Layla | 로컬, 무검열 롤플레이 및 어시스턴트 사용에 초점을 맞춘 안드로이드 채팅 앱 | Layla 리뷰 |
| Google AI Edge Gallery | LiteRT/MediaPipe를 통한 온디바이스 모델을 위한 Google 자체 쇼케이스 앱 | Google AI Edge Gallery 리뷰 |
| MLC Chat | MLC LLM 컴파일러 스택으로 구축된 크로스 플랫폼(안드로이드/iOS) 로컬 채팅 앱 | MLC Chat 리뷰 |
이 목록은 모바일/온디바이스 LLM 분야에서 OlliteRT와 일반적으로 비교되는 도구를 반영한 것이며, PromptQuorum의 독립적인 순위가 아닙니다 — 선택하기 전에 각 도구의 현재 기능과 지원 모델 형식을 확인하세요.
자주 묻는 질문
OlliteRT란 무엇인가요?
OlliteRT(github.com/NightMean/OlliteRT)는 개발자 NightMean이 만든 무료 오픈소스(Apache-2.0) 안드로이드 앱으로, Google의 LiteRT-LM 런타임을 사용해 폰을 완전 로컬, OpenAI 호환 LLM 추론 서버로 바꿔줍니다.
OlliteRT에는 채팅 인터페이스가 있나요?
아니요. OlliteRT에는 내장 채팅 창이 없습니다. 헤드리스 서버로서, 앱에 직접 타이핑하는 것이 아니라 다른 기기나 애플리케이션에서 HTTP API를 통해 상호작용합니다.
OlliteRT는 무료인가요?
예, OlliteRT는 Apache-2.0 라이선스 하에 무료 오픈소스입니다. 이 리뷰는 계정, 구독, 또는 인앱 구매 요구 사항을 찾지 못했습니다.
OlliteRT는 어떤 모델 형식을 사용하나요?
OlliteRT는 Google의 LiteRT-LM 온디바이스 런타임을 위한 .litertlm 모델 파일만 배타적으로 사용합니다. llama.cpp 기반 도구가 사용하는 GGUF는 지원하지 않습니다.
OlliteRT의 하드웨어 요구 사항은 무엇인가요?
arm64-v8a 기기에서 안드로이드 12 이상, 최소 6GB RAM(8GB+ 권장)입니다. Gemma 4 E4B 같은 더 크거나 멀티모달 모델은 프로젝트 README에 따르면 12GB RAM 이상이 필요합니다.
OlliteRT는 인터넷 연결 없이 작동하나요?
모델이 다운로드되면 추론 자체는 완전히 온디바이스에서 실행되므로 인터넷 연결이 필요 없습니다. 다른 기기가 폰의 API 서버에 접근하려면 로컬 네트워크 연결이 필요하며, HuggingFace에서 모델을 초기 다운로드하려면 인터넷 접속이 필요합니다.
OlliteRT는 여러 요청을 한 번에 처리할 수 있나요?
아니요. 프로젝트 README는 한 번에 하나의 모델만 로드되고 요청이 병렬이 아닌 순차적으로 처리된다고 문서화합니다 — 동시, 다중 사용자 부하를 위해 설계되지 않았습니다.
OlliteRT는 iOS에서 사용할 수 있나요?
아니요, OlliteRT는 안드로이드 전용이며, 구체적으로 안드로이드 12 이상을 실행하는 arm64-v8a 기기가 필요합니다.
OlliteRT를 어떻게 설치하나요?
GitHub 릴리스 페이지에서 APK를 직접 다운로드하세요. 이 리뷰 작성 시점 기준 Google Play나 F-Droid에는 등재되어 있지 않습니다.
OlliteRT는 성숙하고 안정적인 프로젝트인가요?
아직입니다. GitHub 저장소는 2026년 4월에 생성되었으며, 최신 태그 릴리스(v0.9.6-beta.1, 2026년 6월)도 여전히 베타 라벨을 달고 있습니다 — 활발히 개발 중인 1.0 이전 프로젝트로 취급하세요.