Skip to main content
PromptQuorum
/고급 로컬 LLM/Parlor 리뷰: 온디바이스 실시간 음성·비전 AI
Voice, Speech & Multimodal

Parlor 리뷰: 온디바이스 실시간 음성·비전 AI

·10분 읽기·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

Parlor는 음성으로 대화를 나누고 카메라가 보는 것에 반응하는 무료 오픈소스 온디바이스 실시간 AI 어시스턴트로, Apple Silicon Mac이나 지원되는 GPU를 갖춘 Linux 컴퓨터에서 완전히 로컬로 실행됩니다 — 클라우드 음성 API가 아닙니다. 1인 개발자가 연구 프리뷰로 만들었으며, 로컬 비전-언어 모델(Gemma 4, llama.cpp 사용)을 로컬 턴 감지 및 텍스트 음성 변환과 결합하고, 선택적 클라우드 리서치 기능을 명시적으로 활성화하지 않는 한 완전히 온디바이스 상태를 유지합니다.

Parlor(github.com/fikrikarim/parlor)는 마이크로 듣고 카메라로 보며 음성으로 응답하는 무료 오픈소스 온디바이스 실시간 멀티모달 AI 어시스턴트입니다 — 클라우드 음성 API 대신 Mac이나 Linux 컴퓨터에서 완전히 로컬로 실행되도록 만들어졌습니다. 1인 개발자가 만든 연구 프리뷰(research preview)이며 다듬어진 상용 제품은 아니지만, GitHub 스타 2,000개 이상을 보유하고 있습니다. 이 리뷰에서는 Parlor가 무엇을 하는지, 캐스케이드 파이프라인이 어떻게 작동하는지, 하드웨어 요구 사항은 무엇인지, 그리고 누구에게 적합한지 다룹니다.

핵심 요점

  • Parlor(github.com/fikrikarim/parlor)는 무료 오픈소스 온디바이스 실시간 멀티모달 AI 어시스턴트입니다 — 완성된 제품이 아니라 연구 프리뷰
  • 개발자 Fikri Karim이 만들었으며, 그는 Bule AI라는 별도의 호스팅형 음성 AI 프로젝트도 만들었습니다. Parlor는 OpenAI의 GPT-Live를 사용해 본 뒤 완전히 로컬로 동작하는 대안을 원해서 만들어졌습니다
  • GitHub 저장소의 LICENSE 파일로 확인된 Apache 2.0 라이선스
  • 음성과 비전을 함께 이해하기 위해 llama.cpp를 통해 Gemma 4(Google DeepMind), 기본적으로 E4B 변형을 실행
  • 이 리뷰 시점 기준 GitHub 스타 2,000개 이상, 포크 271개
  • 지금까지 태그된 릴리스는 두 개: v1.0.0(2026년 7월 29일)과 v2.0.0(2026년 8월 2일)

📍 한 문장으로

Parlor는 1인 개발자가 연구 프리뷰로 만든 무료 오픈소스 온디바이스 실시간 음성·비전 AI 어시스턴트로, Apple Silicon Mac이나 지원되는 GPU를 갖춘 Linux 컴퓨터에서 llama.cpp를 통해 Gemma 4를 실행하며, GitHub 스타 2,000개 이상을 보유하고 있습니다.

💬 쉽게 말하면

Parlor는 직접 설치하고 실행하는 소프트웨어로, 웹캠이 선택적으로 화면을 보는 동안 AI 어시스턴트와 소리 내어 대화할 수 있게 해줍니다 — 기본적으로 모두 자신의 컴퓨터에서 이루어지며, 클라우드 음성 구독료나 계정, 분당 비용이 전혀 없습니다 (선택적 클라우드 리서치 기능을 활성화하지 않는 한). AI 모델을 로컬에서 실행하므로 GPU를 갖춘 어느 정도 성능이 좋은 Mac 또는 Linux 컴퓨터가 필요합니다.

📌참고: 이 리뷰는 Parlor 자체 GitHub 저장소, README, 그리고 GitHub API를 통한 릴리스 이력을 기반으로 합니다. PromptQuorum이 Parlor가 공개한 지연 시간 벤치마크를 독립적으로 재현했다고 주장하지 않습니다 — 해당 수치는 Apple M3 Pro에서 측정된 프로젝트 자체의 값입니다.

Parlor란 무엇인가?

Parlor는 듣고, 카메라로 보고, 음성으로 응답하는 완전한 온디바이스 실시간 AI 어시스턴트의 무료 오픈소스 연구 프리뷰입니다 — 개념적으로는 OpenAI의 GPT-Live와 비슷하지만 클라우드가 아니라 로컬에서 실행됩니다. README는 명시적으로 이를 "연구 프리뷰"로 표시하며 다듬어지지 않은 부분과 버그를 예상하라고 경고합니다.

  • 제품 유형: 자체 호스팅형 로컬 웹 애플리케이션 — 자신의 컴퓨터에서 서버를 실행하고 브라우저에서 엽니다
  • 제작자: 1인으로 작업하는 개발자 Fikri Karim. README에는 코드베이스가 "Claude의 강력한 지원을 받아 작성되었으며, 아이디어와 테스트, 디버깅은 사람이 주도했다"고 명시되어 있습니다
  • 저장소: github.com/fikrikarim/parlor, 생성일 2026년 4월 5일
  • 라이선스: Apache 2.0, 저장소의 LICENSE 파일로 확인됨
  • 자금 조달: 이 리뷰에서는 자금 조달 라운드, 투자자, 상업적 후원에 대한 어떤 증거도 찾지 못했습니다 — Parlor를 자금을 지원받는 기업이 아니라 독립적인 1인 개발자의 연구 프로젝트로 취급하십시오
  • 규모: 이 리뷰 시점 기준 GitHub 스타 2,000개 이상, 포크 271개

Parlor는 실제로 어떻게 작동하는가?

Parlor는 단일 엔드투엔드 음성 모델이 아니라 캐스케이드 파이프라인을 사용합니다: 브라우저가 마이크 오디오와 카메라 프레임을 WebSocket을 통해 로컬 FastAPI 서버로 스트리밍하면, 서버는 턴 감지, 비전-언어 모델, 텍스트 음성 변환을 별도의 단계로 실행합니다.

  • 턴 감지: 브라우저 측 Silero VAD가 무음을 표시한 다음, Pipecat의 smart-turn-v3 모델(약 20ms)이 실제로 말을 마쳤는지 판단하므로, 문장 중간의 멈춤이 턴이 끝난 것으로 잘못 인식되지 않습니다
  • 이해 및 생성: 기본적으로 E4B 변형인 Gemma 4(Google DeepMind)가 QAT 4비트 양자화를 적용해 llama.cpp를 통해 실행되며, 오디오와 카메라 프레임을 모두 처리해 응답을 스트리밍합니다
  • 동작 처리: 같은 모델에 대한 별도의 문법 강제 JSON 요청이 타이머, 모드 전환, 리서치 요청을 결정하므로 제어 지시가 음성 응답에 섞여 들어가지 않습니다
  • 음성 출력: Kokoro 텍스트 음성 변환(macOS에서는 MLX 백엔드, Linux에서는 ONNX)이 모델이 아직 생성 중인 동안에도 응답을 문장 단위로 말합니다
  • 끼어들기(barge-in): Parlor가 말하는 도중에 말을 걸어 중단시킬 수 있습니다 — 재생을 음소거하는 것이 아니라 서버 측에서 생성 자체가 중단됩니다
  • 선택적 클라우드 리서치: REASONER_API_KEY를 설정하면 Parlor는 로컬 대화가 계속되는 동안 개방형 리서치 질문(예: "지금 로마에서 가장 맛있는 피자 찾아줘")을 OpenRouter 같은 OpenAI 호환 엔드포인트를 통해 프런티어 모델에 위임할 수 있습니다. 이 키를 설정하지 않으면 Parlor는 완전히 온디바이스 상태를 유지합니다

Parlor로 무엇을 할 수 있는가?

Parlor는 선택적 카메라 입력을 포함한 핸즈프리 음성 대화를 지원하며, 특정 작업을 위한 몇 가지 명명된 모드도 제공합니다.

  • 핸즈프리 대화: 푸시투토크 버튼이 없음 — Parlor가 말을 시작하고 끝내는 시점을 스스로 감지합니다
  • 카메라 인식 응답: 웹캠을 어떤 대상에 비추고 질문하면, 프레임이 음성과 함께 같은 로컬 모델로 스트리밍됩니다
  • 타이머: "파스타 3분 타이머 맞춰줘" — 카운트다운 시계는 언어 모델이 아니라 서버 자체가 관리하므로, 무음 턴 중에도 타이머가 울리며, 취소 가능한 카운트다운 칩이 화면에서 이를 추적합니다
  • 실시간 번역 모드: "내가 하는 말을 전부 영어로 번역해줘"라고 말하면 Parlor는 순차 통역사가 되어, "번역 중단"이라고 말할 때까지 Gemma 4가 이해하는 모든 언어로 각 발화를 짧은 지연 후 렌더링합니다
  • 듣기 전용 모드: "잠깐 듣기만 해줘, 소리 내서 생각을 정리하고 싶어"라고 말하면 Parlor는 다시 말을 걸 때까지 응답하지 않고 화면에 모든 내용을 전사합니다
  • 백그라운드 리서치: 선택적 클라우드 API 키가 설정되어 있으면 Parlor는 로컬 대화가 계속되는 동안 개방형 조회 질문을 별도의 모델에 위임하고, 답이 도착하면 이를 음성으로 말해줍니다

플랫폼, 가격, 라이선스

플랫폼

Parlor가 명시하는 내용:
브라우저를 통해 접속하는 자체 호스팅형 로컬 웹 앱입니다. Apple Silicon을 탑재한 macOS 또는 지원되는 GPU를 갖춘 Linux에서 실행됩니다. Windows 빌드는 존재하지 않습니다.

비용

Parlor가 명시하는 내용:
무료이며 오픈소스, 구독이나 계정이 없습니다. 모든 AI 처리는 기본적으로 로컬에서 이루어지며, 선택적 클라우드 리서치 기능은 별도 제공업체용 자체 API 키가 필요합니다.

라이선스

Parlor가 명시하는 내용:
GitHub 저장소의 LICENSE 파일로 확인된 Apache 2.0입니다.

하드웨어

Parlor가 명시하는 내용:
기본 Gemma 4 E4B 모델에는 약 6GB의 여유 RAM이 필요합니다. 더 작은 E2B 변형은 약 4GB면 충분하고, 더 큰 12B 옵션은 약 8GB가 필요합니다.

상태

Parlor가 명시하는 내용:
자체 README에서 명시적으로 "연구 프리뷰"로 표시됩니다 — 프로젝트 자체에 따르면 다듬어지지 않은 부분과 버그를 예상해야 합니다.

연구 프리뷰는 릴리스마다 요구 사항이 바뀔 수 있으므로, 설치하기 전에 github.com/fikrikarim/parlor에서 현재 하드웨어 및 플랫폼 요구 사항을 직접 확인하십시오.

Parlor vs. Voxa

Parlor와 Voxa는 모두 오픈소스 실시간 음성 어시스턴트이지만, Parlor는 의도적으로 로컬 전용인 반면 Voxa는 설계상 하이브리드입니다.

처리 위치

Parlor:
기본적으로 온디바이스 전용 — 클라우드 리서치는 옵트인이며 대화 자체와는 별개
Voxa:
하이브리드 — 클라우드 실시간 모델(Gemini Live, OpenAI Realtime) 또는 직접 구성하는 자체 호스팅형 로컬 데몬을 통해 대화를 라우팅

카메라 입력

Parlor:
지원 — 카메라 프레임이 음성과 같은 모델로 전달되어 비전 인식 응답을 제공
Voxa:
자체 문서 기준 핵심 기능 세트에 포함되지 않음

플랫폼 지원

Parlor:
Apple Silicon을 탑재한 macOS 또는 지원되는 GPU를 갖춘 Linux, Windows 빌드 없음
Voxa:
Tauri v2로 제작된 데스크톱 앱으로, 해당 프레임워크 설계상 크로스 플랫폼

인터페이스

Parlor:
브라우저 기반 로컬 웹 앱
Voxa:
탭하면 대화가 시작되는 프레임 없는 항상 위(always-on-top) 오브(orb)

성숙도

Parlor:
명시적으로 "연구 프리뷰"로 표시, 이 리뷰 시점 기준 태그된 릴리스 두 개
Voxa:
표시된 연구 프리뷰가 아니라 사용 가능한 데스크톱 어시스턴트로 포지셔닝

둘 다 오픈소스이며 무료입니다. Mac이나 Linux에서 카메라를 인식하고 기본적으로 완전히 로컬로 처리되는 방식을 원한다면 Parlor를 선택하고, 클라우드 실시간 음성 모델로 전환할 수 있는 옵션을 갖춘 더 가벼운 데스크톱 오브를 원한다면 Voxa를 선택하십시오. 자세한 내용은 Voxa 리뷰를 참조하십시오.

Parlor는 누구에게 적합한가?

Parlor는 완전히 로컬에서 동작하는 카메라 인식 음성 어시스턴트를 실험해보고 싶고 연구 프리뷰 특유의 다듬어지지 않은 부분을 감수할 의향이 있는, Mac 또는 Linux를 사용하는 개발자와 기술에 능숙한 사용자에게 적합합니다.

Parlor가 적합하지 않은 경우

Windows 지원, 원클릭 설치, 또는 계속 진화하는 연구 프리뷰가 아니라 안정적인 프로덕션 도구가 필요하다면 Parlor는 적합하지 않습니다.

  • Windows 사용자를 위한 것이 아님 — Apple Silicon을 탑재한 macOS 또는 지원되는 GPU를 갖춘 Linux만 지원됨
  • 패키징된 원클릭 앱이 아님 — 설치에는 터미널, Python 3.12+, uv, 그리고 작동하는 llama.cpp 빌드가 필요함
  • 완성되고 버전화된 제품이 아님 — 자체 README에서 연구 프리뷰라고 밝히며 버그를 예상하라고 경고함
  • 다중 사용자용이거나 다른 사람을 위한 호스팅용이 아님 — 한 사람이 자신의 컴퓨터에서 로컬로 실행하도록 설계됨
  • 이 리뷰가 확인할 수 있는 기업이나 자금 조달 라운드의 후원을 받지 않음 — 독립적으로 유지 관리되는 1인 개발자 프로젝트로 취급할 것

Parlor 평가 시 흔한 실수

Parlor에 대한 대부분의 혼란은 완성된 상용 제품을 기대하거나 하드웨어 및 플랫폼 요구 사항을 과소평가하는 데서 비롯됩니다.

경쟁 제품 및 대안

Parlor는 순수 클라우드 구독보다 로컬 또는 하이브리드 처리를 강조하는 다른 오픈소스 실시간 음성 및 개인 비서 프로젝트와 가장 직접적으로 비교됩니다.

Tool
Best known for
Link
Voxa오픈소스 데스크톱 음성 어시스턴트 오브, 하이브리드 로컬/클라우드 실시간 음성 라우팅Voxa 리뷰
Jarvis (Mac)로컬 및 구성 가능한 AI 백엔드를 중심으로 만들어진 Mac 전용 음성 어시스턴트 앱Jarvis Mac 리뷰
nanobot영구 메모리를 갖춘 자체 호스팅형 개인 AI 에이전트, 음성 우선이 아니라 텍스트 우선nanobot 리뷰
OpenAI GPT-LiveParlor의 영감이 된, 구독 기반 클라우드 실시간 음성 제품openai.com/index/introducing-gpt-live

이 목록은 로컬 음성 어시스턴트 분야에서 Parlor와 흔히 비교되는 도구를 반영한 것이며, PromptQuorum의 독립적인 순위가 아닙니다 — 선택하기 전에 각 도구의 현재 플랫폼 지원과 기능 세트를 확인하십시오.

자주 묻는 질문

Parlor란 무엇입니까?

Parlor(github.com/fikrikarim/parlor)는 1인 개발자가 만들어 Mac이나 Linux 컴퓨터에서 완전히 실행되도록 한, 온디바이스 실시간 음성·비전 AI 어시스턴트의 무료 오픈소스(Apache 2.0) 연구 프리뷰입니다.

Parlor는 무료입니까?

예, Parlor는 무료이며 오픈소스입니다. 구독이나 계정이 필요하지 않습니다. 선택적 백그라운드 리서치 기능을 활성화하려면 별도 클라우드 제공업체용 자체 API 키가 필요합니다.

Parlor는 Windows에서 작동합니까?

아니요. Parlor는 Apple Silicon을 탑재한 macOS 또는 지원되는 GPU를 갖춘 Linux가 필요합니다. Windows 빌드는 없습니다.

Parlor는 제 음성이나 카메라 데이터를 클라우드로 전송합니까?

기본적으로는 아닙니다 — 마이크 오디오와 카메라 프레임은 자신의 컴퓨터에서 실행되는 모델을 통해 로컬로 처리됩니다. 선택적 백그라운드 리서치 기능을 활성화하기 위해 직접 REASONER_API_KEY를 설정한 경우에만 데이터가 컴퓨터 밖으로 나갑니다.

Parlor는 어떻게 설치합니까?

GitHub 저장소를 클론하고, uv Python 패키지 관리자와 llama.cpp를 설치한 다음 uv sync, 이어서 uv run parlor를 실행하십시오. 브라우저에서 http://localhost:8000을 열고 카메라 및 마이크 권한을 허용하십시오.

Parlor는 어떤 AI 모델을 사용합니까?

Google DeepMind의 Gemma 4를 llama.cpp를 통해 로컬로 실행합니다 — 기본값은 E4B 변형이며, 하드웨어에 따라 더 작은(E2B) 옵션과 더 큰(12B) 옵션도 사용할 수 있습니다.

Parlor는 누가 만들었습니까?

개발자 Fikri Karim이 Parlor를 1인 연구 프리뷰로 만들었으며, 이전에는 Bule AI라는 별도의 상시 온라인 음성 AI 프로젝트를 자체 호스팅한 적이 있습니다.

Parlor는 RAM이 얼마나 필요합니까?

기본 E4B 모델 구성에는 약 6GB의 여유 RAM이 필요합니다. 더 작은 E2B 변형은 약 4GB면 충분하고, 더 큰 12B 옵션은 약 8GB가 필요합니다.

Parlor가 제 카메라를 통해 볼 수 있습니까?

예. 웹캠을 어떤 대상에 비추고 Parlor에게 물어보면, 카메라 프레임이 음성과 함께 같은 로컬 모델로 스트리밍됩니다.

Parlor는 완성된 제품입니까?

아니요. 자체 README에서 명시적으로 "연구 프리뷰"라고 표시하며 사용자에게 다듬어지지 않은 부분과 버그를 예상하라고 요청합니다. 지금까지 태그된 릴리스는 두 개입니다.

출처

← 고급 로컬 LLM으로 돌아가기