핵심 요점
- LoRAX(github.com/predibase/lorax)는 무료 오픈소스 셀프호스팅 멀티 LoRA 추론 서버입니다
- Google과 Uber 출신들이 2021년에 설립한 ML 플랫폼 기업 Predibase가 개발; Rubrik은 2025년 6월 25일 Predibase 인수를 발표했습니다
- Apache 2.0 라이선스로 제공되며, 프로젝트 측은 상업적 이용도 무료라고 설명합니다
- Hugging Face의 text-generation-inference(v0.9.4 기준)의 포크로, 이후 동적 멀티 LoRA 어댑터 로딩이 추가되었습니다
- NVIDIA GPU(Ampere 세대 이상), CUDA 11.8 이상, Linux 환경이 필요합니다
- PEFT 또는 Ludwig로 훈련된 어댑터를 지원; HuggingFace Hub, Predibase, 또는 로컬 파일 시스템 경로에서 로드합니다
- 이 리뷰 작성 시점 기준 GitHub 스타 3,800개 이상, 포크 324개 이상
📍 한 문장으로
LoRAX는 Hugging Face의 text-generation-inference를 포크한 무료 오픈소스(Apache 2.0) 셀프호스팅 추론 서버로, Predibase가 개발했으며(2025년 Rubrik에 인수됨) 하나의 GPU에서 공유 기본 모델 위에 수천 개의 미세조정된 LoRA 어댑터를 서비스하며, GitHub 스타가 3,800개 이상입니다.
💬 쉽게 말하면
기본 LLM의 미세조정된 변형마다 별도의 GPU 호스팅 모델을 개별적으로 운영하는 대신, LoRAX는 기본 모델의 공유 사본 하나를 로드하고 요청마다 작은 LoRA 어댑터 가중치를 동적으로 교체합니다 — 이를 통해 하나의 GPU가 동일한 모델의 여러 다른 미세조정된 "성격"을 동시에 서비스할 수 있으며, 모델마다 GPU 한 대를 두는 경우에 비해 비용이 훨씬 적게 듭니다.
📌참고: 이 리뷰는 LoRAX 자체의 GitHub 저장소, README, 릴리스 노트를 기반으로 작성되었습니다. PromptQuorum이 다른 추론 서버 대비 처리량이나 지연 시간을 독자적으로 벤치마킹했다고 주장하지 않습니다 — 프로덕션 용량 산정을 결정하기 전에 프로젝트 자체 문서에서 최신 성능 수치를 확인하세요.
LoRAX란?
LoRAX("LoRA eXchange")는 미세조정마다 전용 모델 배포를 요구하는 대신, 하나의 공유 기본 모델 위에서 다수의 미세조정된 LoRA 어댑터를 서비스하기 위해 특별히 제작된 셀프호스팅 추론 서버입니다. 자체 설명에 따르면 "하나 가격에 프로덕션 환경에서 수백 개의 미세조정된 LLM을 서비스하기 위한 오픈소스 프레임워크"입니다.
- 제품 유형: 셀프호스팅 추론 서버(CLI + 라이브러리)이며, 호스팅형 API나 데스크톱 앱이 아닙니다
- 개발사: Predibase, Google과 Uber 출신들이 2021년에 ML 플랫폼 기업으로 설립
- 기업 현황: 데이터 보안 기업 Rubrik은 2025년 6월 25일 Predibase 인수 계약을 발표했습니다; Predibase의 상용 플랫폼은 현재 Rubrik 산하에 위치하지만, 오픈소스 LoRAX 프로젝트 자체는 여전히 Predibase 조직 아래 GitHub에 공개되어 있습니다
- 기반: Hugging Face의 text-generation-inference(v0.9.4 기준)의 포크로, 이후 동적 멀티 어댑터 서비스를 위해 특별히 확장되었습니다
- 라이선스: Apache 2.0, GitHub 저장소를 통해 확인됨
- 규모: 이 리뷰 작성 시점 기준 GitHub 스타 3,800개 이상, 포크 324개 이상
프로젝트 역사와 버전 이정표
LoRAX는 2024년 초의 초기 릴리스 이후 지속적으로 개발되어 왔으며, 버전마다 더 폭넓은 모델 지원, 양자화 옵션, 서비스 기능을 추가해왔습니다. 아래 버전 번호와 날짜는 프로젝트 자체의 GitHub 릴리스 노트에서 가져온 것입니다. 이 리뷰의 발행일 이후 출시된 내용은 릴리스 페이지에서 직접 확인하세요.
- 1v0.6.0 — 2024년 1월 10일: OpenAI 호환 API
Why it matters: OpenAI 호환 completions 및 chat-completions 엔드포인트를 추가하여, 기존 OpenAI 클라이언트 코드가 셀프호스팅 LoRAX 서버를 가리킬 수 있게 했습니다. - 2v0.7.0 — 2024년 2월 1일: 멀티 어댑터 병합, EETQ/HQQ 양자화
Why it matters: linear, TIES, DARE 방식을 사용해 요청마다 여러 LoRA 어댑터를 병합할 수 있게 했으며, 양자화 형식 2가지를 추가했습니다. - 3v0.8.0–v0.8.1 — 2024년 2월: 구조화된 출력과 Gemma 지원
Why it matters: Outlines 라이브러리를 통한 JSON 스키마 기반 구조화된 출력을 추가하고, Google의 Gemma 모델 계열을 지원했습니다. - 4v0.9.0 — 2024년 3월 23일: 전용 어댑터 메모리, Qwen2 지원
Why it matters: 릴리스 노트에 따르면 어댑터용 GPU 메모리를 전용으로 예약하고 Qwen2 모델 지원을 추가했습니다. - 5v0.10.0 — 2024년 5월 23일: Medusa 추측 디코딩
Why it matters: Medusa 추측 디코딩 어댑터와 Phi-3, Command-R, DBRX 모델 지원을 추가하여 더 빠른 생성을 목표로 했습니다. - 6v0.11.0 — 2024년 9월 18일: 프리픽스 캐싱, 비전-언어 지원
Why it matters: 반복되는 프롬프트를 위한 프리픽스 캐싱, 비전-언어 모델 Llava-Next 지원, Mistral 및 Llama 모델용 FP8 양자화를 추가했습니다. - 7v0.12.0 — 2024년 11월 6일: 멀티 LoRA 프리픽스 캐싱, 함수 호출
Why it matters: 변경 로그에 따르면 프리픽스 캐싱을 여러 어댑터에 걸쳐 동시에 작동하도록 확장하고, FP8 KV 캐시 지원과 스키마 강제 적용이 포함된 함수 호출을 추가했습니다 — 이 리뷰가 공개된 릴리스 노트로부터 확인할 수 있었던 가장 최근의 이정표입니다.
LoRAX는 실제로 무엇을 하나?
LoRAX는 하나의 공유 기본 모델을 GPU 메모리에 로드한 다음, 들어오는 요청마다 작은 LoRA 어댑터 가중치를 동적으로 로드하고 교체하여, 단일 배포에서 다수의 미세조정된 모델 변형을 서비스할 수 있게 합니다.
- 동적 어댑터 로딩 — 모든 어댑터를 미리 로드하도록 요구하는 대신, 요청마다 LoRA 어댑터를 온디맨드로 로드하며, GPU와 CPU 메모리 간 비동기 프리페칭 및 오프로딩을 통해 어떤 어댑터를 "핫" 상태로 유지할지 관리합니다
- 이질적 연속 배치 처리 — 자체 아키텍처 설명에 따르면, 어댑터마다 별도의 배치를 요구하는 대신 서로 다른 어댑터를 대상으로 하는 요청을 같은 배치에 담습니다
- 기본 모델 지원 — 릴리스 노트에 따르면 Llama, CodeLlama, Mistral, Zephyr, Qwen, Gemma, Phi-3, Command-R, DBRX, 그리고 Mllama/Llava-Next 비전-언어 모델과 호환됩니다
- 양자화 옵션 — fp16, 또는 bitsandbytes, GPT-Q, AWQ, EETQ, HQQ를 통한 양자화, 그리고 이후 버전에서 추가된 FP8 KV 캐시 지원
- 어댑터 호환성 — PEFT 또는 Ludwig로 훈련된 어댑터와 함께 작동하며, HuggingFace Hub, Predibase, 또는 로컬 파일 시스템 경로에서 로드됩니다
- OpenAI 호환 API — OpenAI 요청/응답 형식으로 chat-completions 및 completions 엔드포인트를 제공하여, 기존 OpenAI 클라이언트 코드가 셀프호스팅 LoRAX 서버를 가리킬 수 있게 합니다
- 서비스 인프라 기능 — 문서에 따르면 텐서 병렬 처리, flash-attention, paged attention, 토큰 스트리밍, Prometheus 지표, OpenTelemetry 트레이싱을 지원합니다
- 구조화된 출력 — Outlines 라이브러리를 통한 JSON 스키마 기반 생성, 그리고 이후 버전에서 지원되는 스키마 강제 적용이 포함된 함수 호출
사용 예시: LoRAX를 사용하는 세 가지 방법
이는 LoRAX 자체의 문서화된 기능을 기반으로 한 구체적인 워크플로이며, 가상의 사용 사례가 아닙니다.
플랫폼, 가격, 라이선스
플랫폼
- LoRAX의 설명:
- 셀프호스팅, Linux만 지원; NVIDIA GPU(Ampere 세대 이상)와 CUDA 11.8 이상이 필요합니다.
비용
- LoRAX의 설명:
- 무료 오픈소스이며, 프로젝트 측은 상업적 이용도 무료라고 설명합니다. 자신의 GPU 인프라 비용만 지불하면 됩니다 — 별도의 유료 LoRAX 등급은 없습니다.
라이선스
- LoRAX의 설명:
- Apache 2.0, GitHub 저장소를 통해 확인됨.
설치 방법
- LoRAX의 설명:
- Docker 이미지(
ghcr.io/predibase/lorax:main), 그리고 문서화된 Kubernetes 및 SkyPilot 배포 경로; Python 클라이언트는 pip로 별도 설치합니다.
Predibase(LoRAX 개발사, 2025년 인수 이후 현재 Rubrik 산하에 위치)는 관련 기술을 기반으로 한 별도의 관리형 상용 플랫폼도 판매합니다 — 셀프호스팅이 아닌 관리형 서비스가 필요하다면 현재 상용 가격을 Predibase/Rubrik에 직접 확인하세요.
LoRAX 설치하기
LoRAX는 Docker, Kubernetes, SkyPilot을 통해 셀프호스팅 서버로 실행되며, Python 클라이언트는 pip로 별도 설치할 수 있습니다.
Source | Link |
|---|---|
| GitHub 저장소(소스 코드, Apache 2.0) | github.com/predibase/lorax |
| Docker 이미지 | docker pull ghcr.io/predibase/lorax:main |
| Python 클라이언트 | pip install lorax-client |
| 문서 | loraexchange.ai |
LoRAX는 Linux에서 NVIDIA GPU(Ampere 세대 이상)와 CUDA 11.8 이상을 필요로 합니다 — CPU 전용 모드나 macOS/Windows 네이티브 설치 경로는 없습니다. 명령을 실행하기 전에 항상 GitHub README에서 현재 권장되는 배포 방법을 확인하세요.
LoRAX vs. 범용 추론 엔진
LoRAX와 LMDeploy나 NVIDIA Dynamo 같은 범용 추론 엔진은 모두 대규모로 LLM을 서비스하지만, LoRAX는 하나의 기본 모델 위에서 다수의 LoRA 어댑터를 저렴하게 서비스한다는 특정 문제를 중심으로 설계되었습니다.
항목 | LoRAX | 범용 추론 엔진 |
|---|---|---|
| 핵심 역할 | 하나의 기본 모델 위에서 다수의 LoRA 어댑터 서비스 | 하나 이상의 완전한 모델을 고처리량으로 서비스 |
| 멀티 어댑터 배치 처리 | 이질적 연속 배치 처리가 내장됨 | 일반적으로 핵심 초점이 아님 |
| 기반 | Hugging Face text-generation-inference의 포크 | 프로젝트마다 다름 |
| OpenAI 호환 API | 있음 | 흔히 있음 |
| 최적 활용 | 하나의 기본 모델의 다수의 미세조정된 변형 | 모델 수는 적고 최대 원시 처리량을 중시 |
작업 부하가 동일한 기본 모델의 다수의 미세조정된 변형(고객별 또는 작업별 어댑터)을 서비스하는 것이라면, LoRAX의 어댑터 중심 배치 처리는 바로 그런 용도로 설계되었습니다. 어댑터 전환 필요 없이 소수의 서로 다른 완전한 모델을 최대 원시 처리량으로 서비스한다면 범용 엔진이 더 적합할 수 있습니다 — 두 프로젝트 모두 성능 개선을 자주 출시하므로, 선택하기 전에 각 프로젝트 자체 사이트에서 최신 벤치마크를 확인하세요.
LoRAX는 누구에게 적합한가?
LoRAX는 동일한 기본 모델의 다수의 미세조정된 LoRA 어댑터를 보유했거나 보유할 예정이며, 이를 공유 GPU 용량에서 비용 효율적으로 서비스하고자 하는 팀에 적합합니다.
LoRAX가 적합하지 않은 경우
CPU 전용 또는 비Linux 배포, 어댑터 서비스가 아닌 훈련, 또는 완전 관리형 호스팅 플랫폼이 필요하다면 LoRAX는 적합하지 않습니다.
- CPU 전용이 아님 — NVIDIA GPU(Ampere 세대 이상)와 CUDA 11.8 이상이 필요; CPU 폴백 모드는 없음
- 서버 자체는 크로스 플랫폼이 아님 — 자체 문서에 따르면 LoRAX의 서버는 Linux에서만 실행됨
- 훈련 도구가 아님 — LoRAX는 이미 다른 곳에서(PEFT, Ludwig, 또는 유사한 방식으로) 훈련된 LoRA 어댑터를 서비스함; 자체적으로 모델을 미세조정하지 않음
- 단독으로는 관리형 호스팅 서비스가 아님 — 셀프호스팅 오픈소스 소프트웨어임; 관리형 옵션을 원한다면 Predibase의 별도 상용 플랫폼(2025년 인수 이후 현재 Rubrik 산하)이 선택지가 됨
- PromptQuorum이 처리량이나 지연 시간을 독자적으로 테스트하지 않음 — 이 리뷰는 LoRAX 자체 문서와 릴리스 노트를 기반으로 하며, 실사용 테스트에 기반하지 않음
LoRAX 평가 시 흔한 오해
LoRAX에 대한 대부분의 혼란은 그것이 어댑터를 훈련해줄 것이라 기대하거나, GPU 없이 실행될 것이라 생각하거나, Predibase 인수 이후에도 기업 배경이 변하지 않았다고 가정하는 데서 비롯됩니다.
경쟁 제품 및 대안
LoRAX는 추론 서비스와 LoRA 미세조정이라는 두 영역의 교차점에 위치하기 때문에, 다른 셀프호스팅 추론 및 미세조정 도구와 가장 자주 비교됩니다. 로컬 LLM 소프트웨어 디렉터리에 있는 LoRAX 자체 항목과 함께 참고하세요.
Tool | Best known for | Link |
|---|---|---|
| LMDeploy | 양자화 및 서비스 툴킷을 갖춘 오픈소스 추론 엔진 | LMDeploy 리뷰 |
| NVIDIA Dynamo | API 서버 기능을 갖춘 고처리량 추론 서비스 프레임워크 | NVIDIA Dynamo 리뷰 |
| Unsloth | 빠르고 메모리 효율적인 LoRA/QLoRA 미세조정 라이브러리 | Unsloth 리뷰 |
| LLaMA-Factory | LoRA 및 기타 PEFT 방식을 지원하는 통합 미세조정 프레임워크 | LLaMA-Factory 리뷰 |
이 목록은 LoRAX와 동일한 추론 서비스 및 LoRA 미세조정 영역의 도구들을 반영한 것이며, PromptQuorum의 독자적인 순위가 아닙니다 — LoRAX의 멀티 어댑터 서비스 중심 특성은 범용 추론 엔진이나 훈련 전용 도구와 동일하지 않으므로, 선택하기 전에 각 도구의 현재 기능 세트를 확인하세요.
자주 묻는 질문
LoRAX란 무엇인가요?
LoRAX("LoRA eXchange", github.com/predibase/lorax)는 하나의 GPU에서 공유 기본 모델 위에 다수의 미세조정된 LoRA 어댑터를 서비스하는 무료 오픈소스 셀프호스팅 추론 서버입니다.
LoRAX는 무료인가요?
네, LoRAX 자체는 무료이며 오픈소스(Apache 2.0)이고, 프로젝트 측은 상업적 이용도 무료라고 설명합니다. 이를 실행하기 위한 자신의 GPU 인프라 비용만 지불하면 됩니다.
LoRAX는 누가 만들었나요?
LoRAX는 Google과 Uber 출신들이 2021년에 설립한 ML 플랫폼 기업 Predibase가 만들었습니다. 데이터 보안 기업 Rubrik은 2025년 6월 25일 Predibase 인수 계약을 발표했습니다.
LoRAX에는 어떤 GPU가 필요한가요?
Linux에서 NVIDIA GPU(Ampere 세대 이상)와 CUDA 11.8 이상이 필요합니다. CPU 전용 모드나 macOS/Windows 네이티브 서버 배포는 없습니다.
LoRAX는 어떻게 설치하나요?
Docker 이미지(ghcr.io/predibase/lorax:main)를 사용한 셀프호스팅 서버로 설치하며, Kubernetes와 SkyPilot 배포 경로도 문서화되어 있습니다. Python 클라이언트는 pip install lorax-client로 별도 설치합니다.
LoRAX는 어떤 기본 모델을 지원하나요?
릴리스 노트에 따르면 Llama, CodeLlama, Mistral, Zephyr, Qwen, Gemma, Phi-3, Command-R, DBRX, 그리고 Mllama/Llava-Next 비전-언어 모델 등입니다 — 완전하고 최신인 목록은 현재 문서를 확인하세요.
LoRAX가 LoRA 어댑터를 훈련해주나요?
아니요. LoRAX는 PEFT, Ludwig, 또는 유사한 도구를 통해 이미 다른 곳에서 훈련된 어댑터를 서비스하는 추론 서버입니다. 먼저 어댑터를 만들어야 한다면 Unsloth나 LLaMA-Factory 같은 전용 미세조정 도구와 함께 사용하세요.
LoRAX에는 OpenAI 호환 API가 있나요?
네. LoRAX는 OpenAI 요청/응답 형식으로 chat-completions 및 completions 엔드포인트를 제공하여, 기존 OpenAI 클라이언트 코드가 셀프호스팅 LoRAX 서버를 가리킬 수 있게 합니다.
LoRAX는 어떤 양자화 형식을 지원하나요?
fp16, 그리고 bitsandbytes, GPT-Q, AWQ, EETQ, HQQ를 통한 양자화, 그리고 릴리스 노트에 따르면 이후 버전에서 추가된 FP8 KV 캐시 지원입니다.
PromptQuorum이 LoRAX의 성능 주장을 독자적으로 테스트했나요?
이 리뷰는 LoRAX 자체의 GitHub 저장소, README, 릴리스 노트를 기반으로 하며, PromptQuorum의 실사용 벤치마킹에 기반하지 않습니다. 프로덕션 용량 산정을 결정하기 전에 프로젝트 자체 문서에서 현재 처리량과 지연 시간 수치를 직접 확인하세요.