Skip to main content
PromptQuorum
/고급 로컬 LLM/ExLlamaV2 해설 2026: 아카이브됨, ExLlamaV3로 계승
Overview & Reference

ExLlamaV2 해설 2026: 아카이브됨, ExLlamaV3로 계승

·8분 읽기·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

ExLlamaV2는 turboderp라는 개발자가 만든 무료 MIT 라이선스 추론 라이브러리로, 레이어마다 2~8비트 정밀도를 혼합해 목표 평균 비트레이트에 도달하는 자체 EXL2 양자화 형식을 사용해 소비자용 NVIDIA GPU에서 최대 추론 속도를 내도록 설계되었다. 이 글 작성 시점 기준으로 turboderp-org/exllamav2 저장소는 아카이브 처리되어 있으며, 명시된 이유는 개발이 후속작인 ExLlamaV3로 이전되었기 때문으로, ExLlamaV3는 새로운 EXL3 양자화 형식을 도입한다.

ExLlamaV2는 유연한 EXL2 양자화 형식으로 알려진, 소비자용 GPU에 특화된 빠른 추론 라이브러리였다 — 하지만 이 글 작성 시점 기준으로 저장소 자체가 아카이브되었으며, 개발은 후속 프로젝트인 ExLlamaV3에서 계속되고 있다.

ExLlamaV2 해설 2026: 아카이브됨, ExLlamaV3로 계승

핵심 요점

  • MIT 라이선스, turboderp라는 개발자가 만듦
  • 약 4,600개의 GitHub 스타; github.com/turboderp-org/exllamav2 저장소는 아카이브 처리됨
  • EXL2 양자화 형식: 목표 평균 비트레이트에 도달하기 위해 레이어마다 2, 3, 4, 5, 6, 8비트 정밀도를 혼합, 예를 들어 70B 모델을 24GB VRAM에서 가중치당 약 2.55비트로 실행
  • 후속 프로젝트 ExLlamaV3(약 1,300개의 GitHub 스타)는 Cornell RelaxML의 QTIP 양자화 접근법을 간소화한 EXL3 형식을 도입
  • FastAPI 기반 서버인 TabbyAPI가 두 버전 모두에 권장되는 OpenAI 호환 API 계층
  • text-generation-webui, lollms-webui, 독립형 ExUI 웹 인터페이스에도 통합됨

📍 한 문장으로

ExLlamaV2는 turboderp가 만든 무료 MIT 라이선스 추론 라이브러리로, 소비자용 NVIDIA GPU에서 빠른 LLM 추론을 위해 만들어졌으며 유연한 EXL2 양자화 형식으로 유명하지만, 이제 저장소는 아카이브되어 실제로 개발이 진행 중인 후속작 ExLlamaV3에 자리를 넘겼다.

💬 쉽게 말하면

ExLlamaV2는 이례적으로 유연한 양자화 방식을 사용해 소비자용 GPU 하나에서 최대 속도를 짜내도록 특별히 만들어졌다. 이후 자체 유지 관리자는 V2를 계속 업데이트하는 대신 새 프로젝트인 ExLlamaV3로 개발을 옮겼다.

📌참고: ExLlamaV2 GitHub README 자체가 프로젝트가 아카이브되었으며 개발이 ExLlamaV3에서 계속된다고 명시하고 있다 — 오늘 새 프로젝트를 시작하는 사람은 아카이브된 V2 코드베이스 위에 구축하기보다 ExLlamaV3를 평가해야 한다.

ExLlamaV2는 무엇이었나

ExLlamaV2는 turboderp라는 개발자가 MIT 라이선스로 공개한 무료 오픈소스 추론 라이브러리로, 소비자용 NVIDIA GPU에서 추론 속도를 최대화하기 위해 특별히 만들어졌다. 이전 프로젝트인 ExLlama의 뒤를 이었으며, 그 자체로 단일 GPU에서 양자화된 모델을 빠르게 실행하는 데 초점을 맞춘, 메모리 효율성이 개선된 재작성판이었다.

저장소 github.com/turboderp-org/exllamav2는 아카이브 처리되기 전까지 약 4,600개의 GitHub 스타에 도달했으며, README는 개발이 이제 계속되는 프로젝트로 ExLlamaV3를 가리키고 있다.

  • llama.cpp 같은 엔진의 폭넓은 하드웨어 벤더 지원과 달리 NVIDIA 소비자 GPU에 좁게 집중
  • EXL2 양자화 형식을 주요 기술적 기여로 도입, 단일 모델 내에서 혼합 정밀도 양자화를 가능하게 함
  • 자체 EXL2 형식 외에도 원조 ExLlama와 동일한 4비트 GPTQ 모델을 지원
  • pip(pip install exllamav2), 사전 빌드된 wheel, 또는 CUDA Toolkit을 이용한 소스 빌드로 설치 가능

EXL2 양자화란 무엇인가

EXL2는 ExLlamaV2의 양자화 형식으로, 동일 모델 내 서로 다른 선형 레이어가 서로 다른 비트 폭(2비트에서 8비트까지)을 사용하도록 하며, 목표 평균 비트레이트에 도달하도록 보정 데이터로부터 자동으로 선택된다. 이는 모델 전체에 균일하게 적용되는 단일 고정 비트 폭보다 더 유연하다.

  • 단일 모델 내에서 레이어마다 혼합되는 2, 3, 4, 5, 6, 8비트 양자화 수준 지원
  • 더 중요한 가중치 열은 더 높은 정밀도로, 덜 중요한 열은 더 적은 비트로 양자화할 수 있어 희소 양자화와 취지가 비슷함
  • 제한된 VRAM에서 대형 모델의 극단적인 압축을 가능하게 함 — 문서화된 테스트에 따르면 70B 파라미터 모델이 2048토큰 컨텍스트로 24GB VRAM에서 가중치당 약 2.55비트로 실행됨
  • 수동으로 레이어별 설정을 요구하는 대신 보정 데이터를 기반으로 양자화 매개변수가 자동으로 선택됨

왜 ExLlamaV2는 아카이브되었고, ExLlamaV3는 무엇을 바꾸는가

turboderp-org/exllamav2 저장소는 아카이브 처리되어 있으며, README 자체에 개발이 ExLlamaV3에서 계속된다고 명시되어 있다. 새 프로젝트를 위해 ExLlamaV2를 평가하기 전에 알아야 할 가장 중요한 단 하나의 사실이다.

ExLlamaV3는 Cornell RelaxML의 QTIP 양자화 접근법을 간소화한 변형으로 설명되는 자체 형식 EXL3를 도입한다. EXL2와 달리 EXL3는 텐서 이름을 바꾸지 않고 원본 텐서 구조를 유지하며, 이는 다른 프레임워크의 향후 지원을 더 쉽게 하기 위한 것이다. ExLlamaV3는 CUDA 12.4 이상을 요구 사항으로 문서화하고 있으며, 유지 관리자 스스로 아직 성숙 중이라고 명시한다 — 다소 불완전한 부분을 예상해야 한다.

  • ExLlamaV2: 아카이브됨, MIT 라이선스, EXL2 형식, 여전히 설치 가능하지만 추가 개발은 없음
  • ExLlamaV3: 활발함, MIT 라이선스, EXL3 형식(QTIP 연구 기반), 자체 문서에 따르면 베타 단계 안정성
  • 둘 다 동일한 개발자 turboderp가 turboderp-org GitHub 조직 아래에서 유지 관리

📌참고: 새로운 배포라면 ExLlamaV3를 먼저 평가하라 — 실제 유지 관리와 개선이 이루어지는 곳이다. ExLlamaV2는 주로 이미 그것으로 구축된 기존 설정이나, 이미 유통 중인 EXL2 양자화 모델 파일에 관련이 있다.

ExLlamaV2(또는 V3)를 설치하고 실행하는 방법

ExLlamaV2는 pip, 사전 빌드된 wheel, 또는 CUDA Toolkit을 이용한 소스 빌드로 설치된다. ExLlamaV3도 비슷한 패턴을 따른다. 둘 중 하나 위에 OpenAI 호환 서버를 구축하는 데는 TabbyAPI가 권장된다.

  1. 1
    ExLlamaV2의 경우: pip install exllamav2로 설치하거나, GitHub Releases 페이지에서 자신의 Python 및 CUDA 버전에 맞는 사전 빌드된 wheel을 다운로드하거나, CUDA Toolkit을 설치한 상태로 클론하여 소스에서 빌드한다.
  2. 2
    ExLlamaV3의 경우(새 구성에 권장): github.com/turboderp-org/exllamav3에 문서화된 동등한 설치 경로를 따른다. CUDA 12.4 이상이 필요하다는 점에 유의한다.
  3. 3
    커뮤니티 양자화자들이 Hugging Face에 흔히 게시하는, 사전 양자화된 EXL2(또는 EXL3) 모델을 다운로드한다.
  4. 4
    권장되는 FastAPI 기반 서버인 TabbyAPI를 설치하고 실행하여, HF 모델 다운로드와 Jinja2 채팅 템플릿 지원을 갖춘 OpenAI 호환 API 엔드포인트를 노출한다.
  5. 5
    또는 TabbyAPI를 직접 실행하는 대신 text-generation-webui, lollms-webui, 독립형 ExUI 웹 인터페이스 같은 기존 통합을 통해 ExLlamaV2/V3를 사용한다.

지금도 ExLlamaV2를 사용할 수 있는가?

그렇다. 여전히 설치 가능하고 작동하지만, 저장소는 아카이브되어 있어 추가 업데이트, 버그 수정, 새 기능을 받지 않는다.

EXL2 모델 파일이 ExLlamaV3에서도 작동하는가?

아니다, 직접적으로는 작동하지 않는다 — ExLlamaV3는 자체 EXL3 양자화 형식을 사용한다. 기존 EXL2 모델 파일은 ExLlamaV2/TabbyAPI 구성용이지 V3용이 아니다.

ExLlamaV2는 어떤 하드웨어를 요구하는가

ExLlamaV2는 특히 소비자용 NVIDIA GPU를 대상으로 하며, AMD, Intel, CPU 전용 지원 경로는 없다. 이 좁은 하드웨어 초점이 단일 GPU 속도에 그토록 집중적으로 최적화할 수 있었던 이유의 일부다.

  • NVIDIA GPU만 지원하며 CUDA가 필요함 — AMD, Intel, Apple Silicon에 대한 문서화된 지원은 없음
  • 데이터센터 GPU보다 소비자급 카드를 중심으로 설계되었지만, 그런 카드에서도 실행됨
  • VRAM 요구 사항은 모델 크기와 선택한 EXL2 비트레이트에 따라 달라짐 — 유연한 양자화가 바로 대형 모델을 비교적 적은 VRAM에 담을 수 있게 하는 요소
  • ExLlamaV3는 CUDA 12.4 이상을 요구 사항으로 문서화하며, 이는 ExLlamaV2가 가정했던 것보다 더 최신 기준임

ExLlamaV2(또는 ExLlamaV3)는 누구에게 적합한가

하드웨어 지원 폭이나 장기적 안정성 보장보다 단일 소비자용 NVIDIA GPU에서 최대 속도와 VRAM 효율을 짜내는 것이 더 중요하다면 새 프로젝트에는 ExLlamaV3를 사용하라. 오늘날 아카이브된 ExLlamaV2로 완전히 새로운 프로젝트를 시작할 이유는 거의 없다.

ExLlamaV2는 대안들과 어떻게 비교되는가

ExLlamaV2와 가장 가까운 비교 대상은 자체 후속작과, 양자화 또는 단일 GPU 속도에 강하게 집중하는 다른 엔진들이다.

도구
라이선스
최적 용도
ExLlamaV2(아카이브됨)MIT기존 EXL2 구성 전용
ExLlamaV3MIT단일 GPU 최대 양자화 효율(베타)
llama.cppMIT가장 폭넓은 하드웨어 지원, 직접 제어
OllamaMIT가장 단순한 로컬 구성
KoboldCppAGPL 3.0설치 불필요, 롤플레이/창작 UI 내장

ExLlamaV2를 평가할 때 흔한 오해

대부분의 혼란은 프로젝트가 아카이브되었다는 사실을 인지하지 못하거나, EXL2와 EXL3 모델 파일 간의 상호 호환성을 기대하는 데서 비롯된다.

자주 묻는 질문

ExLlamaV2는 지금도 유지 관리되는가?

아니다. turboderp-org/exllamav2 GitHub 저장소는 아카이브 처리되어 있으며, README에는 개발이 대신 ExLlamaV3에서 계속된다고 명시되어 있다.

EXL2란 무엇인가?

EXL2는 ExLlamaV2의 양자화 형식으로, 목표 평균 비트레이트에 도달하기 위해 단일 모델 내 레이어마다 2-8비트 혼합 정밀도를 지원하여 대형 모델이 더 적은 VRAM에 들어가게 한다.

ExLlamaV3는 무엇이며 어떻게 다른가?

ExLlamaV3는 ExLlamaV2의 실제 개발이 진행 중인 후속작으로, Cornell RelaxML의 QTIP 접근법 기반의 새로운 EXL3 양자화 형식을 사용한다. 자체 유지 관리자에 의해 베타 단계 소프트웨어로 문서화되어 있다.

ExLlamaV2와 ExLlamaV3는 누가 만들었는가?

둘 다 turboderp라는 개발자가 turboderp-org GitHub 조직 아래에서 만들었다.

ExLlamaV2는 무료로 사용할 수 있는가?

그렇다. ExLlamaV2와 ExLlamaV3 모두 MIT 라이선스로 공개되어 개인 및 상업적 사용이 무료다.

ExLlamaV2는 AMD GPU를 지원하는가?

아니다. ExLlamaV2와 ExLlamaV3 모두 CUDA를 갖춘 NVIDIA GPU가 필요하다 — AMD, Intel, Apple Silicon 지원은 없다.

TabbyAPI란 무엇인가?

TabbyAPI는 FastAPI 기반 서버로, ExLlamaV2나 ExLlamaV3 위에 OpenAI 호환 API를 노출하는 데 권장되는 방법이며, Hugging Face 모델 다운로드와 Jinja2 채팅 템플릿 지원 같은 추가 기능을 갖추고 있다.

EXL2와 EXL3 모델 파일을 서로 바꿔 사용할 수 있는가?

아니다. EXL2 파일은 ExLlamaV2용으로 양자화되어 있으며 별도의 EXL3 형식을 사용하는 ExLlamaV3와 직접 호환되지 않는다.

새 프로젝트에는 ExLlamaV2와 ExLlamaV3 중 무엇을 사용해야 하는가?

ExLlamaV3다. ExLlamaV2는 아카이브되어 추가 개발을 받지 않기 때문이다. ExLlamaV3는 아직 베타 단계이므로, 활발히 안정화된 성숙한 프로젝트에 비해 다소 불완전한 부분을 예상해야 한다.

ExLlamaV2는 llama.cpp와 어떻게 비교되는가?

llama.cpp는 훨씬 더 넓은 범위의 하드웨어(NVIDIA, AMD, Apple Silicon, Intel, CPU 전용)를 지원하며 활발히 유지 관리된다. ExLlamaV2는 NVIDIA 소비자 GPU에 좁게 집중했으며 이제 아카이브되었고, ExLlamaV3가 그 활발한 후속작이다.

출처

← 고급 로컬 LLM으로 돌아가기