Key Takeaways
- Unsloth — GitHub 별 7만 5천, Apache-2.0. README는 멀티 GPU 구성과 NVIDIA·AMD·Intel GPU, CPU, Vulkan 백엔드 지원을 Windows·Linux·WSL·macOS에서 명시하며 데스크톱 빌드도 배포합니다. 오픈소스 프로젝트에서 멀티 GPU가 유료 장벽 뒤에 있는 것이 아닙니다.
- Axolotl — 별 1만 2천 4백, Apache-2.0. 셋 중 유일하게 멀티노드 학습(Torchrun, Ray)과 컨텍스트·텐서·완전 샤딩 데이터 병렬을 노드 내부와 여러 노드에 걸쳐 결합하는 ND 병렬을 문서화합니다.
- MLX-LM — 별 6천 8백, MIT, 애플의 `ml-explore` 조직 소속이며 해당 조직 프로필 자체가 "by Apple"이라고 밝힙니다. LoRA와 전체 파인튜닝, 양자화 모델, 그리고 `mx.distributed`를 통한 분산 추론과 조정을 지원합니다.
- Together.ai — 지도 LoRA 파인튜닝이 16B 파라미터까지 학습 토큰 100만당 0.48달러, 17~69B는 1.50달러, 70~100B는 2.90달러입니다. 전체 지도 파인튜닝은 훨씬 비싸 같은 구간에서 각각 1.20, 3.75, 7.25달러입니다. 작업당 4.00달러 최소 요금이 적용됩니다.
- Fireworks.ai — LoRA SFT는 16B까지 100만 토큰당 0.50달러부터 시작해 300B 초과에서 10.00달러까지 오르며, 최상위 구간의 전체 파라미터 DPO는 100만당 40.00달러에 이릅니다. 가격 페이지는 분명히 적고 있습니다. "Serve fine-tuned models for the same price as base models."
- Predibase는 더 이상 독립 제품이 아닙니다. Rubrik이 2025년 6월 25일 인수를 발표했고, 2026년 8월 28일 기준 predibase.com은 Rubrik의 Agent Cloud 페이지로 HTTP 301 리디렉션을 반환합니다. 이미 없어진 가입 화면으로 독자를 보내지 마세요.
- 2026년 8월 기준 Together.ai와 Fireworks.ai 어느 쪽에서도 공개된 제휴나 추천 프로그램을 찾지 못했고, 주요 AI 제휴 프로그램 목록에도 둘 다 등장하지 않습니다. 이 페이지의 모든 링크는 무보수입니다.
🏆 상황별 최적 선택
중요한 갈림길은 학습 작업을 직접 돌릴 것인지, 아니면 남에게 비용을 내고 맡길 것인지입니다. 아래를 읽어 내려가다 본인에게 해당하는 첫 줄에서 멈추세요.
- 쓸 만한 GPU가 있고 동작하는 파인튜닝까지 가장 짧은 길을 원한다 → Unsloth. 무료이고 Apache-2.0이며 이제 멀티 GPU와 비 NVIDIA 하드웨어까지 지원하므로, 예전에 갈아탈 이유였던 것들이 대체로 사라졌습니다.
- 학습이 한 대에 더는 들어가지 않는다 → Axolotl. Torchrun과 Ray를 통한 멀티노드에 ND 병렬을 더한 점이 2026년 Unsloth와의 실질적인 분기점입니다.
- M 시리즈 칩 Mac에서 작업한다 → 가장 가볍고 MLX에 밀착한 길을 원하면 MLX-LM. 다만 Unsloth도 이제 macOS에서 돌아가므로, 이는 유일한 선택지가 아니라 취향의 문제입니다.
- DPO, ORPO, KTO, GRPO 또는 보상 모델링이 필요하다 → Axolotl. 문서화된 기법의 범위가 셋 중 확연히 가장 넓습니다.
- GPU가 없고 빌릴 생각도 없다 → 투명한 토큰 단가를 원하면 Together.ai, 조정한 모델을 이후 서빙할 예정이고 호스팅 추가 요금을 피하고 싶다면 Fireworks.ai.
로컬과 클라우드 중 어디서 조정할까
쓸 만한 GPU가 이미 있고 반복할 계획이라면 로컬에서 조정하고, 하드웨어가 없거나 작업당 과금이 본인의 설정 시간보다 저렴할 만큼 조정 빈도가 낮다면 클라우드 API를 쓰세요. 이 질문은 "어떤 프레임워크인가"보다 앞섭니다. 이 페이지의 어느 절반이 본인에게 해당하는지를 결정하기 때문입니다.
솔직하게 말하면, 로컬 학습은 실행당 저렴하고 여러분의 주의력 시간당으로는 비쌉니다. 클라우드 API는 그 관계를 뒤집습니다. 분기에 한 번 조정하는 사람은 밤 11시에 드라이버 충돌을 디버깅하지 않아도 되는 데서 실제로 이득을 봅니다. 같은 데이터셋으로 주 2회 반복하는 사람은 토큰 과금이 하드웨어 비용을 금세 넘어서는 것을 보게 됩니다.
쓸 만한 GPU가 있고 자주 반복한다면 로컬에서 조정하고, 하드웨어가 없거나 작업당 요금이 본인의 설정 시간보다 적게 들 만큼 학습 빈도가 낮다면 클라우드 파인튜닝 API를 사용하세요.
하드웨어를 소유하면 실행마다 거의 공짜지만 설정 비용을 치릅니다. 서비스를 빌리면 실행당 몇 달러가 들지만 몇 분 만에 시작합니다. 어느 쪽이 싼지는 오로지 얼마나 자주 학습하느냐에 달렸습니다.
- 로컬에서 학습하세요: RTX 3090/4090급 이상 카드가 있거나, 같은 데이터셋으로 매주 반복하거나, 프라이버시나 지식재산 문제로 학습 데이터가 기기를 떠날 수 없는 경우.
- 클라우드 API를 쓰세요: GPU가 없거나, 4비트로도 하드웨어에 들어가지 않는 큰 모델이 필요하거나, 학습과 함께 관리형 서빙을 묶어 받고 싶은 경우.
- 둘 다 괜찮습니다: 7B 모델을 월 1회 조정하는 정도라면 비용 차이가 충분히 작아 편의성이 결정해도 됩니다.
세 가지 로컬 프레임워크 비교
Unsloth, Axolotl, MLX-LM은 2026년에 쓸 만한 세 가지 로컬 파인튜닝 프레임워크이며, 그 사이의 경계선은 이동했습니다. Unsloth는 한때 단일 GPU CUDA용 선택지였지만 지금은 가장 넓은 범위를 지원합니다. Axolotl의 주장은 단순한 멀티 GPU가 아니라 분산 학습의 깊이입니다. MLX-LM은 Apple Silicon에서 여전히 가장 가볍지만 더 이상 Mac의 유일한 선택지는 아닙니다. 셋 다 무료 오픈소스이며, 어느 것도 학습 데이터를 밖으로 내보낼 것을 요구하지 않습니다.
별 수와 라이선스는 2026년 8월 28일 GitHub API에서 읽었습니다. 기능에 관한 서술은 각 프로젝트의 README에서 가져왔습니다.
| 평가 항목 | Unsloth | Axolotl | MLX-LM |
|---|---|---|---|
| GitHub 별 | 7만 5천 | 1만 2천 4백 | 6천 8백 |
| 라이선스 | Apache-2.0 | Apache-2.0 | MIT |
| 적합한 경우 | 자체 하드웨어에서 가장 빠른 길 | 한 대를 넘어선 확장 | Mac에서 MLX 네이티브 경량 작업 |
| 멀티 GPU | 지원, 오픈소스 프로젝트에서 | 지원 — FSDP1, FSDP2, DeepSpeed | mx.distributed 경유 |
| 멀티노드 | README에 문서화 없음 | 지원 — Torchrun과 Ray | mx.distributed 경유 |
| 하드웨어 | NVIDIA, AMD, Intel, CPU, Vulkan | 주로 CUDA 스택 | Apple Silicon 전용 |
| 운영체제 | Windows, Linux, WSL, macOS | 실질적으로 Linux와 WSL | macOS |
| 설치 난이도 | 낮음 — 설치 관리자와 데스크톱 빌드 | 중간 — YAML 설정으로 구동 | 낮음 — pip install |
📌Note: 이 페이지의 바탕이 된 초안을 포함한 과거 비교 글들은 멀티 GPU를 Unsloth의 유료 기능으로, MLX-LM을 애플이 아닌 커뮤니티 프로젝트로 서술합니다. 두 주장 모두 현재 README 및 조직 프로필과 어긋납니다. 다른 곳에서 그런 내용을 읽었다면 날짜를 확인하세요.
Unsloth: 로컬의 기본 선택
대부분은 Unsloth에서 시작해야 하며, 그 이유는 줄어든 것이 아니라 늘었습니다. 셋 중 별 수가 압도적으로 많고, 라이선스는 Apache-2.0이며, 하드웨어와 운영체제 지원 범위는 이제 여기서 가장 넓습니다.
Unsloth — 종합 최고의 로컬 프레임워크
Apache-2.0 무료, 멀티 GPU 포함, NVIDIA·AMD·Intel·CPU·macOS에서 실행
Unsloth는 어텐션과 그래디언트 커널을 새로 작성해 VRAM 사용량을 줄이고 LoRA·QLoRA 학습을 가속하며, 그 점은 여전히 핵심 매력입니다. 달라진 것은 지원 범위입니다. README는 이제 NVIDIA·AMD·Intel GPU, CPU, Vulkan 백엔드에 걸친 멀티 GPU 구성을 명시하고, Windows·Linux·WSL·macOS에서 실행되며 각각에 데스크톱 빌드를 제공합니다. 22KB 분량의 Apache-2.0 README 어디에도 이를 유료 등급 뒤에 두는 내용은 없습니다. 프로젝트 자체도 학습 라이브러리를 넘어 Studio 인터페이스와 OpenAI 호환 서빙 엔드포인트를 갖춘 로컬 작업대에 가까워졌습니다. 유료 Pro와 Enterprise 등급이 있기는 하지만 가격이 공개되지 않았으므로, 다른 곳에서 인용된 구체적 금액은 검증되지 않은 것으로 취급하세요.
장점
- +무료이며 Apache-2.0, 오픈소스 프로젝트에 멀티 GPU 지원 포함
- +여기서 가장 넓은 하드웨어 지원: NVIDIA, AMD, Intel, CPU, Vulkan
- +Windows·Linux·WSL·macOS에서 실행되며 데스크톱 빌드 제공
- +셋 중 설치 부담이 가장 적음 — 설정 트리가 아니라 설치 관리자
단점
- –멀티노드 학습이 README에 문서화되어 있지 않으며, 이 점은 Axolotl이 더 명확함
- –Pro와 Enterprise 가격이 비공개라 예산 편성에 영업 문의가 필요
- –기능 범위가 넓어져, 학습 라이브러리만 원하는 팀에는 다루는 면이 과함
Axolotl: 규모를 넓히기 위한 선택
Axolotl은 분산 학습과 기법의 폭으로 자기 자리를 지키지, 멀티 GPU만으로는 아닙니다. Unsloth가 한 본체 안의 여러 GPU를 지원하게 된 지금, 정직한 분기점은 본체 하나로 부족해진 다음에 무슨 일이 벌어지느냐입니다.
Axolotl — 한 대를 넘어설 때 최적
Torchrun과 Ray를 통한 멀티노드, ND 병렬, 그리고 가장 넓은 기법 범위
Axolotl은 설정 파일로 구동되는데, 학습을 노트북에서 재구성하는 대신 클러스터 전반에서 재현 가능하게 만들어야 할 때 바로 그것이 필요합니다. README는 FSDP1·FSDP2·DeepSpeed를 통한 멀티 GPU, Torchrun과 Ray를 통한 멀티노드, 그리고 컨텍스트·텐서·완전 샤딩 데이터 병렬을 단일 노드 내부와 여러 노드에 걸쳐 결합하는 ND 병렬을 문서화합니다. 분산 전문가 혼합 학습을 위한 전문가 병렬도 있습니다. 학습 기법 목록은 셋 중 확연히 가장 넓어, 전체 파인튜닝, LoRA, QLoRA, GPTQ, 양자화 인지 학습, FP8 혼합 정밀도, DPO·IPO·KTO·ORPO를 통한 선호 조정, GRPO와 GDPO를 통한 강화학습, 그리고 보상 모델링과 프로세스 보상 모델링을 포함합니다.
장점
- +Torchrun과 Ray를 통한 멀티노드 학습이 문서화됨
- +컨텍스트·텐서·샤딩 데이터 병렬을 결합하는 ND 병렬
- +가장 넓은 기법 범위: DPO, IPO, KTO, ORPO, GRPO, GDPO, 보상 모델링
- +설정 기반 실행은 재현 가능하고 검토 가능해 팀에 중요함
단점
- –학습 곡선이 더 가파름 — 첫 성공 전에 문서를 읽는 실제 시간을 잡아야 함
- –실질적으로 CUDA 중심이라 AMD·Intel·애플 하드웨어에서는 답이 아님
- –7B 모델 하나를 혼자 조정하는 사람에게는 과한 장치
MLX-LM: Apple Silicon을 위한 선택
MLX-LM은 M 시리즈 Mac에서 조정하는 가장 가벼운 방법으로, 애플의 MLX 배열 프레임워크에 이식된 것이 아니라 그 위에 직접 구축되었습니다. 무엇인지 정확히 짚어둘 가치가 있습니다. 이를 관리하는 `ml-explore` 조직은 스스로를 "by Apple"이라고 밝히므로, 무관한 커뮤니티 포팅이 아니라 애플 자신의 머신러닝 작업입니다.
MLX-LM — Apple Silicon에서 최적의 경량 선택지
MIT 라이선스, Hugging Face Hub 연동, mx.distributed를 통한 분산 학습
MLX-LM은 MLX로 Apple Silicon에서 텍스트를 생성하고 언어 모델을 조정하는 파이썬 패키지입니다. Hugging Face Hub와 연동되어 수천 개 모델을 명령 하나로 쓸 수 있고, 모델을 양자화해 Hub로 다시 올릴 수 있으며, 양자화된 모델을 포함해 저랭크 조정과 전체 조정을 모두 다룹니다. 또한 `mx.distributed`를 통한 분산 추론과 조정을 지원하므로, 엄밀히 단일 머신용 도구라는 흔한 설명은 이미 낡았습니다. 다만 크로스 플랫폼은 아닙니다. MLX와 Apple Silicon의 통합 메모리에 의존하므로 Windows나 Linux에서는 애초에 후보가 되지 않습니다.
장점
- +MLX와 Apple Silicon 통합 메모리 위에 이식이 아니라 네이티브로 구축됨
- +MIT 라이선스로 셋 중 가장 관대함
- +mx.distributed를 통한 분산 추론과 조정
- +모델을 가져오고 게시하는 양쪽 모두에서 Hugging Face Hub 연동
단점
- –Apple Silicon 전용 — Windows나 Linux에서는 선택지가 아님
- –별 6천 8백으로 셋 중 커뮤니티가 가장 작아 참고할 예제가 적음
- –Unsloth가 macOS 빌드를 제공하면서 더 이상 Mac의 유일한 선택지가 아님
클라우드 플랫폼과 실제 가격
Together.ai와 Fireworks.ai는 둘 다 GPU 시간이 아니라 학습 토큰 단위로 과금하므로, 작업 비용을 시작 전에 추정할 수 있습니다. 아래 요금은 2026년 8월 28일 각 업체의 공개 가격 페이지에서 읽었습니다. LoRA와 전체 파인튜닝 사이의 격차에 주목하세요. 비용 관련 예상 밖 상황은 대부분 여기서 생깁니다.
| 구간과 기법 | Together.ai | Fireworks.ai |
|---|---|---|
| LoRA SFT, 16B 이하 | 0.48달러 / 100만 토큰 | 0.50달러 / 100만 토큰 |
| 전체 SFT, 16B 이하 | 1.20달러 / 100만 토큰 | 1.00달러 / 100만 토큰 |
| LoRA SFT, 중간 구간 | 1.50달러 (17~69B) | 3.00달러 (16.1~80B) |
| LoRA SFT, 대형 구간 | 2.90달러 (70~100B) | 6.00달러 (80~300B) |
| 전체 SFT, 대형 구간 | 7.25달러 (70~100B) | 12.00달러 (80~300B) |
| 공개 가격표 상단 | 전체 DPO 8.00달러, 70~100B | 전체 DPO 40.00달러, 300B 초과 |
| 작업당 최소 요금 | 4.00달러 | 공개되지 않음 |
| 조정된 모델 서빙 | 추론으로 별도 과금 | 기본 모델과 같은 가격 |
가장 명확한 공개 구간 구조와 낮은 진입 요금을 원하면 Together.ai를 고르세요. 이후 모델을 서빙할 예정이라면 Fireworks.ai를 고르세요. 조정된 모델을 기본 모델 가격에 서빙한다는 것이 그들의 명시된 방침입니다.
⚠️Warning: 널리 옮겨 적힌 수치가 Together.ai의 전체 파인튜닝을 100만 토큰당 0.54~3.20달러로 설명합니다. 그것은 사실 LoRA DPO 구간입니다. 전체 지도 파인튜닝은 같은 파라미터 구간에서 1.20~7.25달러로, 잘못 인용된 상단의 두 배가 넘습니다. 비교 기사가 아니라 업체 페이지를 보고 예산을 잡으세요.
Predibase는 어떻게 되었나
Predibase는 더 이상 독립적인 셀프서비스 파인튜닝 플랫폼이 아니며, 아직도 그곳에 가입하라고 안내하는 가이드는 오래된 것입니다. Rubrik이 2025년 6월 25일 인수를 발표했고, 당시 TechCrunch와 CNBC가 보도했으며 Rubrik 자체 뉴스룸도 확인했습니다.
2026년 8월 28일 기준 predibase.com을 요청하면 Rubrik의 Agent Cloud 제품 페이지로 향하는 HTTP 301 영구 리디렉션이 반환됩니다. 그 목적지는 직접 읽을 수 없었으며(자동화된 요청에 HTTP 403을 반환함), 따라서 이 페이지는 그곳이 현재 무엇을 제공하는지에 대해 어떤 주장도 하지 않습니다. 검증 가능한 것은 리디렉션 자체와 그 배경의 인수입니다. Predibase 방식의 관리형 파인튜닝 서비스가 필요하다면, 예전 가입 절차가 여전히 작동하리라 가정하지 말고 무엇이 남았는지 Rubrik에 문의하세요.
💡Tip: 이는 모든 클라우드 플랫폼 비교에 유용한 상기점입니다. 1년 반 전에 확실한 추천이던 제품이 오늘은 죽은 링크일 수 있습니다. 기억에 의존해 추천을 이어가지 말고 갱신할 때마다 업체 상태를 다시 확인하세요.
7B 조정에 실제로 드는 비용
현실적인 인스트럭션 튜닝 작업은 클라우드에서 대부분의 예상보다 저렴하고 로컬에서는 거의 공짜이며, 그래서 보통 연산이 아니라 설정 시간이 결정을 좌우합니다. 평균 300토큰짜리 예시 1만 건을 잡으면 학습 토큰 300만, 세 에포크에 걸쳐 약 900만 토큰을 처리합니다. 아래 표는 위의 공개 요금에 대한 산술 계산입니다.
| 경로 | 적용 요금 | 900만 토큰 비용 |
|---|---|---|
| Together.ai, LoRA SFT | 100만당 0.48달러, 16B 이하 | 4.32달러로 4달러 최소 요금은 적용되지 않음 |
| Together.ai, 전체 SFT | 100만당 1.20달러, 16B 이하 | 10.80달러 |
| Fireworks.ai, LoRA SFT | 100만당 0.50달러, 16B 이하 | 4.50달러 |
| Fireworks.ai, 전체 SFT | 100만당 1.00달러, 16B 이하 | 9.00달러 |
| 빌린 24GB GPU | 시간당 대여, 제공자마다 다름 | 연산은 한 시간 미만인 경우가 많고 설정 시간 추가 |
| 이미 보유한 GPU | 한계 전기요금만 | 실행당 사실상 0 |
이미 보유한 하드웨어라면 첫 실행 이후로는 로컬이 매번 유리합니다. 빌린 하드웨어로 가끔 실행한다면, 실제 데이터셋 규모에 해당하는 고정 토큰 단가와 대여료 더하기 설정 시간을 비교하세요.
💡Tip: 여기 클라우드 금액은 충분히 작아서, 단발 실험에서는 결정 요인이 돈인 경우가 거의 없습니다. 저녁 한 번을 환경 설정에 쓸지, 5달러를 쓸지의 문제입니다. 자기 시간을 정직하게 계산하면 답은 대개 분명해집니다.
누가 무엇을 써야 하나
별 수가 아니라 얼마나 자주 학습하는지와 하드웨어 보유 여부가 결정합니다. 네 가지 유형이 대부분의 독자를 포괄합니다.
- 단발 실험을 하는 취미 사용자 → 인프라를 완전히 건너뛰려면 Together.ai, 또는 빌린 GPU에서 Unsloth. 실험 한 번을 위해 하드웨어를 사지 마세요.
- 매주 반복하는 ML 엔지니어 → 자체 하드웨어의 Unsloth. 반복 빈도가 높으면 토큰 과금이 빠르게 쌓이고, Unsloth는 이제 유료 등급 없이 멀티 GPU를 지원합니다.
- 여러 대에서 학습하는 팀 → Axolotl. 멀티노드와 ND 병렬 때문이며, 설정 기반 실행이 노트북에는 없는 재현성과 검토 가능성을 갖기 때문입니다.
- 조정한 모델을 프로덕션에 올리는 스타트업 → 서빙 경제성이 가장 중요하면 Fireworks.ai(조정된 모델이 기본 모델 가격에 서빙되므로), 더 명확한 구간 구조를 선호하면 Together.ai. 로컬 LLM 프로덕션 운영도 참고하세요.
EU·일본·중국에서의 파인튜닝
파인튜닝은 작업을 수행하는 쪽에 여러분의 학습 데이터를 업로드합니다. 그래서 로컬과 클라우드의 선택은 세 주요 시장에서 단순한 비용 비교가 아니라 데이터 거버넌스 결정이 됩니다.
파인튜닝 스택을 고를 때 흔한 실수
- 1멀티 GPU에 Unsloth 유료 등급이 필요하다고 믿는 것
Why it matters: 널리 반복된 이야기지만 프로젝트의 현재 README와 어긋납니다. README는 멀티 GPU 지원을 AMD·Intel·CPU·Vulkan 백엔드와 나란히 적고 있으며, Apache-2.0 저장소 어디에도 유료 장벽이 없습니다. 이미 갖고 있던 멀티 GPU를 얻겠다고 더 무거운 프레임워크를 도입한 팀들이 있습니다. - 2Together.ai 전체 파인튜닝을 100만 토큰당 0.54~3.20달러로 인용하는 것
Why it matters: 그 구간은 LoRA DPO의 것이지 전체 지도 파인튜닝이 아니며, 후자는 같은 구간에서 실제로 1.20~7.25달러입니다. 잘못된 행에 기반한 예산은 대규모 전체 조정을 절반 넘게 과소평가합니다. - 3독자를 Predibase로 보내는 것
Why it matters: Rubrik이 2025년 6월에 인수했고 predibase.com은 이제 301로 리디렉션합니다. 아직도 Predibase 셀프서비스 가입을 설명하는 가이드는 인수 이후 재확인되지 않은 것입니다. - 4MLX-LM을 비공식 커뮤니티 프로젝트로 취급하는 것
Why it matters: `ml-explore` 조직은 자신의 작업을 "by Apple"이라고 설명합니다. 커뮤니티 포팅으로 치부하면 존재하지도 않는 유지보수 위험을 이유로 배제하게 됩니다. - 5검색이 답인데 파인튜닝하는 것
Why it matters: 파인튜닝은 형식, 어조, 좁은 기술을 가르칩니다. 변하는 사실을 주입하는 수단으로는 형편없고 비쌉니다. 갱신하려면 다시 학습해야 하기 때문입니다. 사실은 검색 파이프라인에 속합니다 — [내 문서에 대한 로컬 RAG](/ko/local-llms/local-rag-2026)를 참고하세요.
이런 경우엔 건너뛰세요
불만이 모델이 회사 문서를 모른다는 것이라면 파인튜닝은 잘못된 도구이며, 그 사실을 알아내는 데 학습 주기 하나를 쓰게 됩니다. 그것은 검색 문제입니다. 잘 만든 RAG 파이프라인은 오늘 오후에 갱신할 수 있는 문서를 바탕으로 답하지만, 파인튜닝은 그것을 가중치에 구워 넣어 고치려면 다시 학습해야 합니다.
파인튜닝이 값을 하는 때는 일관된 출력 형식, 특정한 어조, 또는 프롬프트로는 안정적으로 얻지 못하는 좁은 기술이 필요할 때입니다. 이는 행동의 변화이고, 행동이야말로 학습이 잘 바꾸는 대상입니다. 먼저 구조화된 시스템 프롬프트를, 다음으로 검색을 시도하고, 필요한 바로 그 지점에서 둘 다 눈에 띄게 실패했을 때만 학습에 손을 대세요.
💡Tip: 실용적인 판별법이 있습니다. 올바른 답을 적어서 프롬프트에 붙여넣을 수 있다면 검색이나 프롬프트 문제입니다. 좋은 답의 형태는 설명할 수 있지만 내용은 쓸 수 없다면, 그것이 파인튜닝 문제입니다.
자주 묻는 질문
2026년 최고의 LLM 파인튜닝 프레임워크는 무엇인가요?
자체 하드웨어에서 학습하는 대부분에게는 Unsloth입니다. Apache-2.0 라이브러리가 무료이고 이제 Windows·Linux·WSL·macOS에서 NVIDIA·AMD·Intel·CPU·Vulkan에 걸친 멀티 GPU 구성을 지원하기 때문입니다. 학습이 여러 대에 걸치면 Axolotl이 더 낫습니다. 멀티노드 학습과 ND 병렬을 문서화하고 있기 때문입니다. MLX-LM은 Apple Silicon에서 가장 가벼운 선택지입니다.
Unsloth는 무료이고, 무료 버전이 멀티 GPU를 지원하나요?
Unsloth 라이브러리는 Apache-2.0으로 무료이며, README는 저장소 내에 유료 장벽 없이 멀티 GPU 지원을 명시합니다. 유료 Pro와 Enterprise 등급이 있지만 가격은 공개되지 않았으므로, 다른 곳에서 인용된 구체적 금액은 검증되지 않은 것으로 봐야 합니다. 멀티 GPU에 유료 등급이 필요하다는 흔한 주장은 프로젝트의 현재 문서와 어긋납니다.
클라우드 파인튜닝은 100만 토큰당 얼마인가요?
Together.ai에서 지도 LoRA 파인튜닝은 16B 파라미터까지 100만 토큰당 0.48달러, 17~69B는 1.50달러, 70~100B는 2.90달러이며 작업당 최소 4.00달러입니다. 전체 지도 파인튜닝은 같은 구간에서 1.20, 3.75, 7.25달러입니다. Fireworks.ai에서는 LoRA SFT가 16B까지 100만 토큰당 0.50달러에서 시작해 300B 초과에서 10.00달러까지 오릅니다.
MLX-LM을 Windows나 Linux에서 쓸 수 있나요?
아니요. MLX-LM은 애플의 MLX 프레임워크와 Apple Silicon의 통합 메모리 위에 구축되어 다른 플랫폼에서는 후보가 되지 않습니다. Windows나 Linux에서는 Unsloth나 Axolotl을 쓰세요. Unsloth도 이제 macOS 빌드를 제공하므로 Mac에서는 둘 사이에 실질적인 선택지가 있습니다.
Predibase는 어떻게 되었나요?
Rubrik이 2025년 6월 25일 Predibase 인수를 발표했습니다. 2026년 8월 28일 기준 predibase.com은 독립 제품을 제공하는 대신 Rubrik의 Agent Cloud 페이지로 HTTP 301 리디렉션을 반환합니다. 새 프로젝트에서 의존하기 전에 현재 가용성을 Rubrik에 직접 확인하세요.
Together.ai나 Fireworks.ai에 제휴 프로그램이 있나요?
2026년 8월 기준 두 곳 모두 공개된 제휴나 추천 프로그램을 찾지 못했고, 주요 목록에도 등장하지 않습니다. 두 회사의 파트너 페이지는 기업 연동을 설명할 뿐 창작자용 추천 제도가 아닙니다. PromptQuorum은 이 페이지의 링크로 수익을 얻지 않습니다.
클라우드 파인튜닝이 로컬보다 비싼가요?
얼마나 자주 학습하느냐에 달렸습니다. 작은 데이터셋에서 한 번 실행한다면 클라우드 요금은 몇 달러로, 보통 환경 설정에 저녁 한 번을 쓰는 가치보다 적습니다. 이미 보유한 하드웨어에서 자주 반복한다면 연산의 한계비용이 거의 0이므로 첫 실행 이후로는 로컬이 매번 저렴합니다.
7B 모델을 조정하는 데 멀티 GPU가 필요한가요?
대개 필요 없습니다. 24GB급 카드 한 장이면 QLoRA로 7B 모델을 넉넉히 다룹니다. 멀티 GPU는 더 큰 모델이나 LoRA를 쓰지 않는 전체 파인튜닝에서 더 중요합니다. VRAM 산정은 하드웨어 요구사항 가이드를 참고하세요.
최종 결론
- Unsloth를 쓰세요: 보유한 하드웨어에서 학습하며 동작하는 실행까지 가장 짧은 길을 원한다면. 다음 단계는 설치해서 더 무거운 것을 평가하기 전에 QLoRA 조정을 한 번 돌려보는 것입니다.
- Axolotl을 쓰세요: 학습이 여러 대에 걸쳐야 하거나 DPO, ORPO, KTO, GRPO, 보상 모델링이 필요하다면. 다음 단계는 설정 시스템이 진짜 진입 비용이므로 확정 전에 멀티노드 문서를 읽는 것입니다.
- MLX-LM을 쓰세요: Apple Silicon에서 작업하며 MLX로 가는 가장 직접적인 길을 원한다면. 다음 단계는 유일한 선택지라고 단정하지 말고 Unsloth의 macOS 빌드와 비교하는 것입니다.
- Together.ai나 Fireworks.ai를 쓰세요: GPU를 갖고 싶지 않다면. 다음 단계는 실제 데이터셋을 공개된 토큰 구간에 대입해 계산하되, 전체 조정을 한다면 LoRA DPO 행이 아니라 전체 파인튜닝 행을 쓰는 것입니다.
- 파인튜닝을 건너뛰세요: 모델이 단지 여러분의 문서를 모를 뿐이라면. 다음 단계는 대신 검색 파이프라인을 만드는 것이며, 재학습 없이 고칠 수 있습니다.