Skip to main content
PromptQuorum
/고급 로컬 LLM/TurboFieldfare 리뷰: 2GB RAM으로 Gemma 4 26B-A4B 실행하기
Overview & Reference

TurboFieldfare 리뷰: 2GB RAM으로 Gemma 4 26B-A4B 실행하기

·11분 읽기·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

TurboFieldfare는 1.35GB 크기의 공유 코어와 KV 캐시만 메모리에 상주시키고 나머지 모델 전문가(expert)는 필요에 따라 SSD에서 스트리밍함으로써, Google의 Gemma 4 26B-A4B 모델을 약 2GB RAM으로 실행하는 Apple Silicon Mac용 무료 오픈소스(Apache 2.0) 네이티브 Swift 및 Metal 런타임입니다. 네이티브 Mac 앱, 명령줄 인터페이스, 실험적인 로컬 OpenAI 호환 서버를 제공하며, 모두 Swift Package Manager를 통해 소스에서 빌드합니다 — 미리 빌드된 설치 프로그램은 없으며, llama.cpp나 Ollama 같은 범용 엔진이 아니라 Gemma 4 26B-A4B 모델 전용입니다.

TurboFieldfare(github.com/drumih/turbo-fieldfare)는 Google의 Gemma 4 26B-A4B 모델을 Apple Silicon Mac에서 실행하기 위해 만들어진 무료 오픈소스(Apache 2.0) 네이티브 Swift 및 Metal 런타임입니다. 8GB 기기를 포함해 추론 시 약 2GB의 RAM만 사용하며, GitHub 스타는 6,750개를 넘습니다. 이 리뷰에서는 TurboFieldfare가 무엇을 하는지, 이러한 메모리 사용량을 어떻게 달성하는지, 빌드 및 설치 방법, 그리고 누구에게 적합한지 다룹니다.

핵심 요점

  • TurboFieldfare(github.com/drumih/turbo-fieldfare)는 무료 오픈소스 네이티브 Swift/Metal 런타임입니다 — llama.cpp나 MLX를 감싼 래퍼가 아닙니다
  • Apache 2.0 라이선스이며, GitHub 저장소의 LICENSE 파일로 확인됨
  • 정확히 하나의 모델 패밀리만 실행: instruction-tuned된 Gemma 4 26B-A4B(총 260억 파라미터, 토큰당 약 38.8억 개 활성화)
  • 1.35GB 크기의 공유 코어와 4K 토큰 분량의 KV 캐시를 메모리에 유지하고, 나머지 mixture-of-experts 가중치는 생성 중 pread 호출을 통해 SSD에서 스트리밍하여 약 2GB의 RAM 사용량을 달성
  • 네이티브 SwiftUI/AppKit Mac 앱, 명령줄 인터페이스(TurboFieldfareCLI), 실험적인 루프백 OpenAI 호환 서버(TurboFieldfareServer)의 세 가지 사용 방식 제공
  • 소스에서 빌드하려면 Apple Silicon Mac, Metal 4가 탑재된 macOS 26, 그리고 Swift 6.2 이상의 Xcode 26이 필요 — 패키지는 arm64 전용
  • 이 리뷰 시점 기준 GitHub 스타 6,750개 이상, 포크 430개 이상

📍 한 문장으로

TurboFieldfare는 GitHub 스타 6,750개 이상을 보유한 Apple Silicon Mac용 무료 오픈소스(Apache 2.0) 네이티브 Swift 및 Metal 런타임으로, mixture-of-experts 가중치 대부분을 14.3GB 전체 모델을 메모리에 로드하는 대신 SSD에서 스트리밍함으로써 Google의 Gemma 4 26B-A4B 모델을 약 2GB RAM으로 실행합니다.

💬 쉽게 말하면

TurboFieldfare는 Apple Silicon 칩이 탑재된 Mac에서 소스로부터 빌드하는 무료 앱입니다. 한 번에 모델의 작은 "코어"만 메모리에 유지하고 나머지는 필요할 때 디스크에서 읽어오기 때문에, RAM이 8GB뿐인 Mac에서도 대형(260억 파라미터) AI 모델을 로컬로 실행할 수 있습니다 — 클라우드도, 구독도 필요 없으며, Gemma 4 26B-A4B 외 다른 모델은 사용할 수 없습니다.

📌참고: 이 리뷰는 로컬 LLM 소프트웨어 디렉터리에 있는 TurboFieldfare 항목을 상세히 다루는 심층 기사입니다 — TurboFieldfare가 다른 수십 개의 로컬 AI 도구와 한눈에 어떻게 비교되는지는 해당 페이지를 참고하세요.

TurboFieldfare란 무엇인가?

TurboFieldfare는 범용 엔진처럼 임의의 모델을 지원하는 대신, 엄격한 메모리 예산 내에서 단일 모델 — Gemma 4 26B-A4B — 을 실행하도록 만들어진 Apple Silicon Mac용 모델 전용 로컬 추론 런타임입니다. 자체 GitHub README는 이를 솔직하게 설명합니다. "약 2GB RAM으로 하는 Gemma 4 26B-A4B 추론. 8GB 모델을 포함해 모든 Apple Silicon Mac을 위한 맞춤형 Swift + Metal 런타임."

  • 제품 유형: 네이티브 Swift/Metal 런타임, CLI, Mac 앱 — 자체 README에 따르면 llama.cpp나 MLX의 래퍼가 아님
  • 범위: 모델 전용으로, instruction-tuned된 Gemma 4 26B-A4B만 실행하며 다중 모델 엔진이 아님
  • 저장소: github.com/drumih/turbo-fieldfare, 2026년 7월 17일 생성
  • 라이선스: 소스 코드는 Apache 2.0; 모델 가중치는 Google 자체 Gemma 약관의 적용을 받으며 Hugging Face에서 별도로 다운로드
  • 규모: 이 리뷰 시점 기준 GitHub 스타 6,750개 이상, 포크 430개 이상, 열린 이슈 26건
  • 혼동 주의: 다른 GitHub 계정에도 이름과 설명이 거의 동일한 저장소가 여러 개 존재함; drumih/turbo-fieldfare가 원조이자 스타 수가 가장 많은 저장소이며 이 리뷰가 다루는 대상

TurboFieldfare의 프로젝트 역사와 버전 마일스톤

TurboFieldfare의 GitHub 저장소는 2026년 7월에 생성되었으며, 비교적 최근 프로젝트임에도 이후 여러 릴리스를 출시했고, 가장 최근에는 Mac 앱에 로컬 대화 기록 기능을 추가했습니다.

  1. 1
    저장소 생성 — 2026년 7월 17일
    Why it matters: GitHub 메타데이터에 따르면 TurboFieldfare의 정식 GitHub 저장소(drumih/turbo-fieldfare)가 생성되었습니다.
  2. 2
    v0.7.2 — 이전 릴리스
    Why it matters: v0.8.0 바로 이전 릴리스로, 해당 릴리스의 변경 로그 비교 링크에서 참조됩니다.
  3. 3
    v0.8.0 — 2026년 9월 8일: 로컬 대화 기록
    Why it matters: 공식 릴리스 노트에 따르면 Mac 앱이 대화 기록을 로컬에 저장하기 시작했으며, 사용자는 사이드바에서 저장된 텍스트와 이미지를 포함해 과거 대화를 검색·이름 변경·삭제·재개방할 수 있습니다. 이 릴리스는 첨부된 사전 빌드 바이너리 없이 명시적으로 "소스 전용"으로 표시되어 있습니다.

TurboFieldfare는 실제로 무엇을 하는가?

TurboFieldfare의 기능 세트는 하나의 대형 모델을 평범한 Apple Silicon 하드웨어에서 사용 가능하게 만드는 데 집중되어 있습니다. 자체 GitHub README와 문서에 따라 각 부분이 실제로 무엇을 하는지 살펴봅니다.

  • SSD에서 전문가(expert) 가중치 스트리밍 — 약 14.3GB 규모의 Gemma 4 26B-A4B 모델 전체를 메모리에 로드하는 대신, TurboFieldfare는 1.35GB 크기의 공유 코어와 FP16 키-값 캐시만 메모리에 유지하고, 각 토큰에 필요한 mixture-of-experts 가중치만 pread 호출을 통해 디스크에서 스트리밍합니다. SSD 기반 전문가 캐시에는 LFU(최소 빈도 사용) 축출 정책을 사용합니다
  • 맞춤형 Metal 커널 — 범용 ML 프레임워크에 의존하는 대신, 직접 작성한 Metal 커널이 양자화된 GEMV, 어텐션, mixture-of-experts 라우팅, 정규화, 샘플링을 처리합니다
  • 청크 단위 prefill — 프로젝트의 시스템 설계 문서에 따르면, 청크 단위 prefill 전략은 메모리 사용량을 제한된 상태로 유지하면서 첫 토큰까지의 시간을 줄입니다
  • 세 가지 인터페이스, 하나의 모델 저장소 — 네이티브 Mac 앱, 명령줄 인터페이스(TurboFieldfareCLI), 실험적인 루프백 OpenAI 호환 서버(TurboFieldfareServer) 모두 동일한 .gturbo 모델 디렉터리를 읽지만, 모델을 소유하는 프로세스는 한 번에 하나만 실행해야 합니다
  • 선택적 비전 타워 — 이미지 입력은 별도로 설치 가능한 비전 타워 부속 패키지(약 1.1GB)를 통해 지원되며, M2 이상의 Mac이 필요합니다; 텍스트 전용 추론은 M1에서도 계속 사용할 수 있습니다
  • 앱/CLI에서 도구 실행 없음 — Mac 앱과 CLI는 사용자/모델 메시지와 선택적 시스템 지침을 지원하지만 도구를 노출하거나 실행하지는 않습니다; README에 따르면 루프백 서버는 function-tool 선언을 받아들이고 모델이 생성한 도구 호출을 반환하여 클라이언트가 실행하도록 합니다
  • 오디오/비디오 미지원 — 자체 문서에 따르면 TurboFieldfare는 오디오 또는 비디오 입력을 지원하지 않습니다

사용 예시: TurboFieldfare를 사용하는 세 가지 방법

다음은 TurboFieldfare 자체의 문서화된 README에서 가져온 구체적인 워크플로우이며, 가상의 사용 사례가 아닙니다.

TurboFieldfare 가격: 정말 무료인가?

네 — TurboFieldfare에는 유료 요금제가 없습니다. 소스 코드는 Apache 2.0 라이선스이며 빌드와 실행이 무료입니다; 프로젝트 자체가 부과하는 구독, 계정, 사용량 제한이 없습니다.

  • TurboFieldfare 자체가 부과하는 구독, 유료 요금제, 사용량 제한 없음
  • 앱, CLI, 서버를 빌드하거나 실행하는 데 계정이나 가입이 필요 없음
  • Gemma 4 26B-A4B 모델 가중치는 Hugging Face에서 한 번만 다운로드되며, TurboFieldfare의 Apache 2.0 소스 라이선스와는 별개로 Google 자체의 Gemma 모델 약관의 적용을 받음
  • 유일한 지속적 비용은 자신의 하드웨어와 디스크 공간뿐입니다: 텍스트 모델용 약 14.3GB, 선택적 이미지 비전 타워를 설치할 경우 약 1.1GB 추가

TurboFieldfare 대 Ollama

TurboFieldfare와 Ollama는 서로 다른 문제를 해결합니다. Ollama는 macOS, Windows, Linux에서 방대하고 계속 늘어나는 오픈 웨이트 모델 카탈로그를 지원하는 범용 로컬 모델 러너인 반면, TurboFieldfare는 Gemma 4 26B-A4B를 약 2GB RAM에 맞추도록 특별히 최적화된 Apple Silicon 전용 단일 모델 런타임입니다.

모델 지원

TurboFieldfare 대 Ollama:
TurboFieldfare는 Gemma 4 26B-A4B만 실행합니다; Ollama는 폭넓고 정기적으로 업데이트되는 오픈 웨이트 모델 카탈로그를 지원합니다.

플랫폼

TurboFieldfare 대 Ollama:
TurboFieldfare는 Apple Silicon macOS 전용입니다(arm64, macOS 26 이상); Ollama는 macOS, Windows, Linux를 지원합니다.

설치 방법

TurboFieldfare 대 Ollama:
TurboFieldfare는 Swift Package Manager를 통해 소스에서 빌드합니다; Ollama는 플랫폼별 사전 빌드된 설치 프로그램/바이너리를 제공합니다.

메모리 접근 방식

TurboFieldfare 대 Ollama:
TurboFieldfare는 8GB Mac에 맞추기 위해 전문가 가중치 대부분을 SSD에서 스트리밍합니다; Ollama는 하드웨어에서 사용 가능한 RAM/VRAM에 따라 모델을 로드하며, 비슷한 규모의 모델에는 일반적으로 더 많은 메모리가 필요합니다.

엔진 기반

TurboFieldfare 대 Ollama:
TurboFieldfare는 llama.cpp를 기반으로 하지 않는 맞춤형 Swift/Metal 런타임입니다; Ollama는 추론 코어로 llama.cpp(GGML)를 기반으로 구축되었습니다.

메모리가 제한된 Apple Silicon 하드웨어에서 특정 대형 모델 하나를 실행하는 것이 우선순위라면, TurboFieldfare의 좁은 초점이 바로 그 강점입니다. 여러 모델과 플랫폼에 걸친 유연성이 우선순위라면, Ollama가 더 폭넓은 범용 도구입니다 — 자세한 내용은 Ollama 리뷰를 참고하세요. 선택하기 전에 각 프로젝트의 공식 사이트에서 현재 기능 세부 정보를 직접 확인하세요.

TurboFieldfare는 누구에게 적합한가?

TurboFieldfare가 적합한지는 범용 로컬 모델 러너가 필요한지 여부가 아니라, 메모리가 제한된 Apple Silicon Mac에서 특별히 Gemma 4 26B-A4B를 실행하고 싶은지에 달려 있습니다.

경쟁 제품 및 대안

로컬 추론 엔진 분야에서 TurboFieldfare는 Ollama 및 LMDeploy와 가장 많이 비교됩니다 — 가장 큰 차별점은 여러 모델을 지원하는 범용 엔진이 아니라 범위가 좁은 모델 전용 런타임이라는 점입니다.

도구
가장 잘 알려진 점
링크
Ollama대규모 모델 카탈로그를 갖춘 범용 로컬 모델 러너, macOS/Windows/LinuxOllama 리뷰
LMDeploy추론 처리량에 중점을 둔 LLM 압축, 배포, 서빙 툴킷LMDeploy 리뷰

이 목록은 로컬 추론 엔진 분야에서 TurboFieldfare와 흔히 비교되는 도구를 반영한 것이며, PromptQuorum의 독립적인 순위가 아닙니다 — TurboFieldfare 자체의 디렉터리 항목을 포함해 정기적으로 업데이트되는 전체 카탈로그는 로컬 LLM 소프트웨어 디렉터리를 참고하세요. 선택하기 전에 각 도구의 현재 플랫폼 및 모델 지원 여부를 확인하세요.

TurboFieldfare 평가 시 흔한 오해

TurboFieldfare에 대한 대부분의 혼란은 의도적으로 갖추지 않은 범용 엔진 기능을 기대하거나, 같은 이름의 다른 저장소로 착각하는 데서 비롯됩니다.

자주 묻는 질문

TurboFieldfare란 무엇입니까?

TurboFieldfare(github.com/drumih/turbo-fieldfare)는 Apple Silicon Mac용 무료 오픈소스(Apache 2.0) 네이티브 Swift 및 Metal 런타임으로, Google의 Gemma 4 26B-A4B 모델을 약 2GB RAM으로 실행합니다.

TurboFieldfare는 무료입니까?

네, TurboFieldfare의 소스 코드는 무료이며 Apache 2.0 라이선스이고 유료 요금제가 없습니다. Gemma 4 26B-A4B의 가중치는 Google 자체의 Gemma 모델 약관에 따라 Hugging Face에서 별도로 다운로드합니다.

TurboFieldfare는 어떻게 설치합니까?

저장소를 클론하고 swift build -c release를 실행한 다음 .build/release/TurboFieldfareMac을 실행합니다. 사전 빌드된 설치 프로그램은 없습니다 — TurboFieldfare는 Swift Package Manager를 통해 소스에서 빌드해야 합니다.

TurboFieldfare는 어떤 모델을 지원합니까?

Gemma 4 26B-A4B(instruction-tuned)만 지원합니다. 임의의 모델을 지원하는 범용 엔진이 아니라 모델 전용 런타임입니다.

TurboFieldfare는 260억 파라미터 모델을 어떻게 2GB RAM으로 실행합니까?

1.35GB 크기의 공유 코어와 작은 KV 캐시를 메모리에 유지하고, 생성 중 필요에 따라 모델의 나머지 mixture-of-experts 가중치를 SSD에서 스트리밍합니다. 맞춤형 Metal 커널과 SSD 기반 전문가 캐시를 위한 LFU 축출 정책을 사용합니다.

TurboFieldfare에는 어떤 하드웨어가 필요합니까?

Apple Silicon Mac(텍스트 전용은 M1 이상; 선택적 비전 타워는 M2 이상), Metal 4가 탑재된 macOS 26, 텍스트 모델용 약 14.3GB의 여유 공간이 필요합니다. 빌드하려면 Xcode 26과 Swift 6.2 이상이 필요합니다.

TurboFieldfare는 Windows나 Linux를 지원합니까?

아니요, 패키지는 arm64 전용이며 Metal 4가 탑재된 macOS 26이 필요합니다 — Windows, Linux, Intel 기반 Mac은 지원하지 않습니다.

TurboFieldfare는 이미지를 지원합니까?

네, 별도로 설치 가능한 비전 타워 부속 패키지(약 1.1GB)를 통해 지원하며 M2 이상의 Mac이 필요합니다. 이 패키지가 없어도 M1 Mac을 포함해 텍스트 전용 추론은 계속 작동합니다.

TurboFieldfare는 tool-calling을 지원합니까?

네이티브 Mac 앱과 CLI는 도구를 노출하거나 실행하지 않습니다. 실험적인 루프백 OpenAI 호환 서버는 function-tool 선언을 받아들이고 모델이 생성한 도구 호출을 반환하여 클라이언트 코드가 실행하도록 합니다.

TurboFieldfare는 Ollama와 어떻게 다릅니까?

TurboFieldfare는 맞춤형 Swift/Metal 런타임을 통해 Apple Silicon Mac에서 Gemma 4 26B-A4B만 실행합니다; Ollama는 llama.cpp를 기반으로 구축된 범용 크로스 플랫폼 모델 러너로 훨씬 더 폭넓은 모델 카탈로그를 지원합니다. 위의 TurboFieldfare 대 Ollama 비교를 참고하세요.

PromptQuorum이 TurboFieldfare의 주장을 독립적으로 테스트했습니까?

이 리뷰는 PromptQuorum이 직접 수행한 벤치마크가 아니라 TurboFieldfare 자체의 GitHub 저장소, README, 문서를 기반으로 합니다.

출처

← 고급 로컬 LLM으로 돌아가기