Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/Reseña de TurboFieldfare: ejecutar Gemma 4 26B-A4B con 2 GB de RAM
Overview & Reference

Reseña de TurboFieldfare: ejecutar Gemma 4 26B-A4B con 2 GB de RAM

·11 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

TurboFieldfare es un runtime nativo en Swift y Metal, gratuito y de código abierto (Apache 2.0), para Macs con Apple Silicon, que ejecuta el modelo Gemma 4 26B-A4B de Google usando alrededor de 2 GB de RAM, manteniendo en memoria solo un núcleo compartido de 1,35 GB y una caché KV, y transmitiendo el resto de los expertos del modelo desde el SSD según se necesiten. Incluye una app nativa para Mac, una interfaz de línea de comandos y un servidor local experimental compatible con OpenAI, todos compilados desde el código fuente mediante Swift Package Manager — no hay instalador precompilado, y es específico para el modelo Gemma 4 26B-A4B, no un motor de propósito general como llama.cpp u Ollama.

TurboFieldfare (github.com/drumih/turbo-fieldfare) es un runtime nativo en Swift y Metal, gratuito y de código abierto (Apache 2.0), creado específicamente para ejecutar el modelo Gemma 4 26B-A4B de Google en Macs con Apple Silicon, incluidas las máquinas de 8 GB, usando alrededor de 2 GB de RAM durante la inferencia, con más de 6.750 estrellas en GitHub. Esta reseña cubre qué hace, cómo logra ese consumo de memoria, cómo compilarlo e instalarlo, y para quién es adecuado.

Conclusiones clave

  • TurboFieldfare (github.com/drumih/turbo-fieldfare) es un runtime nativo en Swift/Metal, gratuito y de código abierto — no un simple wrapper de llama.cpp o MLX
  • Con licencia Apache 2.0, confirmada mediante el archivo LICENSE del repositorio de GitHub
  • Ejecuta exactamente una familia de modelos: el Gemma 4 26B-A4B instruction-tuned (26.000 millones de parámetros en total, unos 3.880 millones activos por token)
  • Logra un uso de RAM de alrededor de 2 GB manteniendo en memoria un núcleo compartido de 1,35 GB más una caché KV de 4K tokens, y transmitiendo los pesos mixture-of-experts restantes desde el SSD mediante llamadas pread durante la generación
  • Incluye tres formas de uso: una app nativa para Mac en SwiftUI/AppKit, una interfaz de línea de comandos (TurboFieldfareCLI) y un servidor experimental en loopback compatible con OpenAI (TurboFieldfareServer)
  • Requiere un Mac con Apple Silicon, macOS 26 con Metal 4, y Xcode 26 con Swift 6.2 o superior para compilarlo desde el código fuente — el paquete es exclusivamente arm64
  • Más de 6.750 estrellas en GitHub y 430+ forks al momento de esta reseña

📍 En una frase

TurboFieldfare es un runtime nativo en Swift y Metal, gratuito y de código abierto (Apache 2.0), para Macs con Apple Silicon, con más de 6.750 estrellas en GitHub, que ejecuta el modelo Gemma 4 26B-A4B de Google usando unos 2 GB de RAM al transmitir la mayoría de sus pesos mixture-of-experts desde el SSD en lugar de cargar el modelo completo de 14,3 GB en memoria.

💬 En términos simples

TurboFieldfare es una app gratuita que compilas desde el código fuente en un Mac con chip Apple Silicon. Permite ejecutar en local un modelo de IA grande (26.000 millones de parámetros) incluso en un Mac con solo 8 GB de RAM, porque mantiene en memoria solo un pequeño "núcleo" del modelo a la vez y lee el resto desde el disco según se necesita — sin nube, sin suscripción y sin ningún otro modelo aparte de Gemma 4 26B-A4B.

📌Nota: Esta reseña es el artículo en profundidad que acompaña la entrada de TurboFieldfare en el Local LLM Software Directory — consulta esa página para ver cómo se compara TurboFieldfare, de un vistazo, con docenas de otras herramientas de IA local.

¿Qué es TurboFieldfare?

TurboFieldfare es un runtime de inferencia local específico para un modelo, pensado para Macs con Apple Silicon, creado para ejecutar un único modelo — Gemma 4 26B-A4B — dentro de un presupuesto de memoria estricto, en lugar de soportar modelos arbitrarios como haría un motor de propósito general. Su propio README de GitHub lo describe sin rodeos: "Inferencia de Gemma 4 26B-A4B con alrededor de 2 GB de RAM. Un runtime en Swift + Metal hecho a medida para cualquier Mac con Apple Silicon, incluso los de 8 GB."

  • Tipo de producto: un runtime nativo en Swift/Metal, una CLI y una app para Mac — no un wrapper de llama.cpp o MLX, según su propio README
  • Alcance: específico para un modelo, ejecuta únicamente Gemma 4 26B-A4B (instruction-tuned), no es un motor multi-modelo
  • Repositorio: github.com/drumih/turbo-fieldfare, creado el 17 de julio de 2026
  • Licencia: Apache 2.0 para el código fuente; los pesos del modelo se rigen por los propios términos de Gemma de Google y se descargan por separado desde Hugging Face
  • Escala: más de 6.750 estrellas en GitHub, 430+ forks y 26 issues abiertas al momento de esta reseña
  • Desambiguación: existen varios repositorios con nombres y descripciones casi idénticos en otras cuentas de GitHub; drumih/turbo-fieldfare es el original, el de más estrellas, y el que cubre esta reseña

Historia del proyecto e hitos de versiones de TurboFieldfare

El repositorio de GitHub de TurboFieldfare se creó en julio de 2026 — un proyecto relativamente reciente — y desde entonces ha publicado varias versiones, la más reciente de las cuales añadió historial de conversaciones local a su app para Mac.

  1. 1
    Repositorio creado — 17 de julio de 2026
    Why it matters: El repositorio canónico de GitHub de TurboFieldfare (drumih/turbo-fieldfare) se creó, según los metadatos de GitHub.
  2. 2
    v0.7.2 — versión anterior
    Why it matters: La versión inmediatamente anterior a v0.8.0, referenciada en el enlace de comparación del changelog de esa versión.
  3. 3
    v0.8.0 — 8 de septiembre de 2026: historial de conversaciones local
    Why it matters: Según las notas de versión oficiales, la app para Mac comenzó a guardar el historial de conversaciones en local, permitiendo a los usuarios buscar, renombrar, eliminar y reabrir chats anteriores — incluidos textos e imágenes guardados — desde la barra lateral. Esta versión está marcada explícitamente como "solo código fuente", sin binarios precompilados adjuntos.

¿Qué hace realmente TurboFieldfare?

El conjunto de funciones de TurboFieldfare se centra en hacer utilizable un único modelo grande en hardware Apple Silicon modesto. Esto es lo que hace realmente cada parte, según su propio README de GitHub y documentación.

  • Transmisión de pesos de expertos desde el SSD — en lugar de cargar el modelo Gemma 4 26B-A4B completo (~14,3 GB) en memoria, TurboFieldfare mantiene en memoria un núcleo compartido de 1,35 GB y una caché clave-valor en FP16, y transmite solo los pesos mixture-of-experts necesarios para cada token desde el disco mediante llamadas pread, con una política de expulsión LFU (least-frequently-used) para la caché de expertos respaldada por SSD
  • Kernels Metal a medida — kernels de Metal escritos a mano gestionan el GEMV cuantizado, la atención, el enrutamiento mixture-of-experts, la normalización y el muestreo, en lugar de depender de un framework de ML de propósito general
  • Prefill fragmentado (chunked) — según la documentación de diseño del sistema del proyecto, una estrategia de prefill fragmentado reduce el tiempo hasta el primer token manteniendo acotado el uso de memoria
  • Tres interfaces, un solo almacén de modelo — una app nativa para Mac, una interfaz de línea de comandos (TurboFieldfareCLI) y un servidor experimental en loopback compatible con OpenAI (TurboFieldfareServer) leen todos del mismo directorio de modelo .gturbo, aunque solo debería ejecutarse un proceso propietario del modelo a la vez
  • Torre de visión opcional — la entrada de imágenes se admite mediante un paquete complementario de torre de visión instalable por separado (unos 1,1 GB), que requiere un Mac M2 o superior; la inferencia solo de texto sigue disponible en M1
  • Sin ejecución de herramientas en la app/CLI — la app para Mac y la CLI admiten mensajes de usuario/modelo e instrucciones de sistema opcionales, pero no exponen ni ejecutan herramientas; el servidor en loopback acepta declaraciones de function-tools y devuelve las llamadas a herramientas generadas por el modelo para que las ejecute el cliente, según el README
  • No admite audio/vídeo — según su propia documentación, TurboFieldfare no admite entrada de audio ni de vídeo

Ejemplos de uso: tres formas de usar TurboFieldfare

Estos son flujos de trabajo concretos extraídos del propio README documentado de TurboFieldfare, no casos de uso hipotéticos.

Precios de TurboFieldfare: ¿es realmente gratuito?

Sí — TurboFieldfare no tiene ningún plan de pago. El código fuente tiene licencia Apache 2.0 y es gratuito de compilar y ejecutar; no hay suscripción, cuenta ni límite de uso impuesto por el propio proyecto.

  • Sin suscripción, sin plan de pago, sin límites de uso impuestos por TurboFieldfare
  • No se requiere cuenta ni registro para compilar o ejecutar la app, la CLI o el servidor
  • Los pesos del modelo Gemma 4 26B-A4B se descargan una vez desde Hugging Face y se rigen por los propios términos del modelo Gemma de Google, independientes de la licencia de código fuente Apache 2.0 de TurboFieldfare
  • El único coste continuo es tu propio hardware y espacio en disco: unos 14,3 GB para el modelo de texto, más unos 1,1 GB adicionales si instalas la torre de visión opcional para imágenes

TurboFieldfare vs. Ollama

TurboFieldfare y Ollama resuelven problemas distintos: Ollama es un ejecutor de modelos locales de propósito general que admite un catálogo amplio y creciente de modelos abiertos en macOS, Windows y Linux, mientras que TurboFieldfare es un runtime de un solo modelo, exclusivo de Apple Silicon, optimizado específicamente para hacer caber Gemma 4 26B-A4B en unos 2 GB de RAM.

Soporte de modelos

TurboFieldfare vs. Ollama:
TurboFieldfare solo ejecuta Gemma 4 26B-A4B; Ollama admite un catálogo amplio y actualizado regularmente de modelos abiertos.

Plataforma

TurboFieldfare vs. Ollama:
TurboFieldfare es exclusivo de Apple Silicon/macOS (arm64, macOS 26+); Ollama admite macOS, Windows y Linux.

Método de instalación

TurboFieldfare vs. Ollama:
TurboFieldfare se compila desde el código fuente mediante Swift Package Manager; Ollama ofrece un instalador/binario precompilado por plataforma.

Enfoque de memoria

TurboFieldfare vs. Ollama:
TurboFieldfare transmite la mayoría de los pesos de expertos desde el SSD para caber en un Mac de 8 GB; Ollama carga los modelos según la RAM/VRAM disponible de tu hardware, y suele necesitar más memoria para un modelo de tamaño comparable.

Base del motor

TurboFieldfare vs. Ollama:
TurboFieldfare es un runtime Swift/Metal hecho a medida, no está construido sobre llama.cpp; Ollama está construido sobre llama.cpp (GGML) como núcleo de inferencia.

Si tu prioridad es ejecutar un único modelo grande y específico en hardware Apple Silicon con memoria limitada, el enfoque estrecho de TurboFieldfare es precisamente el punto. Si tu prioridad es la flexibilidad entre muchos modelos y plataformas, Ollama es la herramienta de propósito general más amplia — consulta la reseña de Ollama para más detalles. Verifica los detalles de funciones actuales directamente en el sitio de cada proyecto antes de decidir.

¿Para quién es TurboFieldfare?

Que TurboFieldfare te sirva depende de si quieres específicamente ejecutar Gemma 4 26B-A4B en un Mac con Apple Silicon con memoria limitada, en lugar de necesitar un ejecutor de modelos locales de propósito general.

Competidores y alternativas

TurboFieldfare se compara con mayor frecuencia con Ollama y LMDeploy en el espacio de los motores de inferencia local — su principal diferenciador es ser un runtime específico de un modelo y de alcance reducido, en lugar de un motor de propósito general que admite muchos modelos.

Herramienta
Más conocido por
Enlace
OllamaEjecutor de modelos locales de propósito general con un amplio catálogo de modelos, macOS/Windows/LinuxReseña de Ollama
LMDeployKit de herramientas para comprimir, desplegar y servir LLM, centrado en el rendimiento de inferenciaReseña de LMDeploy

Esta lista refleja herramientas con las que se compara habitualmente a TurboFieldfare, no una clasificación independiente de PromptQuorum — consulta el Local LLM Software Directory para el catálogo completo y actualizado regularmente, que incluye la propia entrada de TurboFieldfare en el directorio. Verifica el soporte actual de plataforma y modelos de cada herramienta antes de elegir.

Errores comunes al evaluar TurboFieldfare

La mayor parte de la confusión sobre TurboFieldfare surge de esperar funciones de motor de propósito general que deliberadamente no tiene, o de suponer que se trata de un repositorio diferente con el mismo nombre.

Preguntas frecuentes

¿Qué es TurboFieldfare?

TurboFieldfare (github.com/drumih/turbo-fieldfare) es un runtime nativo en Swift y Metal, gratuito y de código abierto (Apache 2.0), para Macs con Apple Silicon, que ejecuta el modelo Gemma 4 26B-A4B de Google usando alrededor de 2 GB de RAM.

¿Es gratuito TurboFieldfare?

Sí, el código fuente de TurboFieldfare es gratuito y tiene licencia Apache 2.0, sin plan de pago. Los pesos de Gemma 4 26B-A4B se descargan por separado desde Hugging Face bajo los propios términos del modelo Gemma de Google.

¿Cómo instalo TurboFieldfare?

Clona el repositorio, ejecuta swift build -c release y luego lanza .build/release/TurboFieldfareMac. No hay instalador precompilado — TurboFieldfare debe compilarse desde el código fuente mediante Swift Package Manager.

¿Qué modelos admite TurboFieldfare?

Solo Gemma 4 26B-A4B (instruction-tuned). Es un runtime específico de un modelo, no un motor de propósito general que admita modelos arbitrarios.

¿Cómo ejecuta TurboFieldfare un modelo de 26.000 millones de parámetros con 2 GB de RAM?

Mantiene en memoria un núcleo compartido de 1,35 GB y una pequeña caché KV, y transmite los pesos mixture-of-experts restantes del modelo desde el SSD según se necesitan durante la generación, usando kernels Metal a medida y una política de expulsión LFU para la caché de expertos respaldada por SSD.

¿Qué hardware requiere TurboFieldfare?

Un Mac con Apple Silicon (M1 o superior para solo texto; M2 o superior para la torre de visión opcional), macOS 26 con Metal 4, y unos 14,3 GB de espacio libre para el modelo de texto. Compilarlo requiere Xcode 26 y Swift 6.2 o superior.

¿TurboFieldfare admite Windows o Linux?

No, el paquete es exclusivamente arm64 y requiere macOS 26 con Metal 4 — no admite Windows, Linux ni Macs basados en Intel.

¿TurboFieldfare admite imágenes?

Sí, mediante un paquete complementario de torre de visión instalable por separado (unos 1,1 GB), que requiere un Mac M2 o superior. Sin él, la inferencia solo de texto sigue funcionando, incluso en Macs M1.

¿TurboFieldfare admite tool-calling?

La app nativa para Mac y la CLI no exponen ni ejecutan herramientas. El servidor experimental en loopback compatible con OpenAI acepta declaraciones de function-tools y devuelve las llamadas a herramientas generadas por el modelo para que las ejecute tu código cliente.

¿En qué se diferencia TurboFieldfare de Ollama?

TurboFieldfare solo ejecuta Gemma 4 26B-A4B en Macs con Apple Silicon mediante un runtime Swift/Metal a medida; Ollama es un ejecutor de modelos de propósito general y multiplataforma construido sobre llama.cpp que admite un catálogo de modelos mucho más amplio. Consulta la comparación TurboFieldfare vs. Ollama más arriba.

¿Ha probado PromptQuorum de forma independiente las afirmaciones de TurboFieldfare?

Esta reseña se basa en el propio repositorio de GitHub, README y documentación de TurboFieldfare, en lugar de en pruebas de rendimiento prácticas realizadas por PromptQuorum.

Fuentes

← Volver a LLM locales avanzados