Skip to main content
PromptQuorum
Home/Local LLMs/Mejor framework de fine-tuning de LLM 2026: Unsloth, Axolotl o nube
Tools & Interfaces

Mejor framework de fine-tuning de LLM 2026: Unsloth, Axolotl o nube

·13 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

Esta página contiene enlaces de referencia a productos de terceros. PromptQuorum no participa en ningún programa de afiliados — son enlaces simples que no generan comisión. Hacer clic en los enlaces y los pasos siguientes son de su entera responsabilidad. Estos enlaces no representan ningún respaldo ni verificación por parte de PromptQuorum.

Unsloth es el mejor framework de fine-tuning para la mayoría de desarrolladores en 2026: la biblioteca Apache-2.0 es gratuita, ya cubre configuraciones multi-GPU y los backends de NVIDIA, AMD, Intel, CPU y Vulkan en Windows, Linux, WSL y macOS, y ofrece aplicación de escritorio. Axolotl es la mejor opción cuando una sola máquina se queda corta, porque es el único de los tres con entrenamiento multinodo y paralelismo ND, además de la gama más amplia de métodos de alineación. MLX-LM es la opción más ligera en Apple Silicon, construida directamente sobre MLX de Apple. Si prefiere no ejecutar el trabajo, Together.ai cobra 0,48 $ por millón de tokens de entrenamiento para LoRA en modelos de hasta 16B, con un mínimo de 4 $ por trabajo.

Key Takeaways

  • Unsloth — 75,0k estrellas en GitHub, Apache-2.0. Su README declara compatibilidad con configuraciones multi-GPU, GPU de NVIDIA, AMD e Intel, CPU y el backend Vulkan, en Windows, Linux, WSL y macOS, con compilaciones de escritorio. Multi-GPU no está detrás de un muro de pago en el proyecto de código abierto.
  • Axolotl — 12,4k estrellas, Apache-2.0. El único de los tres con entrenamiento multinodo documentado (Torchrun, Ray) y paralelismo ND que combina paralelismo de contexto, de tensores y de datos totalmente fragmentados dentro de un nodo y entre varios.
  • MLX-LM — 6,8k estrellas, MIT, de la organización `ml-explore` de Apple, cuyo propio perfil describe el trabajo como «by Apple». Admite LoRA y fine-tuning completo, modelos cuantizados e inferencia y ajuste distribuidos mediante `mx.distributed`.
  • Together.ai — fine-tuning supervisado con LoRA a 0,48 $/M tokens de entrenamiento hasta 16B parámetros, 1,50 $ en 17–69B y 2,90 $ en 70–100B. El fine-tuning supervisado completo cuesta bastante más: 1,20 $, 3,75 $ y 7,25 $ en esos mismos tramos. Se aplica un mínimo de 4,00 $ por trabajo.
  • Fireworks.ai — LoRA SFT desde 0,50 $/M tokens hasta 16B, subiendo a 10,00 $ por encima de 300B; el DPO de parámetros completos alcanza 40,00 $/M en el tramo superior. Su página de precios lo dice sin rodeos: «Serve fine-tuned models for the same price as base models».
  • Predibase ya no es un producto independiente. Rubrik anunció la adquisición el 25 de junio de 2025 y, a 28 de agosto de 2026, predibase.com devuelve una redirección HTTP 301 a la página de Agent Cloud de Rubrik. No envíe a nadie a un registro que ya no existe.
  • Ni Together.ai ni Fireworks.ai tienen un programa público de afiliados o referidos que hayamos podido encontrar en agosto de 2026, y ninguno aparece en los principales listados del sector. Todos los enlaces de esta página no generan comisión.

🏆 La mejor opción para su caso

La división que importa es si ejecuta usted el entrenamiento o paga a otro por ejecutarlo. Lea la lista y deténgase en la primera línea que le describa.

  • Tiene una GPU capaz y quiere el camino más corto a un ajuste funcional → Unsloth. Gratuito, Apache-2.0 y ahora con multi-GPU y hardware no NVIDIA, así que el viejo motivo para abandonarlo ha desaparecido en gran medida.
  • Su entrenamiento ya no cabe en una máquina → Axolotl. El multinodo con Torchrun y Ray más el paralelismo ND es la verdadera línea divisoria frente a Unsloth en 2026.
  • Trabaja en un Mac con chip de la serie M → MLX-LM si quiere la vía más ligera y nativa de MLX, aunque Unsloth ya funciona también en macOS, así que hoy es una preferencia y no la única opción.
  • Necesita DPO, ORPO, KTO, GRPO o modelado de recompensa → Axolotl. Su gama documentada de métodos es con diferencia la más amplia de los tres.
  • No tiene GPU ni quiere alquilar una → Together.ai por sus precios por token transparentes, o Fireworks.ai si después va a servir el modelo ajustado y no quiere recargo de alojamiento.
Together.ai — ver precios de fine-tuningenlace de producto · divulgadoFireworks.ai — ver precios de fine-tuningenlace de producto · divulgado

¿Ajustar en local o en la nube?

Ajuste en local si ya tiene una GPU capaz y prevé iterar; use una API en la nube si no tiene hardware o si ajusta tan poco que la facturación por trabajo sale más barata que su propio tiempo de configuración. Esta pregunta va antes que «qué framework», porque decide qué mitad de esta página le corresponde.

La versión honesta del compromiso es que entrenar en local es barato por ejecución y caro por hora de su atención, mientras que una API en la nube invierte esa relación. Quien ajusta una vez por trimestre gana de verdad al no depurar una incompatibilidad de controladores a las once de la noche. Quien itera dos veces por semana sobre el mismo conjunto de datos verá la facturación por token superar rápidamente el coste del hardware.

Ajuste en local cuando tenga una GPU capaz e itere con frecuencia, y use una API de fine-tuning en la nube cuando no tenga hardware o ajuste tan poco que la tarifa por trabajo cueste menos que su propio tiempo de configuración.

Tener el hardware hace que cada ejecución sea casi gratuita pero le cuesta la configuración. Alquilar el servicio cuesta unos dólares por ejecución pero empieza en minutos. Cuál sale más barato depende solo de con qué frecuencia entrene.

  • Entrene en local si tiene una tarjeta de clase RTX 3090/4090 o superior, itera semanalmente sobre el mismo conjunto de datos, o los datos de entrenamiento no pueden salir de su máquina por privacidad o propiedad intelectual.
  • Use una API en la nube si no tiene GPU, necesita un modelo más grande de lo que su hardware admite incluso en 4 bits, o quiere servicio gestionado incluido con el entrenamiento.
  • Cualquiera de las dos sirve si ajusta mensualmente un modelo 7B: a esa cadencia la diferencia de coste es lo bastante pequeña como para que decida la comodidad.

Los tres frameworks locales comparados

Unsloth, Axolotl y MLX-LM son los tres frameworks locales de fine-tuning que merecen la pena en 2026, y las fronteras entre ellos se han movido. Unsloth fue en su día la opción CUDA de una sola GPU y hoy es la más amplia; el argumento de Axolotl es la profundidad en entrenamiento distribuido, no el mero multi-GPU; MLX-LM sigue siendo el más ligero en Apple Silicon, pero ya no es la única opción para Mac. Los tres son gratuitos y de código abierto, y ninguno exige que sus datos de entrenamiento salgan de casa.

Las estrellas y las licencias se leyeron de la API de GitHub el 28 de agosto de 2026. Las afirmaciones sobre capacidades proceden del README de cada proyecto.

CriterioUnslothAxolotlMLX-LM
Estrellas en GitHub75,0k12,4k6,8k
LicenciaApache-2.0Apache-2.0MIT
Mejor paraLa vía más rápida en hardware propioEscalar más allá de una máquinaTrabajo ligero nativo de MLX en Mac
Multi-GPUSí, en el proyecto de código abiertoSí — FSDP1, FSDP2, DeepSpeedMediante mx.distributed
MultinodoNo documentado en el READMESí — Torchrun y RayMediante mx.distributed
HardwareNVIDIA, AMD, Intel, CPU, VulkanPila CUDA principalmenteSolo Apple Silicon
Sistemas operativosWindows, Linux, WSL, macOSEn la práctica Linux y WSLmacOS
Dificultad de instalaciónBaja — instalador y compilacionesMedia — dirigido por YAMLBaja — pip install

📌Note: Las comparativas antiguas, incluido el borrador del que se reescribió esta página, describen el multi-GPU como una función de pago de Unsloth y MLX-LM como un proyecto comunitario en lugar de uno de Apple. Ambas afirmaciones contradicen el README actual y el perfil de la organización. Si lo lee en otro sitio, compruebe la fecha.

Unsloth: la opción local por defecto

Unsloth es por donde debería empezar la mayoría, y los motivos han aumentado en lugar de reducirse. Es con diferencia el más valorado de los tres, la licencia es Apache-2.0 y su cobertura de hardware y sistemas operativos es hoy la más amplia de las aquí presentes.

1

Unsloth — mejor framework local general

Gratuito con Apache-2.0, multi-GPU incluido, funciona en NVIDIA, AMD, Intel, CPU y macOS

Unsloth reescribe los kernels de atención y de gradientes para reducir el uso de VRAM y acelerar el entrenamiento LoRA y QLoRA, y ese sigue siendo su atractivo central. Lo que ha cambiado es el alcance. Su README declara ahora compatibilidad con configuraciones multi-GPU en GPU de NVIDIA, AMD e Intel, CPU y el backend Vulkan, funcionando en Windows, Linux, WSL y macOS, con compilaciones de escritorio para cada uno. Nada en los 22 KB del README Apache-2.0 restringe eso a un plan de pago. El proyecto también ha crecido más allá de una biblioteca de entrenamiento hacia algo parecido a un banco de trabajo local, con una interfaz Studio y un endpoint de servicio compatible con OpenAI. Existen planes de pago Pro y Enterprise, pero sus precios no están publicados: trate como no verificada cualquier cifra concreta que vea citada en otro sitio.

Ventajas

  • +Gratuito y Apache-2.0, con soporte multi-GPU en el proyecto de código abierto
  • +La cobertura de hardware más amplia aquí: NVIDIA, AMD, Intel, CPU y Vulkan
  • +Funciona en Windows, Linux, WSL y macOS, con compilaciones de escritorio
  • +El menor esfuerzo de instalación de los tres: un instalador en vez de un árbol de configuración

Desventajas

  • El entrenamiento multinodo no está documentado en el README; Axolotl es más claro aquí
  • Los precios Pro y Enterprise no están publicados, así que presupuestarlos exige hablar con ventas
  • El alcance creciente implica más superficie de la que necesita un equipo que solo quiere una biblioteca de entrenamiento
Unsloth — repositorio de código abiertoenlace de producto · divulgado

Axolotl: la opción para escalar

Axolotl se gana su sitio por el entrenamiento distribuido y la amplitud de métodos, no por el multi-GPU en sí. Ahora que Unsloth cubre varias GPU en una misma caja, la línea divisoria honesta está en qué ocurre cuando una caja no basta.

1

Axolotl — mejor para escalar más allá de una máquina

Multinodo con Torchrun y Ray, paralelismo ND y la gama de métodos más amplia

Axolotl se dirige mediante archivos de configuración, que es justo lo que se quiere cuando un entrenamiento debe ser reproducible en un clúster en lugar de reconstruirse desde un cuaderno. Su README documenta multi-GPU con FSDP1, FSDP2 y DeepSpeed, multinodo con Torchrun y Ray, y paralelismo ND que combina paralelismo de contexto, de tensores y de datos totalmente fragmentados tanto dentro de un nodo como entre varios. También incluye paralelismo de expertos para entrenamiento distribuido de mezcla de expertos. La lista de métodos de entrenamiento es con diferencia la más amplia de los tres: fine-tuning completo, LoRA, QLoRA, GPTQ, entrenamiento consciente de la cuantización, precisión mixta FP8, ajuste por preferencias con DPO, IPO, KTO y ORPO, aprendizaje por refuerzo con GRPO y GDPO, y modelado de recompensa y de recompensa de proceso.

Ventajas

  • +Entrenamiento multinodo documentado con Torchrun y Ray
  • +Paralelismo ND que combina contexto, tensores y datos fragmentados
  • +La gama de métodos más amplia: DPO, IPO, KTO, ORPO, GRPO, GDPO y modelado de recompensa
  • +Las ejecuciones dirigidas por configuración son reproducibles y revisables, algo que importa en equipo

Desventajas

  • Curva de aprendizaje más pronunciada: cuente con tiempo real de lectura antes del primer éxito
  • En la práctica es CUDA-céntrico, así que no es la respuesta en hardware AMD, Intel o Apple
  • Más maquinaria de la que realmente necesita alguien que ajusta un solo modelo 7B
Axolotl — repositorio de código abiertoenlace de producto · divulgado

MLX-LM: la opción para Apple Silicon

MLX-LM es la forma más ligera de ajustar en un Mac con chip de la serie M, construida directamente sobre el framework de arrays MLX de Apple en lugar de adaptada a él. Conviene precisar qué es: la organización `ml-explore` que lo mantiene se describe como «by Apple», así que se trata del trabajo de aprendizaje automático de la propia Apple, no de una adaptación comunitaria ajena.

1

MLX-LM — mejor opción ligera en Apple Silicon

Licencia MIT, integración con Hugging Face Hub, entrenamiento distribuido con mx.distributed

MLX-LM es un paquete de Python para generar texto y ajustar modelos de lenguaje en Apple Silicon con MLX. Se integra con Hugging Face Hub, de modo que miles de modelos quedan a un solo comando, permite cuantizar y subir modelos de vuelta al Hub, y admite tanto ajuste de rango bajo como completo, incluso sobre modelos cuantizados. También admite inferencia y ajuste distribuidos mediante `mx.distributed`, lo que deja obsoleta la afirmación habitual de que es estrictamente una herramienta de una sola máquina. Lo que no es, es multiplataforma: depende de MLX y de la memoria unificada de Apple Silicon, así que en Windows o Linux sencillamente no es candidato.

Ventajas

  • +Construido de forma nativa sobre MLX y la memoria unificada de Apple Silicon
  • +Licencia MIT, la más permisiva de las tres
  • +Inferencia y ajuste distribuidos mediante mx.distributed
  • +Integración con Hugging Face Hub tanto para descargar como para publicar modelos

Desventajas

  • Solo Apple Silicon: no es opción en Windows ni Linux
  • La comunidad más pequeña de las tres con 6,8k estrellas, y por tanto menos ejemplos resueltos
  • Ya no es la única opción para Mac ahora que Unsloth publica compilaciones de macOS
MLX-LM — repositorio de código abiertoenlace de producto · divulgado

Plataformas en la nube y precios reales

Together.ai y Fireworks.ai cobran por token de entrenamiento en lugar de por hora de GPU, lo que permite estimar el coste de un trabajo antes de lanzarlo. Las tarifas siguientes se leyeron de las páginas públicas de precios de cada proveedor el 28 de agosto de 2026. Fíjese en la diferencia entre LoRA y fine-tuning completo: ahí nacen casi todas las sorpresas de coste.

Tramo y métodoTogether.aiFireworks.ai
LoRA SFT, hasta 16B0,48 $ / 1M tokens0,50 $ / 1M tokens
SFT completo, hasta 16B1,20 $ / 1M tokens1,00 $ / 1M tokens
LoRA SFT, tramo medio1,50 $ (17–69B)3,00 $ (16,1–80B)
LoRA SFT, tramo grande2,90 $ (70–100B)6,00 $ (80–300B)
SFT completo, tramo grande7,25 $ (70–100B)12,00 $ (80–300B)
Máximo publicado8,00 $ DPO completo, 70–100B40,00 $ DPO completo, +300B
Mínimo por trabajo4,00 $No publicado
Servir el modelo ajustadoFacturado aparte como inferenciaMismo precio que los modelos base

Elija Together.ai por la estructura de tramos más clara y la tarifa de entrada más baja. Elija Fireworks.ai si va a servir el modelo después, ya que su política declarada es servir modelos ajustados a precio de modelo base.

⚠️Warning: Una cifra muy copiada describe el fine-tuning completo de Together.ai como 0,54 a 3,20 $ por millón de tokens. En realidad ese es su rango de LoRA DPO. El fine-tuning supervisado completo cuesta de 1,20 a 7,25 $ en esos mismos tramos, más del doble del máximo mal citado. Presupueste desde la página del proveedor, no desde un artículo comparativo.

Qué pasó con Predibase

Predibase ya no es una plataforma independiente de fine-tuning autoservicio, y cualquier guía que siga enviándole allí a registrarse está desactualizada. Rubrik anunció la adquisición el 25 de junio de 2025, informada entonces por TechCrunch y CNBC y confirmada por la sala de prensa de la propia Rubrik.

A 28 de agosto de 2026, solicitar predibase.com devuelve una redirección permanente HTTP 301 a la página de producto Agent Cloud de Rubrik. No hemos podido leer ese destino directamente —responde HTTP 403 a peticiones automatizadas—, así que esta página no afirma nada sobre lo que ofrece actualmente. Lo verificable es la redirección en sí y la adquisición que hay detrás. Si necesita un servicio gestionado de fine-tuning al estilo de Predibase, pregunte a Rubrik qué ha sobrevivido en lugar de suponer que el registro antiguo sigue funcionando.

💡Tip: Es un recordatorio útil para cualquier comparativa de plataformas en la nube: un producto que hace año y medio era una recomendación sólida hoy puede ser un enlace muerto. Vuelva a comprobar el estado del proveedor en cada actualización en lugar de arrastrar una recomendación de memoria.

Cuánto cuesta realmente ajustar un 7B

Un trabajo realista de ajuste por instrucciones sale más barato de lo que la gente espera en la nube y casi gratis en local, y por eso suele decidir el tiempo de configuración y no el cómputo. Tome 10.000 ejemplos de 300 tokens de media: son 3M de tokens de entrenamiento, o unos 9M procesados en tres épocas. La tabla es aritmética sobre las tarifas publicadas arriba.

VíaTarifa usadaCoste de 9M tokens
Together.ai, LoRA SFT0,48 $ / 1M, hasta 16B4,32 $, así que el mínimo de 4 $ no se aplica
Together.ai, SFT completo1,20 $ / 1M, hasta 16B10,80 $
Fireworks.ai, LoRA SFT0,50 $ / 1M, hasta 16B4,50 $
Fireworks.ai, SFT completo1,00 $ / 1M, hasta 16B9,00 $
GPU de 24 GB alquiladaAlquiler por horas, según proveedorA menudo menos de una hora, más configuración
GPU que ya poseeSolo electricidad marginalPrácticamente cero por ejecución

En hardware que ya posee, local gana en cada ejecución después de la primera. Para ejecuciones ocasionales en hardware alquilado, compare alquiler más configuración frente al precio fijo por token para el tamaño real de su conjunto de datos.

💡Tip: Las cifras de nube aquí son tan pequeñas que, para un solo experimento, el factor decisivo casi nunca es el dinero. Es si prefiere dedicar una tarde a configurar el entorno o cinco dólares. Cuente su propio tiempo con honestidad y la respuesta suele volverse obvia.

Quién debería usar qué

Con qué frecuencia entrena y si tiene hardware deciden esto, no el número de estrellas. Cuatro perfiles cubren a la mayoría de lectores.

  • Aficionado con un solo experimento → Together.ai para saltarse la infraestructura por completo, o Unsloth en una GPU alquilada. No compre hardware para un único experimento.
  • Ingeniero de ML iterando cada semana → Unsloth en hardware propio. La facturación por token se acumula deprisa con alta frecuencia de iteración, y Unsloth ya cubre multi-GPU sin plan de pago.
  • Equipo que entrena en varias máquinas → Axolotl, por el multinodo y el paralelismo ND, y porque las ejecuciones dirigidas por configuración son reproducibles y revisables como no lo son los cuadernos.
  • Startup que lleva un modelo ajustado a producción → Fireworks.ai si prima la economía del servicio, ya que los modelos ajustados se sirven a precio de modelo base; Together.ai si prefiere su estructura de tramos más clara. Véase también ejecutar LLM locales en producción.

Fine-tuning en la UE, Japón y China

El fine-tuning sube sus datos de entrenamiento a quien ejecute el trabajo. Eso convierte la elección entre local y nube en una decisión de gobernanza de datos en tres mercados importantes, y no en una mera comparación de costes.

Errores comunes al elegir una pila de fine-tuning

  1. 1
    Creer que el multi-GPU exige el plan de pago de Unsloth
    Why it matters: Se ha repetido mucho y contradice el README actual del proyecto, que enumera el soporte multi-GPU junto a los backends de AMD, Intel, CPU y Vulkan sin ningún muro de pago en el repositorio Apache-2.0. Hay equipos que han adoptado un framework más pesado solo para obtener un multi-GPU que ya tenían.
  2. 2
    Citar el fine-tuning completo de Together.ai como 0,54 a 3,20 $ por millón de tokens
    Why it matters: Ese rango corresponde a LoRA DPO, no al fine-tuning supervisado completo, que en realidad cuesta de 1,20 a 7,25 $ en esos mismos tramos. Un presupuesto basado en la fila equivocada infravalora un ajuste completo grande en más de la mitad.
  3. 3
    Enviar lectores a Predibase
    Why it matters: Rubrik lo adquirió en junio de 2025 y predibase.com ahora redirige con un 301. Cualquier guía que siga describiendo un registro autoservicio en Predibase no se ha vuelto a verificar desde la adquisición.
  4. 4
    Tratar MLX-LM como un proyecto comunitario no oficial
    Why it matters: La organización `ml-explore` describe su trabajo como «by Apple». Descartarlo como una adaptación comunitaria lleva a rechazarlo por un riesgo de mantenimiento que no existe.
  5. 5
    Ajustar cuando la respuesta era la recuperación
    Why it matters: El fine-tuning enseña formato, tono y habilidades concretas. Es una forma mala y cara de inyectar hechos que cambian, porque actualizarlos implica volver a entrenar. Los hechos pertenecen a una canalización de recuperación: véase [RAG local sobre sus documentos](/es/local-llms/local-rag-2026).

Sáltese esto si…

Si su queja es que el modelo no conoce los documentos de su empresa, el fine-tuning es la herramienta equivocada y le costará un ciclo de entrenamiento descubrirlo. Eso es un problema de recuperación. Una canalización RAG bien construida responde a partir de documentos que puede actualizar esta misma tarde, mientras que un ajuste los cuece en pesos que tendría que reentrenar para corregir.

El fine-tuning se gana su sitio cuando necesita un formato de salida consistente, un tono concreto o una habilidad estrecha que el prompting no produce de forma fiable. Son cambios de comportamiento, y el comportamiento es justo lo que el entrenamiento cambia bien. Pruebe primero un prompt de sistema estructurado, luego la recuperación, y recurra a un entrenamiento solo cuando ambos hayan fallado de forma visible en lo concreto que necesita.

💡Tip: Una prueba práctica: si puede escribir la respuesta correcta y pegarla en el prompt, tiene un problema de recuperación o de prompting. Si solo puede describir la forma de una buena respuesta pero no su contenido, entonces sí es un problema de fine-tuning.

Preguntas frecuentes

¿Cuál es el mejor framework de fine-tuning de LLM en 2026?

Unsloth para la mayoría de quienes entrenan en hardware propio, porque la biblioteca Apache-2.0 es gratuita y ya cubre configuraciones multi-GPU en NVIDIA, AMD, Intel, CPU y Vulkan sobre Windows, Linux, WSL y macOS. Axolotl es mejor cuando el entrenamiento abarca varias máquinas, ya que documenta entrenamiento multinodo y paralelismo ND. MLX-LM es la opción más ligera en Apple Silicon.

¿Unsloth es gratuito y la versión gratuita admite multi-GPU?

La biblioteca Unsloth es gratuita bajo Apache-2.0 y su README enumera soporte multi-GPU sin muro de pago en el repositorio. Existen planes de pago Pro y Enterprise, pero sus precios no están publicados, así que cualquier cifra concreta citada en otro sitio debe considerarse no verificada. La afirmación habitual de que el multi-GPU exige un plan de pago contradice la documentación actual del proyecto.

¿Cuánto cuesta el fine-tuning en la nube por millón de tokens?

En Together.ai, el fine-tuning supervisado con LoRA cuesta 0,48 $ por millón de tokens hasta 16B parámetros, 1,50 $ entre 17 y 69B y 2,90 $ entre 70 y 100B, con un mínimo de 4,00 $ por trabajo. El fine-tuning supervisado completo cuesta 1,20 $, 3,75 $ y 7,25 $ en esos mismos tramos. En Fireworks.ai, LoRA SFT parte de 0,50 $ por millón de tokens hasta 16B y sube a 10,00 $ por encima de 300B.

¿Puedo usar MLX-LM en Windows o Linux?

No. MLX-LM está construido sobre el framework MLX de Apple y la memoria unificada de Apple Silicon, así que no es candidato en otras plataformas. Use Unsloth o Axolotl en Windows o Linux. Tenga en cuenta que Unsloth también publica compilaciones de macOS, de modo que en un Mac tiene una elección real entre ambos.

¿Qué pasó con Predibase?

Rubrik anunció la adquisición de Predibase el 25 de junio de 2025. A 28 de agosto de 2026, predibase.com devuelve una redirección HTTP 301 a la página Agent Cloud de Rubrik en lugar de servir un producto independiente. Confirme la disponibilidad actual directamente con Rubrik antes de depender de ello para un proyecto nuevo.

¿Together.ai o Fireworks.ai tienen programas de afiliados?

No hemos encontrado ningún programa público de afiliados o referidos para ninguno de los dos en agosto de 2026, y ninguno aparece en los principales listados del sector. Sus páginas de partners describen integraciones empresariales, no programas de referidos para creadores. PromptQuorum no gana nada con los enlaces de esta página.

¿El fine-tuning en la nube es más caro que el local?

Depende de con qué frecuencia entrene. Para una sola ejecución sobre un conjunto pequeño, la tarifa en la nube es de unos pocos dólares, normalmente menos que el valor de una tarde dedicada a configurar el entorno. Para iteración frecuente en hardware que ya posee, local es más barato en cada ejecución después de la primera, porque el coste marginal de cómputo es casi nulo.

¿Necesito multi-GPU para ajustar un modelo 7B?

Normalmente no. Una sola tarjeta de clase 24 GB maneja un modelo 7B con holgura usando QLoRA. El multi-GPU importa más en modelos mayores o en fine-tuning completo sin LoRA. Consulte la guía de requisitos de hardware para el dimensionamiento de VRAM.

Veredicto final

  • Use Unsloth si entrena en hardware propio y quiere el camino más corto a una ejecución funcional — siguiente paso: instálelo y haga un ajuste QLoRA antes de evaluar nada más pesado.
  • Use Axolotl si su entrenamiento debe abarcar varias máquinas o necesita DPO, ORPO, KTO, GRPO o modelado de recompensa — siguiente paso: lea la documentación multinodo antes de comprometerse, porque el sistema de configuración es el verdadero coste de entrada.
  • Use MLX-LM si trabaja en Apple Silicon y quiere la vía más directa a MLX — siguiente paso: compárelo con la compilación de macOS de Unsloth en lugar de asumir que es su única opción.
  • Use Together.ai o Fireworks.ai si prefiere no tener GPU — siguiente paso: calcule su conjunto de datos real contra los tramos publicados por token, usando la fila de fine-tuning completo y no la de LoRA DPO si va a hacer un ajuste completo.
  • Evite el fine-tuning si el modelo simplemente no conoce sus documentos — siguiente paso: construya en su lugar una canalización de recuperación, que podrá corregir sin reentrenar.

Fuentes

Nota sobre hechos de terceros

Este artículo hace referencia a modelos de IA, benchmarks, precios y licencias de terceros. El panorama de la IA cambia rápidamente. Las puntuaciones de benchmark, los términos de licencia, los nombres de modelos y los precios de API pueden cambiar entre el momento en que se escribió y cuando usted lo lee. Antes de tomar decisiones de despliegue o cumplimiento basadas en este artículo, verifique las cifras actuales en la fuente oficial de cada proveedor: tarjetas de modelos de Hugging Face para licencias y benchmarks, sitios web de proveedores para precios de API y EUR-Lex para el texto actualizado del RGPD y la Ley de IA de la UE.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs