Points clés
- 7 outils, deux types : fine-tuning (4) et observabilité et évaluation (3). Un outil qui remplit plusieurs rôles apparaît dans chaque type auquel il appartient.
- Le tableau est généré à partir de la fiche de chaque outil et vérifié d'après son README ou son site officiel ; un tiret signifie « non indiqué dans la documentation », jamais « non ».
- Ce groupe est restreint : le répertoire ne compte pas encore d'outils évalués pour les sous-catégories des jeux de données et des hubs de modèles, ils ne sont donc pas comparés ici.
- Chaque nom d'outil du tableau renvoie vers son propre avis PromptQuorum, où sont traités l'installation et les limites.
📍 En une phrase
Les outils locaux d'entraînement et d'exploitation sont deux types de produits différents — les outils de fine-tuning et les outils d'observabilité et d'évaluation — c'est pourquoi les 7 outils du répertoire PromptQuorum sont comparés au sein de chaque type, à l'aide d'un tableau généré à partir des mêmes données que l'avis de chaque outil.
💬 En termes simples
Certains outils apprennent un nouveau comportement à un modèle en l'affinant sur vos données, d'autres surveillent les performances d'une application à base de modèle et notent ses réponses. Comparer un outil d'entraînement et un tableau de bord de supervision sur les mêmes fonctionnalités n'a pas de sens ; ce guide compare donc des outils comparables.
Notre méthode de comparaison
Les informations de chaque outil — prix, licence, plateformes, besoins matériels et attributs propres à la catégorie — sont stockées une seule fois, dans la fiche de l'outil du répertoire. Le tableau comparatif ci-dessous est généré à partir de ces fiches, et l'avis de l'outil s'appuie sur la même fiche : les deux ne peuvent donc pas indiquer des valeurs différentes.
Les attributs propres à la catégorie (par exemple la prise en charge de LoRA et QLoRA ou le tracing) proviennent du README ou du site officiel de chaque projet et ont été vérifiés d'après la formulation exacte qui s'y trouve. Lorsque la documentation est muette, le tableau affiche un tiret plutôt que de deviner ; lorsqu'une affirmation est nuancée (feuille de route uniquement, édition entreprise ou paquet séparé), l'attribut est exclu du tableau et traité dans l'avis de l'outil.
Seuls les outils disposant de leur propre avis PromptQuorum figurent dans le tableau. La comparaison ne classe pas les outils, car le bon choix dépend de votre contrainte.
Tableau comparatif
Choisissez un type d'outil ci-dessous, puis lisez la ligne de gauche à droite. Cliquez sur le nom d'un outil pour ouvrir son avis PromptQuorum complet.
| Outil | Prix | Licence | Plateformes | Exécution | Matériel | Version | LoRA / QLoRA | Interface web | Entraînement multi-GPU | Mode faible VRAM | Export vers GGUF / Ollama | Avis | lien produit · divulgué |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| LLaMA-Factory | Gratuit | Apache-2.0 | macOS, Windows, Linux | Local | 16 Go de VRAM | v0.9.5 | Oui | Oui | Oui | Oui | Oui | Lire l'avis → | LLaMA-Factory |
| LoRAX | Gratuit | Apache-2.0 | Linux | Local | Variable selon le modèle | v0.12.1 | — | — | — | — | — | Lire l'avis → | LoRAX |
| Second Me | Gratuit | Apache-2.0 | macOS, Windows, Linux | Local | Variable selon le modèle | — | — | — | — | — | — | Lire l'avis → | Second Me |
| Unsloth | Gratuit | Apache-2.0 | macOS, Windows, Linux | Local | Variable selon le modèle | — | Oui | Oui | Oui | Oui | Oui | Lire l'avis → | Unsloth |
« — » signifie que la documentation du projet ne le précise pas, et non que la fonctionnalité est absente. Les valeurs proviennent du README ou du site officiel de chaque projet et sont revérifiées lors de la mise à jour de l'avis d'un outil.
Outils de fine-tuning : ce qui les distingue
- LoRA et QLoRA. LLaMA-Factory et Unsloth documentent le fine-tuning LoRA ou QLoRA.
- Interface web. LLaMA-Factory et Unsloth documentent une interface web pour l'entraînement.
- Entraînement multi-GPU. LLaMA-Factory et Unsloth documentent l'entraînement multi-GPU.
- Entraînement à faible VRAM. LLaMA-Factory et Unsloth documentent un mode faible VRAM ou d'économie de mémoire.
- Export vers GGUF ou Ollama. LLaMA-Factory et Unsloth documentent l'export de modèles vers GGUF ou Ollama.
- Lignes peu renseignées. LoRAX et Second Me figurent ici pour leurs fonctionnalités liées au fine-tuning, mais leur documentation n'indique aucun des attributs comparés, leurs cellules sont donc des tirets ; consultez leurs avis.
Observabilité et évaluation : ce qui les distingue
- Tracing. Langfuse et Plano documentent le tracing des appels LLM.
- Évaluations. Langfuse documente les évaluations ou le scoring.
- Gestion des prompts. Langfuse documente la gestion des prompts.
- OpenTelemetry. Plano documente la prise en charge d'OpenTelemetry.
- Docker et auto-hébergement. Langfuse et Mission Control documentent un déploiement Docker ou auto-hébergé.
- LLM locaux. Langfuse documente l'utilisation avec des LLM locaux ou auto-hébergés.
Ce que cette comparaison ne peut pas vous dire
- Elle compare des capacités documentées, pas des résultats. Elle ne dit rien de la qualité d'un modèle affiné, de la vitesse d'entraînement sur votre matériel ni de la précision d'un score d'évaluation — PromptQuorum n'a pas mesuré ces éléments pour les outils listés.
- Les tirets sont des lacunes de la documentation que nous avons consultée, pas des constats négatifs. Certains outils peuvent prendre en charge une fonctionnalité que leur README ne mentionne pas.
- Les besoins matériels du fine-tuning dépendent fortement du modèle et des réglages ; lisez l'avis de l'outil pour connaître la configuration réaliste avant de lancer un entraînement.
- Les outils évoluent vite. L'avis de chaque outil indique la version qui a été vérifiée, et ce guide est actualisé lorsqu'un avis l'est.
Questions fréquentes
Quelle est la différence entre un outil de fine-tuning et un outil d'observabilité ?
Un outil de fine-tuning adapte un modèle en l'entraînant sur vos données, souvent avec des méthodes économes en paramètres comme LoRA ou QLoRA. Un outil d'observabilité ou d'évaluation enregistre et note le comportement d'une application LLM à l'usage, par exemple en traçant chaque requête. Ils remplissent des rôles différents, c'est pourquoi ils sont comparés séparément.
Que signifie un tiret dans le tableau comparatif ?
Cela signifie que la documentation du projet n'indique pas cet attribut. Cela ne veut pas dire que la fonctionnalité est absente ; consultez l'avis de l'outil ou son dépôt.
Pourquoi y a-t-il si peu d'outils ici ?
Le répertoire compte pour l'instant peu d'outils évalués dans ce domaine, et aucun pour les jeux de données ou les hubs de modèles. La comparaison couvre ce qui est évalué ; d'autres outils seront ajoutés à mesure que leurs avis seront rédigés.
Un de ces outils a-t-il un lien d'affiliation ?
Non. PromptQuorum n'a aucune relation d'affiliation avec les outils de cette comparaison au moment de la rédaction, et aucun lien ici ne rapporte de commission.
À quelle fréquence cette comparaison est-elle mise à jour ?
Elle est actualisée deux fois par an et chaque fois que l'avis d'un des outils listés est mis à jour, car le tableau est généré à partir des mêmes données que ces avis.
Sources
- Le README ou le site officiel de chaque outil, indiqué dans l'avis PromptQuorum de l'outil (lié depuis le tableau comparatif).
- Répertoire PromptQuorum des applications d'IA locale — la fiche à partir de laquelle chaque ligne du tableau est générée.