Points clés
- Licence Apache 2.0 ; les propres modifications du projet à llama.cpp et whisper.cpp restent sous licence MIT pour rester upstreamables
- Environ 25 900+ étoiles GitHub en septembre 2026, dépôt sur github.com/mozilla-ai/llamafile
- Créé par Justine Tunney, créatrice de Cosmopolitan Libc, publié pour la première fois par le groupe d'innovation de Mozilla en novembre 2023
- Un seul fichier exécutable fonctionne sur macOS, Linux, BSD et Windows — Windows limite spécifiquement les exécutables à 4 Go
- Accélération GPU disponible via Metal (Apple Silicon), CUDA (NVIDIA), ROCm (AMD) et Vulkan
- Construit directement sur llama.cpp pour l'inférence de modèle proprement dite, Cosmopolitan Libc résolvant l'empaquetage multiplateforme
📍 En une phrase
llamafile est un projet gratuit sous licence Apache 2.0, créé par Justine Tunney et initialement publié par Mozilla, qui regroupe un modèle et le moteur llama.cpp dans un seul exécutable fonctionnant sans modification sur macOS, Linux, Windows et BSD grâce à Cosmopolitan Libc.
💬 En termes simples
Téléchargez un fichier et double-cliquez dessus — pas d'installateur, pas de choix de build spécifique à la plateforme — car le fichier lui-même est valide sur plusieurs systèmes d'exploitation à la fois, un tour de force rendu possible par Cosmopolitan Libc plutôt que par l'empaquetage de plusieurs builds séparés par llamafile.
📌Remarque: La version 0.10.0 a introduit un système de build reconstruit pour maintenir llamafile aligné avec les versions actuelles de llama.cpp, et le support CUDA pour Linux a été réintroduit en février 2026 après une période de désynchronisation — consultez les notes de version pour connaître l'ensemble exact des fonctionnalités de la version téléchargée.
Qu'est-ce que llamafile ?
llamafile est un projet gratuit et open source qui regroupe un modèle de langage avec le moteur d'inférence llama.cpp dans un seul fichier exécutable, distribuable et exécutable sans installation sur plusieurs systèmes d'exploitation. Il a été créé par Justine Tunney et publié pour la première fois par le groupe d'innovation de Mozilla en novembre 2023.
Le projet est hébergé sur github.com/mozilla-ai/llamafile (précédemment sous l'organisation Mozilla-Ocho) et a dépassé environ 25 900 étoiles GitHub. Il est publié sous licence Apache 2.0, les propres modifications du projet à llama.cpp et whisper.cpp restant sous MIT pour rester compatibles avec ces projets et upstreamables vers eux.
- Combine un fichier de modèle et le moteur llama.cpp en un seul exécutable distribuable, plutôt que de nécessiter une installation de moteur séparée plus un téléchargement de modèle séparé
- S'appuie sur llama.cpp pour le travail d'inférence proprement dit — la contribution propre de llamafile est la couche d'empaquetage et d'exécution multiplateforme
- Lance par défaut une interface web de chat au démarrage, aux côtés d'un mode serveur compatible API OpenAI
- Des exemples de llamafiles préconstruits pour des modèles ouverts populaires sont publiés sur Hugging Face par le projet et des membres de la communauté
Qu'est-ce que Cosmopolitan Libc, et comment rend-elle cela possible ?
Cosmopolitan Libc est une bibliothèque standard C, également créée par Justine Tunney, conçue pour compiler des binaires « gras » qui sont simultanément des exécutables valides sur plusieurs systèmes d'exploitation et architectures CPU. C'est la technologie sous-jacente qui rend possible la distribution multiplateforme en un seul fichier de llamafile.
- Un binaire construit avec Cosmopolitan Libc peut fonctionner, sans modification, sur macOS, Linux, BSD et Windows, plutôt que de nécessiter un build compilé séparé par système d'exploitation
- Cela diffère de l'empaquetage de plusieurs binaires spécifiques à une plateforme dans une seule archive — c'est véritablement un seul binaire valide sur plusieurs systèmes
- Windows impose une limite de taille de fichier de 4 Go aux exécutables, ce qui limite la taille qu'un seul llamafile peut atteindre spécifiquement sur cette plateforme
- Cosmopolitan Libc est un projet distinct et généraliste ; llamafile en est une application notable, pas la seule
Comment télécharger et lancer un llamafile ?
Téléchargez un llamafile préconstruit pour le modèle souhaité, rendez-le exécutable, et lancez-le directement — aucune étape d'installation séparée. Construire un llamafile personnalisé à partir de votre propre fichier de modèle GGUF est également pris en charge.
- 1Téléchargez un llamafile préconstruit (un modèle empaqueté avec le moteur) depuis la page Hugging Face du projet ou la page GitHub Releases.
- 2Sur macOS et Linux, rendez le fichier exécutable (
chmod +x votremodele.llamafile) s'il ne l'est pas déjà, puis lancez-le directement (./votremodele.llamafile). - 3Sur Windows, renommez le fichier pour ajouter une extension
.exes'il n'en a pas déjà une, en raison de la façon dont Windows identifie les exécutables. - 4Par défaut, exécuter le fichier lance une interface web de chat locale dans votre navigateur, aux côtés d'un point de terminaison serveur compatible API OpenAI.
- 5Pour activer l'accélération GPU, passez
-ngl 999pour décharger autant de couches que possible sur un GPU détecté (Metal, CUDA, ROCm ou Vulkan). - 6Pour construire un llamafile personnalisé à partir de votre propre modèle GGUF, utilisez les outils d'empaquetage du projet pour combiner le modèle avec le binaire moteur llamafile.
llamafile nécessite-t-il une installation ?
Non. Téléchargez le fichier, rendez-le exécutable si nécessaire, et lancez-le directement — aucun installateur séparé n'est requis.
llamafile peut-il fonctionner sans GPU ?
Oui. Le fonctionnement CPU seul fonctionne d'emblée ; l'accélération GPU (Metal, CUDA, ROCm, Vulkan) est une amélioration de performance optionnelle, pas une exigence.
Quel matériel et quelle accélération GPU llamafile prend-il en charge ?
llamafile prend en charge le fonctionnement CPU seul d'emblée, avec une accélération GPU optionnelle chez la plupart des grands fournisseurs. Le support GPU a évolué au fil du temps, donc la capacité exacte dépend de la version téléchargée.
- Apple Silicon — accélération Metal, activée par défaut lorsqu'un GPU Metal est détecté (implémentée en décembre 2025)
- NVIDIA — accélération CUDA sous Linux, réintroduite en février 2026 après une période de désynchronisation avec llama.cpp en amont
- AMD — accélération ROCm
- Multi-fournisseurs — support du backend Vulkan
- Les bibliothèques GPU (CUDA, ROCm, Vulkan) sont chargées dynamiquement depuis des fichiers précompilés à côté de l'exécutable plutôt que compilées de façon permanente à l'intérieur
À qui s'adresse llamafile ?
Utilisez llamafile si distribuer ou exécuter un modèle comme un fichier unique, sans dépendance, multiplateforme compte plus qu'avoir immédiatement les toutes dernières fonctionnalités de llama.cpp ; utilisez llama.cpp directement ou une application wrapper si cette portabilité en un seul fichier n'est pas la priorité.
Comment llamafile se compare-t-il à KoboldCpp et aux autres outils sans installation ?
La comparaison la plus proche de llamafile est KoboldCpp — tous deux se distribuent comme un seul fichier construit sur llama.cpp — mais ils résolvent des problèmes différents : portabilité multiplateforme contre interface intégrée orientée jeu de rôle.
Outil | Licence | Idéal pour |
|---|---|---|
| llamafile | Apache 2.0 | Un fichier tourne sans modification sur 4 OS |
| KoboldCpp | AGPL 3.0 | Sans installation, UI jeu de rôle/écriture intégrée |
| llama.cpp | MIT | Support matériel le plus large, contrôle direct |
| Ollama | MIT | CLI/API simple, gestion des modèles |
| LM Studio | Propriétaire (gratuit) | Interface de bureau sans terminal |
Erreurs courantes lors de l'évaluation de llamafile
La plupart des confusions viennent d'une mauvaise compréhension du fonctionnement de l'astuce multiplateforme en un seul fichier, ou d'attentes envers les toutes dernières fonctionnalités de llama.cpp.
Questions fréquentes
Qu'est-ce que llamafile ?
llamafile est un projet gratuit sous licence Apache 2.0 qui regroupe un modèle et le moteur llama.cpp dans un seul fichier exécutable fonctionnant sans modification sur macOS, Linux, Windows et BSD, grâce à Cosmopolitan Libc.
Qui a créé llamafile ?
Justine Tunney, créatrice de Cosmopolitan Libc, a créé llamafile, publié pour la première fois par le groupe d'innovation de Mozilla en novembre 2023. Il est maintenant maintenu sur github.com/mozilla-ai/llamafile.
Comment un fichier peut-il fonctionner sur macOS, Linux et Windows ?
llamafile est construit avec Cosmopolitan Libc, une bibliothèque standard C conçue pour produire un binaire unique valide simultanément sur plusieurs systèmes d'exploitation et architectures CPU, plutôt que de nécessiter des builds séparés par plateforme.
llamafile est-il gratuit pour un usage commercial ?
Oui. llamafile est sous licence Apache 2.0, gratuit pour un usage personnel et commercial. Ses propres modifications à llama.cpp et whisper.cpp restent sous licence MIT.
llamafile nécessite-t-il un GPU ?
Non. Le fonctionnement CPU seul fonctionne par défaut ; l'accélération GPU via Metal, CUDA, ROCm ou Vulkan est optionnelle et améliore la vitesse.
Existe-t-il une limite de taille de fichier pour un llamafile ?
Oui, spécifiquement sous Windows — Windows limite les fichiers exécutables à 4 Go, ce qui peut limiter la taille qu'un modèle peut atteindre lorsqu'il est empaqueté comme un seul llamafile pour les utilisateurs Windows.
llamafile reste-t-il à jour avec llama.cpp ?
Il se synchronise périodiquement plutôt qu'en continu — la version 0.10.0 a introduit un système de build reconstruit spécifiquement pour suivre le rythme des versions actuelles de llama.cpp, et le support CUDA pour Linux a été réintroduit en février 2026 après une période de retard.
Quelle est la différence entre llamafile et KoboldCpp ?
Les deux se distribuent comme un seul fichier construit sur llama.cpp sans installateur séparé, mais la caractéristique distinctive de llamafile est une véritable portabilité multiplateforme (un fichier fonctionne sur 4 systèmes d'exploitation différents), tandis que celle de KoboldCpp est une interface web intégrée orientée jeu de rôle et écriture d'histoires.
Puis-je créer un llamafile à partir de mon propre modèle ?
Oui. Le projet fournit des outils d'empaquetage pour combiner un fichier de modèle GGUF avec le binaire moteur llamafile en un exécutable unique personnalisé.
llamafile convient-il au service de production multi-utilisateurs ?
Ce n'est pas son objectif. llamafile est conçu pour une distribution simple et portable en un seul fichier et un usage mono-utilisateur ou à petite échelle ; pour un service de production multi-utilisateurs à fort débit, vLLM ou SGLang sont les outils plus appropriés.
