Skip to main content
PromptQuorum
Accueil/LLMs locaux/Ollama Dernière Version 2026 : v0.33.1 + Top 10 Modèles Open Source
Best Models

Ollama Dernière Version 2026 : v0.33.1 + Top 10 Modèles Open Source

·9 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

Mise à jour août 2026. La version actuelle d'Ollama est la v0.33.1 (publiée le 26 août 2026), qui ajoute la prise en charge MLX de Qwen3.8 Flash Next, la sortie structurée et des correctifs de délai GPU. La série v0.33 a également apporté la passerelle Claude Desktop. Les modèles les plus récents de la bibliothèque sont Laguna XS 2.1 (Poolside, 2 juillet, codage agentique) et Kimi K2.7 Code (Moonshot AI, juin 2026), rejoignant Kimi K2.6, Qwen3.8, GLM-5.3, gpt-oss et Gemma 4. Le plus téléchargé reste la famille Llama (Llama 4 Scout, Llama 3.x) ; le meilleur global sur materiel grand public est Qwen3.8-27B (61,7% SWE-bench).

Présentation: Ollama Dernière Version 2026 : v0.33.1 + Top 10 Modèles Open Source

La présentation ci-dessous couvre : top 10 modèles Ollama par nombre de téléchargements, comparaison de performance (60-74% HumanEval), meilleurs modèles par cas d'utilisation (chat, codage, raisonnement, vision), DeepSeek-R1 chain-of-thought reasoning et commandes pull exactes. Téléchargez le PDF comme votre carte de référence de sélection de modèles Ollama.

Parcourez les diapositives ci-dessous ou téléchargez en PDF. Télécharger la fiche de référence (PDF)

Ollama Dernière Version 2026 : v0.33.1 + Top 10 Modèles Open Source

Points clés

  • Meilleur global sur materiel grand public : Qwen3.8-27B (61,7% SWE-bench, tient en 24 Go en Q4). Polyvalent : qwen3:30b.
  • Plus téléchargés : Llama 3.2 3B (tutoriels) et la famille Llama.
  • Meilleur raisonnement : DeepSeek-R1 (Chain-of-Thought) et gpt-oss:20b (raisonnement reglable, ~niveau o3-mini). (DeepSeek a depuis publié DeepSeek-V4 — Flash/Pro — comme nouvelle génération à poids ouverts ; R1/V3 restent utilisables en local.)
  • Meilleur coding : Kimi K2.6 (Frontier MoE), Qwen3.8-27B (meilleur dense), Devstral Small 24B (meilleur agentic), qwen3-coder:30b (completion).
  • Meilleur petit / 16 Go : gpt-oss:20b. Meilleure vision/multimodal : Gemma 4 (E4B+). Meilleur long contexte (10M) / grand multimodal : Llama 4 Scout (~55 Go). Meilleur non censuré/polyvalent : Dolphin 3.0.
  • Bibliothèque Ollama juillet 2026 : plusieurs centaines de modèles. Tous disponibles via `ollama pull <nom>`.

📍 En une phrase

Le meilleur modèle Ollama en juillet 2026 est Qwen3.8-27B (61,7% SWE-bench, tient en 24 Go en Q4) ; le meilleur pour le codage est Kimi K2.6 ou Laguna XS 2.1.

💬 En termes simples

Ollama est un outil gratuit qui permet d'exécuter des modèles d'IA sur votre propre ordinateur, sans internet ni clé API. Voici les meilleurs modèles téléchargeables en une seule commande, classés selon vos besoins réels.

Quelle Est la Dernière Version d'Ollama et Qu'est-ce Qui a Changé ?

Version Ollama actuelle : v0.33.1 (publiée le 26 août 2026). C'est la dernière version stable ; une release candidate v0.33.2 est parue le 27 août mais n'est pas encore marquée stable, disponible via ollama.com/download. Mettez à jour avec `curl https://ollama.ai/install.sh | sh` (macOS : `brew upgrade ollama`), puis vérifiez avec `ollama --version`.

Ce qui a changé dans la série v0.32–v0.33 (juillet–août 2026) : La v0.32.0 (11 juillet) a introduit une expérience d'agent interactive « Chat, Code & Work » et renommé l'intégration Codex App en ChatGPT. La v0.32.12 (14 août) a ajouté la prise en charge de Qwen 3.8 27B avec une variante optimisée MLX pour Apple Silicon. La v0.32.13 (14 août) a ajouté la prise en charge des instructions développeur pour qwen3.8. La v0.32.14 (15 août) a apporté le transcodage WebP pour les moteurs de rendu llama-server. La v0.32.15 (19 août) a ajouté un nouveau parcours d'accueil sur le bureau et réduit de près de moitié le délai avant le premier token. La v0.33.0 (21 août) a activé Claude Desktop comme passerelle tierce et fiabilisé les points de restauration du cache KV, permettant de reprendre un long prefill annulé au lieu de le recalculer. La v0.33.1 (26 août) a ajouté la prise en charge MLX de Qwen3.8 Flash Next, la sortie structurée et des correctifs de délai GPU sur stockage lent. Notes complètes : github.com/ollama/ollama/releases.

Nouveaux modèles ajoutés depuis la dernière mise à jour (fin juin–juillet 2026) :

  • Laguna XS 2.1 (Poolside, 2 juillet 2026) — 33B au total / 3B actif MoE conçu pour le codage agentique et le travail local de longue durée : planifier, écrire du code, exécuter des tests, itérer. Contexte 256K, licence OpenMDW-1.1. SWE-bench Verified 70,9%, SWE-bench Multilingual 63,1%. Téléchargement : `ollama pull laguna-xs-2.1`
  • Kimi K2.7 Code (Moonshot AI, juin 2026) — Modèle agentique axé sur le codage, construit sur Kimi K2.6, visant spécifiquement les sessions de codage de longue durée. Téléchargement : `ollama pull kimi-k2.7-code`
  • DeepSeek V4 Pro (DeepSeek, 23 avril 2026) — Spécialiste du codage algorithmique, 93.5% LiveCodeBench, licence MIT. Variante économique DeepSeek V4 Flash pour le materiel plus léger. Téléchargement : `ollama pull deepseek-v4-pro`
  • Kimi K2.6 (Moonshot AI, 20 avril 2026) — Modèle de codage de frontière, SWE-Bench Pro 58.6, SWE-bench Verified 80.2% (à égalité avec GPT-5.5). Architecture MoE (32B actif / 1T au total). Licence Modified MIT.
  • Qwen3.8-27B (Alibaba, 16 avril 2026) — Meilleur global sur materiel grand public, 61,7% SWE-bench, Apache 2.0, tient en 24 Go en Q4. Aussi Qwen3.6-35B-A3B (MoE, 73,4 SWE-bench).
  • GLM-5.3 (Z.ai) — 744B / 40B actif MoE, licence MIT. Leader en génération de code structuré.
  • gpt-oss (OpenAI, 2026) — MoE à poids ouverts : gpt-oss:20b (21B au total / 3,6B actif, tourne en 16 Go, ~niveau o3-mini, raisonnement reglable) et gpt-oss:120b (80 Go).
  • Gemma 4 (Google, 2 avril 2026) — Tailles multimodales E2B / E4B / E12B (26B MoE) / E27B (31B dense), toutes avec vision et appel d'outils. Désormais ~90 % plus rapide sur Apple Silicon (mise à jour MLX de juillet 2026). E4B tourne en ~6 Go VRAM.
bash
# Mettre à jour Ollama vers la dernière version (v0.33.1)
curl https://ollama.ai/install.sh | sh

# Ou sur Mac : brew upgrade ollama

# Vérifier la version actuelle
ollama --version  # Sortie : ollama version 0.33.1

# Télécharger les nouveaux modèles de juillet 2026
ollama pull laguna-xs-2.1
ollama pull kimi-k2.7-code
ollama pull kimi-k2.6

Meilleurs modèles par catégorie

La qualité de la sortie d'un modèle dépend fortement de la façon dont vous le promptez. Pour des techniques structurées applicables à tous les modèles locaux — chain-of-thought, exemples few-shot et formatage de sortie — consultez le guide de prompt engineering. Pour les tâches de raisonnement, le prompt engineering de chaîne de pensée améliore considérablement la qualité des sorties DeepSeek-R1 et Qwen3. Pour déterminer la RAM requise pour chaque modèle, consultez le guide des exigences VRAM →. Pour les workflows d'agents avec Gemini 4, voir Tree-of-Thought et ReAct. Une fois qu'un modèle à appel d'outils de cette liste est intégré dans une boucle multi-étapes avec accès aux fichiers et aux bases de données, voir Agents IA locaux avec MCP pour le pattern d'orchestration open source.

  • Chat général (débutant) : `ollama run llama3.2:3b` -- la plupart de la documentation, le modèle de démarrage le mieux soutenu.
  • Chat général (meilleur choix) : `ollama run qwen3.8:27b` -- 61,7% SWE-bench, meilleur global sur materiel grand public, tient en 24 Go en Q4. Polyvalent : `ollama run qwen3:30b`. Pour les machines à 8 Go, gardez `ollama run llama3.2:3b`.
  • Long contexte / multimodal : `ollama run llama4:scout` -- contexte 10M tokens + multimodal, MoE (17B actif/109B au total). Nécessite ~55 Go VRAM en Q4 (tient en 24 Go uniquement en 1,78 bit, ~20 tok/s).
  • Meilleur petit / 16 Go : `ollama run gpt-oss:20b` -- 21B au total / 3,6B actif MoE, ~niveau o3-mini, raisonnement reglable. Plus grand : `ollama run gpt-oss:120b` (80 Go).
  • Codage (7B) : `ollama run qwen3:8b` -- 76% HumanEval, amélioré par rapport à Qwen3, multilingue.
  • Codage (meilleur agentique, 24B) : `ollama run devstral-small:24b` -- Meilleur modèle de codage agentique (éditions multi-fichiers, débogage). 16 Go RAM. Par Mistral AI.
  • Codage (meilleur dense, 27B) : `ollama run qwen3.8:27b` -- 61,7% SWE-bench. Meilleur modèle de codage dense. 22 Go VRAM.
  • Codage (frontière MoE) : `ollama run kimi-k2.6` -- SWE-Bench Pro 58.6 (à égalité avec GPT-5.5), tier supérieur. MoE (32B actif/1T au total). Licence Modified MIT.
  • Codage (agentique, longue durée) : `ollama run laguna-xs-2.1` -- MoE 33B/3B actif de Poolside, SWE-bench Verified 70,9%, contexte 256K. Conçu pour les boucles multi-étapes planifier → coder → tester → itérer. Licence OpenMDW-1.1.
  • Tâches d'agent et appel d'outils : `ollama run gemma4:e4b` -- Lancé le 2 avril 2026. Support d'appel d'outils intégré + vision. Recommandé pour les agents locaux, l'appel de fonctions et la sortie structurée. 6 Go RAM.
  • Raisonnement et mathématiques : `ollama run deepseek-r1:7b` -- modèle de chaîne de pensée, meilleure performance mathématique locale à 7B.
  • Multilingue : `ollama run qwen3:7b` -- 29+ langues natives, support non-anglais le plus fort, 76% HumanEval.
  • Non censuré / polyvalent : `ollama run dolphin3` -- Dolphin 3.0 (Cognitive Computations, construit sur Llama 3.1), sans filtrage de contenu intégré, pour le chat, le codage et les tâches agentiques.
  • Compréhension d'images : `ollama run gemma4:e4b` -- vision + appel d'outils (juillet 2026). Ou `ollama run llama3.2-vision:11b` pour une vision dédiée.
  • Rapide et léger : `ollama run gemma2:2b` -- inférence CPU la plus rapide, 1,7 Go RAM.
  • Haute qualité (16 Go RAM) : `ollama run mistral-small3.1` -- qualité proche de 70B à 14 Go RAM.
  • Domotique / IA mot de réveil : `ollama run phi4-mini` — Phi-4 Mini (3,8B, ~3 Go VRAM) gère les commandes vocales Home Assistant à 20–25 tok/sec sur mini PC sans GPU dédié. Voir guide d'intégration Home Assistant + Ollama →.
Sélection Ollama par cas d'usage : juillet 2026. Chat : llama4:scout, codage : qwen3.8:27b ou laguna-xs-2.1, raisonnement : deepseek-r1:7b.
Sélection Ollama par cas d'usage : juillet 2026. Chat : llama4:scout, codage : qwen3.8:27b ou laguna-xs-2.1, raisonnement : deepseek-r1:7b.

DeepSeek-R1 : Percée en raisonnement

DeepSeek-R1 a été lancé en janvier 2025 et représente une avancée significative en raisonnement sur tailles locales. Le modèle effectue un raisonnement explicite en chaîne de pensée (CoT) : vous voyez les chaînes de pensée internes du modèle avant la réponse finale.

  • Tailles disponibles : 1.5B (mobile), 7B, 70B. 1.5B suffisant pour appareils éducatifs ; 7B surpasse Llama 3.3 13B en mathématiques.
  • Performance sur benchmarks : 52 % MATH (vs 23 % Llama 3.1 8B), logique améliorée et résolution multiétapes.
  • Exigences RAM : 1.5B : 2 GB, 7B : 6 GB, 70B : 44 GB (quantification Q4).
  • Licence : Licences DeepSeek (certaines restrictions sur décompilation ; vérifier avant déploiement d'entreprise).
  • Gestion des données EU : Lorsqu'il est déployé dans les régions UE, DeepSeek-R1 traite les données selon les règlementations UE. L'exécution locale sur serveurs privés ou appareils garantit la souveraineté des données -- aucune transmission cloud requise.
bash
ollama run deepseek-r1:7b
# Exemple de prompt : "Si deux trains se rapprochent d'une gare à 100 km/h, quand se rencontrent-ils ?"
# DeepSeek-R1:7b répond avec les chaînes de pensée visibles :
# <pensée>
# ...explorer les chemins, vérifier les hypothèses...
# </pensée>
# Réponse : Ils se rencontrent ...
DeepSeek-R1 7B vs Mistral Small: 52% vs 28% MATH. Raisonnement chain-of-thought -- plus lent, nettement plus précis.
DeepSeek-R1 7B vs Mistral Small: 52% vs 28% MATH. Raisonnement chain-of-thought -- plus lent, nettement plus précis.

Modèles de vision sur Ollama

Quatre modèles de vision remarquables sont maintenant nativement disponibles sur Ollama :

Modèle
RAM
Support image
Commande Ollama
Llama 3.2 Vision 11B11 GBJPEG, PNG, GIF; entrée multi-imagesollama run llama3.2-vision:11b
Qwen2-VL 7B8 GBJPEG, PNG; meilleur en OCR et diagrammesollama run qwen2-vl:7b
Gemma 3 Vision 9B9.5 GBJPEG, PNG; contexte natif 128Kollama run gemma3:9b
Mistral AI Pixtral 12B12.5 GBJPEG, PNG; basé sur latentollama run pixtral:12b
4 modèles Ollama vision : llama3.2-vision:11b (8 Go), gemma3:9b (6 Go), minicpm-v (5,5 Go). Tous en local.
4 modèles Ollama vision : llama3.2-vision:11b (8 Go), gemma3:9b (6 Go), minicpm-v (5,5 Go). Tous en local.

Comparaison complète du Top 10

Les 10 modèles les plus téléchargés sur Ollama en avril 2026 selon les téléchargements mensuels :

#
Modèle
Meilleur pour
RAM
HumanEval
1Llama 3.1 8BDébutants, polyvalent6.5 GB68.2 %
2Qwen3 7BCodage, mathématiques6.5 GB75.4 %
3Mistral SmallMultilingue6.5 GB73.2 %
4Llama 3.3 70BHaut débit44 GB86.1 %
5Laguna XS 2.1Codage agentique, longue duréeQuantifié70.9 % SWE-bench Verified
6DeepSeek-R1 7BRaisonnement6.5 GB76.8 %
7Gemma 3 9BVision + texte9.5 GB72.1 %
8Llama 3.2 Vision 11BMultimodal11 GB71.5 %
9Phi-3.5 Mini 3.8BPetits appareils3 GB61.2 %
10Qwen3 32BQualité plutôt que vitesse20 GB81.7 %
Top 10 modèles Ollama par téléchargements : RAM 1,7 Go (gemma2:2b) à 14 Go (mistral-small3.1). HumanEval 39-74 %.
Top 10 modèles Ollama par téléchargements : RAM 1,7 Go (gemma2:2b) à 14 Go (mistral-small3.1). HumanEval 39-74 %.

Comment parcourir la bibliothèque Ollama ?

Il existe deux façons de travailler avec les modèles Ollama. Changer de modèle installé : Dans l'application Ollama pour Mac, cliquez sur le bouton déroulant de modèle en bas du champ de saisie du chat (affiche le nom du modèle actuel, ex. "gemma3:1b") pour basculer entre les modèles installés localement. Trouver et télécharger de nouveaux modèles : Visitez ollama.com/library pour parcourir plusieurs centaines de modèles par catégorie, puis utilisez les commandes CLI ci-dessous pour les télécharger.

  • Ouvrez ollama.ai/library dans un navigateur pour la bibliothèque complète interrogeable de plusieurs centaines de modèles.
  • Options de filtrage : taille du modèle, licence, date de publication, benchmarks (MMLU, HumanEval, MATH).
  • Notation par modèle : téléchargements utilisateur, étoiles GitHub (pour le modèle de base), étoiles Ollama.
  • Nouveaux modèles : La bibliothèque Ollama est mise à jour chaque semaine (jeudis, 18:00 UTC).
bash
ollama list
# Affiche tous les modèles installés

ollama pull llama3.1:8b
# Télécharge et installe Llama 3.1 8B

ollama pull qwen2.5:7b
# Télécharge Qwen3 7B (pour codage et mathématiques)

ollama run qwen2.5:7b
# Démarre une session de chat interactive

ollama run -m deepseek-r1:7b "Résoudre 2^10"
# Résout les tâches de raisonnement avec CoT

Erreurs courantes lors du choix de modèles Ollama

J'ai téléchargé un grand tag de modèle mais ma RAM est pleine. Qu'est-ce qui s'est passé ?

Vous avez téléchargé trop vite sans vérifier la RAM. Utilisez `ollama show [model-name]` AVANT le téléchargement. Exemple : `ollama show llama3.1:70b` affiche les exigences (~42-48 GB avec quantification Q4). Pour les débutants : restez avec les modèles 7B-13B (moins de 16 GB RAM). Supprimez avec `ollama rm [model-name]`.

J'utilise un modèle polyvalent comme Llama 3.3, mais le codage est lent. Pourquoi ?

Llama 3.1 8B est convivial, mais Qwen3 ou Mistral Small sont spécialisés pour les tâches techniques. Pour le codage : basculez à Qwen3 7B (75.4 % HumanEval vs 68.2 % pour Llama). Les deux fonctionnent en moins de 8 GB RAM.

J'ai téléchargé un modèle mais ne le vois pas dans la liste. Comment vérifier l'installation ?

Exécutez `ollama list`. Ollama stocke les modèles sous `~/.ollama/models/` (Mac) ou `%USERPROFILE%.ollamamodels` (Windows). Si le modèle y est mais n'apparaît pas, redémarrez le daemon Ollama : fermez Ollama et rouvrez-le.

Étapes suivantes

Questions fréquemment posées

Quelle est la dernière version d'Ollama ?

La dernière version stable d'Ollama est la v0.33.1, publiée le 26 août 2026. Une release candidate v0.33.2 a suivi le 27 août, mais elle n'est pas encore marquée comme stable. Téléchargez-la sur ollama.com/download ou mettez à jour avec `curl https://ollama.ai/install.sh | sh` sous Linux et `brew upgrade ollama` sous macOS.

Où trouver le changelog et les notes de version d'Ollama ?

Les notes de version de chaque tag figurent sur github.com/ollama/ollama/releases, avec la date et le changelog. Les entrées les plus récentes sont la v0.33.1 (26 août 2026 -- MLX Qwen3.8 Flash Next, sortie structurée, correctifs de délai GPU), la v0.33.0 (21 août -- passerelle Claude Desktop, points de restauration du cache KV) et la v0.32.15 (19 août -- nouveau parcours d'accueil, chargement des modèles environ deux fois plus rapide).

Comment vérifier quelle version d'Ollama est installée ?

Exécutez `ollama --version` dans le terminal. La sortie ressemble à `ollama version 0.33.1`. Si le numéro est inférieur à la version actuelle, mettez à jour avec `curl https://ollama.ai/install.sh | sh` (Linux) ou `brew upgrade ollama` (macOS), puis relancez `ollama --version` pour confirmer.

Combien de RAM me faut-il pour un modèle local ?

Modèles 7B : 6.5-8 GB RAM. 13B : 11-14 GB. 70B : 42-48 GB avec quantification (Q4_K_M). Petits (3B) : 2-3 GB. Vérifiez avec `ollama show [model-name]` avant le téléchargement.

Puis-je exécuter les modèles Ollama hors ligne ?

Oui. Après le téléchargement initial, chaque inférence s'exécute localement, sans connexion Internet. Ollama vérifie occasionnellement les mises à jour (mais ne les applique pas automatiquement).

Quel modèle a le meilleur support du français ?

Qwen3 7B a un support français supérieur (entraîné sur CulturaX et texte wiki FR). Llama 3.3 est adéquat pour le français, mais Qwen est plus précis. Mistral Small est compétent en français et espagnol.

Les modèles Ollama sont-ils vraiment gratuits ?

Oui. Tous les modèles disponibles sur Ollama sont open source avec des licences libres (Apache 2.0, Meta Llama 3 Community, Deepseek). Pas d'abonnements, pas de frais d'API. Téléchargez, installez localement et utilisez sans limite.

Quelle est vraiment la vitesse de DeepSeek-R1 ?

Vitesse de génération : 15-25 tokens/sec sur M1 Pro (similaire à Llama 3.3 7B). La latence totale est plus élevée car les chaînes de pensée sont générées -- attendez-vous à 8-12 secondes pour les requêtes moyennes. Pour l'interaction en temps réel, utilisez Llama 3.3 ou Mistral.

Pourquoi utiliser Ollama plutôt que simplement ChatGPT Plus ?

Confidentialité : aucun chat n'est transmis à OpenAI. Coût : pas d'abonnement mensuel ; investissement GPU unique. Hors ligne : fonctionne complètement sans Internet. Personnalisable : invites système, directives de comportement et paramètres entièrement sous votre contrôle.

Les modèles Ollama peuvent-ils traiter les images ?

Oui. Llama 3.2 Vision, Qwen2-VL et Gemma 3 sont tous multimodaux. Chargez les images comme fichiers locaux ; aucune transmission cloud. Support : JPEG, PNG, GIF.

Comment mettre à jour vers les nouvelles versions des modèles Ollama ?

Exécutez `ollama pull [model-name]` à nouveau. Ollama télécharge uniquement les différences (déduplication). Les anciennes versions peuvent être supprimées avec `ollama rm [model-name]:tag`.

Dois-je me soucier du RGPD avec Ollama ?

Oui. Le RGPD exige des mesures de sécurité appropriées pour les données personnelles. L'inférence locale sur appareils privés ou serveurs satisfait les exigences de protection par défaut. Aucune transmission cloud signifie : souveraineté des données, aucune export de données, conformité aux cadres de sécurité. Remarque : si vous utilisez un modèle cloud, vérifiez d'abord les contrats de traitement des données.

Ollama convient-il aux petites et moyennes entreprises (PME) françaises ?

Oui. Les PME françaises bénéficient de : souveraineté des données (sans verrouillage éditeur cloud), conformité aux standards de sécurité IT (cadres de sécurité), scalabilité sur matériel standard et économies sans frais d'API. Qwen3 7B s'exécute sur une GPU de bureau typique ; Llama 3.1 8B est un modèle PME éprouvé pour les outils internes, l'automatisation du service client et le traitement de documents.

Quel est le nom officiel de l'entreprise derrière Ollama ?

L'entreprise est Ollama Inc., une startup financée en Série B basée à Palo Alto, en Californie, fondée en 2023 par Jeffrey Morgan et Michael Chiang.

Quel modèle Dolphin dois-je utiliser avec Ollama ?

Utilisez Dolphin 3.0 (`ollama pull dolphin3`), pas l'ancien `dolphin-mistral` (dernière mise à jour en 2024, basé sur Mistral 0.2). Dolphin 3.0, maintenu par Cognitive Computations, est construit sur Llama 3.1, ne comporte aucun filtrage de contenu intégré et est conçu comme un modèle local polyvalent pour le codage, les mathématiques, les tâches agentiques et le chat sans restriction.

Quels modèles Ollama fonctionnent le mieux pour les tâches en russe ?

Qwen3 / Qwen3.8 et Mistral Small 3.1 incluent tous deux le russe dans leurs données d'entraînement multilingues natives. Qwen3 obtient de meilleurs scores sur les benchmarks non anglophones, tandis que Mistral Small 3.1 offre une fluidité conversationnelle en russe légèrement supérieure de façon informelle. Aucun des deux n'est d'origine russe.

Lectures connexes

Sources

Note sur les faits tiers

Cet article fait référence à des modèles d’IA, des benchmarks, des prix et des licences de tiers. Le paysage de l’IA évolue rapidement. Les scores de benchmark, les conditions de licence, les noms de modèles et les prix des API peuvent changer entre le moment de la rédaction et le moment où vous lisez ceci. Avant de prendre des décisions de déploiement ou de conformité basées sur cet article, vérifiez les chiffres actuels auprès de la source officielle de chaque fournisseur : fiches de modèles Hugging Face pour les licences et benchmarks, sites web des fournisseurs pour les prix API, et EUR-Lex pour les textes RGPD et AI Act actuels.

Utilisez PromptQuorum avec un LLM local, vos propres clés API, ou les deux — vous choisissez le backend.

Télécharger la bêta PromptQuorum →

← Retour aux LLMs locaux