Points clés
- Un distill DeepSeek-R1 n'a besoin du réseau qu'une seule fois (pour le téléchargement). Lors de l'inférence, il s'exécute entièrement hors ligne.
- Pour le raisonnement en chinois, les distills basés sur Qwen2.5 (1.5B/7B/14B/32B) gèrent mieux le chinois que les 8B/70B basés sur Llama 3.
- Adaptez le matériel au modèle : 16 Go → 14B, 24 Go → 32B ; la correspondance complète par GPU se trouve dans les références Bite.
- La configuration ici est uniquement côté modèle — Ollama ou LM Studio. La mécanique réseau/pare-feu est liée pour éviter la duplication.
- Vérifiez le « hors ligne » empiriquement : bloquez le réseau ou surveillez le trafic sortant pendant une session et confirmez l'absence totale de trafic sortant.
- L'auto-hébergement hors ligne signifie aucune dépendance au Grand Pare-feu et aucun flux de données transfrontalier.
- Exécutez chaque distill à une température de 0.6 sans prompt système.
Pourquoi exécuter DeepSeek hors ligne ?
Exécuter DeepSeek hors ligne vous donne un contrôle total des données et supprime toute dépendance à une API hébergée ou aux conditions du réseau — le modèle répond depuis du matériel local sans que rien ne quitte la machine. Pour le travail sensible à la souveraineté, c'est la différence entre un outil que vous contrôlez et un service dont vous dépendez.
Quatre motivations dominent : la souveraineté des données (les prompts et sorties ne quittent jamais votre environnement), l'absence de facturation API par jeton une fois le matériel acheté, l'indépendance vis-à-vis des restrictions réseau (concret pour les utilisateurs derrière le Grand Pare-feu — un modèle hors ligne n'a aucun point de terminaison étranger à atteindre) et la fiabilité (aucune panne ni limite de débit sur un point de terminaison hébergé). Aucune de ces raisons n'est « c'est automatiquement moins cher » — voir la comparaison de coûts ci-dessous. Cette analyse de la sensibilité des données s'inscrit dans le cadre des recommandations de la CNIL pour le traitement local de données professionnelles sensibles (financières, médicales, juridiques).
C'est le pendant pratique de l'analyse de confidentialité dans DeepSeek local résout-il le problème des données en Chine ? — cette page explique pourquoi l'auto-hébergement local supprime la préoccupation du flux de données ; celle-ci montre comment le construire et quel matériel acheter.
📍 En une phrase
Exécuter DeepSeek hors ligne garde chaque prompt et chaque sortie sur du matériel local, supprimant la dépendance à une API hébergée et toute restriction réseau.
💬 En termes simples
Un modèle hors ligne est comme un livre que vous possédez face à un site web que vous visitez. Une fois sur votre étagère, vous n'avez besoin ni d'internet — ni de la permission de quiconque — pour le lire.
DeepSeek local vs l'API DeepSeek
Ne présumez pas que le local est moins cher — la tarification hébergée de l'API DeepSeek est très basse, donc la véritable raison de s'auto-héberger est la confidentialité, le contrôle et le fonctionnement hors ligne, pas une économie garantie. Au 25 août 2026 (vérifié sur la page officielle de tarification API de DeepSeek), DeepSeek-V4 Flash coûte 0,007 $/0,22 $ par million de jetons en entrée (cache atteint/manqué, heures creuses) et 0,66 $ par million de jetons en sortie en heures creuses ; DeepSeek-V4 Pro coûte 0,022 $/0,66 $ en entrée et 1,98 $ en sortie en heures creuses, ces tarifs doublant environ pendant les heures de pointe en semaine (01h00–04h00 et 06h00–10h00 UTC). À ces tarifs, un utilisateur léger ou occasionnel peut dépenser très peu sur l'API pendant longtemps avant que le matériel ne soit rentabilisé.
Le calcul du seuil de rentabilité dépend entièrement de votre volume d'usage : un usage quotidien intensif (plusieurs millions de jetons/mois) fait pencher la balance vers le matériel en quelques mois ; un usage occasionnel ou irrégulier peut ne jamais atteindre la rentabilité. Utilisez le calculateur de coût IA locale de PromptQuorum avec votre propre dépense mensuelle prévue pour obtenir un chiffre réel plutôt qu'une estimation approximative.
Facteur | API DeepSeek | DeepSeek local |
|---|---|---|
| Matériel | Aucun | 400–2 800 $+ selon le palier (voir la section budget) |
| Internet | Requis | Non requis après le téléchargement du modèle |
| Coût par jeton | Oui (voir tarifs ci-dessus) | Aucun coût API récurrent |
| Confidentialité | Prompts envoyés à un point hébergé | Rien ne quitte la machine |
| Maintenance | Aucune | Vous gérez le matériel et la pile logicielle |
| Contrôle du modèle | Hébergé, contrôlé par le fournisseur | Auto-contrôlé, distill au choix |
| Capable hors ligne | Non | Oui, après le téléchargement initial |
| Idéal pour | Usage occasionnel, confort | Usage quotidien/intensif, confidentialité, souveraineté |
La vraie raison de s'auto-héberger est la confidentialité + l'indépendance + le contrôle — pas une économie automatique. Si vous utilisez DeepSeek occasionnellement, l'API est très probablement moins chère et plus simple.
Quel distill DeepSeek est le meilleur pour le raisonnement en chinois ?
Pour le raisonnement en chinois, choisissez un distill DeepSeek-R1 basé sur Qwen2.5 (7B, 14B ou 32B) — Qwen2.5 a été entraîné avec une forte couverture du chinois, donc ces distills gèrent nettement mieux les prompts et sorties en chinois que les 8B et 70B basés sur Llama 3. Le comportement de raisonnement est identique sur tous les distills ; le modèle de base détermine la qualité linguistique.
Choix pratiques pour les charges de travail en chinois : le 14B sur une carte de 16 Go est le choix équilibré par défaut, et le 32B sur une carte de 24 Go est la meilleure option mono-GPU. Les deux raisonnent couramment en chinois grâce à la base Qwen2.5. Réservez les distills basés sur Llama au travail majoritairement en anglais ou aux exigences de licence Llama.
Requêtes principales servies : 本地部署 deepseek (déployer DeepSeek localement), deepseek 离线 (DeepSeek hors ligne) et deepseek 私有化部署 (déploiement privé de DeepSeek). La réponse aux trois est la même — un distill basé sur Qwen2.5 exécuté localement avec Ollama ou LM Studio.
📍 En une phrase
Pour le raisonnement en chinois, choisissez un distill DeepSeek-R1 basé sur Qwen2.5 (7B/14B/32B) ; la base Qwen gère bien mieux le chinois que les distills basés sur Llama.
Quel modèle exécuter et combien de VRAM faut-il ?
Adaptez le distill à votre VRAM et à votre usage — les mêmes paliers que tout déploiement DeepSeek-R1, avec ce à quoi chaque palier est réellement adapté. Ceci est la version brève ; les deux références Bite contiennent le tableau complet par GPU et la VRAM par quant.
- Avis de PromptQuorum : pour la plupart des gens, le 14B ou le 32B est le point idéal. Le saut vers le 70B est une catégorie matérielle vraiment différente (double GPU, station de travail à grande mémoire, refroidissement et alimentation sérieux) — traitez-le comme sa propre décision d'achat, pas comme une suite naturelle du 32B.
- Le modèle complet de 671B n'est pas une cible normale pour un PC grand public. Si votre charge de travail nécessite cette échelle, comparez une station de travail IA dédiée aux coûts cloud/API plutôt que de l'assembler pièce par pièce — voir le guide de construction d'une station de travail IA locale.
VRAM | Meilleur distill (hors ligne) | Verdict | Idéal pour |
|---|---|---|---|
| 8 Go | 7B ou R1-0528-Qwen3-8B | Bon point d'entrée | Portables, GPU économiques, petits serveurs, expérimentation |
| 16 Go | 14B (Qwen2.5) | Meilleur rapport qualité-prix | La plupart des utilisateurs sérieux ; défaut équilibré, chinois solide |
| 24 Go | 32B (Qwen2.5) | Meilleur mono-GPU | Passionnés voulant un vrai palier supérieur sans multi-GPU |
| 48 Go+ / bi-GPU | 70B (Llama 3) | Territoire station de travail sérieuse | Professionnels ; sortie en chinois plus faible que les distills Qwen |
| ~400 Go+ | DeepSeek-R1 complet (671B) | Pas une charge grand public normale | Clusters multi-GPU de classe entreprise uniquement — n'achetez pas un mini PC en espérant cela |
Pour un point de terminaison hors ligne permanent et basse consommation, un mini PC capable exécute les distills 7B et 14B silencieusement — voir Meilleurs mini PC pour LLM locaux. Pour la correspondance GPU exacte, voir les références Bite dans Guides connexes.
Meilleures classes de matériel pour DeepSeek local
Plutôt qu'une seule recommandation produit, voici les quatre parcours matériels réalistes — choisissez celui qui correspond à vos priorités, puis utilisez le guide dédié pour les choix et prix actuels.
- GPU NVIDIA — idéal pour la performance et la compatibilité maximales. Le choix par défaut : le support logiciel le plus large (Ollama, vLLM, llama.cpp tournent tous bien sur CUDA), le plus d'options de VRAM au meilleur prix dans les paliers 16 Go/24 Go, et le dépannage le plus simple puisque la plupart des outils LLM locaux sont développés en priorité pour NVIDIA. Voir le meilleur guide d'achat GPU pour LLM locaux pour les choix actuels.
- GPU AMD — idéal pour les acheteurs prêts à composer avec l'écosystème ROCm. Potentiellement un bon rapport VRAM/prix, mais vérifiez la compatibilité ROCm/logicielle pour votre runtime exact (Ollama, llama.cpp) avant d'acheter — le support est plus restreint que celui de NVIDIA et varie selon la génération de carte.
- Apple Silicon — idéal pour une machine silencieuse et basse consommation avec une grande mémoire unifiée. L'avantage n'est pas la VRAM GPU traditionnelle, c'est la capacité de mémoire partagée — un Mac avec suffisamment de RAM unifiée peut charger des distills plus grands qu'un GPU discret de prix comparable, avec une fraction de la consommation électrique. Voir Meilleur Mac pour l'IA locale.
- Mini PC — idéal pour un serveur IA local toujours actif. Le bon choix si la charge de travail est du 7B, un peu de 14B, l'intégration Home Assistant, du RAG ou un assistant local en arrière-plan plutôt qu'une vitesse d'inférence maximale. Voir Meilleurs mini PC pour LLM locaux.
- Location GPU cloud — idéal si vous voulez tester un palier avant d'acheter, ou avez besoin d'une capacité ponctuelle occasionnelle. Pas « hors ligne », mais un moyen légitime d'essayer les performances de classe 32B/70B avant de vous engager sur du matériel. Voir le guide de location de GPU cloud.
Notre configuration DeepSeek locale recommandée
Pour la plupart des lecteurs de PromptQuorum qui souhaitent un vrai palier supérieur en raisonnement local sans entrer en territoire multi-GPU : un GPU 24 Go, 64 Go de RAM système, et 2 To de stockage NVMe, exécutant DeepSeek-R1 32B via Ollama. Ceci est une cible de configuration, pas un produit spécifique — utilisez le guide d'achat GPU lié ci-dessous pour les choix et prix actuels.
- Usages réalistes à ce palier : raisonnement en chinois, aide au codage, analyse de documents, assistant privé, RAG sur documents locaux et expérimentation d'agents locaux.
- Budget limité ? Descendez au palier 16 Go / 14B — voir Quel modèle et combien de VRAM ? ci-dessus et la répartition budgétaire ci-dessous.
Composant | Spécification cible |
|---|---|
| GPU | 24 Go de VRAM |
| RAM système | 64 Go |
| Stockage | 2 To NVMe |
| Logiciel | Ollama |
| Modèle | DeepSeek-R1-Distill-Qwen-32B |
Comment configurer DeepSeek hors ligne ?
La configuration hors ligne est uniquement côté modèle : téléchargez une fois, puis exécutez sans réseau. Voici les étapes avec Ollama (LM Studio est l'équivalent graphique — récupérez le modèle, puis passez hors ligne).
- 1Installer Ollama ou LM Studio
Why it matters: Ils exécutent le modèle localement sans dépendance externe lors de l'inférence ; installez une fois en ligne. - 2Récupérer le distill une fois
Why it matters: Exécutez `ollama run deepseek-r1:14b` (ou votre palier) connecté — c'est la seule étape nécessitant le réseau. - 3Déconnecter ou bloquer le réseau
Why it matters: Une fois le modèle en cache, coupez l'accès réseau ; le modèle fournit les réponses entièrement à partir des poids locaux. - 4Régler la température sur 0.6, vider le prompt système
Why it matters: Empêche le mode d'échec par répétition de R1 ; mettez toutes les instructions dans le prompt utilisateur. - 5Exécuter l'inférence hors ligne
Why it matters: Chaque prompt et chaque sortie reste désormais sur la machine sans trafic sortant — confirmez avec l'étape de vérification ci-dessous.
ollama pull deepseek-r1:14b # une seule fois, en ligne
# puis déconnecter / bloquer le réseau
ollama run deepseek-r1:14b # inférence entièrement hors ligneQu'en est-il de la mécanique réseau et pare-feu ?
Le modèle hors ligne lui-même n'a besoin d'aucune configuration de pare-feu, VPN ou tunnel réseau — il n'a aucun point de terminaison étranger à atteindre — donc le seul travail réseau consiste à s'assurer que rien d'autre sur la machine ne transmet de données. Ce sujet général (règles de pare-feu, isolation réseau, blocage des connexions sortantes) est traité en détail ailleurs et n'est pas dupliqué ici.
Pour la configuration complète du pare-feu et du réseau hors ligne — y compris l'isolation d'un poste de travail et le verrouillage du trafic sortant — voir IA locale derrière un pare-feu : hors ligne 2026. Cet article couvre le choix du modèle DeepSeek et la configuration du modèle hors ligne ; celui-là couvre la mécanique réseau.
Comment vérifier que vous êtes vraiment hors ligne ?
Prouvez le statut hors ligne empiriquement : exécutez une session d'inférence complète avec le trafic sortant surveillé ou le réseau désactivé, et confirmez l'absence de connexions sortantes du processus du modèle. Ne présumez pas — démontrez-le, car c'est ce qui rend l'affirmation de souveraineté vérifiable.
Deux méthodes rapides : désactivez l'adaptateur réseau (ou débranchez le câble) et confirmez que l'inférence fonctionne toujours — preuve que le modèle n'a besoin d'aucune connectivité ; ou gardez le réseau actif mais surveillez les connexions sortantes avec une capture de paquets ou un pare-feu par processus et confirmez que le processus Ollama/LM Studio n'en ouvre aucune durant une session.
Astuce de pro : température 0.6 et aucun prompt système
Réglez la température sur 0.6 (0.5–0.7 est sûr) et n'utilisez aucun prompt système — mettez toutes les instructions dans le prompt utilisateur. Cela évite le mode d'échec par répétition et incohérence auquel les distills DeepSeek-R1 sont sujets, et c'est tout aussi important hors ligne qu'en ligne.
Acheter du matériel ou utiliser l'API ?
C'est la vraie décision, et elle dépend de la fréquence réelle d'usage de DeepSeek — pas de l'option « meilleure » dans l'absolu.
- Achetez du matériel si : vous utilisez DeepSeek quotidiennement, la confidentialité est importante pour votre travail, vous avez besoin d'un fonctionnement hors ligne, vous prévoyez d'exécuter plusieurs services locaux sur la même machine, vous possédez déjà du matériel adapté, ou vous voulez un accès prévisible à long terme sans dépendre des changements tarifaires d'un fournisseur.
- Utilisez l'API si : vous utilisez DeepSeek occasionnellement, vous ne voulez pas entretenir de matériel ou de pile logicielle, vous avez besoin d'une vitesse d'inférence maximale sans acheter de GPU de classe entreprise, ou le fonctionnement hors ligne n'a réellement pas d'importance pour votre usage.
- La tarification actuelle de l'API DeepSeek (vérifiée ci-dessus) est assez basse pour que les utilisateurs occasionnels aient très probablement intérêt à simplement payer l'usage de l'API plutôt qu'à acheter du matériel pour économiser — l'argument du matériel porte sur la confidentialité et le contrôle, pas sur une économie garantie.
- Faites vos propres calculs avec le calculateur de coût IA locale avant de décider — indiquez votre dépense API mensuelle prévue et le prix du matériel pour obtenir une véritable estimation de rentabilité plutôt qu'une règle empirique.
Budget matériel par palier
Contexte important pour 2026 : les prix des GPU et de la VRAM ont fortement augmenté au cours de l'année écoulée en raison des tensions sur le marché de la mémoire — une carte 24 Go d'occasion qui coûtait environ 1 000–1 300 $ en 2025 se négociait plutôt autour de 2 200–2 800 $ en août 2026. Budgétez en conséquence plutôt que de présumer que les prix de l'an dernier tiennent encore ; le palier d'entrée 16 Go est resté relativement stable.
Budget | Objectif | Remarques |
|---|---|---|
| Moins de 500 $ | DeepSeek 7B, petites charges 14B | Systèmes GPU d'occasion ou d'entrée de gamme |
| 500–900 $ | DeepSeek local 14B | GPU 16 Go — palier idéal pour débuter, tarifs restés relativement stables |
| 1 500–3 000 $ | DeepSeek 32B | GPU 24 Go — ce palier est nettement plus cher en 2026 qu'auparavant ; vérifiez les prix actuels avant de budgéter |
| 3 000 $+ | IA locale sérieuse, marge de croissance | GPU 24 Go+, 64–128 Go de RAM, plusieurs disques NVMe |
| 5 000 $+ | Modèles 70B et plus grands | Comparez une station de travail IA dédiée aux coûts cloud/API à ce budget — voir le guide de construction |
Ce qu'il ne faut pas acheter
Quelques erreurs courantes qu'il vaut la peine de nommer clairement, car une page qui ne dit jamais que « achetez ceci » ressemble à une page de vente.
- N'achetez pas un système GPU à 2 000 $+ juste pour exécuter un modèle 7B — c'est un gaspillage d'argent que le palier d'entrée gère déjà.
- N'achetez pas 128 Go de RAM système sans une charge qui en a réellement besoin ; c'est la VRAM, pas la RAM système, qui est généralement le vrai goulot d'étranglement pour l'inférence GPU.
- N'achetez pas un GPU AMD uniquement parce que les spécifications sur le papier semblent impressionnantes — vérifiez d'abord la compatibilité ROCm/logicielle pour votre runtime exact.
- N'achetez pas un mini PC en espérant une inférence rapide en 70B ou en 671B complet — les besoins en mémoire et en calcul à cette échelle relèvent d'une classe de matériel totalement différente.
- Ne présumez pas que le local est moins cher avant d'avoir fait le calcul — un utilisateur occasionnel est très probablement mieux servi par l'API (voir la comparaison de coûts ci-dessus).
Questions fréquentes
DeepSeek peut-il fonctionner complètement hors ligne ?
Oui. Une fois qu'un distill a été téléchargé, l'inférence peut continuer avec le réseau désactivé — vous pouvez déconnecter ou bloquer entièrement le réseau et il continue de fonctionner à partir des poids locaux.
DeepSeek-R1 nécessite-t-il un VPN en Chine ?
Pas lors d'une exécution locale du modèle. Un modèle hors ligne n'a aucun point de terminaison étranger à atteindre, donc les VPN et contournements de pare-feu sont sans rapport avec l'inférence. La seule tâche réseau consiste à s'assurer que rien d'autre sur la machine n'envoie de données.
Quel distill DeepSeek est le meilleur pour le chinois ?
Un distill basé sur Qwen2.5 (7B, 14B ou 32B). Qwen2.5 a une forte couverture du chinois, donc ces distills gèrent mieux les prompts et sorties en chinois que les distills 8B et 70B basés sur Llama 3.
Combien de VRAM DeepSeek 32B nécessite-t-il ?
Un GPU de 24 Go est une cible pratique pour un déploiement quantifié en 32B, selon la quantisation et le runtime — voir le tableau Quel modèle et combien de VRAM ci-dessus pour la répartition complète par palier.
Un mini PC peut-il exécuter DeepSeek ?
Oui, notamment le distill 7B et certaines configurations 14B. Les mini PC sont un bon choix pour un point de terminaison toujours actif et basse consommation, mais ils ne conviennent généralement pas pour une performance DeepSeek maximale ou pour les modèles 70B+.
Puis-je exécuter DeepSeek sur Apple Silicon ?
Oui. Les systèmes Apple Silicon à grande mémoire unifiée peuvent être particulièrement intéressants pour l'expérimentation LLM locale, car l'avantage est la capacité de mémoire partagée plutôt que la VRAM GPU traditionnelle — voir la section Meilleures classes de matériel ci-dessus.
DeepSeek local est-il moins cher que l'API ?
Pas nécessairement. Le matériel représente un coût initial substantiel, et la tarification actuelle de l'API DeepSeek est basse. Les principaux avantages du déploiement local sont la confidentialité, le contrôle et le fonctionnement hors ligne, pas une économie garantie — faites vos propres calculs avec le calculateur de coût lié.
Comment savoir que le modèle hors ligne n'envoie de données nulle part ?
Surveillez le trafic sortant pendant une session ou désactivez entièrement le réseau et confirmez que l'inférence fonctionne toujours. Un modèle chargé localement n'a pas intrinsèquement besoin d'une connexion à l'API DeepSeek pour l'inférence, mais vous devriez le vérifier empiriquement pour votre propre déploiement plutôt que de le présumer.
Quel matériel exécute bien DeepSeek hors ligne ?
Un GPU de 16 Go exécute le distill 14B et un GPU de 24 Go exécute le 32B. Pour un point de terminaison silencieux et permanent, un mini PC capable gère les 7B et 14B. Voir les bites GPU et VRAM pour la correspondance exacte, et la section Meilleures classes de matériel pour les compromis NVIDIA/AMD/Apple Silicon/mini PC.
Puis-je exécuter le DeepSeek-R1 complet hors ligne ?
Pas sur du matériel grand public. Le R1 671B complet nécessite environ 400 Go+ de VRAM en quantisation niveau Q4. L'auto-hébergement hors ligne utilise en pratique les distills (1,5B–70B), qui s'exécutent sur des GPU locaux.
Où vont les étapes pare-feu et réseau ?
Ce guide ne réexplique délibérément pas la mécanique pare-feu et isolation réseau. Voir IA locale derrière un pare-feu : hors ligne 2026 pour le verrouillage réseau complet ; ici nous couvrons le choix du modèle DeepSeek, le matériel et la configuration du modèle hors ligne.
Quels réglages utiliser pour DeepSeek hors ligne ?
Température 0.6 sans prompt système, instructions dans le message utilisateur. C'est la configuration standard de DeepSeek-R1 et elle évite le mode d'échec par répétition.
Journal des mises à jour
- Refonte complète en page affiliée le 2026-08-25 : ajout d'une répartition par classe de matériel (NVIDIA/AMD/Apple Silicon/mini PC/cloud), une configuration cible recommandée, une comparaison tarifaire vérifiée de l'API DeepSeek, une section de décision achat vs API, un tableau budgétaire matériel 2026 corrigé (les prix GPU/VRAM ont fortement augmenté d'une année sur l'autre), et une section « ce qu'il ne faut pas acheter ». Correction d'une affirmation excessive (« les poids ouverts de DeepSeek n'ont aucune télémétrie » → vérifier empiriquement selon le déploiement plutôt que d'affirmer catégoriquement).
- Publié le 2026-06-19. Prochaine révision prévue le 2026-09-25 (palier de fraîcheur mensuel, reflétant l'évolution rapide des prix GPU/API).
- Couvre le choix du modèle DeepSeek hors ligne, le choix du modèle pour le chinois, le choix de la classe de matériel et la configuration du modèle hors ligne. Mécanique réseau/pare-feu volontairement liée. Monétise l'infrastructure matérielle autour de DeepSeek (guides GPU/Mac/mini PC/station de travail), pas l'API DeepSeek elle-même.
