TL;DR
- 16 Go : modèles 7B uniquement (serré)
- 36 Go : 13B confortablement, 34B Q4 serré
- 64 Go : 34B Q5 confortablement
- 70B Q5 confortablement avec 128 Go
- Impossible de mettre à niveau après l'achat — acheter le maximum à l'achat
Points clés
- La mémoire unifiée est partagée entre CPU et GPU — tout est disponible pour les modèles LLM.
- La RTX 4070 a 12 Go VRAM + 32 Go RAM (séparés). Le Mac a une mémoire unifiée = tout disponible.
- Un Mac 64 Go dispose de ~56–60 Go pour les LLM après l'overhead macOS (4–8 Go).
- Le swap existe : macOS utilise le SSD si le modèle dépasse la mémoire libre. Fonctionne mais 5–10× plus lent.
- La taille du modèle en Go varie selon la quantification : Llama 3.3 8B fait 16 Go FP16, 5 Go Q4, 8,5 Go Q8.
- Règle : Acheter le maximum de mémoire — impossible à mettre à niveau après l'achat. Le coût mémoire à la vente est de 5–10 % ; remplacer l'intégralité du Mac plus tard coûte 100 %.
📍 En une phrase
Pour les LLM locaux sur Apple Silicon : 16 Go seulement pour les 7B (limité), 36 Go pour les 13B confortablement, 64 Go pour les 70B Q3 (limité) ou 34B Q5 (confortable), 128 Go pour les 70B Q5 confortablement — achetez le maximum car la mémoire n'est pas évolutive.
💬 En termes simples
La mémoire unifiée sur un Mac est partagée entre CPU, GPU et moteur IA. Règle empirique : un modèle 7B en Q4 nécessite environ 5 Go ; un 14B environ 9 Go ; un 70B en Q4 environ 42 Go. Ajoutez 8 Go pour l'OS. Si le modèle ne rentre pas, il bascule sur le disque — 100× plus lent.
Fonctionnement de la mémoire unifiée pour les LLM
La mémoire unifiée est partagée entre CPU et GPU — tout est disponible pour le modèle. Contrairement aux GPU discrets (la RTX 4070 a 12 Go VRAM + 32 Go RAM séparés), l'Apple Silicon partage un seul pool. Mac 64 Go = 64 Go disponibles pour le modèle. macOS et les applications utilisent 4–8 Go, laissant 56–60 Go pour le LLM.
La mémoire unifiée est-elle la même chose que la VRAM ?
Oui — sur Apple Silicon, la mémoire unifiée *est* la VRAM du GPU. Il n'existe pas de pool de VRAM séparé et fixe comme sur un GPU dédié. Le CPU, le GPU et le Neural Engine d'une puce M lisent et écrivent dans la même mémoire physique, si bien que la quasi-totalité du pool de mémoire unifiée — et non une simple fraction — est disponible pour le GPU lors de l'exécution d'un LLM.
- GPU dédié (RTX 4070) : 12 Go de VRAM constituent un plafond fixe pour les poids du modèle, même si le PC dispose de 64 Go de RAM système séparée.
- Apple Silicon : le GPU peut accéder à tout le pool de mémoire unifiée moins l'overhead macOS (4–8 Go) — un Mac 64 Go donne au GPU ~56-60 Go, pas une tranche fixe de VRAM de 12-24 Go.
- C'est pourquoi un Mac 64 Go peut exécuter un modèle 34B confortablement alors qu'un PC 64 Go avec un GPU 12 Go ne le peut pas — la mémoire accessible au GPU du PC est plafonnée par sa VRAM, pas par sa RAM totale.
- « Mémoire partagée » et « mémoire unifiée » décrivent la même architecture : un seul pool, adressable à la fois par le CPU et le GPU, sans étape manuelle d'allocation de VRAM.
Tableau principal : niveau mémoire vs taille de modèle
| Model | Parameters | Q3_K | Q4_K_M | Q5_K_M | Q8 | FP16 |
|---|---|---|---|---|---|---|
| Phi-4 | 3,8B | 2,1 Go | 2,5 Go | 2,9 Go | 4,0 Go | 7,6 Go |
| Mistral Small | 7B | 3,8 Go | 4,5 Go | 5,2 Go | 7,5 Go | 14 Go |
| Llama 3.3 8B | 8B | 4,2 Go | 5,0 Go | 5,8 Go | 8,5 Go | 16 Go |
| Llama 3.3 13B | 13B | 7,0 Go | 8,5 Go | 9,8 Go | 14 Go | 26 Go |
| Qwen3 34B | 34B | 17 Go | 20 Go | 24 Go | 36 Go | 68 Go |
| Llama 3.3 70B | 70B | 36 Go | 42 Go | 49 Go | 74 Go | 140 Go |
| Llama 3.3 405B | 405B | 200+ Go | 240 Go | 280 Go | 410 Go | 810 Go |
Ajouter 4–8 Go pour l'overhead macOS lors du calcul de la compatibilité sur votre Mac.
Matrice compatible / incompatible
| Modèle + Quantification | 16 Go | 36 Go | 64 Go | 128 Go |
|---|---|---|---|---|
| Phi-4 Q4 (2,5 Go) | ✓ Largement | ✓ Largement | ✓ Largement | ✓ Largement |
| Llama 3.3 8B Q4 (5 Go) | ⚠️ Serré | ✓ Confortable | ✓ Largement | ✓ Largement |
| Llama 3.3 8B Q8 (8,5 Go) | ✗ Incompatible | ✓ Confortable | ✓ Largement | ✓ Largement |
| Llama 3.3 13B Q4 (8,5 Go) | ✗ Incompatible | ✓ Confortable | ✓ Largement | ✓ Largement |
| Qwen3 34B Q4 (20 Go) | ✗ Incompatible | ⚠️ Serré | ✓ Confortable | ✓ Largement |
| Qwen3 34B Q5 (24 Go) | ✗ Incompatible | ✗ Incompatible | ✓ Confortable | ✓ Largement |
| Llama 3.3 70B Q3 (36 Go) | ✗ Incompatible | ✗ Incompatible | ⚠️ Serré | ✓ Confortable |
| Llama 3.3 70B Q4 (42 Go) | ✗ Incompatible | ✗ Incompatible | ⚠️ Très serré | ✓ Confortable |
| Llama 3.3 70B Q5 (49 Go) | ✗ Incompatible | ✗ Incompatible | ✗ Incompatible | ✓ Confortable |
| Llama 3.3 70B Q8 (74 Go) | ✗ Incompatible | ✗ Incompatible | ✗ Incompatible | ✓ Compatible |
✓ Largement = 4+ Go libres | ✓ Confortable = 2–4 Go libres | ⚠️ Serré = moins de 2 Go libres | ✗ Incompatible = swap ou plantage

Ce qui tient dans chaque niveau mémoire (pratique)
- 116 Go (M5 base, MacBook Air)
Why it matters: Llama 3.3 8B Q4 tient (5 Go modèle + 8 Go OS = 13 Go) ✓ mais serré. Llama 8B Q8 ne tient pas sans swap. Whisper small tient à côté. - 236 Go (M5 Pro base)
Why it matters: Llama 3.3 8B Q8 tient confortablement. Llama 13B Q4 tient. Qwen3 34B Q4 tient tout juste (20 Go + 8 Go OS = 28 Go). Multi-modèle : Whisper + LLaVA + TTS tiennent ✓ - 364 Go (M5 Pro max)
Why it matters: Qwen3 34B Q5 tient confortablement (24 Go). Llama 70B Q3 tient à peine. Les stacks multi-modèles ont beaucoup de place. - 4128 Go (M5 Max)
Why it matters: Meilleur modèle pour 128 Go : Llama 3.3 70B Q5 (49 Go) — le plus grand modèle courant qui tient avec de la marge. 70B Q8 tient (74 Go) pour une qualité quasi sans perte. Multi-modal : Whisper + modèle vision 90B + LLM 8B tiennent simultanément ✓
Besoins mémoire pour les stacks multi-modèles
| Cas d'utilisation (stack) | Mémoire nécessaire |
|---|---|
| LLM seul (Llama 8B Q4) | 5 Go + OS = 13 Go |
| LLM + STT (Llama 8B + Whisper large-v3) | 8 Go + OS = 16 Go |
| LLM + STT + TTS (assistant vocal) | 9 Go + OS = 17 Go |
| LLM + Vision (Llama 8B + LLaVA 7B) | 11 Go + OS = 19 Go |
| Multimodal complet (LLM + Vision + STT + TTS) | 14 Go + OS = 22 Go |
| LLM + RAG (Llama 8B + embeddings + ChromaDB) | 8 Go + OS = 16 Go |
| Multimodal lourd (Llama 70B Q4 + Vision 90B) | 100+ Go |
Les stacks dépassant 22 Go nécessitent un Mac minimum 36 Go. Les stacks dépassant 50 Go nécessitent un Mac minimum 64 Go. Le stack multimodal lourd ne fonctionne que sur M5 Max 128 Go.
La fenêtre de contexte génère un overhead mémoire supplémentaire
Le cache KV évolue avec la longueur du contexte — plus la fenêtre de contexte est grande, plus le modèle utilise de mémoire à l'exécution. C'est un piège courant qui peut faire basculer une configuration serrée vers le swap.
- Llama 3.3 8B avec contexte 8K : +0,5 Go
- Llama 3.3 8B avec contexte 32K : +2 Go
- Llama 3.3 8B avec contexte 128K : +8 Go
- Llama 3.3 70B avec contexte 32K : +6 Go
- Llama 3.3 70B avec contexte 128K : +24 Go
Acheter le maximum de mémoire — voici pourquoi
- La mémoire Apple Silicon ne peut pas être mise à niveau après l'achat.
- Les tailles de modèles augmentent : 8B aujourd'hui → sweet spot 13–34B en 2027.
- 16 Go est déjà marginal pour les LLM — 36 Go minimum recommandé.
- Différence de prix : 36 Go→64 Go coûte ~200 € à l'achat, économise l'achat d'un nouveau Mac dans 2 ans quand les modèles dépasseront 36 Go.
- M5 Pro 36 Go coûte aujourd'hui ~1 000 € ; 64 Go coûte ~1 200 €. Nouveau Mac dans 2 ans : 1 500 €+ pour la même configuration M5 Pro 64 Go.
- Façon la moins chère d'obtenir 36 Go+ de mémoire unifiée : le Mac mini M5 Pro de base (~1 000 €, 36 Go) est le Mac le moins cher avec assez de mémoire pour exécuter des modèles 13B confortablement — moins cher que toute configuration Mac Studio ou MacBook Pro à mémoire équivalente.

Impact de la quantification sur la qualité
Q4_K_M (4 bits) : ~1–2 % de perte de qualité vs FP16. Imperceptible pour la plupart des usages. Meilleur choix par défaut.
Q5_K_M (5 bits) : ~0,5–1 % de perte de qualité. Négligeable. Recommandé si de la mémoire est disponible.
Q8 (8 bits) : ~0,1 % de perte de qualité. Essentiellement sans perte.
Q3_K (3 bits) : 3–5 % de perte de qualité. Perceptible sur le raisonnement complexe. Acceptable uniquement pour les scénarios contraints en espace.
Dois-je choisir 36 Go ou 64 Go ?
Prendre 64 Go si le budget le permet (~200 € de plus). 36 Go fonctionne aujourd'hui mais deviendra serré dans 12 mois avec la croissance des modèles. 64 Go est à l'épreuve du temps jusqu'en 2027–2028.
Puis-je mettre à niveau la mémoire plus tard ?
Non. La mémoire Apple Silicon est soudée et non mise à niveau. Acheter le maximum à l'achat.
Pourquoi 16 Go ne suffit-il pas ?
16 Go pour LLM + 4–8 Go pour macOS = 8–12 Go disponibles. Llama 8B Q4 nécessite 5 Go, ne laissant aucune place pour Whisper ou autres tâches. Trop serré.
Ai-je vraiment besoin de 128 Go ?
Seulement si vous exécutez régulièrement des modèles 70B ou avez besoin de Vision + LLM + STT simultanément. Sinon, 64 Go est largement suffisant.
48 Go suffisent-ils pour les LLM locaux ?
Oui — 48 Go (disponible sur M4 Pro et certaines configs M5 Pro) est un bon compromis. Fait tourner tous les modèles 34B, 70B Q3 à la limite, et les stacks multimodaux complets. Mieux que 36 Go ; si 64 Go est abordable, l'avenir le justifie.
Quelle mémoire pour exécuter Llama 3.3 70B en local ?
Minimum 48 Go (quantification Q3, perte de qualité perceptible). Recommandé 64 Go (quantification Q4, fit serré). Confortable 128 Go (quantification Q5/Q8, haute qualité). Le niveau 64 Go exige une gestion mémoire soigneuse ; 128 Go est la seule option sans contrainte pour le 70B.
Ai-je besoin de 128 Go pour l'IA locale en 2026 ?
Seulement pour exécuter régulièrement des modèles 70B ou des stacks Vision + LLM + STT simultanément. Pour l'usage LLM courant (modèles 8B–34B, RAG, assistance au code), le M5 Pro 64 Go est le sweet spot. 128 Go représente un surcoût de 2–3× pour un bénéfice marginal sans besoin spécifique de 70B.
La mémoire unifiée Apple Silicon est-elle la même chose que la VRAM ?
Oui. Contrairement à un GPU dédié avec un pool de VRAM fixe et séparé (par ex. 12 Go sur une RTX 4070), le GPU d'Apple Silicon lit et écrit dans la même mémoire physique que le CPU. Le GPU peut accéder à la quasi-totalité de la mémoire unifiée d'un Mac — un Mac 64 Go donne au GPU ~56-60 Go après l'overhead macOS, pas une tranche fixe de VRAM.
Quel est le plus grand LLM qui tient dans 128 Go de mémoire unifiée ?
Llama 3.3 70B en quantification Q5_K_M (49 Go) est le plus grand modèle courant qui tient confortablement, laissant ~70 Go libres pour le contexte et l'overhead. En Q8 (74 Go), il tient encore avec de la marge pour macOS. Un modèle 405B nécessite 240 Go+ même en Q4 — au-delà de la mémoire unifiée de tout Mac, donc 70B reste le plafond pratique sur une seule machine.
Quel espace de stockage nécessite un LLM local, indépendamment de la mémoire ?
Mémoire (RAM) et stockage disque sont différents : la mémoire contient le modèle pendant son exécution ; le stockage contient le fichier du modèle téléchargé de façon permanente. Un modèle 8B en Q4 nécessite ~5 Go de mémoire et de disque. Un modèle 70B Q5 nécessite ~49 Go de mémoire et ~49 Go de disque — le même fichier. Exécuter plusieurs modèles en local (par ex. 8B, 34B, 70B, plus un modèle vision) nécessite 100-150 Go d'espace disque libre, indépendamment du niveau de mémoire de votre Mac.
Les LLM locaux sur M5 Max sont-ils conformes au RGPD ?
Oui. Toutes les données étant traitées localement sans transmission vers des serveurs externes, aucune donnée personnelle n'est soumise à l'article 28 RGPD. La CNIL recommande les solutions d'IA en local pour les traitements de données sensibles, en particulier dans les secteurs médical, juridique et financier.
