News · Hardware
Mac Studio M5 : ce que ça change pour faire tourner l’IA chez soi
Apple ne vend plus le Mac Studio comme un Mac de graphistes. Le M5 Max / Ultra est pitché comme serveur d’inférence local : jusqu’à 512 Go de mémoire unifiée, clusters Thunderbolt 5, prix de 2 999 € à plus de 21 000 €.

Le 25 août 2026, Apple a présenté un nouveau Mac Studio (ouvre apple.com dans un nouvel onglet) avec puce M5 Max ou M5 Ultra. Ce n’est pas un MacBook. C’est le cube de bureau 19,7 × 19,7 × 9,5 cm, précommandable sur le store Apple France (ouvre apple.com dans un nouvel onglet), disponible à partir du 22 septembre.
Apple ne le vend plus comme « le Mac des graphistes ». Le communiqué parle d’IA embarquée, d’inférence locale, de LLM énormes sur l’appareil, et même de cluster de plusieurs Mac Studio via Thunderbolt 5. C’est le sujet.

Image Apple, newsroom du 25 août 2026.
Ce que c’est
Deux machines, même boîtier :
| M5 Max | M5 Ultra | |
|---|---|---|
| CPU | 18 cœurs (6 super + 12 perf). Option GPU 40 cœurs. | 30 cœurs de base (10 super + 20 perf). Option 36 cœurs. |
| GPU | 32 cœurs de base, 40 en option. Neural Accelerators dans chaque cœur. | 64 cœurs de base, 80 en option. Neural Accelerators aussi. |
| Neural Engine | 16 cœurs | 32 cœurs |
| Mémoire unifiée | 36 Go de base, jusqu’à 128 Go | 96 Go de base, jusqu’à 512 Go |
| Bande passante | 460 Go/s (32 cœurs GPU) ou 614 Go/s (40 cœurs) | 1,2 To/s |
| SSD | 512 Go → 8 To | 1 To → 16 To |
| Écrans | jusqu’à 5 | jusqu’à 8 |
| Face avant | 2× USB-C 10 Gbit/s + SDXC | 2× Thunderbolt 5 + SDXC |
| Poids | 2,7 kg | 3,6 kg |
Les deux ont Wi-Fi 7, Bluetooth 6, 10 GbE, HDMI 2.1, quatre Thunderbolt 5 à l’arrière (120 Gbit/s). Consommation max annoncée : 480 W. Détail officiel : caractéristiques Mac Studio (ouvre apple.com dans un nouvel onglet).

Image Apple.
Ce qu’Apple met en avant : l’inférence, pas la DAW
Le texte Apple est clair. Johny Srouji : « l’ordinateur de bureau ultime pour l’IA embarquée ». Les Neural Accelerators sont maintenant dans chaque cœur GPU, y compris sur l’Ultra (première fois sur une Ultra). Apple promet :
- jusqu’à 4,3× de perf IA vs M3 Ultra, 9,8× vs M1 Ultra (M5 Ultra) ;
- jusqu’à 3,9× vs M4 Max et 10,7× vs M1 Max sur le traitement de prompts LM Studio (M5 Max) ;
- génération d’images texte→image jusqu’à 3,5× vs M4 Max ;
- cluster de 4 Mac Studio en Thunderbolt 5 + RDMA : jusqu’à 3× l’inférence d’une seule machine, mémoire partagée entre boîtiers.
Côté logiciels, Apple pousse Core AI (nouveau framework local), MLX, LM Studio, Draw Things, et le clustering exo. Le graphisme / la vidéo 8K / DaVinci / Redshift sont toujours là. Ils ne sont plus le premier slide.
C’est un changement de cible : de la station créative silencieuse vers un serveur d’inférence qui tient sur le bureau, sans envoyer les tokens dans le cloud.

Image Apple. LM Studio est l’exemple qu’Apple utilise pour les prompts LLM.
Qu’est-ce qu’on peut en faire, concrètement
Chez soi, sans API payante. Charger un modèle, discuter, coder avec un agent, résumer des PDF internes, générer des images. Les poids restent sur le SSD. Pas de facture au million de tokens, pas de fuite vers un endpoint tiers.
Un 70B qui tient vraiment. Sur un PC gamer, le goulot c’est la VRAM : 24 ou 32 Go sur une carte grand public. Ici la mémoire est unifiée : CPU, GPU et Neural Engine voient le même tas. 64 Go, 128 Go, 256 Go, 512 Go, ce n’est pas « de la RAM en plus ». C’est la taille du modèle que tu peux garder entier en Q4/Q8.
Du gros MoE / du 405B. Apple dit explicitement que 512 Go + 1,2 To/s permettent d’exécuter « d’énormes LLM entièrement sur l’appareil ». Un 405B quantifié, un MoE sparse type centaines de milliards, ça ne rentre pas dans une 5090. Ça rentre dans ce cube — lentement ou non, on y revient.
Un mini cluster. Quatre Ultra via Thunderbolt 5, RDMA, pool de mémoire. Apple vend ça aux labos et aux équipes qui ne veulent pas d’un rack NVIDIA. Le prix grimpe très vite (voir plus bas). Ce n’est plus « un Mac ». C’est une baie.
Toujours le reste. Montage 8K, 3D, compile Xcode, agents de code on-device. Si tu n’as que ça comme besoin, un M4 Max d’occasion fait déjà le job. L’argument neuf, c’est la capacité mémoire × bande passante × accélérateurs GPU.
Quels modèles, quelle mémoire
Ordre de grandeur, pas une science exacte. Un poids Q4, c’est ~0,5–0,6 octet par paramètre, plus le KV cache (contexte long = plus de RAM). On parle de ce qui tient, pas de ce qui file.
| Mémoire unifiée | Ce qui passe sans jouer au Tetris | Ce qui devient juste |
|---|---|---|
| 36 Go (Max de base) | 8B, 14B, 32B Q4 | 70B Q4 : trop juste une fois le contexte ouvert |
| 64 Go | 70B Q4 confortable | 70B Q8 / 120B Q4 : limite |
| 96–128 Go | 70B Q8, 120B Q4, gros MoE 8×22 | 405B : non |
| 256 Go (Ultra) | 405B Q4, très gros MoE | dense ~200B+ en Q8 |
| 512 Go (Ultra, fin octobre) | les plus gros LLM « un seul boîtier » qu’Apple met en avant | le plafond, c’est le prix |
Le 70B (Llama 3.x / Qwen / Mistral Large distillé, selon ce qui est réellement dispo chez toi) est le palier « frontier utilisable à la maison » : assez fort pour du code et du raisonnement, assez petit pour rester fluide si la RAM suit. Le 405B et les MoE énormes, c’est l’argument Ultra 256/512 Go : le modèle rentre. La vitesse, elle, dépend de la bande passante, pas seulement du tas.
Tokens par seconde : ce qu’on a, ce qu’on n’a pas
Apple n’a pas publié de tok/s. Les machines ne sont pas encore chez les gens (22 septembre). Donc pas de bench YatoFix, et on ne va pas inventer un chiffre.
Ce qu’on peut dire sans mentir :
- Les multiplicateurs Apple (LM Studio, « jusqu’à ») : M5 Max 3,9× vs M4 Max, 10,7× vs M1 Max sur le traitement de prompts. M5 Ultra 4,3× vs M3 Ultra en pic IA. « Jusqu’à » = labo Apple, charge choisie. On ne multiplie pas ça sur un 70B comme si c’était une constante.
- La génération précédente, déjà mesurée ailleurs. Sur M4 Max / M3 Ultra, un 70B Q4 en MLX ou llama.cpp est souvent cité autour de 25 à 40 tok/s en génération, parfois plus en préfill, parfois moins avec un long contexte. C’est l’ordre de grandeur d’un chat utilisable, pas d’une API cloud à 200 tok/s.
- Ce que ça implique si Apple a raison. Si le 3,9× LM Studio se voit hors labo, un 70B sur Max 64–128 Go sort de la zone « ça rame » pour aller vers un débit de conversation vraiment confortable. Sur Ultra 256–512 Go, le sujet n’est plus le 70B : c’est de faire tourner un modèle que tu ne faisais tourner nulle part, quitte à rester à quelques tok/s. Un 405B lent chez toi bat un 70B rapide si tu as besoin de la qualité du gros.
- Le cluster. Apple annonce jusqu’à 3× l’inférence d’une machine, pas 4×. La communication Thunderbolt/RDMA se paie. Utile pour un modèle trop gros pour 512 Go, pas pour gagner 4× sur un 8B.
Frontier à la maison : oui, si tu mets la RAM. Un Max 36 Go ne fait pas un frontier. Un Ultra 512 Go, si, au sens « le poids tient, l’inférence est locale, personne d’autre ne voit le prompt ». Ce n’est pas magique. C’est de la mémoire.
Prix Apple France (store, 28 août 2026)
Prix affichés sur acheter un Mac Studio (ouvre apple.com dans un nouvel onglet). Livraison gratuite, retours 14 jours.
| Config de départ (store) | Prix | Mensualité affichée |
|---|---|---|
| M5 Max, 18 CPU / 32 GPU, 36 Go, SSD 512 Go | 2 999 € | 102,51 € |
| M5 Max, 18 CPU / 40 GPU, 64 Go, SSD 1 To | 3 659 € | 125,07 € |
| M5 Ultra, 30 CPU / 64 GPU, 96 Go, SSD 1 To | 6 599 € | 207,28 € |
| M5 Ultra, 36 CPU / 80 GPU (départ) | à partir de 8 029 € | 252,19 € |
| Plafond du configurateur (offre groupée Apple) | 21 258,98 € | — |
La mémoire et le SSD se paient cash : 512 Go de RAM sur Ultra, 8 ou 16 To de SSD, et tu grimpes vers le plafond. Apple ne met plus les deltas d’options sur la première page ; ils s’affichent une fois la puce choisie. Option 512 Go Ultra : disponible fin octobre, pas le 22 septembre.
Boulanger affiche déjà l’Ultra 96 Go / 1 To à 6 599 € — le même tarif qu’Apple.
Pour l’IA, le SSD 512 Go de base est petit (un 70B Q4 + KV + OS, ça mange). Le vrai levier, c’est la RAM. 64 Go minimum pour un 70B propre. 128 Go si tu veux du Q8 ou plusieurs modèles. 256/512 Go seulement si tu vises du 405B / gros MoE.

Image Apple. Quatre Thunderbolt 5 à l’arrière ; l’Ultra a aussi deux TB5 à l’avant.
Dispo et délais
- Précommande ouverte depuis le 25 août.
- Disponible à partir du 22 septembre 2026.
- RAM 512 Go Ultra : fin octobre.
- Apple ne donne pas un délai unique : « validez votre commande pour connaître les dates ». Les configs stock partent plus vite que le sur-mesure. Pas de date magique par SKU tant que le panier n’est pas simulé jusqu’au checkout — le store France n’expose les créneaux qu’après le choix de puce / RAM / SSD.
Ça vaut le coup pour qui
Oui si tu veux un frontier (ou un gros 70B) local, que tu refuses le cloud pour tes prompts, et que tu paies la RAM. Le Max 64 Go à 3 659 € est le premier palier sérieux. L’Ultra 96 Go à 6 599 € est le palier « ça rentre vraiment ». Le 512 Go, c’est le labo à la maison.
Non si tu cherches un portable (ce n’est pas un MacBook), si un 70B Q4 sur un PC avec 2×24 Go de VRAM te suffit, ou si tu comptes sur des tok/s « comme une API ». Personne n’a encore mesuré le M5 hors du PowerPoint Apple.
Le lien utile : Mac Studio chez Apple (ouvre apple.com dans un nouvel onglet). Communiqué : Apple présente le nouveau Mac Studio avec M5 Max ou M5 Ultra (ouvre apple.com dans un nouvel onglet).
Laisser un avis
Avis des lecteurs
Aucun avis publié pour le moment.