News · Logiciel
DeepSeek V4.1-Flash : 0,15 $ / 0,60 $ hors pointe
Le 10 septembre 2026, DeepSeek lance V4.1-Flash : MoE 552 B, 8 B actifs en entrée, vision native. API deepseek-flash à 0,15 $ / 0,60 $ hors pointe. V4-Pro reste listé le 20. Chiffres constructeur.

Le 10 septembre 2026, DeepSeek a sorti V4.1-Flash (ouvre api-docs.deepseek.com dans un nouvel onglet). C’est, dit le labo, le plus petit modèle de sa nouvelle famille d’architecture, avec de la vision native. L’API s’appelle deepseek-flash. Hors pointe : 0,15 $ le million en entrée cache miss, 0,60 $ en sortie. Le 20 septembre, la table des prix (ouvre api-docs.deepseek.com dans un nouvel onglet) liste encore V4-Pro à côté.
Info
Contrôle du 20 septembre 2026. Annonce : news260910 (ouvre api-docs.deepseek.com dans un nouvel onglet). Changelog : updates, 10 septembre (ouvre api-docs.deepseek.com dans un nouvel onglet). Prix : Models & Pricing (ouvre api-docs.deepseek.com dans un nouvel onglet). Dépôt MIT : Hugging Face DeepSeek-V4.1-Flash (ouvre huggingface.co dans un nouvel onglet), papier (ouvre huggingface.co dans un nouvel onglet). Les benches du README et du changelog sont des évals DeepSeek, effort 100 sur l’instruct. Ce n’est pas un audit indépendant.
552 B, mais 8 B / 16 B actifs
Le README Hugging Face : Mixture-of-Experts 552 B de backbone. Architecture Causal Encoder–Decoder (CED) : 40 couches, 20 d’encodeur causal, 20 de décodeur. L’activation : 8 B par token en préfill, 16 B en decode. Un expert partagé, 384 experts routés, 6 routés par token. Mémoire conditionnelle Engram : 196 B, accédée par lookup.
Le pitch, c’est le KV cache. V4.1-Flash : 890 octets par token. DeepSeek dit 1/4 de la HBM et 1/8 du SSD par rapport à V4-Flash. La figure du dépôt descend de 389 120 octets sur V1 (novembre 2023) à 890 en septembre 2026. Chiffre constructeur.
Contexte 1 M. Sortie max 384 K. Vision native. Concurrence API Flash : 2 500. Thinking et non-thinking. JSON, tool calls, Responses API, Anthropic API.
L’API : deepseek-flash, V4-Pro pas retiré
Annonce du 10 : V4-Flash et V4-Flash-Vision-Exp sont retirés. Pour compatibilité, deepseek-v4-flash et deepseek-v4-flash-vision-exp routent vers V4.1-Flash, au tarif Flash.
L’annonce prévoyait aussi, à partir du 14 septembre 04:00 UTC, de router deepseek-v4-pro vers V4.1-Flash au tarif Flash, jusqu’à V4.1-Pro. Le changelog (ouvre api-docs.deepseek.com dans un nouvel onglet) du même 10 septembre dit autre chose : « In response to user demand, we have decided to continue providing API services for DeepSeek V4 Pro after September 14, 2026, with the billing method remaining unchanged. »
Le 20 septembre, la table officielle le confirme : deepseek-v4-pro = DeepSeek-V4-Pro-0813, concurrence 500, pas de vision. On ne dit pas que Pro a disparu. On dit que la page prix le liste encore.
Flash (deepseek-flash) | V4-Pro (deepseek-v4-pro) | |
|---|---|---|
| Version | V4.1-Flash | V4-Pro-0813 |
| Vision | oui | non |
| Concurrence | 2 500 | 500 |
| Entrée cache hit, hors pointe / pointe | 0,003 $ / 0,006 $ | 0,022 $ / 0,044 $ |
| Entrée cache miss, hors pointe / pointe | 0,15 $ / 0,30 $ | 0,66 $ / 1,32 $ |
| Sortie, hors pointe / pointe | 0,60 $ / 1,20 $ | 1,98 $ / 3,96 $ |
Pointe : lundi–vendredi 01:00–04:00 et 06:00–10:00 UTC, hors jours fériés chinois. Week-end et fériés CN : hors pointe toute la journée. Hors pointe = 50 % de la pointe. Nouveaux tarifs Flash : 04:00 UTC le 10 septembre.
Partenaires nommés le 10 : WorkBuddy (dont CodeBuddy) et OpenCode.
Les benches, ce sont les leurs
Changelog, instruct, effort max :
| Bench | V4.1-Flash |
|---|---|
| GPQA Diamond | 90,9 |
| HLE | 36,8 (39,1* texte) |
| Codeforces | 3471 |
| Terminal-Bench 2.1 | 90,6 |
| Terminal-Bench 3.0 | 30,0 |
| DeepSWE v1.1 | 74,2 |
| CyberGym | 88,1 |
| BabyVision (w/tools) | 89,6 |
- sous-ensemble texte de HLE.
La figure agentique du dépôt compare V4.1-Flash à Kimi K3, GLM-5.3, Opus 5 et GPT-5.6 Sol. Sur Terminal-Bench 3.0, Flash est à 30,0, Opus 5 à 43,3. Sur DeepSWE v1.1, Flash 74,2, un cran au-dessus. Sur CyberGym, 88,1. Ce n’est pas « plus fort partout ». C’est la planche DeepSeek.

Crédit : DeepSeek, figure du dépôt Hugging Face (ouvre huggingface.co dans un nouvel onglet). Effort max, harnais DeepSeek. Pas un classement indépendant.

Crédit : DeepSeek, même dépôt. 890 octets / token : chiffre constructeur, pas une mesure Yatofix.
Face au forfait Codex, le point n’est pas que Flash soit plus intelligent. C’est que le million de tokens a un prix, un cache, et une pointe affichée. Le 20 septembre, on peut encore payer Pro plus cher. La doc le permet.
Attention
Trois choses. (1) deepseek-flash = V4.1-Flash, vision, 0,15/0,60 $ hors pointe. (2) L’annonce du 10 parlait de router Pro vers Flash le 14 ; le changelog et la table du 20 gardent V4-Pro-0813. (3) 90,6 sur Terminal-Bench 2.1 et 3471 Codeforces sont des évals DeepSeek à effort 100.
Sources
- DeepSeek, V4.1-Flash announcement, 10 septembre 2026 (ouvre api-docs.deepseek.com dans un nouvel onglet)
- DeepSeek API, Change Log, 10 septembre 2026 (ouvre api-docs.deepseek.com dans un nouvel onglet)
- DeepSeek API, Models & Pricing (ouvre api-docs.deepseek.com dans un nouvel onglet)
- Hugging Face, deepseek-ai/DeepSeek-V4.1-Flash (ouvre huggingface.co dans un nouvel onglet)
- DeepSeek, V4.1 technical report (PDF) (ouvre huggingface.co dans un nouvel onglet)
Laisser un avis
Avis des lecteurs
Aucun avis publié pour le moment.
À lire aussi
- MLX : les gros modèles tiennent enfin sur un MacLe 20 septembre 2026, MLX fait tourner en local ce qu’on envoyait au cloud. WWDC : cluster Thunderbolt, Kimi 2.6 à 1 T. Rapid-MLX : V4.1-Flash 2-bit sur un M3 Ultra 256 Go, 7,3 tok/s. Pas un MacBook 16 Go.
- RX 9050 4 Go : même nom, bus 64-bit, OEM onlyLe 19–20 septembre 2026, Hardware Unboxed et Clubic mesurent la RX 9050 4 Go OEM. Même GPU que la 8 Go, bus 64-bit, 144 Go/s. En 1080p Low, la 8 Go est 37 % plus vite. Pas au rayon.
- GLM Coding Plan : 18, 80 et 168 $, en créditsAu 20 septembre 2026, GLM Coding Plan : Lite 18 $, Pro 80 $, Max 168 $. Crédits 5 h + semaine, hors-pointe à 50 %. Pas une API générale. Campagne Flash jusqu’au 20.