Retour
Menu des articles40

News · Logiciel

DeepSeek V4.1-Flash : 0,15 $ / 0,60 $ hors pointe

Le 10 septembre 2026, DeepSeek lance V4.1-Flash : MoE 552 B, 8 B actifs en entrée, vision native. API deepseek-flash à 0,15 $ / 0,60 $ hors pointe. V4-Pro reste listé le 20. Chiffres constructeur.

Par 20 septembre 20265 min de lecture0 vues
DeepSeek V4.1-Flash : 0,15 $ / 0,60 $ hors pointe

Le 10 septembre 2026, DeepSeek a sorti V4.1-Flash (ouvre api-docs.deepseek.com dans un nouvel onglet). C’est, dit le labo, le plus petit modèle de sa nouvelle famille d’architecture, avec de la vision native. L’API s’appelle deepseek-flash. Hors pointe : 0,15 $ le million en entrée cache miss, 0,60 $ en sortie. Le 20 septembre, la table des prix (ouvre api-docs.deepseek.com dans un nouvel onglet) liste encore V4-Pro à côté.

Info

Contrôle du 20 septembre 2026. Annonce : news260910 (ouvre api-docs.deepseek.com dans un nouvel onglet). Changelog : updates, 10 septembre (ouvre api-docs.deepseek.com dans un nouvel onglet). Prix : Models & Pricing (ouvre api-docs.deepseek.com dans un nouvel onglet). Dépôt MIT : Hugging Face DeepSeek-V4.1-Flash (ouvre huggingface.co dans un nouvel onglet), papier (ouvre huggingface.co dans un nouvel onglet). Les benches du README et du changelog sont des évals DeepSeek, effort 100 sur l’instruct. Ce n’est pas un audit indépendant.

552 B, mais 8 B / 16 B actifs

Le README Hugging Face : Mixture-of-Experts 552 B de backbone. Architecture Causal Encoder–Decoder (CED) : 40 couches, 20 d’encodeur causal, 20 de décodeur. L’activation : 8 B par token en préfill, 16 B en decode. Un expert partagé, 384 experts routés, 6 routés par token. Mémoire conditionnelle Engram : 196 B, accédée par lookup.

Le pitch, c’est le KV cache. V4.1-Flash : 890 octets par token. DeepSeek dit 1/4 de la HBM et 1/8 du SSD par rapport à V4-Flash. La figure du dépôt descend de 389 120 octets sur V1 (novembre 2023) à 890 en septembre 2026. Chiffre constructeur.

Contexte 1 M. Sortie max 384 K. Vision native. Concurrence API Flash : 2 500. Thinking et non-thinking. JSON, tool calls, Responses API, Anthropic API.

L’API : deepseek-flash, V4-Pro pas retiré

Annonce du 10 : V4-Flash et V4-Flash-Vision-Exp sont retirés. Pour compatibilité, deepseek-v4-flash et deepseek-v4-flash-vision-exp routent vers V4.1-Flash, au tarif Flash.

L’annonce prévoyait aussi, à partir du 14 septembre 04:00 UTC, de router deepseek-v4-pro vers V4.1-Flash au tarif Flash, jusqu’à V4.1-Pro. Le changelog (ouvre api-docs.deepseek.com dans un nouvel onglet) du même 10 septembre dit autre chose : « In response to user demand, we have decided to continue providing API services for DeepSeek V4 Pro after September 14, 2026, with the billing method remaining unchanged. »

Le 20 septembre, la table officielle le confirme : deepseek-v4-pro = DeepSeek-V4-Pro-0813, concurrence 500, pas de vision. On ne dit pas que Pro a disparu. On dit que la page prix le liste encore.

Flash (deepseek-flash)V4-Pro (deepseek-v4-pro)
VersionV4.1-FlashV4-Pro-0813
Visionouinon
Concurrence2 500500
Entrée cache hit, hors pointe / pointe0,003 $ / 0,006 $0,022 $ / 0,044 $
Entrée cache miss, hors pointe / pointe0,15 $ / 0,30 $0,66 $ / 1,32 $
Sortie, hors pointe / pointe0,60 $ / 1,20 $1,98 $ / 3,96 $

Pointe : lundi–vendredi 01:00–04:00 et 06:00–10:00 UTC, hors jours fériés chinois. Week-end et fériés CN : hors pointe toute la journée. Hors pointe = 50 % de la pointe. Nouveaux tarifs Flash : 04:00 UTC le 10 septembre.

Partenaires nommés le 10 : WorkBuddy (dont CodeBuddy) et OpenCode.

Les benches, ce sont les leurs

Changelog, instruct, effort max :

BenchV4.1-Flash
GPQA Diamond90,9
HLE36,8 (39,1* texte)
Codeforces3471
Terminal-Bench 2.190,6
Terminal-Bench 3.030,0
DeepSWE v1.174,2
CyberGym88,1
BabyVision (w/tools)89,6
  • sous-ensemble texte de HLE.

La figure agentique du dépôt compare V4.1-Flash à Kimi K3, GLM-5.3, Opus 5 et GPT-5.6 Sol. Sur Terminal-Bench 3.0, Flash est à 30,0, Opus 5 à 43,3. Sur DeepSWE v1.1, Flash 74,2, un cran au-dessus. Sur CyberGym, 88,1. Ce n’est pas « plus fort partout ». C’est la planche DeepSeek.

Graphique constructeur DeepSeek sur quatre benches agents.

Crédit : DeepSeek, figure du dépôt Hugging Face (ouvre huggingface.co dans un nouvel onglet). Effort max, harnais DeepSeek. Pas un classement indépendant.

KV cache global par token, de V1 à V4.1-Flash.

Crédit : DeepSeek, même dépôt. 890 octets / token : chiffre constructeur, pas une mesure Yatofix.

Face au forfait Codex, le point n’est pas que Flash soit plus intelligent. C’est que le million de tokens a un prix, un cache, et une pointe affichée. Le 20 septembre, on peut encore payer Pro plus cher. La doc le permet.

Attention

Trois choses. (1) deepseek-flash = V4.1-Flash, vision, 0,15/0,60 $ hors pointe. (2) L’annonce du 10 parlait de router Pro vers Flash le 14 ; le changelog et la table du 20 gardent V4-Pro-0813. (3) 90,6 sur Terminal-Bench 2.1 et 3471 Codeforces sont des évals DeepSeek à effort 100.

Sources

Laisser un avis

Ta note :

Anti-robots : recopie le code

Avis des lecteurs

Pas encore de note. La première est pour toi.

Aucun avis publié pour le moment.

À lire aussi