News · Logiciel
Eleven v4 : ElevenLabs reprend la première place de la voix IA
Lancé le 28 septembre 2026, Eleven v4 est n° 1 du classement à l'aveugle d'Artificial Analysis avec 1320 Elo, 149 points de plus que v3. v4 Turbo vise les agents à 150 ms. Plus de 90 langues dont le français, API à 22 $ le million de caractères jusqu'au 12 octobre.

ElevenLabs a repris la première place de la synthèse vocale. Le 28 septembre 2026, la société a lancé Eleven v4 et sa version rapide Eleven v4 Turbo, deux nouveaux modèles de voix. Trois jours plus tard, v4 est toujours numéro 1 du classement à l'aveugle d'Artificial Analysis, avec 1320 points Elo, soit 47 points devant le deuxième.
La promesse : des voix qui ne se contentent plus de lire, mais qui jouent le texte. On peut leur dire comment dire une phrase, avec quelle émotion, et même ajouter des bruitages. La version Turbo vise les agents vocaux, avec une réponse annoncée en 150 millisecondes. Et le prix de l'API est cassé jusqu'au 12 octobre.
Info
Contrôle du 1er octobre 2026. Sources primaires lues : le message d'annonce d'ElevenLabs sur X (ouvre x.com dans un nouvel onglet) (28 septembre, 14 h 01 UTC, lu via fxtwitter), le billet Introducing Eleven v4 (ouvre elevenlabs.io dans un nouvel onglet), la page produit v4 (ouvre elevenlabs.io dans un nouvel onglet), le billet Eleven v4 Turbo dans ElevenAgents (ouvre elevenlabs.io dans un nouvel onglet), la documentation des modèles (ouvre elevenlabs.io dans un nouvel onglet), la grille tarifaire API (ouvre elevenlabs.io dans un nouvel onglet) et le classement Artificial Analysis (ouvre artificialanalysis.ai dans un nouvel onglet), relevé le 1er octobre. Recoupement : The Decoder (ouvre the-decoder.com dans un nouvel onglet). Les chiffres de latence et de préférence viennent d'ElevenLabs, sauf mention contraire.
Le tweet : 4,8 millions de vues
L'annonce tient en deux phrases. « Introducing Eleven v4 and Eleven v4 Turbo, our fastest and most emotive voice models yet », puis « Ranked #1 by Artificial Analysis ». Elle est accompagnée d'une vidéo de démonstration de 2 min 36 s.
Au 1er octobre, le message affiche 4,81 millions de vues et un peu plus de 19 000 j'aime. C'est énorme pour une annonce de modèle de voix, un domaine qui fait d'habitude moins de bruit que les modèles de texte.
La vidéo ouvre sur un avertissement : tout ce qu'on va entendre a été généré à partir des prompts affichés, sans retouche. On y voit justement ces prompts, avec les balises qui pilotent la voix.
![Image de la vidéo d'annonce : une phrase avec les balises [inhales] et [exhales with sadness] au-dessus de deux visages en nuage de points.](/files/eleven-v4-video-annonce-x-20260928.jpg)
Crédit : ElevenLabs sur X (ouvre x.com dans un nouvel onglet), image extraite de la vidéo d'annonce (vers 0:30), 28 septembre 2026.
Ce qui change avec v4
ElevenLabs dit avoir construit v4 sur une architecture entièrement nouvelle. Le billet, signé par les cofondateurs Mati Staniszewski et Piotr Dabkowski, insiste sur un point : le modèle lit un script comme un comédien. Il tient compte de qui parle, de ce qui vient de se passer et du ton voulu.
Le contrôle par balises et par consignes. On écrit des indications directement dans le texte, entre crochets : [laughs], [whispers], [said angrily in French accent], et même des bruitages comme [light rain] ou [door slams]. On peut aussi décrire en langage naturel comment une ligne doit être dite. Selon ElevenLabs, v4 suit ces balises « plus fidèlement » que v3. La prononciation par phonèmes (alphabet phonétique international) est aussi améliorée.
Les dialogues à plusieurs voix. Le modèle comprend une scène entière. Les personnages se répondent au lieu d'enchaîner des répliques collées bout à bout. La voix d'un personnage reste aussi la même quand on régénère une ligne une ou cinquante fois.
Le clonage de voix. Un clone instantané se fait désormais avec 10 secondes d'audio. Les clones « professionnels » (PVC), absents de v3, font leur retour. Attention : les clones créés avant v4 doivent être réentraînés pour bien fonctionner avec le nouveau modèle.
Des textes plus longs. Une requête accepte 10 000 caractères, environ 10 minutes d'audio, contre 5 000 pour v3.
Le français est-il bien servi ?
Oui, il fait partie des langues prises en charge. v4 et v4 Turbo couvrent plus de 90 langues, contre plus de 70 pour v3, et la documentation (ouvre elevenlabs.io dans un nouvel onglet) liste bien le français.
La nouveauté la plus utile pour le doublage est ailleurs : une voix enregistrée dans une langue peut parler une autre langue avec l'accent d'un natif, tout en restant reconnaissable. ElevenLabs dit que la voix ne « dérive » plus vers son accent d'origine au fil du texte.
Par contre, ElevenLabs ne cite pas le français parmi les langues les plus améliorées. Pour Turbo, ce sont le japonais, le portugais du Brésil, le mandarin et le cantonais. Nous n'avons pas pu tester nous-mêmes la qualité en français.
v4 Turbo : la voix pour les agents
Turbo est la version basse latence, pensée pour les agents vocaux au téléphone ou dans une application. ElevenLabs annonce :
- environ 100 ms de temps de calcul médian ;
- environ 150 ms avant d'entendre le premier son.
Selon ElevenLabs, ces 100 ms de calcul sont plus courtes que le blanc moyen entre deux personnes qui se parlent. La marque compare avec ses concurrents, mesurés par elle-même en septembre 2026, réseau retiré :
| Modèle | Délai médian avant la première parole |
|---|---|
| Eleven v4 Turbo | ~150 ms |
| Cartesia Sonic 3.6 | 262 ms |
| Google Gemini 3.8 Flash TTS | 685 ms (chiffre repris par The Decoder (ouvre the-decoder.com dans un nouvel onglet)) |
| OpenAI GPT-4o mini TTS | 814 ms |
Ce sont des mesures du constructeur, pas des tests indépendants. Turbo fonctionne en streaming dans les deux sens : on envoie le texte au fur et à mesure qu'un modèle de langage l'écrit, et l'audio revient avant la fin de la phrase. Il est intégré à ElevenAgents (ouvre elevenlabs.io dans un nouvel onglet), la plateforme d'agents de la marque.
Le classement Artificial Analysis, en chiffres
Artificial Analysis fait voter des internautes à l'aveugle : ils écoutent deux voix lisant la même phrase et choisissent la meilleure. Les votes donnent un score Elo, comme aux échecs. Le classement cité par ElevenLabs est le Provider Voice Arena, où chaque modèle est testé avec les voix maison de son éditeur.

Crédit : Artificial Analysis (ouvre artificialanalysis.ai dans un nouvel onglet), capture du 1er octobre 2026.
| Rang | Modèle | Éditeur | Elo | Prix API (1 M caractères) |
|---|---|---|---|---|
| 1 | Eleven v4 | ElevenLabs | 1320 (±18) | 80 $ |
| 2 | Sonic 3.6 | Cartesia | 1273 (±16) | 49 $ |
| 3 | Gemini 3.8 Flash TTS | 1272 (±16) | 16,50 $ | |
| 4 | Qwen-Audio-3.0-TTS-Plus | Alibaba | 1259 (±16) | 19,30 $ |
| 5 | Realtime TTS-2 | Inworld | 1247 (±17) | 20,80 $ |
| 13 | v3 Conversational | ElevenLabs | 1200 (±15) | 50 $ |
| 16 | Eleven v3 | ElevenLabs | 1171 (±11) | 100 $ |
| 33 | TTS-1 HD | OpenAI | 1102 (±12) | 30 $ |
| 46 | GPT-Realtime-2 | OpenAI | 1074 (±13) | 191,60 $ |
Relevé du 1er octobre 2026. Le prix affiché pour v4 est le tarif normal, pas la promotion.
Trois choses à retenir :
- La première place est nette. v4 est seul dans sa fourchette de rang (1 à 1). Ses 47 points d'avance dépassent les marges d'erreur. Le score repose toutefois sur 1 803 votes, moins que la plupart des concurrents. Le jour du lancement, la presse citait 1319 : le score bouge un peu avec les votes.
- Le saut depuis v3 est énorme. Eleven v3 est à 1171, soit 149 points de moins. ElevenLabs était tombé à la 16e place, derrière Cartesia, Google, Alibaba et Inworld. v4 rattrape tout ce retard d'un coup.
- OpenAI est loin. Son meilleur modèle dans ce classement, TTS-1 HD, est 33e. Google, lui, talonne Cartesia avec Gemini 3.8 Flash TTS, pour un prix cinq fois plus bas que celui de v4.
v4 Turbo n'apparaît pas dans le classement au 1er octobre. Le « numéro 1 » vaut donc pour v4, pas pour Turbo.
ElevenLabs avance aussi un autre chiffre : environ 75 % des auditeurs préfèrent v4 dans des tests à l'aveugle face à Cartesia, Inworld et Google. Mais ces tests, ElevenLabs les a organisés lui-même. Selon The Decoder, la préférence varie de 65 à 81 % selon le concurrent.
Prix, API et disponibilité
Les deux modèles sont disponibles depuis le 28 septembre dans ElevenCreative (l'outil de création), ElevenAgents et l'API, sous les identifiants eleven_v4 et eleven_v4_turbo.
| Modèle | Prix normal (1 M caractères) | Promo jusqu'au 12 octobre |
|---|---|---|
| Eleven v4 | 80 $ | 22 $ |
| Eleven v4 Turbo | 40 $ | 11 $ |
| Eleven v3 (pour comparer) | 80 $ | — |
| v3 Conversational | 40 $ | — |
Source : grille tarifaire API d'ElevenLabs (ouvre elevenlabs.io dans un nouvel onglet), relevée le 1er octobre 2026, hors taxes.
La réduction est de 72 % jusqu'au 12 octobre. Après, v4 coûtera le même prix que v3. Les abonnés Creator et au-dessus ont aussi trois fois plus de crédits pendant la même période.
Pour essayer, il existe un plan gratuit de 10 000 crédits par mois, sans carte bancaire, limité à un usage personnel. Les offres payantes commencent à 6 $ par mois.
Ce qu'il faut retenir
- Eleven v4 est le numéro 1 actuel du classement à l'aveugle d'Artificial Analysis, avec 1320 points et une avance nette.
- Le progrès face à v3 est réel : près de 150 points d'écart, des textes deux fois plus longs, plus de langues, et le retour des clones professionnels.
- Turbo vise les agents vocaux avec 150 ms annoncées, mais il n'est pas encore classé par Artificial Analysis.
- Le prix de lancement est très bas jusqu'au 12 octobre. Ensuite, v4 reste nettement plus cher que Google ou Alibaba.
Ce qu'on ne sait pas encore
- La place de v4 Turbo dans les classements indépendants.
- La latence réelle hors des mesures d'ElevenLabs.
- La qualité en français face à v3 : aucune mesure par langue n'est publiée.
- La réponse de Google et d'OpenAI, qui ont tous deux des modèles de voix récents mais restent derrière pour l'instant.
Laisser un avis
Avis des lecteurs
Aucun avis publié pour le moment.
À lire aussi
- Ce que vous avez raté du 27 septembre au 1er octobreSonnet 5.5, le prospectus d’Anthropic, le DevDay d’OpenAI, GLM-5.3, l’enquête de la FTC, la date d’Apple et les prix de la mémoire : l’actualité IA et tech du 27 septembre au 1er octobre 2026, en brèves datées et sourcées.
- DRAM et SSD : encore 10 à 20 % de hausse au quatrième trimestreTrendForce prévoit au T4 2026 +10 à 15 % sur la DRAM conventionnelle et +15 à 20 % sur la NAND en prix contractuels. La hausse ralentit sans s’arrêter, l’offre de DRAM PC pourrait baisser en 2027 et les SSD des PC rétrécissent.
- Apple viserait le 13 octobre pour son hub maison, un HomePod mini et une Apple TVSelon Mark Gurman (Bloomberg, 30 septembre 2026), Apple dévoilerait le 13 octobre un hub domestique à écran de 6 pouces, un HomePod mini et une Apple TV 4K à puces plus rapides pour Siri IA. Rien n’est confirmé par Apple.
