📑 Table des matières

ElevenLabs Eleven v4 : la génération vocale passe un cran avec Turbo et la latence temps réel

Avatars IA 🟢 Débutant ⏱️ 16 min de lecture 📅 2026-09-29

ElevenLabs Eleven v4 : la génération vocale passe un cran avec Turbo et la latence temps réel

🔎 Deux modèles, deux fronts : la qualité et la milliseconde

Le 28 septembre 2026, ElevenLabs a lancé Eleven v4 et Eleven v4 Turbo, officialisant une stratégie en deux paliers : v4 pour la qualité studio, Turbo pour la latence temps réel des agents conversationnels. Le paper de lancement est co-signé par les deux fondateurs, Mati Staniszewski et Piotr Dabkowski — un signal fort sur l'ambition de la mise à jour.

Pourquoi maintenant ? Parce que le trône du TTS n'a jamais été aussi contesté. Cartesia Sonic 3.6 attaque frontalement le marché des agents, Google casse les prix avec Gemini 3.8 Flash TTS, et l'open source — VoiceStudio en tête, avec 646 langues et 24 500 étoiles sur GitHub — offre une porte de sortie aux équipes allergiques aux API propriétaires.

Mon analyse, chiffres au crible : v4 consolide la couronne qualité, mais Turbo est la vraie nouveauté stratégique. 150 ms avant la première syllabe, c'est sous le seuil de la pause humaine. Le point de friction reste le prix — 80 $ le million de caractères, le plus cher du trio de tête. Décryptage.


L'essentiel

  • Qualité : Eleven v4 est n°1 du Provider Voice TTS Arena d'Artificial Analysis avec un Elo de 1 319 (1 674 apparitions, septembre 2026), devant Cartesia Sonic 3.6 (1 276) et Gemini 3.8 Flash TTS (1 267).
  • Temps réel : Eleven v4 Turbo affiche ~100 ms de latence médiane d'inférence et 150 ms de time-to-first-speech en benchmarks WebSocket indépendants, contre 262 ms pour Sonic 3.6 et 814 ms pour GPT-4o mini TTS.
  • Expressivité : tags inline pour émotions, rires, soupirs, accents et SFX, dialogues multi-locuteurs, ~75 % de préférence des auditeurs en évaluations aveugles (chiffre éditeur).
  • Langues : 90+ langues contre 70+ pour Eleven v3, transfert d'identité vocale entre langues, clonage instantané à partir de 10 secondes d'audio.
  • Prix : 80 $/1M caractères pour v4 (septembre 2026) — 63 % plus cher que Sonic 3.6 (49 $) et près de 5x Gemini 3.8 Flash TTS (16,49 $).
  • Intégration : bascule v4 ↔ Turbo via un paramètre model_id unique (eleven_v4 / eleven_v4_turbo), générations gratuites deux semaines et crédits x2 pour les plans Creator+.

Outils recommandés

Outil Usage principal Prix (septembre 2026) Idéal pour
ElevenLabs Eleven v4 TTS studio, narration, clonage haute fidélité 80 $/1M caractères (vérifiez sur elevenlabs.io) Audiobooks, voix de marque, doublage
Eleven v4 Turbo TTS temps réel pour agents Tarif non détaillé au lancement (vérifiez sur elevenlabs.io) Agents vocaux, support, téléphonie
Cartesia Sonic 3.6 TTS temps réel 49 $/1M caractères (vérifiez sur cartesia.ai) Agents à budget maîtrisé
Gemini 3.8 Flash TTS TTS bas coût 16,49 $/1M caractères (vérifiez sur ai.google.dev) Gros volumes, prototypage
VoiceStudio (open source) TTS auto-hébergé Gratuit (coût GPU à votre charge) Souveraineté des données, très gros volumes

Les grilles tarifaires bougent tous les trimestres sur ce marché : vérifiez toujours les prix officiels avant de budgéter.


Eleven v4, c'est quoi au juste ?

Eleven v4 est le modèle de synthèse vocale le plus expressif et le plus émotif jamais publié par ElevenLabs, en ligne depuis le 28 septembre 2026 dans l'app créateur, la plateforme d'agents et l'API développeurs. Là où la v3 lisait un texte, la v4 joue un script.

La direction de jeu se pilote avec des tags inline qui contrôlent l'émotion, le pacing, les réactions, les effets sonores et le style. Le modèle sait rire, soupirer, changer d'accent — y compris jouer un français en colère, un détail qui compte pour la localisation. Les dialogues multi-locuteurs sont gérés nativement, ce qui simplifie la production de fiction audio.

Côté performances brutes, la progression est mesurable : 73,4 caractères/s générés contre 42,5 pour la v3 (+73 %), et 90+ langues contre 70+. La robustesse de prononciation atteint 91,7 %, meilleur score jamais mesuré par Artificial Analysis, contre 85,6 % pour la v3. Pour le français, langue à liaisons et exceptions, c'est un argument concret.

En évaluations aveugles, v4 obtient environ 75 % de préférence des auditeurs selon le paper de lancement. C'est un chiffre éditeur, à prendre avec la prudence d'usage — mais les leaderboards indépendants confirment la hiérarchie, comme on le voit plus bas.

Le clonage vocal passe à la vitesse supérieure

L'Instant Voice Clone produit un clone haute fidélité à partir de 10 secondes d'audio. La barrière d'entrée du clonage n'est plus technique ni financière : elle est désormais éthique et juridique, un point auquel je reviens dans les erreurs courantes.

La cohérence du locuteur sur les longues générations — point faible historique des modèles vocaux — est explicitement mise en avant par ElevenLabs sur v4 comme sur Turbo.

Autre capacité sous-estimée : le transfert inter-langues. Une voix enregistrée dans une langue peut en parler une autre en conservant l'identité du locuteur et en adoptant un accent natif. Pour une marque qui décline un même ambassadeur vocal sur dix marchés, le gain de production est majeur.


Turbo : 100 ms, la latence qui débloque vraiment les agents vocaux

Eleven v4 Turbo est la variante temps réel de v4, co-optimisée avec ElevenAgents, avec une latence médiane d'inférence d'environ 100 ms — plus rapide que la pause naturelle entre deux humains qui se répondent. C'est le chiffre qui change la donne pour les agents.

La vraie innovation d'architecture est le streaming bidirectionnel sur WebSockets.

Le streaming bidirectionnel, la révolution silencieuse

Concrètement : le client envoie le texte au fil de la génération du LLM et reçoit l'audio avant même la fin de la phrase. La synthèse démarre pendant que le modèle de langage réfléchit encore, et la latence perçue se rapproche de celle du TTS seul.

Cette conception élimine le pattern classique « le LLM finit sa phrase, puis le TTS démarre », qui empilait deux attentes. Pour les développeurs, cela signifie une architecture d'agent plus simple et une conversation qui ne « claque » plus entre les tours de parole.

Sur benchmarks WebSocket indépendants, Turbo atteint 150 ms médian de time-to-first-speech. La hiérarchie est sans appel :

Modèle Time-to-first-speech médian (WebSocket, septembre 2026)
Eleven v4 Turbo 150 ms
Cartesia Sonic 3.6 262 ms
OpenAI GPT-4o mini TTS 814 ms

814 ms, c'est inexploitable en conversation : l'interlocuteur perçoit un blanc, hésite, se coupe. À 150 ms, on repasse sous la pause humaine — les travaux sur le tour de parole (Stivers et al., PNAS, 2009) situent l'écart moyen entre deux locuteurs autour de 200 ms. OpenAI, distancé avec son TTS classique, mise sur une ligne temps réel dédiée : nous avons détaillé GPT-Realtime-2 et ses trois modèles voix dans un article séparé.

Turbo conserve par ailleurs les contrôles expressifs de v4 et supporte le Professional Voice Clone tout au long d'un appel, comme le confirme TestingCatalog. Votre agent garde la voix de votre marque du premier au dernier mot, rires et pauses dirigés par script inclus.


Face à la concurrence : ce que disent vraiment les chiffres

Sur la qualité, Eleven v4 domine les classements indépendants — mais pas tous, et c'est là que l'analyse devient intéressante. Les données consolidées de BenchLM et le leaderboard vocal d'Artificial Analysis convergent sur trois tableaux :

Classement (Artificial Analysis, septembre 2026) Position Eleven v4 Détail
Provider Voice TTS Arena n°1 Elo 1 319 sur 1 674 apparitions, devant Sonic 3.6 (1 276) et Gemini 3.8 Flash TTS (1 267)
Controlled Voice n°2 Elo 1 157, derrière Alibaba Qwen-Audio-3.1-TTS-Plus (1 178), loin devant Eleven v3 (1 073)
Pronunciation Robustness n°1 (record) 91,7 %, devant Gemini 3.8 Flash TTS (89,5 %) et Gemini 3.1 Flash TTS (88,2 %)

v4 est aussi n°1 dans les quatre catégories mesurées de l'arène : Customer Service, Assistants, Knowledge Sharing et Entertainment. L'écart d'Elo avec Cartesia (43 points) reste toutefois modéré : la hiérarchie est claire, la domination n'est pas écrasante.

Le point le plus instructif est le Controlled Voice : quand la performance est entièrement dirigée, Alibaba Qwen-Audio-3.1-TTS-Plus prend la première place. ElevenLabs domine l'arène ouverte, pas le contrôle fin — une nuance qui compte pour les studios de doublage, beaucoup moins pour les agents conversationnels.

Et l'open source ? Le cas VoiceStudio

VoiceStudio, projet open source qui cumule 24 500 étoiles sur GitHub, couvre 646 langues — bien plus que les 90+ d'ElevenLabs. Sur le papier, l'écart est humiliant. En pratique, il faut lire ce chiffre pour ce qu'il est : une couverture linguistique large ne dit rien de la qualité par langue ni de la robustesse de prononciation, mesurée à 91,7 % côté v4.

Mon positionnement est sans ambiguïté : VoiceStudio est l'option rationnelle si la souveraineté des données est non négociable — santé, finance, secteur public — ou si votre volume rend l'API prohibitive. Vous échangez alors de la simplicité contre de l'infrastructure : GPUs à dimensionner, latence à régler vous-même, aucun SLA, aucune intégration agent clé en main.

Pour évaluer l'option open source sans engager un budget lourd, un VPS GPU suffit au prototypage : Hostinger en propose à partir de quelques euros par mois, de quoi monter un banc d'essai VoiceStudio avant de trancher. Mais soyons lucides : atteindre les 150 ms de Turbo en auto-hébergé exige une expertise d'infrastructure que peu d'équipes ont en interne.


Prix : le premium ElevenLabs à l'épreuve du coût réel

À 80 $ le million de caractères, Eleven v4 est le modèle le plus cher du trio de tête — près de 5x Gemini 3.8 Flash TTS. Ce premium se défend sur certains usages, pas sur tous :

Modèle Prix / 1M caractères (septembre 2026) Écart vs Eleven v4
Eleven v4 80 $ (vérifiez sur elevenlabs.io) —
Cartesia Sonic 3.6 49 $ (vérifiez sur cartesia.ai) −39 %
Gemini 3.8 Flash TTS 16,49 $ (vérifiez sur ai.google.dev) −79 %

Le coût horaire, seul indicateur qui compte vraiment

Un million de caractères correspond à peu près à 20 heures de voix parlée (estimation à 14 caractères/seconde, à recalculer sur votre débit réel). Eleven v4 revient donc à environ 4 $ l'heure de voix, contre ~2,45 $ pour Sonic 3.6 et ~0,80 $ pour Gemini 3.8 Flash TTS.

Deux facteurs atténuent pourtant l'écart. D'abord la robustesse de prononciation : moins de régénérations, donc un coût réel plus bas — chaque retake facturé double le prix du segment. Ensuite le débit de génération (73,4 caractères/s), qui réduit le temps machine sur les pipelines batch.

Mon verdict par cas d'usage : pour un audiobook ou une voix de marque, les 80 $ se justifient — la qualité d'interprétation économise des retouches qui coûtent plus cher en temps humain. Pour une boucle d'agent à forte volumétrie, l'écart se multiplie par le volume et Gemini 3.8 Flash TTS ou Sonic 3.6 deviennent le choix rationnel.

Google pousse d'ailleurs la logique du temps réel bon marché jusqu'au bout avec Gemini 3.8 Live, sa voix conversationnelle à 1,38 $ de l'heure — un positionnement qu'ElevenLabs ne contre pas frontalement, en assumant pleinement le premium qualité.

Côté offre commerciale, le lancement s'accompagne de générations gratuites pendant deux semaines pour les plans Creator+ dans ElevenCreative, et de crédits mensuels multipliés jusqu'à 2x. De quoi tester v4 sur votre propre corpus avant de sortir la carte bancaire.


Deux paliers, une stratégie : le pari le plus lucide du marché

La stratégie en deux paliers — un modèle qualité, un modèle latence — est, à mon sens, le choix le plus pragmatique du marché vocal actuel. Et je parie qu'elle devient la norme d'ici 2027.

Le marché s'est scindé en deux populations aux besoins incompatibles : les studios veulent de l'émotion et de la finesse, les développeurs d'agents veulent des millisecondes. Un modèle unique qui prétend servir les deux échoue forcément sur l'un des fronts — c'est exactement ce que montre la concurrence : Cartesia mise tout sur le temps réel, Google sépare déjà Flash TTS (pas cher) et Live (conversationnel).

L'intérêt de l'approche ElevenLabs, c'est le socle commun : même bibliothèque de voix, même pipeline de clonage, mêmes tags expressifs sur les deux paliers. Un studio qui produit une voix de marque avec v4 peut la déployer en agent avec Turbo sans refaire aucun travail amont.

Le risque existe : maintenir deux modèles, c'est accepter une possible divergence de qualité entre les deux lignes. Mais la co-optimisation de Turbo avec ElevenAgents montre que la latence a été traitée comme une contrainte de conception, pas comme un simple paramètre de déploiement.

Dernier avantage structurel : ElevenLabs reste modulaire — une couche TTS qui se branche sur le LLM de votre choix. À l'inverse, Gemini 3.8 Live regroupe voix et raisonnement dans un service unique. Pour une équipe qui a déjà arrêté sa stack LLM (GPT-5.5, Gemini 3.1 Pro...), la modularité pèse lourd dans la décision.


Intégration : une bascule à un paramètre, pas une réécriture

Côté intégration, la bascule entre les deux modèles se fait avec un seul paramètre — eleven_v4 ou eleven_v4_turbo comme model_id — sur les trois surfaces d'ElevenLabs : ElevenCreative pour la création, ElevenAgents pour les agents, ElevenAPI pour le développement. La documentation officielle des modèles détaille les IDs et les capacités de chacun.

Aucune réécriture de pipeline, aucun endpoint supplémentaire. C'est un détail qui compte : vous pouvez router intelligemment — Turbo pour les appels live, v4 pour la production de contenu — sans maintenir deux intégrations distinctes.

Ma recommandation de migration : ne basculez pas tout d'un coup. Dupliquez vos routes, envoyez 10 % du trafic sur Turbo, et mesurez trois métriques chez vos utilisateurs réels : le time-to-first-speech effectif, le taux d'interruptions (barge-in) et le taux d'abandon en début d'appel. C'est là que les 150 ms se convertissent en euros.

TestingCatalog confirme que Turbo cible précisément les appels en direct et les boucles d'agents — le positionnement produit est cohérent avec les benchmarks. Rien ne sert de payer du temps réel là où un pipeline batch suffit.


Agents vocaux et avatars : ce que ça change pour les développeurs

Avec Turbo à 150 ms, la synthèse vocale cesse d'être le goulot d'étranglement des agents vocaux. Le budget temporel se redistribue vers les trois autres maillons qui déterminent la fluidité perçue : la reconnaissance vocale, le raisonnement du LLM et l'exécution d'outils.

Pour monter une stack complète, il vous faut donc un bon moteur de transcription en amont — notre comparatif de la meilleure IA de reconnaissance vocale passe en revue les options du marché. Côté cerveau, un LLM agentique comme GPT-5.5 ou Gemini 3.1 Pro gère le raisonnement pendant que Turbo génère l'audio en continu.

Le front des avatars, en revanche, n'est pas celui où ElevenLabs joue. Google a ajouté à Gemini 3.8 Live une présence visuelle temps réel avec Live Avatar : voix et visage animé dans la même boucle conversationnelle. Pour un avatar parlant complet, Google a une longueur d'avance ; pour un agent purement vocal — téléphonie, support — Turbo est la référence latence du moment.

Plus largement, la course au temps réel dépasse la voix : AlayaWorld, premier world model open source à générer des mondes jouables en temps réel au-delà de 60 secondes, montre que toute la génération IA converge vers des sorties instantanées et continues. Turbo n'est pas un produit isolé : c'est un symptôme de marché.

Ma lecture d'ensemble : la voix synthétique se banalise techniquement, et la différenciation remonte la stack — orchestration, outils, mémoire conversationnelle. ElevenLabs l'a compris en ouvrant v4 et Turbo à ses trois surfaces dès le premier jour.


❌ Erreurs courantes

Erreur 1 : utiliser v4 pour un agent temps réel

Eleven v4 est optimisé pour la qualité, pas pour la latence : le mettre dans une boucle conversationnelle, c'est payer le premium sans bénéficier du temps réel. Solution : eleven_v4_turbo pour tout ce qui est live, v4 pour la production de contenu. La stratégie en deux paliers existe précisément pour ça.

Erreur 2 : comparer les prix sans compter les régénérations

Les pipelines TTS régénèrent — retakes, ponctuation ratée, émotions à refaire. À 80 $ contre 16,49 $ le million, un taux de régénération de 20 % creuse encore l'écart. Solution : budgétez avec un coefficient de retry mesuré sur votre corpus réel, jamais théorique.

Erreur 3 : cloner une voix sans droits ni consentement

Cloner une voix à partir de 10 secondes d'audio est désormais trivial — et juridiquement sensible : le droit à la voix s'applique et les plateformes exigent le consentement du locuteur. Solution : autorisation écrite systématique, et Professional Voice Clone pour un usage professionnel encadré.

Erreur 4 : croire le leaderboard à votre place

Un Elo de 1 319 sur une arène de votants ne garantit rien pour votre cas d'usage — le Controlled Voice le prouve, où Alibaba devance ElevenLabs. Solution : testez avec vos scripts, vos voix et vos auditeurs avant de migrer. Les benchmarks sont un filtre, pas un verdict.


❓ Questions fréquentes

Quelle différence entre Eleven v4 et Eleven v4 Turbo ?

v4 est le modèle le plus expressif, pensé pour la qualité studio ; Turbo est sa variante temps réel à ~100 ms de latence médiane, co-optimisée avec ElevenAgents. Turbo conserve les contrôles expressifs et le Professional Voice Clone pendant les appels. Même API, bascule via le paramètre model_id.

Combien coûte Eleven v4 ?

80 $ par million de caractères (septembre 2026, vérifiez sur elevenlabs.io). Le tarif de Turbo n'a pas été détaillé au lancement. Offre de lancement : générations gratuites pendant deux semaines et jusqu'à 2x les crédits mensuels pour les plans Creator+.

Eleven v4 gère-t-il bien le français ?

Oui. Le modèle couvre 90+ langues et affiche un record de 91,7 % en robustesse de prononciation (contre 85,6 % pour la v3). Il interprète les indications de jeu — rire, soupir, accent, colère — et peut faire parler une voix enregistrée en français dans une autre langue avec un accent natif.

Faut-il quitter ElevenLabs pour VoiceStudio ou Gemini 3.8 Flash TTS ?

Cela dépend de votre contrainte dominante : souveraineté des données ou très gros volumes → VoiceStudio en auto-hébergé ; budget avant tout → Gemini 3.8 Flash TTS à 16,49 $/1M ; qualité et agents temps réel → ElevenLabs. Dans la majorité des cas, aucune migration ne s'impose — testez avant de trancher.

Quelle latence faut-il pour une conversation vocale naturelle ?

Les travaux sur le tour de parole situent la pause humaine autour de 200 ms. Turbo, à 150 ms de time-to-first-speech, repasse sous ce seuil côté synthèse et laisse un budget pour la reconnaissance et le LLM. Au-delà de 300 ms cumulés, la conversation paraît artificielle.


✅ Conclusion

Eleven v4 consolide la domination qualité d'ElevenLabs et Turbo fait passer la synthèse vocale sous le seuil de la pause humaine — si vous construisez des agents vocaux, c'est le moment de refaire vos benchmarks, et l'offre de lancement (générations gratuites deux semaines, crédits x2 pour les plans Creator+) est le bon prétexte pour tester Eleven v4 dès maintenant.