📑 Table des matières

Gemini 3.5 Transcribe : Google lance un moteur STT 85 langues a 2,6% WER, 70% plus rapide que Chirp 3 - et qui auto-nettoie les hesitations

Outils IA 🟢 Débutant ⏱️ 13 min de lecture 📅 2026-08-28

Gemini 3.5 Transcribe : Google lance un moteur STT 85 langues à 2,6% WER, 70% plus rapide que Chirp 3 — et qui auto-nettoie les hésitations

🔎 Pourquoi un modèle STT dédié change la donne

Le speech-to-text était jusqu'ici un problème qu'on résolvait avec des modèles généralistes bricolés pour la transcription. Whisper, Deepgram, Chirp 3 : tous font le travail, mais aucun n'a été conçu exclusivement pour transformer de la voix en texte propre.

Google vient de changer la donne avec Gemini 3.5 Transcribe, annoncé en public preview le 26 août 2026. Ce n'est pas un chatbot qui sait transcrire. C'est un modèle STT spécialisé, avec deux endpoints distincts (batch et streaming), qui atteint 2,6% de Word Error Rate en batch — un score qui rivalise avec l'humain sur certaines tâches.

Le détail qui fait mouche : il supprime automatiquement les tics de langage, hésitations et répétitions. Votre transcript sort propre, prêt à être publié ou analysé. Plus besoin de post-traitement.

Autre signal fort : Google retire progressivement generateContent comme interface par défaut pour les agents Gemini au profit de l'Interactions API. Gemini 3.5 Transcribe est l'un des premiers modèles à tirer pleinement parti de cette nouvelle architecture.


L'essentiel

  • Deux endpoints spécialisés : batch (Interactions API, 2,6% WER) et streaming live (4,0% WER), chacun optimisé pour son cas d'usage.
  • 85+ langues avec détection automatique et gestion du code-switching (changer de langue en cours de phrase).
  • Smart transcription : le modèle filtre les mots de remplissage ("euh", "en fait", "bah") et les répétitions — le texte final est directement exploitable.
  • Pricing agressif : ~0,005 $/minute en batch, free tier sur AI Studio.
  • Intégrations immédiates : LiveKit, Pipecat, Agora, Fishjam, Vercel AI Gateway. Déploiement Gboard, app Gemini macOS, et Chrome prochainement.
  • ** Successeur de Chirp 3**, 70% plus rapide sur le time-to-final-transcript. API uniquement, pas d'open weights.

Outils recommandés

Outil Usage principal Prix (août 2026, vérifiez sur ai.google.dev) Idéal pour
Gemini 3.5 Transcribe (batch) Transcription asynchrone 2 $ / 12 $ par 1M tokens (~0,005 $/min) Podcasts, réunions, interviews
Gemini 3.5 Transcribe (live) Transcription temps réel 3,50 $ / 21 $ par 1M tokens Appels live, sous-titres, voicebots
AI Studio Test gratuit Free tier inclus Prototypage rapide, POC
LiveKit Infrastructure audio live Variable Intégration voix temps réel
Vercel AI Gateway Routing et cache IA Variable Apps Next.js avec transcription

Deux endpoints, deux philosophies

Gemini 3.5 Transcribe ne propose pas un seul modèle avec un mode "fast" et un mode "precise". Google a conçu deux endpoints véritablement distincts, chacun avec sa propre optimisation.

Batch : la précision avant tout

L'endpoint batch utilise l'Interactions API de Google — la nouvelle interface par défaut pour les agents Gemini. Vous envoyez un fichier audio (jusqu'à 1 heure par requête), vous attendez, et vous recevez un transcript à 2,6% de WER.

Ce score de 2,6% WER en batch est mesuré par Google sur des benchmarks internes. Pour donner un ordre d'idée, Whisper Large v3 tourne autour de 5-7% de WER sur l'anglais conversationnel selon les benchmarks indépendants. On est dans un autre ordre de grandeur.

Le cas d'usage évident : les réunions enregistrées, les podcasts, les interviews. Tout ce qui n'est pas temps réel et où la qualité du transcript prime.

Streaming live : la réactivité sans compromis

L'endpoint live atteint 4,0% de WER en streaming. C'est logiquement moins bon qu'en batch — le modèle n'a pas le contexte complet de la phrase. Mais 4,0% en temps réel, c'est excellent.

L'avantage clé : le temps pour obtenir le transcript final est 70% plus rapide qu'avec Chirp 3, le modèle précédent de Google. Pour des sous-titres live ou des assistants vocaux, cette latence réduite fait toute la différence.


Smart transcription : le transcript qui se nettoie seul

C'est peut-être la feature la plus sous-estimée de l'annonce. Gemini 3.5 Transcribe intègre une "smart transcription" qui filtre automatiquement les éléments non pertinents.

Concrètement, le modèle identifie et retire les mots de remplissage ("euh", "hum", "quoi"), les hésitations ("je vais dire... enfin..."), et les répétitions involontaires. Le résultat ne contient que le propos structuré.

The Decoder, qui a analysé le modèle en détail, souligne que cette capacité d'auto-correction des balbutiements verbaux est intégrée nativement — pas ajoutée via un prompt ou un post-traitement séparé. C'est le modèle lui-même qui décide quoi garder et quoi retirer.

Pour les producteurs de contenu, les journalistes, les équipes juridiques : ça supprime un poste de travail entier. Plus besoin de relire le transcript brut pour le nettoyer avant publication ou analyse.


85 langues, code-switching et diarization

Détection automatique et code-switching

Le modèle gère 85+ langues avec détection automatique. Vous n'avez pas besoin de spécifier la langue en entrée — le modèle la détecte seul.

Plus intéressant : le code-switching natif. C'est-à-dire la capacité à transcrire correctement un locuteur qui change de langue en cours de phrase. Un Franco-Marocain qui alterne entre français et arabe dialectal, un Indien qui passe de l'hindi à l'anglais — le modèle suit sans broncher.

Pour les entreprises internationales et les marchés multilingues (Afrique, Inde, Asie du Sud-Est), c'est un atout majeur. Aucun des concurrents directs ne gère aussi bien ce scénario nativement.

Diarization : qui dit quoi ?

La diarization est disponible jusqu'à 3 speakers en version stable, et jusqu'à 8 speakers en mode expérimental. Chaque mot du transcript est associé à un identifiant de locuteur.

Couplée aux timestamps au niveau du mot (word-level timestamps), ça permet de reconstruire précisément la timeline d'une conversation : qui a parlé, quand, et exactement quoi.

Pour les outils de réunion intelligente, c'est le combo gagnant. Plus besoin d'un modèle de diarization séparé — tout est intégré dans un seul appel API.


Tarifs détaillés : Google attaque sur le prix

Le pricing de Gemini 3.5 Transcribe est structurellement agressif. Voici le tableau comparé (août 2026, vérifiez sur ai.google.dev) :

Endpoint Input (1M tokens) Output (1M tokens) Estimation par minute
Batch 2 $ 12 $ ~0,005 $
Streaming live 3,50 $ 21 $ ~0,009 $

MLQ.ai a calculé une estimation de coût blendé autour de 0,005 $/minute en batch. C'est extrêmement compétitif. Pour contextualiser : Deepgram facture généralement entre 0,004 $ et 0,012 $/minute selon le modèle et le volume. Whisper auto-hébergé coûte moins en tokens mais plus en infrastructure.

Le free tier sur AI Studio permet de tester sans carte bancaire. C'est un signal clair de la stratégie de Google : rendre l'adoption frictionless pour les développeurs.


Comparatif : Gemini 3.5 Transcribe vs Whisper vs Deepgram

OrcaRouter a publié une analyse comparative solide à la sortie du modèle. Voici une synthèse :

Critère Gemini 3.5 Transcribe Whisper Large v3 Deepgram Nova-2
WER batch (anglais) 2,6% ~5-7% ~3-5%
WER streaming 4,0% N/A (non natif) ~5-7%
Langues 85+ 99 30+
Code-switching Natif Partiel Limité
Smart transcription Oui (natif) Non Non
Diarization 3 (8 exp.) Via pipeline externe 3-5
Word-level timestamps Oui Oui Oui
Pricing (~/min) 0,005 $ (batch) Gratuit (auto-hébergé) 0,004-0,012 $
Latence live 70% plus rapide que Chirp 3 Non applicable Bonne
Open weights Non Oui Non

Whisper reste pertinent si vous avez des contraintes de souveraineté des données (on-premise) ou besoin de fine-tuning. Mais en SaaS pur, Gemini 3.5 Transcribe prend la tête sur presque tous les critères techniques.

Pour choisir entre les modèles LLM qui pourraient compléter ce workflow transcription, notre comparatif Gemini vs ChatGPT vs Claude reste la référence.


Intégrations : prêt à l'emploi, pas un jouet de labo

Un modèle STT puissant sans écosystème d'intégration, c'est un papier mort. Google a visiblement passé du temps côté partenariats avant la launch.

Frameworks voice AI

Gemini 3.5 Transcribe est déjà intégré avec :

  • LiveKit : infrastructure audio/video open source, très populaire dans la communauté voice AI
  • Pipecat : framework Python pour construire des pipelines vocaux multimodaux
  • Agora : SDK temps réel pour les appels audio
  • Fishjam : framework SFU pour les applications temps réel
  • Vercel AI Gateway : routing intelligent et cache pour les appels IA dans les apps Next.js

Ces intégrations signifient qu'un développeur peut brancher Gemini 3.5 Transcribe dans un voicebot en quelques lignes de code, sans gérer l'infrastructure audio sous-jacente.

Produits Google

Côté grand public, le modèle débarque déjà dans :

  • Gboard / Rambler sur Android : transcription vocale améliorée
  • App Gemini sur macOS : dictée et transcription
  • Chrome : intégration prévue à court terme pour la dictée vocale dans le navigateur

Cette distribution produit est un avantage compétitif massif. Deepgram et Whisper n'ont pas de canal de distribution grand public équivalent. Google peut tester et améliorer son modèle à l'échelle de milliards d'utilisateurs.


Cas d'usage concrets par secteur

Média et journalisme

Un journaliste enregistre une interview de 45 minutes en français avec des passages en arabe. Il envoie le fichier via l'API batch. En quelques minutes, il reçoit un transcript propre, sans hésitations, avec diarization et timestamps. Il peut directement copier-coller les citations dans son article.

La smart transcription économise facilement 30 à 45 minutes de nettoyage par heure d'audio. Pour une rédaction qui traite 10 interviews par jour, c'est un demi-poste de travail récupéré.

Réunions d'entreprise

Intégré via LiveKit ou Pipecat dans un outil de réunion, Gemini 3.5 Transcribe peut fournir des comptes-rendus en temps réel avec identification des intervenants. Le code-switching est précieux dans les entreprises multinationales où les équipes mélangent langues locales et anglais.

Voicebots et assistants vocaux

L'endpoint streaming à 4,0% WER avec une latence réduite de 70% par rapport à Chirp 3 est taillé pour les voicebots. Un assistant qui transcrit mal la requête vocale ne peut pas y répondre correctement — le STT est le maillon critique de la chaîne.

Pour les développeurs qui construisent des agents vocaux avec des LLM comme Gemini 3.1 Pro ou GPT-5.5 en backend, Gemini 3.5 Transcribe en entrée et un TTS en sortie forment un pipeline vocal complet.

Sous-titrage et accessibilité

Les word-level timestamps permettent un sous-titrage synchronisé au mot près. Pour le sous-titrage live (streaming, conférences, émissions), la latence réduite est un game-changer par rapport aux solutions précédentes.


Limites et points de vigilance

Pas d'open weights

Gemini 3.5 Transcribe est API uniquement. Vous ne pouvez pas le télécharger, le fine-tuner sur vos données, ni le déployer on-premise. Pour les organisations avec des contraintes de souveraineté des données (banque, défense, santé), c'est un bloqueur.

Dans ce cas, Whisper reste la seule option crédible en open source. Ou les APIs IA gratuites pour des cas moins sensibles.

1 heure maximum par requête

La limite d'1 heure par requête en batch est suffisante pour la plupart des cas, mais les longs enregistrements (conférences de 3 heures, auditions juridiques) nécessitent un découpage en segments. C'est un point à gérer dans votre pipeline.

Diarization expérimentale à 8 speakers

La diarization à 8 speakers est marked "experimental". Pour les tables rondes avec de nombreux intervenants, la version stable à 3 speakers peut être insuffisante. Il faudra tester en conditions réelles avant de compter dessus en production.

WER mesuré par Google

Les chiffres de WER (2,6% batch, 4,0% streaming) sont publiés par Google sur des benchmarks internes. Ils sont probablement fiables, mais un benchmark indépendant (comme le fait régulièrement l'équipe de HuggingFace pour Whisper) serait bienvenu pour confirmer.


Comment commencer : guide rapide

Étape 1 : AI Studio

Allez sur AI Studio (aistudio.google.com), créez un compte gratuit. Le free tier donne accès à Gemini 3.5 Transcribe sans carte bancaire. Uploadez un fichier audio de test, sélectionnez le modèle, lancez une transcription batch.

C'est la façon la plus rapide de juger par vous-même la qualité du smart transcription sur vos propres données.

Étape 2 : Appel API batch

Pour l'endpoint batch, vous utilisez l'Interactions API. Le flux est simple : authentification via clé API, envoi du fichier audio (jusqu'à 1 heure), attente du résultat, récupération du transcript avec diarization et timestamps.

La documentation officielle sur ai.google.dev/gemini-api/docs/models/gemini-3.5-transcribe couvre les paramètres : langue (optionnel, auto-détection par défaut), activation de la diarization, format de sortie.

Étape 3 : Intégration streaming

Pour le temps réel, le chemin le plus simple passe par un framework partenaire. LiveKit et Pipecat ont tous deux publié des exemples de code pour brancher Gemini 3.5 Transcribe en quelques minutes. Si vous utilisez déjà l'un de ces frameworks, c'est un changement de modèle, pas une réécriture.


❌ Erreurs courantes

Erreur 1 : Confondre STT spécialisé et LLM généraliste

Gemini 3.5 Transcribe ne répond pas aux questions. Il transcrit. Si vous voulez un agent qui écoute, transcrit, comprend et répond, vous devez chaîner Gemini 3.5 Transcribe (entrée) avec un LLM comme Gemini 3.1 Pro ou GPT-5.5 (raisonnement) et un TTS (sortie). Ce ne sont pas les mêmes modèles.

Erreur 2 : Utiliser le streaming pour des tâches batch

L'endpoint streaming coûte 75% plus cher que le batch (3,50 $ vs 2 $ par 1M tokens en input) et a un WER plus élevé (4,0% vs 2,6%). Si vous n'avez pas de contrainte de temps réel, utilisez toujours le batch.

Erreur 3 : Ignorer le code-switching dans vos tests

Beaucoup d'équipes testent le modèle sur de l'anglais pur et concluent que "c'est juste un bon STT". Le vrai différentiel se mesure sur des conversations multilingues avec alternance de langues. Testez avec vos données réelles, pas des échantillons Wikipedia.

Erreur 4 : Compter sur la diarization 8 speakers en production

C'est expérimental. Si votre use case dépend de la diarization au-delà de 3 speakers, attendez la version stable ou prévoyez un fallback.


❓ Questions fréquentes

Gemini 3.5 Transcribe remplace-t-il directement Chirp 3 ?

Oui, c'est son successeur officiel. Google indique un gain de 70% sur le time-to-final-transcript et une réduction significative du WER. Chirp 3 sera probablement déprécié progressivement.

Peut-on utiliser Gemini 3.5 Transcribe gratuitement ?

Oui, via le free tier d'AI Studio. Les limites exactes du free tier ne sont pas encore publiées en détail, mais Google permet de prototyper sans frais. Pour la production, le pricing par tokens s'applique.

Le modèle gère-t-il le français correctement ?

Oui, le français fait partie des 85+ langues supportées. Le code-switching franco-arabe, franco-anglais ou franco-allemand est géré nativement, ce qui est un atout pour les usages francophones internationaux.

Quelle différence avec un LLM qui transcrit ?

Un LLM généraliste (Gemini 3.1 Pro, GPT-5.5) peut transcrire de l'audio via un mode multimodal, mais c'est un effet de bord. Gemini 3.5 Transcribe est architecturé pour le STT : meilleurs WER, diarization native, word-level timestamps, smart transcription. Pour la transcription pure, c'est l'outil dédié.

Comment ça se compare aux outils IA pour le SEO ou le marketing ?

C'est un composant d'infrastructure, pas un outil final utilisateur. Mais les équipes qui utilisent des outils IA pour le SEO ou le marketing peuvent s'en servir pour transcrire des podcasts ou des webinaires avant de les recycler en contenu. De même pour les équipes réseaux sociaux qui transforment des lives en posts.


✅ Conclusion

Gemini 3.5 Transcribe est le meilleur modèle STT SaaS disponible en août 2026. Le combo 2,6% WER en batch, smart transcription native, code-switching sur 85 langues et pricing à 0,005 $/minute ne laisse aucune place au doute sur l'intention de Google : dominer le speech-to-text comme il domine la recherche.

Si vous construisez un voicebot, un outil de réunion ou un pipeline de contenu, testez-le dès aujourd'hui sur AI Studio. Et si vous cherchez les meilleurs outils IA pour le code pour intégrer ce modèle dans votre stack, on a ce qu'il faut.