Google sort Gemini 3.8 Live : le dialogue vocal passe en production
Google a annoncé le 15 septembre 2026 deux modèles de dialogue vocal en direct, disponibles immédiatement via son API. Derrière les scores record, un chiffre rappelle où en est vraiment l'agent vocal.

Le 15 septembre 2026, Google a annoncé deux modèles de dialogue vocal en direct : Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking. Ils sont accessibles dès l’annonce par l’API Gemini, et déjà branchés dans l’application Gemini, dans Google Workspace et dans Search. Précision qui a son importance : la seule source de cet article est le billet de Google lui-même. Tous les chiffres qui suivent sont ceux du fournisseur, aucun n’a été reproduit par un tiers indépendant.
Un modèle pour le volume, un modèle pour réfléchir
La séparation est nette. Gemini 3.8 Live est présenté comme conçu pour l’échelle et l’efficacité de coût : dialogue fluide, intelligence conversationnelle et ancrage visuel — comprenez que le modèle raisonne aussi sur ce qu’il voit pendant que vous lui parlez. Google le place deuxième du Speech Agent Arena, un classement établi sur la préférence des utilisateurs.
Gemini 3.8 Live Extended Thinking prend l’autre bout du problème : tâches à forte complexité et raisonnement en plusieurs étapes, avec ce que le billet décrit comme du raisonnement en quasi temps réel. C’est l’aveu implicite du format vocal : le temps de réflexion s’y entend. Trois secondes de calcul supplémentaires, à l’écrit c’est un indicateur de chargement, à l’oral c’est un blanc gênant.
Les scores, et ce qu’ils disent vraiment
Extended Thinking prend la première place du Speech to Speech Quality Index d’Artificial Analysis avec 82,6, et affiche 97,7 % sur Big Bench Audio. Jusqu’ici, la courbe monte bien.
Puis arrivent les deux chiffres qui parlent à quiconque a déjà tenté de mettre un agent vocal en production : 68,6 % de tâches menées à bout sur τ-Voice, et 35,1 % sur τ-Voice-banking, le jeu d’épreuves bancaires de Sierra. Google précise que ces deux résultats sont les meilleurs du marché sur l’exécution de tâches agentiques. Autrement dit : sur un scénario bancaire réaliste, le meilleur modèle de dialogue vocal du moment échoue à peu près deux fois sur trois. Le billet parle de briques pour des agents vocaux fiables et prêts pour la production ; il ne précise pas pour quelle production.
Ce que le speech-to-speech change dans votre code
L’intérêt technique ne se lit pas dans les classements. Un assistant vocal se construit traditionnellement en trois étages : transcription de la voix en texte, modèle de texte, puis synthèse vocale. Chaque étage ajoute sa latence, et les deux extrémités perdent en route ce que le texte ne transporte pas — l’hésitation, l’intonation, le fait que l’utilisateur vous coupe la parole. Un modèle qui entre et sort directement en audio supprime ces frontières, et avec elles une bonne partie du travail de plomberie que vous maintenez aujourd’hui.
Google annonce par ailleurs que ces modèles exécutent des tâches en arrière-plan, notamment des appels d’outils, sans interrompre la conversation en cours. Sur le papier, c’est la fin du silence embarrassé pendant qu’un agent interroge une API. Sur le papier seulement : le billet ne documente ni la latence mesurée, ni les conditions de test.
Un prix « très compétitif », et rien d’autre
Les deux modèles sont vendus sur leur rapport qualité-prix, face à ce que Google appelle les autres modèles de pointe — sans en nommer aucun, et sans donner le moindre tarif. Pour Gemini 3.8 Live, l’argument coût est même le premier de la fiche.
Un modèle dont l’argument principal est la fluidité de la conversation, et dont l’annonce s’arrête net dès qu’on parle d’argent : sur ce point au moins, le silence est parfaitement audible.
Sources (1)
Article rédigé avec l'assistance d'une IA à partir des sources citées, puis relu et validé avant publication par Sébastien Soulier.


