Histoire
août 26, 2026
La dictée plus propre de Google pose une grande question : l’avez‑vous vraiment dit ?
Google déploie Gemini 3.5 Transcribe dans une sélection de produits et d’outils pour développeurs, promettant une saisie vocale plus rapide et multilingue. Sa capacité à polir la parole au fil de la transcription place aussi l’exactitude et l’intention de l’utilisateur sous un examen plus attentif.
La dernière offensive de Google dans la reconnaissance vocale promet de rendre la saisie par la voix moins brouillonne, plus rapide et plus utile. Mais le même système qui supprime le bruit verbal peut aussi remodeler ce qu’un locuteur a réellement dit.
Le déploiement a commencé avec Gemini 3.5 Transcribe, un nouveau modèle qui, selon Google, améliore son moteur de transcription Chirp 3. Il peut reconnaître plus de 85 langues, s’adapter à un vocabulaire personnalisé, identifier jusqu’à trois intervenants dans un enregistrement audio et mettre automatiquement le texte en forme tout en supprimant les hésitations comme « euh » et « heu ». Google le présente comme un outil qui permet aux utilisateurs de « modifier naturellement avec uniquement votre voix ».1
Le jour du lancement, l’argumentaire de la société visait autant les développeurs que les utilisateurs de dictée au quotidien. Sundar Pichai a indiqué que le modèle pouvait aider à créer des applications qui comprennent « la parole / l’intention de l’utilisateur, même avec plusieurs intervenants », en mettant en avant la détection de la langue et la prise en charge d’un jargon spécialisé.
2 Le modèle est disponible via l’API Gemini, AI Studio et Antigravity, tandis que l’application Gemini sur macOS et la fonctionnalité Gboard Rambler du Pixel 11 comptent parmi ses premiers ancrages grand public.3
Les promesses de performance de Google sont substantielles : l’entreprise affirme que le passage de la parole à la transcription finale est environ 70 % plus rapide, et situe son taux d’erreur sur la parole en direct à 5,5 %, contre 7,32 % pour Chirp 3.3 Une intégration à Chrome est prévue « bientôt », ce qui pourrait étendre la fonctionnalité aux champs de texte sur l’ensemble du web.
Pourtant, l’attrait d’une transcription polie constitue aussi son piège. Supprimer les hésitations et gérer les corrections orales peut produire une prose plus nette, mais cela signifie que l’IA fait plus qu’entendre des mots : elle interprète l’intention. Un compte rendu de tests préliminaires l’a jugée efficace sur de courts passages, tout en avertissant qu’elle « modifie techniquement la formulation de ce que vous avez dit ».3
Il y a également eu un léger accroc dans la communication plus large de Google sur Gemini Audio : après avoir fourni dans un premier temps des informations sur les mises à jour Gemini 3.5 Live et 3.5 Live Experimental, la société a indiqué à The Verge que seule Transcribe était annoncée, sans donner de nouvelle date pour les autres modèles.1