Historia
agosto 26, 2026

La nueva dictado más limpio de Google plantea una gran pregunta: ¿realmente dijiste eso?

Google está implementando Gemini 3.5 Transcribe en productos selectos y herramientas para desarrolladores, prometiendo una entrada de voz más rápida y multilingüe. Su capacidad para pulir el habla mientras transcribe también pone la precisión y la intención del usuario bajo un escrutinio más estricto.

El último impulso de Google en el reconocimiento de voz a texto promete hacer que la entrada por voz sea menos desordenada, más rápida y más útil. Pero el mismo sistema que elimina el ruido verbal también puede remodelar lo que una persona realmente dijo.

El despliegue comenzó con Gemini 3.5 Transcribe, un nuevo modelo que, según Google, mejora su motor de transcripción Chirp 3. Puede reconocer más de 85 idiomas, adaptarse a vocabulario personalizado, identificar hasta tres interlocutores en audio grabado y dar formato automáticamente al texto mientras elimina muletillas como “eh” y “este”. Google lo llama una herramienta que permite a los usuarios “editar de forma natural solo con tu voz”.

El día del lanzamiento, la propuesta de la compañía se dirigía directamente tanto a desarrolladores como a usuarios cotidianos de dictado. Sundar Pichai dijo que el modelo podría ayudar a crear aplicaciones que entiendan “user speech / intent, even w/ multiple speakers”, destacando la detección de idioma y el soporte para jerga especializada. El modelo está disponible a través de la API de Gemini, AI Studio y Antigravity, mientras que la app Gemini en macOS y la función Rambler de Gboard en el Pixel 11 se encuentran entre sus primeros destinos orientados al consumidor.

Las afirmaciones de rendimiento de Google son importantes: afirma que el trayecto desde el habla hasta la transcripción final es aproximadamente un 70% más rápido y sitúa su tasa de error en habla en vivo en el 5,5%, frente al 7,32% de Chirp 3. Está prevista una integración con Chrome “pronto”, lo que podría extender la función a campos de texto en toda la web.

Sin embargo, el atractivo de una transcripción pulida es también su trampa. Eliminar los tropiezos y gestionar las correcciones habladas puede producir una prosa más limpia, pero significa que la IA hace algo más que oír palabras: está interpretando la intención. Un relato de las primeras pruebas la encontró eficaz en pasajes cortos, aunque advirtió que “técnicamente sí cambia el modo en que expresaste lo que dijiste”.

También hubo un breve contratiempo en el mensaje más amplio de Google sobre Gemini Audio: tras ofrecer inicialmente información sobre las actualizaciones de Gemini 3.5 Live y 3.5 Live Experimental, la compañía dijo a The Verge que solo se estaba anunciando Transcribe, sin ofrecer una nueva fecha para los otros modelos.