História
agosto 26, 2026

Ditado mais limpo do Google traz uma grande questão: você disse isso mesmo?

O Google está lançando o Gemini 3.5 Transcribe em produtos selecionados e ferramentas para desenvolvedores, prometendo entrada de voz mais rápida e multilíngue. Sua capacidade de lapidar a fala enquanto a transcreve também coloca precisão e intenção do usuário sob um escrutínio mais rigoroso.

A mais recente investida do Google em reconhecimento de fala promete tornar a entrada de voz menos confusa, mais rápida e mais útil. Mas o mesmo sistema que remove a desordem verbal também pode remodelar o que o interlocutor realmente disse.

A implementação começou com o Gemini 3.5 Transcribe, um novo modelo que o Google diz ser uma melhoria em relação ao seu mecanismo de transcrição Chirp 3. Ele consegue reconhecer mais de 85 idiomas, adaptar-se a vocabulário personalizado, identificar até três interlocutores em áudio gravado e formatar automaticamente o texto enquanto remove muletas verbais como “ééé” e “ãhn”. O Google o descreve como uma ferramenta que permite aos usuários “editar naturalmente apenas com a voz.”

No dia do lançamento, a apresentação da empresa mirava diretamente tanto em desenvolvedores quanto em usuários comuns de ditado. Sundar Pichai disse que o modelo pode ajudar a criar apps que entendem “user speech / intent, even w/ multiple speakers”, destacando a detecção de idioma e o suporte a jargões especializados. O modelo está disponível por meio da Gemini API, do AI Studio e do Antigravity, enquanto o app Gemini no macOS e o recurso Rambler do Gboard no Pixel 11 estão entre seus primeiros destinos voltados ao consumidor.

As promessas de desempenho do Google são significativas: a empresa afirma que o caminho da fala até a transcrição final é cerca de 70% mais rápido e coloca sua taxa de erro em fala ao vivo em 5,5%, abaixo dos 7,32% do Chirp 3. A integração com o Chrome está planejada “em breve”, o que pode levar o recurso a campos de texto em toda a web.

Ainda assim, o atrativo de uma transcrição polida é também a sua armadilha. Remover hesitações e lidar com correções faladas pode produzir um texto mais limpo, mas isso significa que a IA está fazendo mais do que ouvir palavras — ela está interpretando a intenção. Um relato de testes iniciais considerou o sistema eficaz em trechos curtos, ao mesmo tempo em que alertou que ele “does technically change the wording of what you said.”

Houve também um breve contratempo na comunicação mais ampla do Google sobre o Gemini Audio: depois de inicialmente fornecer informações sobre as atualizações do Gemini 3.5 Live e 3.5 Live Experimental, a empresa disse ao The Verge que apenas o Transcribe estava sendo anunciado, sem oferecer uma nova data para os outros modelos.