История
август 26, 2026

Более «чистая» диктовка Google ставит один большой вопрос: вы *действительно* это сказали?

Google запускает Gemini 3.5 Transcribe в отдельных продуктах и инструментах для разработчиков, обещая более быстрый, многоязычный голосовой ввод. Его способность «полировать» речь по ходу транскрипции также ставит под более пристальный контроль точность и соответствие пользовательскому намерению.

Последняя инициатива Google в области распознавания речи обещает сделать голосовой ввод менее хаотичным, более быстрым и полезным. Но та же система, которая убирает словесный мусор, может и изменить то, что говорящий на самом деле произнёс.

Развёртывание началось с Gemini 3.5 Transcribe, новой модели, которая, по словам Google, улучшает движок транскрипции Chirp 3. Она может распознавать более 85 языков, адаптироваться к пользовательскому словарю, определять до трёх говорящих в записанном аудио и автоматически форматировать текст, убирая слова-паразиты вроде «э-э» и «ну». Google называет её инструментом, который позволяет пользователям «редактировать естественно, используя только голос».

В день запуска презентация компании была нацелена как на разработчиков, так и на обычных пользователей диктовки. Сундар Пичаи сказал, что модель может помочь создавать приложения, которые понимают «речь / намерения пользователя, даже при нескольких говорящих», подчеркнув возможности определения языка и поддержки специализированного жаргона. Модель доступна через Gemini API, AI Studio и Antigravity, а приложение Gemini на macOS и функция Gboard Rambler в Pixel 11 — среди её первых пользовательских «домов».

Заявления Google о производительности значительны: компания утверждает, что путь от речи до готовой транскрипции стал примерно на 70% быстрее, а уровень ошибок при распознавании живой речи составляет 5,5% против 7,32% у Chirp 3. Интеграция с Chrome запланирована «вскоре», что потенциально распространит функцию на поля ввода текста по всему вебу.

Однако привлекательность «отполированной» транскрипции одновременно является её уязвимостью. Удаление запинок и обработка устных исправлений могут давать более аккуратный текст, но это значит, что ИИ делает не только распознавание слов — он интерпретирует намерения. В одном из первых отчётов о тестировании говорится, что модель хорошо работает на коротких отрывках, при этом делается предупреждение, что она «технически изменяет формулировку того, что вы сказали».

Возникла и небольшая заминка в более широкой коммуникации Google о Gemini Audio: после того как компания сначала предоставила информацию об обновлениях Gemini 3.5 Live и 3.5 Live Experimental, она сообщила The Verge, что объявляется только Transcribe, не назвав новой даты для остальных моделей.