Gemini 3.5 Transcribe задает новый стандарт распознавания речи
Google представила Gemini 3.5 Transcribe — новую модель преобразования речи в текст, разработанную для более точного и естественного голосового взаимодействия. Она превращает устную речь в чистый, хорошо отформатированный текст, удаляет слова-паразиты, учитывает самоисправления и распознает специализированную терминологию. Разработчики уже могут тестировать модель в режиме предварительного доступа через Google AI Studio и Gemini Enterprise Agent Platform.
Новую модель можно использовать для голосовых агентов, субтитров в реальном времени и анализа звонков после их завершения. Для приложений, работающих в режиме прямой трансляции, аудио можно передавать через Live API с задержкой менее секунды. Interactions API поддерживает работу с записями, временными метками и идентификацией говорящих. Модель автоматически распознает более 85 языков и поддерживает пользовательские словари.
Gemini 3.5 Transcribe также демонстрирует значительный прирост точности. Согласно данным Artificial Analysis, показатель WER составляет 4,0% для потоковой обработки и 2,6% — для непотоковой обработки, а итоговая транскрипция формируется на 70% быстрее, чем с Chirp 3. Новая модель уверенно работает с зашумленным аудио и точно распознает такие данные, как коды и идентификаторы.
Gemini 3.5 Transcribe уже используется в продуктах Google, включая функцию Rambler для Gboard и Gemini для macOS. На Android она позволяет редактировать надиктованный текст с помощью голосовых команд — например, исправлять ошибки и менять стиль написания. Google также планирует добавить голосовой ввод в Chrome, чтобы пользователи могли диктовать текст непосредственно на веб-страницах.
