Gemini 3.5 Transcribe — новий стандарт розпізнавання мовлення
Google представила Gemini 3.5 Transcribe — нову модель перетворення мовлення на текст, створену для більш точних і природних голосових взаємодій. Вона перетворює усне мовлення на чистий, добре відформатований текст, прибирає слова-паразити, враховує самовиправлення та розпізнає спеціалізовану термінологію. Розробники вже можуть тестувати її у режимі попереднього перегляду через Google AI Studio та Gemini Enterprise Agent Platform.
Нова модель може використовуватися для голосових агентів, субтитрів у реальному часі та аналізу дзвінків після їх завершення. Для застосунків, що працюють наживо, аудіо можна передавати через Live API із затримкою менше секунди. Interactions API підтримує роботу із записами, часовими мітками та визначенням мовців. Модель автоматично розпізнає понад 85 мов і підтримує користувацькі словники.
Точність Gemini 3.5 Transcribe також демонструє значний прогрес. За даними Artificial Analysis, WER становить 4,0% для потокового режиму та 2,6% — для непотокового режиму, а фінальна транскрипція формується на 70% швидше, ніж у Chirp 3. Нова модель ефективно працює із зашумленим аудіо і точно розпізнає такі дані, як коди й ідентифікатори.
Gemini 3.5 Transcribe вже використовується в продуктах Google, зокрема у функції Rambler для Gboard та Gemini для macOS. На Android вона дає змогу редагувати продиктований текст за допомогою голосу — наприклад, виправляти помилки та змінювати стиль написання. Google також планує додати голосове введення в Chrome, щоб користувачі могли диктувати текст безпосередньо на вебсторінках.
