28.08.2026
92

Gemini 3.5 Transcribe marca un nuevo estándar en reconocimiento de voz

Yuliia Zablotska
Autora en ApiX-Drive
Tiempo de leer: ~1 min

Google ha presentado Gemini 3.5 Transcribe, un nuevo modelo de conversión de voz a texto diseñado para ofrecer interacciones por voz más precisas y naturales. Convierte el habla en texto limpio y bien estructurado, elimina las palabras de relleno, procesa las autocorrecciones y reconoce terminología especializada. Los desarrolladores ya pueden probarlo en versión preliminar a través de Google AI Studio y Gemini Enterprise Agent Platform.

El nuevo modelo puede utilizarse para agentes de voz, subtítulos en tiempo real y análisis posteriores a las llamadas. Para las aplicaciones en tiempo real, el audio puede transmitirse mediante la Live API con una latencia inferior a un segundo, mientras que la Interactions API permite trabajar con grabaciones, marcas de tiempo e identificación de hablantes. El modelo detecta automáticamente más de 85 idiomas y admite vocabularios personalizados.

Gemini 3.5 Transcribe también supone un avance significativo en precisión. Según Artificial Analysis, alcanza un WER del 4,0 % en la transmisión en tiempo real y del 2,6 % en el procesamiento sin streaming, mientras que las transcripciones finales se generan un 70 % más rápido que con Chirp 3. El nuevo modelo también funciona de forma fiable con audio ruidoso y reconoce con precisión datos como códigos e identificadores.

Gemini 3.5 Transcribe ya se utiliza en varios productos de Google, entre ellos Rambler para Gboard y Gemini para macOS. En Android, también permite editar por voz el texto dictado, por ejemplo, para corregir errores o cambiar el estilo de redacción. Google también tiene previsto incorporar la escritura por voz en Chrome, para que los usuarios puedan dictar texto directamente en las páginas web.