Google lanzó Gemini 3.5 Transcribe, su nueva solución de conversión de voz a texto. El sistema destaca por su capacidad para transcribir con precisión incluso en situaciones donde existen palabras difíciles, acentos regionales marcados o ruido de fondo.
La herramienta permite convertir cualquier audio en texto de manera precisa, pulida y formateada, adaptándose a contextos tan diversos como la generación de subtítulos en tiempo real, el análisis de llamadas o la creación de agentes de voz.
El modelo se integra en múltiples plataformas y aplicaciones de productos de Google, lo que amplía sus posibilidades de uso y lo convierte en una herramienta versátil para tareas empresariales y personales.
PUBLICIDAD
Cómo opera Gemini 3.5 Transcribe y qué la diferencia de otros sistemas
Gemini 3.5 Transcribe utiliza un enfoque avanzado que transforma directamente el audio sin procesar en texto, evitando los errores frecuentes de los sistemas tradicionales ante la presencia de ruido de fondo, acentos complejos o disfluencias.
El modelo ofrece una tasa de error promedio del 4,0% para transmisión en vivo y del 2,6% para audios grabados, cifras que lo posicionan como uno de los sistemas más precisos actualmente disponibles.
El sistema incorpora funciones de autocorrección y limpieza automática, eliminando palabras de relleno como “eh” o “ah”, y corrigiendo cambios de decisión dentro de una misma frase.
PUBLICIDAD
Además, el texto final se presenta ya formateado, lo que reduce el tiempo de edición y mejora la legibilidad para su uso en documentos, subtítulos o análisis posteriores.
Para qué situaciones es útil el nuevo modelo de Google
La versatilidad de Gemini 3.5 Transcribe permite adaptar su uso a distintos escenarios. La herramienta puede implementarse en la creación de agentes de voz para atención al cliente, sistemas de subtitulado en tiempo real para conferencias o retransmisiones y aplicaciones de dictado para la elaboración de documentos o correos mediante la voz.
La compatibilidad con más de 85 idiomas y la capacidad de reconocer acentos regionales y vocabulario especializado amplían su alcance en contextos internacionales y espacios profesionales específicos, como el sector médico, legal o tecnológico.
PUBLICIDAD
Asimismo, la función de identificación de hablantes facilita la transcripción de reuniones o entrevistas en las que participan varias personas, atribuyendo con precisión cada intervención.
Qué funciones de integración ofrece Gemini 3.5 Transcribe
Google ha puesto a disposición de los desarrolladores dos API principales para integrar el modelo en diferentes flujos de trabajo. La primera opción, “Live”, permite la transmisión continua y bidireccional con una latencia inferior a un segundo, ideal para aplicaciones de voz interactivas y asistentes virtuales.
La segunda, denominada “Interacciones”, está orientada al procesamiento de audio pregrabado, como reuniones, registros de llamadas o cualquier archivo de voz, e incluye atribución de hablantes y marcas de tiempo a nivel de palabra.
PUBLICIDAD
Ambas opciones facilitan la integración en aplicaciones empresariales y de consumo, permitiendo que empresas de diversos sectores puedan automatizar procesos y mejorar la accesibilidad de sus plataformas. Las API están disponibles a través de Google AI Studio y la plataforma Gemini Enterprise Agent.
Cómo mejora la experiencia del usuario en plataformas de Google
La incorporación de Gemini 3.5 Transcribe en productos como Gboard, Antigravity, la app Gemini y próximamente en Chrome, permite a los usuarios aprovechar la transcripción inteligente directamente en sus dispositivos y aplicaciones cotidianas.
En Gboard para Android, por ejemplo, la función Rambler convierte el habla en texto legible y corrige errores ortográficos o de estilo de forma automática. En Google Antigravity, la herramienta utiliza el contexto de la pantalla y el historial de chat para mejorar la precisión de la transcripción en documentos y nombres de archivos.
PUBLICIDAD
La integración en la app Gemini para macOS permite el uso de comandos de voz para gestionar tareas complejas, como resumir archivos, reutilizar texto o generar imágenes, todo de manera fluida y sin necesidad de intervención manual.
PUBLICIDAD