
Google lanzó Gemini 3.5 Transcribe, su nueva solución de conversión de voz a texto. El sistema destaca por su capacidad para transcribir con precisión incluso en situaciones donde existen palabras difíciles, acentos regionales marcados o ruido de fondo.
La herramienta permite convertir cualquier audio en texto de manera precisa, pulida y formateada, adaptándose a contextos tan diversos como la generación de subtítulos en tiempo real, el análisis de llamadas o la creación de agentes de voz.
PUBLICIDAD
El modelo se integra en múltiples plataformas y aplicaciones de productos de Google, lo que amplía sus posibilidades de uso y lo convierte en una herramienta versátil para tareas empresariales y personales.

Cómo opera Gemini 3.5 Transcribe y qué la diferencia de otros sistemas
Gemini 3.5 Transcribe utiliza un enfoque avanzado que transforma directamente el audio sin procesar en texto, evitando los errores frecuentes de los sistemas tradicionales ante la presencia de ruido de fondo, acentos complejos o disfluencias.
PUBLICIDAD
El modelo ofrece una tasa de error promedio del 4,0% para transmisión en vivo y del 2,6% para audios grabados, cifras que lo posicionan como uno de los sistemas más precisos actualmente disponibles.
El sistema incorpora funciones de autocorrección y limpieza automática, eliminando palabras de relleno como “eh” o “ah”, y corrigiendo cambios de decisión dentro de una misma frase.
PUBLICIDAD
Además, el texto final se presenta ya formateado, lo que reduce el tiempo de edición y mejora la legibilidad para su uso en documentos, subtítulos o análisis posteriores.
Para qué situaciones es útil el nuevo modelo de Google
La versatilidad de Gemini 3.5 Transcribe permite adaptar su uso a distintos escenarios. La herramienta puede implementarse en la creación de agentes de voz para atención al cliente, sistemas de subtitulado en tiempo real para conferencias o retransmisiones y aplicaciones de dictado para la elaboración de documentos o correos mediante la voz.
PUBLICIDAD
La compatibilidad con más de 85 idiomas y la capacidad de reconocer acentos regionales y vocabulario especializado amplían su alcance en contextos internacionales y espacios profesionales específicos, como el sector médico, legal o tecnológico.
Asimismo, la función de identificación de hablantes facilita la transcripción de reuniones o entrevistas en las que participan varias personas, atribuyendo con precisión cada intervención.
PUBLICIDAD

Qué funciones de integración ofrece Gemini 3.5 Transcribe
Google ha puesto a disposición de los desarrolladores dos API principales para integrar el modelo en diferentes flujos de trabajo. La primera opción, “Live”, permite la transmisión continua y bidireccional con una latencia inferior a un segundo, ideal para aplicaciones de voz interactivas y asistentes virtuales.
La segunda, denominada “Interacciones”, está orientada al procesamiento de audio pregrabado, como reuniones, registros de llamadas o cualquier archivo de voz, e incluye atribución de hablantes y marcas de tiempo a nivel de palabra.
PUBLICIDAD
Ambas opciones facilitan la integración en aplicaciones empresariales y de consumo, permitiendo que empresas de diversos sectores puedan automatizar procesos y mejorar la accesibilidad de sus plataformas. Las API están disponibles a través de Google AI Studio y la plataforma Gemini Enterprise Agent.

Cómo mejora la experiencia del usuario en plataformas de Google
La incorporación de Gemini 3.5 Transcribe en productos como Gboard, Antigravity, la app Gemini y próximamente en Chrome, permite a los usuarios aprovechar la transcripción inteligente directamente en sus dispositivos y aplicaciones cotidianas.
PUBLICIDAD
En Gboard para Android, por ejemplo, la función Rambler convierte el habla en texto legible y corrige errores ortográficos o de estilo de forma automática. En Google Antigravity, la herramienta utiliza el contexto de la pantalla y el historial de chat para mejorar la precisión de la transcripción en documentos y nombres de archivos.
La integración en la app Gemini para macOS permite el uso de comandos de voz para gestionar tareas complejas, como resumir archivos, reutilizar texto o generar imágenes, todo de manera fluida y sin necesidad de intervención manual.
PUBLICIDAD
PUBLICIDAD
PUBLICIDAD
Últimas Noticias
Un robot humanoide supera el récord humano de salto en alto: casi alcanza los tres metros
El mismo dispositivo logró completar una carrera de 100 metros en 9,39 segundos

Probamos Marvel Tōkon: Fighting Souls y es el juego de peleas ideal para una noche con amigos
Este juego de PlayStation es desarrollado por Arc System Works, los mismos encargados de Dragon Ball FighterZ y Guilty Gear

IA en el quirófano: así fue la primera operación cerebral en vivo asistida por inteligencia artificial
El algoritmo, entrenado con cientos de grabaciones quirúrgicas, procesó imágenes en vivo desde un endoscopio y destacó zonas seguras y de riesgo en una segunda pantalla

¿Cómo funciona el mercado de criptomonedas y cuál es su valor este jueves 27 de agosto?
Estos han sido los movimientos de las criptomonedas en las últimas horas

Alerta para teléfonos Xiaomi: lista de cuáles podrán recibir la actualización HyperOS 4
La compañía ya tiene lista internamente la primera compilación estable de su nuevo sistema operativo basado en Android 17




