Transcribir un audio con un par de voces es sencillo, el verdadero reto es cuando hay más de unas 20 personas hablando. En este contexto, Meta presentó Muse Voice Transcribe, el primer modelo de percepción de audio en tiempo real desarrollado por Meta Superintelligence Labs.
El modelo de inteligencia artificial transcribe las palabras mientras una persona habla, identifica quién dijo qué entre más de 20 hablantes y detecta cuándo termina una intervención.
PUBLICIDAD
Estas funciones, que habitualmente requieren sistemas separados, se integran en una sola herramienta. Está entrenado en más de 70 idiomas y, para este lanzamiento, Meta validó 25. También reconoce los cambios de idioma dentro de una misma frase.

Entre los idiomas validados para la versión inicial se encuentran el chino, francés, hindi, japonés, español y vietnamita.
El modelo está disponible para desarrolladores a través de la Meta Model API, con un precio de USD 3 por cada 1.000 minutos de audio, equivalente a USD 0,18 por hora. Además, ya impulsa el dictado por voz en Meta AI y Muse Code.
PUBLICIDAD
Este nuevo modelo también se encuentra disponible en la aplicación de Meta AI para Mac.
Qué capacidades tiene la nueva IA de transcripción de Meta
Muse Voice Transcribe reconoce cambios de idioma dentro de una misma oración o entre frases consecutivas. Esta capacidad permite transcribir conversaciones bilingües en las que los hablantes alternan idiomas de forma natural.
PUBLICIDAD
El modelo también utiliza sesgos de contexto para mejorar la precisión del reconocimiento. Esa función le permite considerar palabras clave o referencias específicas durante la transcripción.
Muse Voice Transcribe admite entradas de audio de más de una hora e identifica intervenciones de más de 20 hablantes sin requerir procesamiento posterior. Esta capacidad apunta a conversaciones extensas con múltiples participantes.
PUBLICIDAD

El modelo fue entrenado en más de 70 idiomas, de los cuales Meta validó 25 de forma exhaustiva para el lanzamiento inicial. La compañía recomienda utilizar esas 25 lenguas, aunque informó que también hay soporte disponible para idiomas adicionales.
Entre los idiomas validados se encuentran el chino, francés, hindi, japonés, español y vietnamita.
Según el ranking de streaming speech-to-text de Artificial Analysis, Muse Voice Transcribe ocupó el primer lugar.

La compañía también indicó que el modelo obtuvo una tasa de error de palabras del 3,1% en la transcripción final y una tasa media de error de diarización del 17,5% en pruebas públicas.
PUBLICIDAD
A diferencia de los modelos que funcionan con una configuración fija de velocidad o precisión, Muse Voice Transcribe decide palabra por palabra cuánto tiempo necesita escuchar antes de transcribir. Ese mecanismo, denominado demora adaptativa, busca mantener la velocidad sin sacrificar precisión en las palabras más difíciles.
Cómo empezar a usar Muse Voice Transcribe de Meta
Para comenzar a usar Muse Voice Transcribe de Meta, los desarrolladores pueden acceder al modelo a través de la Meta Model API.
La herramienta permite integrar transcripción de voz en tiempo real, identificación de participantes y detección del final de cada intervención en aplicaciones propias.
El servicio tiene un precio de USD 3 por cada 1.000 minutos de audio, equivalente a USD 0,18 por hora. Muse Voice Transcribe admite audios de más de una hora, reconoce a más de 20 hablantes y fue entrenado en más de 70 idiomas.
PUBLICIDAD
La familia de modelos de IA de Meta Muse
Muse es la familia de modelos y plataforma de inteligencia artificial desarrollada por los Meta Superintelligence Labs (MSL). Además de su variante para transcripción de voz, existen:

- Muse Spark: El modelo principal de razonamiento multimodal y agéntico de Meta, diseñado con una ventana de contexto de un millón de tokens y capacidades multitarea avanzadas.
- Muse Glimmer: Un modelo de pesos abiertos más ligero de 30 mil millones de parámetros, optimizado para ejecutarse de manera local en computadoras y dispositivos de consumo.
- Muse Image: El primer modelo de generación y edición de imágenes de Meta integrado en plataformas como Meta AI, Instagram y WhatsApp.
PUBLICIDAD
PUBLICIDAD
Últimas Noticias
No vuelvas a perder tu pasaporte: Android lanza función para recordar dónde dejas objetos importantes
Esta nueva herramienta se encontrará disponible en dispositivos Android 16+ y se vinculará con Gemini y Find Hub
La IA necesita más electricidad y centros de datos: el pedido de Mark Zuckerberg y Elon Musk ante ministros del G20
Su argumento se apoya en la construcción de instalaciones que requieren técnicos, redes de alta capacidad, sistemas de refrigeración, chips, permisos locales y terrenos adecuados para operar

Taxis autónomos en Colombia: qué falta para que circulen por las calles del país
El gerente general de Yango, advierte que antes de incorporar vehículos sin conductor deben definirse responsabilidades, seguros, controles técnicos y protocolos para responder ante incidentes durante los recorridos

Cómo se verían Los Saja Boys de Las Guerreras K-pop como Power Rangers
Los antagonistas de la película de Netflix se pueden adaptar a diferentes animaciones a través de aplicaciones seguras

Anthropic refuerza su apuesta por la IA con Fable 5.1 para código y Mythos 5.1 para investigación científica
Anthropic promete mayor eficiencia y menores costes con sus nuevos modelos, mientras limita el acceso a las funciones más sensibles de Mythos 5.1



