
xAI lanzó Grok Voice Transcribe 2.0, su nuevo modelo de reconocimiento de voz, con una mejora de precisión que la compañía cifra en el doble respecto a la generación anterior. El sistema está diseñado para convertir conversaciones y grabaciones de audio en texto y ya puede utilizarse a través de la API de reconocimiento de voz de la compañía.
El modelo mantiene el precio de su antecesor: 0,10 dólares por hora de audio para las transcripciones por lotes y 0,20 dólares por hora para el procesamiento en tiempo real.
PUBLICIDAD
xAI también anunció que la nueva versión será próximamente el modelo predeterminado de su API, mientras que Grok Voice Transcribe 1.0 será retirado en las próximas semanas.

Un modelo entrenado para entornos reales
Grok Voice Transcribe 2.0 se basa en el modelo de audio que xAI utiliza para Grok Voice. La compañía asegura que esta tecnología ya procesa decenas de miles de llamadas de atención al cliente cada día, transcribe millones de horas de narraciones de vídeo y permite ejecutar agentes de voz en productos físicos, incluido el asistente Grok integrado en vehículos Tesla.
Para desarrollar la nueva versión, xAI utilizó grabaciones de audio en directo, con ruido de fondo y en diferentes idiomas y entornos. Posteriormente, aplicó procesos de postentrenamiento para mejorar el comportamiento del modelo en situaciones habituales de uso.
PUBLICIDAD
Según la compañía, Grok Voice Transcribe 2.0 ocupa el primer puesto en precisión entre 32 modelos de transmisión analizados en la clasificación pública de Artificial Analysis. En sus propias pruebas, xAI también comparó el sistema con modelos como Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3 y Whisper Large v3.

Las pruebas internas utilizaron cuatro tipos de audio: llamadas de atención al cliente, conversaciones con Grok, información hablada como códigos y direcciones de correo electrónico, y comandos de voz breves en distintos idiomas.
La mejora más importante está en los idiomas
xAI señala que el mayor avance frente a Grok Voice Transcribe 1.0 se encuentra en la transcripción multilingüe. El modelo puede trabajar con decenas de idiomas, detectar automáticamente cuál se está utilizando y seguir una conversación en la que el hablante cambia de idioma.
PUBLICIDAD
Esta capacidad resulta especialmente relevante para comandos cortos, donde existe poco contexto para identificar la lengua. En las pruebas de xAI con frases breves de asistentes de voz en 19 idiomas, la tasa de error de palabras pasó del 20,6 % en la versión anterior al 6,8 % con Grok Voice Transcribe 2.0.
Funciones para desarrolladores
La API permite utilizar el modelo tanto para archivos de audio previamente grabados como para transcripciones en tiempo real. Entre sus funciones se encuentran las marcas de tiempo y las puntuaciones de confianza a nivel de palabra, la identificación de diferentes hablantes y la transcripción de hasta ocho canales de audio.
PUBLICIDAD
También incorpora un sistema para priorizar términos específicos de un sector, con hasta 100 palabras o expresiones por solicitud. El modelo puede devolver correctamente escritos números, fechas, monedas, teléfonos y direcciones de correo electrónico, además de eliminar palabras de relleno.
Para los agentes de voz, xAI incluye una función de detección de turnos que permite determinar cuándo una persona ha terminado de hablar y el sistema puede responder.
La API admite 12 formatos de audio, archivos de hasta 500 MB y diferentes frecuencias de muestreo. También ofrece parámetros para trabajar con 25 idiomas.
Loom ya utiliza el nuevo modelo
Una de las primeras implementaciones destacadas está en Loom, la plataforma de grabación de pantalla de Atlassian. Según xAI, Atlassian comparó Grok Voice Transcribe 2.0 con su solución anterior y determinó que el nuevo modelo ofrecía una mayor precisión.
PUBLICIDAD
A partir de esa evaluación, Loom comenzó a utilizar Grok Voice Transcribe 2.0 para transcribir sus vídeos. Atlassian también destaca la posibilidad de combinar estas transcripciones con herramientas de programación como Cursor para convertir instrucciones habladas en código.
El modelo ya puede seleccionarse mediante las interfaces REST y WebSocket de xAI. Durante la transición, quienes necesiten continuar utilizando la versión anterior podrán especificar manualmente grok-voice-transcribe-1. Sin embargo, xAI prevé convertir Grok Voice Transcribe 2.0 en la opción predeterminada y retirar progresivamente la primera versión.
PUBLICIDAD
PUBLICIDAD
Últimas Noticias
Cuánto cuesta la criptomoneda Bitcoin este sábado
El bitcoin fue creado por Satoshi Nakamoto en el 2008 y lanzado al mercado oficialmente el 3 de enero de 2009 con “el bloque de génesis” de 50 monedas

Ethereum: cómo se ha movido en el mercado este sábado
Ethereum fue lanzada en 2015 por el programador Vitalik Buterin, con la intención de impulsar un instrumento para aplicaciones descentralizadas y colaborativas

Patriminio neto de Sam Altman en septiembre de 2026: el CEO no tiene acciones en OpenAI
La fortuna del CEO de OpenAI se estima en USD 3.500 millones. Altman dejó la Universidad de Stanford para fundar una empresa de mapas sociales
Batman Day 2026: las preguntas más populares del personaje de DC este 19 de septiembre
Los fanáticos también realzan consultas sobre otro querido personaje de este universo; Superman, cuyo día se celebra cada 18 de abril

Inversores cuestionan si Anthropic podrá sostener sus ingresos después de salir a bolsa
La presión de OpenAI y los modelos de IA más baratos podría reducir los precios y dificultar que Anthropic conserve sus ingresos




