Meta lanza una IA que transcribe audios con más de 20 voces: incluye español
Transcribir un audio con un par de voces es sencillo, el verdadero reto es cuando hay más de unas 20 personas hablando.
En este contexto, Meta presentó Muse Voice Transcribe , el primer modelo de percepción de audio en tiempo real desarrollado por Meta Superintelligence Labs.
El modelo de inteligencia artificial transcribe las palabras mientras una persona habla, identifica quién dijo qué entre más de 20 hablantes y detecta cuándo termina una intervención.
Estas funciones, que habitualmente requieren sistemas separados, se integran en una sola herramienta.
Está entrenado en más de 70 idiomas y, para este lanzamiento, Meta validó 25.
También reconoce los cambios de idioma dentro de una misma frase.
Entre los idiomas validados para la versión inicial se encuentran el chino, francés, hindi, japonés, español y vietnamita.
El modelo está disponible para desarrolladores a través de la Meta Model API , con un precio de USD 3 por cada 1.000 minutos de audio, equivalente a USD 0,18 por hora.
Además, ya impulsa el dictado por voz en Meta AI y Muse Code.
Este nuevo modelo también se encuentra disponible en la aplicación de Meta AI para Mac.
Qué capacidades tiene la nueva IA de transcripción de Meta Muse Voice Transcribe reconoce cambios de idioma dentro de una misma oración o entre frases consecutivas.
Esta capacidad permite transcribir conversaciones bilingües en las que los hablantes alternan idiomas de forma natural.
El modelo también utiliza sesgos de contexto para mejorar la precisión del reconocimiento.
Esa función le permite considerar palabras clave o referencias específicas durante la transcripción.
5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en www.infobae.com — el contenido pertenece a Infobae (Tecno).