Google lanzó Gemini 3.5 Transcribe: pasa más de 85 idiomas a texto entendiendo palabras difíciles y acentos
Google lanzó Gemini 3.5 Transcribe , su nueva solución de conversión de voz a texto.
El sistema destaca por su capacidad para transcribir con precisión incluso en situaciones donde existen palabras difíciles, acentos regionales marcados o ruido de fondo.
La herramienta permite convertir cualquier audio en texto de manera precisa, pulida y formateada, adaptándose a contextos tan diversos como la generación de subtítulos en tiempo real, el análisis de llamadas o la creación de agentes de voz.
El modelo se integra en múltiples plataformas y aplicaciones de productos de Google , lo que amplía sus posibilidades de uso y lo convierte en una herramienta versátil para tareas empresariales y personales.
Cómo opera Gemini 3.5 Transcribe y qué la diferencia de otros sistemas Gemini 3.5 Transcribe utiliza un enfoque avanzado que transforma directamente el audio sin procesar en texto , evitando los errores frecuentes de los sistemas tradicionales ante la presencia de ruido de fondo, acentos complejos o disfluencias.
El modelo ofrece una tasa de error promedio del 4,0% para transmisión en vivo y del 2,6% para audios grabados , cifras que lo posicionan como uno de los sistemas más precisos actualmente disponibles.
El sistema incorpora funciones de autocorrección y limpieza automática, eliminando palabras de relleno como “eh” o “ah”, y corrigiendo cambios de decisión dentro de una misma frase.
Además, el texto final se presenta ya formateado, lo que reduce el tiempo de edición y mejora la legibilidad para su uso en documentos, subtítulos o análisis posteriores.
Para qué situaciones es útil el nuevo modelo de Google La versatilidad de Gemini 3.5 Transcribe permite adaptar su uso a distintos escenarios.
La herramienta puede implementarse en la creación de agentes de voz para atención al cliente, sistemas de subtitulado en tiempo real para conferencias o retransmisiones y aplicaciones de dictado para la elaboración de documentos o correos mediante la voz.
La compatibilidad con más de 85 idiomas y la capacidad de reconocer acentos regionales y vocabulario especializado amplían su alcance en contextos internacionales y espacios profesionales específicos, como el sector médico, legal o tecnológico.
Asimismo, la función de identificación de hablantes facilita la transcripción de reuniones o entrevistas en las que participan varias personas , atribuyendo con precisión cada intervención.
Qué funciones de integración ofrece Gemini 3.5 Transcribe Google ha puesto a disposición de los desarrolladores dos API principales para integrar el modelo en diferentes flujos de trabajo.
La primera opción, “Live”, permite la transmisión continua y bidireccional con una latencia inferior a un segundo, ideal para aplicaciones de voz interactivas y asistentes virtuales.
5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en www.infobae.com — el contenido pertenece a Infobae Tecno.