Google lanza Gemini Omni 1.1 Flash: crea vídeos de hasta 40 segundos y con resolución en 4K
Google presentó Gemini Omni 1.1 Flash , una nueva versión de su modelo de inteligencia artificial para la generación de vídeo que amplía la duración de las escenas y mejora el control sobre el resultado final.
La actualización permite crear secuencias de hasta 40 segundos mediante la extensión progresiva de fragmentos, incorporar fotogramas clave para definir el inicio y el final de una toma y escalar el contenido hasta resolución 4K .
La novedad apunta a uno de los principales problemas que enfrentan los modelos de vídeo generativo: mantener la coherencia visual cuando una escena se prolonga durante varios segundos.
Con Gemini Omni 1.1 Flash, Google amplía la cantidad de información que el sistema puede analizar del vídeo anterior , lo que debería permitir conservar con mayor precisión elementos como la iluminación, los movimientos, la física de la escena y la apariencia de los personajes.
Más memoria para mantener la coherencia de una escena Uno de los cambios más importantes de Gemini Omni 1.1 Flash está relacionado con la memoria visual del modelo.
Según la información disponible, la nueva versión puede tomar como referencia hasta los diez segundos previos del vídeo original , frente al aproximadamente un segundo que procesaba la versión anterior.
Esta diferencia resulta relevante al extender una escena.
En los modelos de vídeo con IA, una continuación puede cambiar repentinamente la posición de un objeto, la dirección de la luz o incluso los rasgos de un personaje cuando el sistema no dispone de suficiente contexto sobre lo que ocurrió previamente.
Al analizar una ventana temporal más amplia, Gemini Omni 1.1 Flash puede utilizar más información para construir el siguiente fragmento .
El objetivo es evitar que cada nueva sección del vídeo parezca una escena completamente independiente y conseguir transiciones más naturales.
Los vídeos se generan en bloques de diez segundos Aunque el modelo puede alcanzar una duración total de hasta 40 segundos, no genera toda la secuencia en una sola operación .
El sistema construye el vídeo en bloques de diez segundos que se van encadenando progresivamente.
Cada nuevo segmento utiliza como referencia el material anterior, lo que permite revisar el resultado antes de continuar con la generación.
Este sistema también ofrece una ventaja para los creadores: si un fragmento presenta un error o no responde a lo esperado, es posible corregirlo antes de avanzar y evitar que el problema afecte a toda la secuencia.
5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en www.infobae.com — el contenido pertenece a Infobae Tecno.