Segun MarkTechPost (AI/ML News), Google ha presentado una actualización clave de su modelo multimodal de generación de video, Gemini Omni 1.1 Flash. Esta versión transforma el sistema de un generador pasivo en una herramienta directable, permitiendo al usuario intervenir con precisión en la evolución de secuencias visuales. El avance se centra en tres dimensiones técnicas: integración nativa de modos (texto, imagen, audio y video), edición conversacional mediante una API de interacciones y acceso a conocimientos del entorno a través del modelo Gemini.
La capacidad de extensión de escenas representa el cambio más significativo. Ahora, el modelo puede analizar hasta 10 segundos de contexto previo, en lugar de solo el último fotograma. Esta información se utiliza para continuar una secuencia en incrementos de 10 segundos, alcanzando un total de hasta 40 segundos de contenido generados. Cada llamada produce una continuación entre 3 y 10 segundos, con ajustes finales para garantizar que las transiciones sean fluidas. El sistema solo permite añadir contenido al final de una grabación, sin posibilidad de insertar elementos en medio o al inicio. Los videos subidos deben tener una duración máxima de 10 segundos, salvo en casos de extensión en múltiples turnos. En estas situaciones, el modelo puede gestionar diálogos hablados, aunque no permite añadir nuevos diálogos en videos subidos directamente.
Las versiones finales se escalan hasta 4K, mientras que las bocetos se generan en 360p, reduciendo el costo en un tercio respecto a la resolución 720p. Este enfoque permite una eficiencia técnica notable, ya que el sistema conserva el estado de la interacción previa sin necesidad de reenviar el video original. La edición se realiza de forma persistente: si el usuario modifica ciertos aspectos, el modelo aplica los cambios manteniendo los elementos no mencionados. Esta característica reduce el overhead de procesamiento y mejora la experiencia de trabajo en entornos de producción.
El modelo ya está disponible en la plataforma Google AI Studio y en la plataforma empresarial de Google, con integraciones ya en marcha en empresas como Adobe, Figma Weave, GMI Cloud y Runway. Su utilidad se extiende al diseño de contenidos multimedia, la creación de videos para redes sociales o la producción de materiales educativos.
Para inversores y profesionales peruanos, esta evolución en inteligencia artificial no solo representa un avance técnico, sino una oportunidad para optimizar el uso de recursos en medios digitales. En un contexto donde el contenido visual es clave para comunicar ideas, herramientas como esta permiten generar videos de alta calidad en menos tiempo. Aunque aún no está disponible para usuarios individuales, su integración en plataformas de diseño sugiere que en los próximos meses podría accederse a través de servicios especializados. Esto abre el camino a que empresas locales, desde pequeñas agencias hasta instituciones educativas, puedan automatizar procesos de producción sin necesidad de equipos técnicos especializados.
