CLOSED
S&PNASDAQDOWR2KVIXAAPLMSFTNVDAGOOGLMETAAMZNTSLAAVGOGOLDWTIUSDPEN
Yahoo · 60s · delay ~15min
LIVE
BTCETHSOLXRPADABNBDOGE
CoinGecko · 30s
Google lanza nuevo sistema de análisis de video para Gemini
Papers

Google lanza nuevo sistema de análisis de video para Gemini

MarkTechPost (AI/ML News)5 de setiembre de 2026Cortesia de MarkTechPost (AI/ML News)

Segun MarkTechPost (AI/ML News), Google ha implementado una innovación significativa en su tecnología de inteligencia artificial, introduciendo un nuevo enfoque para el análisis de video en sus modelos Gemini Flash. Esta evolución, conocida como "entendimiento agente", permite que el sistema no procese todo el contenido de un video de forma lineal, sino que navega activamente a través de su duración, seleccionando qué fragmentos observar, a qué velocidad y bajo qué modalidad. Este cambio representa una ruptura con el modelo tradicional, que hasta ahora procesaba videos a una velocidad fija de un fotograma por segundo, independientemente de la pregunta que se formulara.

El sistema reduce en hasta un 88% el número de tokens utilizados, lo que traduce en un costo operativo hasta 66% menor y una precisión del 7% superior en pruebas estándar. Estos avances se observan especialmente en contenidos largos, como tutoriales de 10 minutos o más, donde la capacidad de priorizar detalles específicos resulta crucial. La implementación se ofrece como servicio a través de la API de Gemini, disponible en Google AI Studio y en la plataforma empresarial de Gemini. Los usuarios pueden cargar archivos directamente o ingresar enlaces públicos de YouTube, sin necesidad de descargar o preprocesar el contenido. El costo se aplica según la tarifa estándar de tokens, sin cargos adicionales por el uso de esta funcionalidad.

Aunque el sistema se ejecuta exclusivamente como servicio en la nube, sin disponibilidad de pesos abiertos ni posibilidad de implementación local, la mejora radica en que el modelo internaliza un ciclo de razonamiento autónomo. En lugar de procesar todo el video en una sola pasada, ahora combina su capacidad de inferencia con herramientas nativas de análisis de video, permitiendo que escaneen, busquen y examinen solo las secciones relevantes. Este enfoque elimina el gasto innecesario de procesar fragmentos que no responden a la consulta, sin sacrificar precisión.

Para los lectores peruanos, este avance tiene implicaciones claras en el ámbito de las finanzas digitales y la gestión de información. Muchos usuarios del mercado peruano dependen de videos educativos, presentaciones en línea o conferencias para tomar decisiones sobre inversiones, gestión de empresas o desarrollo profesional. Con esta tecnología, se puede ahorrar tiempo y costos al procesar contenido de forma más inteligente, sin tener que recurrir a herramientas externas o esperar respuestas a preguntas específicas. Además, al permitir el análisis de videos de larga duración con mayor eficiencia, se abre la puerta a una mejor integración de contenido audiovisual en plataformas de aprendizaje, análisis de riesgos o toma de decisiones en entornos empresariales locales.