Segun MarkTechPost (AI/ML News), Google DeepMind ha presentado Gemini Robotics 2, una capa de inteligencia diseñada para impulsar la autonomía de robots de próxima generación. Este avance marca una transición clave en la infraestructura de IA, al desplazar el enfoque tradicional de manipulación en superficies planas hacia el control integral de cuerpos completos, habilidades de agilidad fina y coordinación entre múltiples unidades. La nueva plataforma se entrega como tres modelos distintos, cada uno con un nivel de acceso específico, permitiendo una adaptación flexible según las necesidades técnicas de distintos usuarios.
El primer componente, el modelo de visión-lenguaje-acción (VLA), traduce entradas visuales y lingüísticas directamente en comandos motorizados. Gracias a esta funcionalidad, puede guiar desde humanoides completos hasta robots bi-manuales, gestionando movimientos desde las piernas hasta los dedos. Este modelo también maneja tareas de manipulación fina, tanto en manos multidentadas como en grippers paralelos. El segundo, el modelo de razonamiento embodiado (ER), actúa como cerebro central del sistema. Basado en Gemini 3.5 Flash, permite a los robots entender el entorno físico, comunicarse con humanos y ejecutar tareas complejas que duran varios minutos. Su capacidad de procesar entradas intercaladas de texto, imágenes, video y audio, con un contexto hasta de 128 mil tokens, y generar respuestas de hasta 64 mil tokens, refleja un alto nivel de integración y capacidad de respuesta. Finalmente, el modelo on-device 2 está optimizado para funcionar directamente en dispositivos robóticos, reduciendo la dependencia de nubes y mejorando la latencia en entornos críticos.
A pesar de esta evolución, persisten desequilibrios técnicos. La agilidad en manos multifuncionales aún se mantiene como limitación, con rendimientos que oscilan entre el 32% y el 92%. Esta brecha indica que, aunque el sistema ha avanzado significativamente, aún requiere refinamiento para operar con fluidez en entornos dinámicos. Además, la nueva evaluación de seguridad ASIMOV-Agentic, ahora disponible en Hugging Face bajo licencia CC-BY-4.0, ofrece un marco para medir y mejorar la confiabilidad de los sistemas agentes de IA.
Para el lector peruano, este desarrollo representa una oportunidad para explorar cómo tecnologías de IA avanzada pueden integrarse en sectores clave como logística, manufactura o servicios públicos. Aunque los modelos aún están en fases iniciales, su capacidad para operar en entornos reales y adaptarse a cambios puede transformar procesos que hoy dependen de operaciones manuales o predefinidas. El desafío seguirá siendo el acceso tecnológico y la formación adecuada, pero con herramientas como estas, el potencial de automatización en espacios locales se vuelve más tangible.
