CLOSED
S&P—NASDAQ—DOW—R2K—VIX—AAPL—MSFT—NVDA—GOOGL—META—AMZN—TSLA—AVGO—GOLD—WTI—USDPEN—
Yahoo · 60s · delay ~15min
LIVE
BTC—ETH—SOL—XRP—ADA—BNB—DOGE—
CoinGecko · 30s
FLUX 3 Action: Modelo de IA para robots con rendimiento superior
Papers

FLUX 3 Action: Modelo de IA para robots con rendimiento superior

MarkTechPost (AI/ML News)25 de setiembre de 2026Cortesia de MarkTechPost (AI/ML News)

Segun MarkTechPost (AI/ML News), Black Forest Labs ha lanzado FLUX 3 Action, un modelo abierto de 7 mil millones de parámetros diseñado para controlar robots. Este sistema, conocido como World Action Model (WAM), integra datos visuales, estado del robot y instrucciones textuales para predecir tanto el comportamiento futuro del robot como las secuencias de imágenes en tiempo real. En la evaluación del leaderboard RoboLab-120, el modelo alcanza un 42,92% de éxito en tareas, posicionándose como el más eficaz en el conjunto de pruebas.

La implementación requiere una memoria de hasta 32 gigabytes en GPU, operando en formato BF16 sobre arquitecturas como H200. Sin embargo, mediante la técnica de cuantización FP8 y la despliegue del decodificador de texto, el modelo puede ejecutarse en tarjetas de hasta 24 gigabytes. La licencia FLUX Kommunity permite su uso en entornos no comerciales, aunque con restricciones claras sobre su aplicación en escenarios de mercado.

La elección entre diferentes políticas de control robótico implica un equilibrio entre rendimiento y eficiencia. Modelos como Cosmos 3 Nano de NVIDIA logran un 36,8% de éxito en la misma evaluación, pero requieren un 4,7 veces más tiempo de procesamiento que π0,5 en una misma acción de robot. Este dato evidencia que, aunque los modelos basados en visión y lenguaje (VLAs) son más rápidos, su capacidad de predicción de acciones complejas es limitada. FLUX 3 Action supera esta brecha al mantener una predicción integrada de video y acciones, utilizando un backbone multimodal que fue entrenado con más del 95% de datos de video.

Durante el entrenamiento, el modelo mezcla 36,95% de datos preentrenados con 63,05% de vídeos alineados a acciones específicas. Estos datos provienen de grabaciones de juegos, videos de manos humanas en perspectiva propia, dispositivos de agarre manuales y operaciones remotas, distribuidos en 14 escenarios distintos. La acción del robot se define mediante un espacio común de 50 dimensiones, denominado EE50, que permite una compatibilidad amplia entre distintos sistemas.

El entrenamiento preentrenado es clave para el desempeño final. Sin este paso, el modelo entrenado únicamente con políticas de control (DROID) no alcanza el rendimiento observado, lo que subraya la importancia del conocimiento previo en la formación de inteligencias artificiales que operan en entornos físicos.

Para los inversionistas y profesionales peruanos, este avance indica que la IA aplicada al control robótico está pasando de ser un experimento a una solución viable. En un contexto donde el sector de manufactura, logística y agricultura busca automatizar procesos, modelos como FLUX 3 Action ofrecen una alternativa accesible y eficiente. Aunque aún dependen de infraestructura de alto rendimiento, su capacidad de integrar visión y acción en tiempo real podría impulsar la innovación en soluciones locales, especialmente en proyectos de inteligencia industrial o robótica para tareas repetitivas en entornos físicos.