Segun MarkTechPost (AI/ML News), un nuevo enfoque en el desarrollo de algoritmos de aprendizaje por refuerzo agente ha sido presentado por el equipo de NeMo de NVIDIA. Este sistema, denominado Molt, busca reducir significativamente el costo computacional y cognitivo asociado a las modificaciones constantes en los frameworks de investigación. Mientras que los sistemas tradicionales requieren ajustes en múltiples capas —desde entrenadores distribuidos hasta mecanismos de ejecución—, Molt está diseñado para ser sencillo y directo. Su base de código, evaluada mediante el trazado del grafo de importaciones desde el punto de entrada de aprendizaje por refuerzo, tiene una extensión de aproximadamente 8.600 líneas. Este valor contrasta con otros frameworks: 62.000 líneas en Verl, 25.000 en Slime y 7.200 en OpenRLHF.
El sistema está publicado bajo licencia Apache 2.0 y incluye guías de inicio, scripts de gestión de tareas mediante Slurm y una imagen preconstruida para su ejecución. Aunque es funcional, su propósito se enfoca en investigación, no en servicios de entrenamiento de producción. El despliegue requiere una infraestructura específica: dos nodos con 8 GPUs H100 cada uno, distribuidos en 8 para entrenamiento y 8 para ejecución. Esta configuración limita su acceso a laboratorios de vanguardia, startups tecnológicas con recursos elevados, grupos de investigación en sectores como salud, finanzas o robótica, y centros académicos con acceso a múltiples nodos de H100 o H200.
Las aplicaciones que Molt permite desarrollar abarcan desde agentes que usan múltiples herramientas en interacciones sucesivas, hasta sistemas que ejecutan código o operan en entornos visuales y lingüísticos. También se integra en bucles de evaluación donde un modelo grande actúa como juez de calidad, y permite la distilación de políticas en modelos más pequeños, manteniendo eficiencia en el proceso. La arquitectura se compone de tres componentes clave: Ray para la gestión de nodos y colas asincrónicas, vLLM para ejecutar el flujo de respuestas y NVIDIA AutoModel con FSDP2 para el entrenamiento. Ninguno de estos componentes ha sido derivado, lo que garantiza que mejoras en las versiones originales se propaguen simplemente mediante actualizaciones de contenedor, sin necesidad de rebase.
El entorno de ejecución se organiza como una piscina de agentes, donde múltiples motores vLLM operan bajo un router de solicitudes, mientras un único actor de política se encarga del entrenamiento. Un mecanismo de flujo continuo mantiene grupos de prompts en ejecución, evitando que los motores se vacíen mientras el actor principal realiza actualizaciones.
Para el lector peruano, esta innovación representa un paso clave hacia la democratización del acceso a herramientas avanzadas de inteligencia artificial. Aunque su implementación requiere infraestructura de alto costo, el modelo de diseño de Molt ofrece una estructura clara y manejable que podría adaptarse a entornos académicos o de startups locales que buscan explorar aplicaciones de agentes inteligentes sin necesidad de profundizar en complejidades técnicas. En contextos como servicios financieros, salud digital o logística, el potencial de estos sistemas podría impulsar soluciones más autónomas y eficientes, siempre que se considere la viabilidad de sus costos operativos.
