Segun MarkTechPost (AI/ML News), Black Forest Labs ha presentado FLUX 3, un modelo de base multimodal que integra la comprensión de imágenes, vídeos y audio dentro de una sola arquitectura. Este avance representa la primera versión del FLUX que capta simultáneamente video, sonido y predicción de acciones físicas, todo a partir de un mismo conjunto de parámetros. La investigación del equipo de BFL sostiene que ninguna sola modalidad ofrece una descripción completa del mundo. Las imágenes capturan estructuras espaciales en un instante, el video revela el tiempo y las dinámicas físicas, mientras que el audio expone relaciones causales entre eventos mecánicos y sonidos. Cada una de estas fuentes se considera una proyección perdida del mismo estado real subyacente. Al entrenar conjuntamente estas modalidades, se genera una mutua restricción: el sonido debe coincidir con el impacto físico, y el movimiento debe obedecer las leyes de la masa. FLUX 3 es el primer modelo diseñado desde cero sobre esta premisa.
El núcleo de su funcionamiento se basa en la técnica denominada Self-Flow, desarrollada previamente por BFL en marzo de 2026. Esta metodología combina el objetivo de alineación por flujo con una reconstrucción de características autodes supervisadas. La implementación disponible en GitHub opera bajo licencia Apache-2.0, utilizando el modelo SiT-XL/2 y condiciona cada token con un paso temporal. Durante el entrenamiento, se aplica una máscara del 25% por token, junto con una auto-distilación desde un modelo maestro (EMA) en la capa 20 hacia un modelo estudiante en la capa 8. Aunque el punto de partida en GitHub es un modelo de ImageNet de 256×256, no corresponde directamente a FLUX 3. BFL afirma que el modelo final fue entrenado mediante una escalada significativa en recursos computacionales y datos, manteniendo la misma metodología. Lo novedoso no es la técnica, sino la magnitud de su escalamiento.
FLUX 3 Video permite generar clips de hasta 20 segundos, con audio nativo, a través de diversas entradas: desde texto hasta imágenes, vídeos de referencia, o mediante marcas clave para controlar la generación. Esta capacidad de integrar múltiples modos en una sola generación abre nuevas posibilidades en diseño visual, creación de contenidos y simulaciones interactivas.
Para el lector peruano, este avance en inteligencia artificial no solo refleja el avance tecnológico global, sino que también pone de manifiesto cómo las herramientas digitales están volviéndose más integradas. En un contexto donde el contenido multimedia es clave para el comercio, la educación o la comunicación social, modelos como FLUX 3 podrían transformar la forma en que se producen videos, animaciones o explicaciones técnicas. Aunque aún no están disponibles para uso comercial en el mercado latinoamericano, su desarrollo indica una tendencia clara: la convergencia entre imágenes, sonido y acción física en un solo sistema. Esto puede acelerar el crecimiento de plataformas digitales que requieren contenido auténtico, dinámico y coherente, especialmente en sectores como el turismo, la educación o la publicidad.
