CLOSED
S&PNASDAQDOWR2KVIXAAPLMSFTNVDAGOOGLMETAAMZNTSLAAVGOGOLDWTIUSDPEN
Yahoo · 60s · delay ~15min
LIVE
BTCETHSOLXRPADABNBDOGE
CoinGecko · 30s
Alibaba lanza Qwen3.8-Flash-Next: modelo multimodal de 125B parámetros
Papers

Alibaba lanza Qwen3.8-Flash-Next: modelo multimodal de 125B parámetros

MarkTechPost (AI/ML News)27 de agosto de 2026Cortesia de MarkTechPost (AI/ML News)

Segun MarkTechPost (AI/ML News), el equipo de Qwen de Alibaba ha presentado Qwen3.8-Flash-Next, un modelo multimodal basado en expertos (Mixture-of-Experts) con un peso total de 180 billones de parámetros, compuesto por una arquitectura principal de 125 billones, una tabla de embeddings de 51 billones y un módulo de predicción multitemporal de 4 billones. Este modelo está diseñado para optimizar el costo por token, activando solo 6 billones de parámetros por cada entrada, lo que representa una reducción significativa en el consumo computacional. La nueva versión se presenta como una visión preliminar de la estructura que sustentarán las futuras iteraciones del modelo Qwen4, siguiendo el camino que Qwen3-Next recorrió en su lanzamiento para Qwen3.5.

La evolución técnica se materializa en cuatro innovaciones clave. Primero, se implementa un híbrido de atención compuesto por Gated DeltaNet y Qwen Sparse Attention (QSA). En tres de cada cuatro capas, se emplea el Gated DeltaNet, que compila el historial de entrada en un estado recurrente fijo, reduciendo el almacenamiento de contexto. La cuarta capa utiliza QSA, que selecciona bloques contextuales a nivel micro, en lugar de procesar cada token individualmente. Este diseño se aplica en una configuración de 48 capas, con una distribución de 12 bloques en serie, donde tres capas utilizan GDN y una QSA, y el presupuesto de QSA se mantiene en 512 bloques o 2048 tokens. Segundo, se introduce un mecanismo de residuo con cuatro ramas paralelas, que permite una lectura selectiva mediante una puerta de elementos y una escritura escalonada por rama, con un punto crítico de 320 dimensiones. Tercero, se integra un sistema de embeddings basado en n-gramas, que amplía el alcance semántico del modelo mediante una tabla de 20.000 combinaciones. Cuarto, se aplica el optimizador Muon, que mejora la convergencia durante el entrenamiento.

El modelo fue entrenado con un costo aproximadamente uno noveno del de Qwen3.7-Plus, lo que refleja una mejora notable en eficiencia energética y de infraestructura. Los checkpoints disponibles tienen un tamaño de 172.78 gigabytes en precisión FP8 y 335.28 gigabytes en BF16. Para su implementación, se recomienda un entorno mínimo de TP2 con GB300 para FP8, mientras que TP4 es la configuración más adecuada. En un entorno de 8 nodos con GPUs H200, se debe utilizar TEP8, ya que la configuración estándar TP8 no es compatible con los bloques de cuantización de 128 del modelo. Es importante destacar que la reducción del uso computacional no afecta el almacenamiento físico, sino que se logra mediante la activación selectiva de parámetros.

Para el lector peruano, esta evolución en inteligencia artificial resalta la importancia de tecnologías que optimizan el uso de recursos. En un contexto donde el acceso a infraestructura de alto rendimiento es limitado, modelos como Qwen3.8-Flash-Next ofrecen una vía viable para que instituciones, universidades o pymes puedan explorar aplicaciones de IA sin necesidad de grandes inversiones en hardware. Aunque su implementación requiere infraestructura avanzada, su diseño eficiente podría inspirar soluciones más accesibles para sectores como educación, salud o servicios financieros, donde el costo por operación es clave.