CLOSED
S&PNASDAQDOWR2KVIXAAPLMSFTNVDAGOOGLMETAAMZNTSLAAVGOGOLDWTIUSDPEN
Yahoo · 60s · delay ~15min
LIVE
BTCETHSOLXRPADABNBDOGE
CoinGecko · 30s
GLM-5.3-Flash y Qwen3.8-Flash-Next: Dos modelos chinos convergen en diseño
Papers

GLM-5.3-Flash y Qwen3.8-Flash-Next: Dos modelos chinos convergen en diseño

MarkTechPost (AI/ML News)29 de agosto de 2026Cortesia de MarkTechPost (AI/ML News)

Segun MarkTechPost (AI/ML News), dos modelos de inteligencia artificial de vanguardia, lanzados en menos de 24 horas, comparten una arquitectura casi idéntica a pesar de haber sido desarrollados de forma independiente. Z.ai presentó GLM-5.3-Flash, un sistema multimodal con 320 mil millones de parámetros y 18 mil millones activos, entrenado sobre un corpus de 30 mil millones de tokens. Este modelo, disponible bajo licencia MIT en Hugging Face, fue probado anónimamente como Ox Alpha en OpenRouter y se posicionó como el más utilizado de la semana. Su ventana de contexto alcanza 1 millón de tokens, y según Z.ai, supera a GLM-5.2 en múltiples pruebas, especialmente en tareas de programación y agencia, alcanzando niveles comparables a Claude Opus 4.8. El costo por millón de tokens de entrada es de $0.15 y por salida, $0.50.

Al mismo tiempo, el equipo de Alibaba lanzó Qwen3.8-Flash-Next, un modelo de 125 mil millones de parámetros con 6 mil millones activos por token, que actúa como una vista previa del próximo diseño de la familia Qwen. Incluye un tablero de embeddings de 51 mil millones de parámetros, y ofrece una ventana nativa de 262.144 tokens, extensible hasta 1 millón mediante YaRN. El equipo afirma que el entrenamiento requirió aproximadamente una novena parte del poder computacional de Qwen3.7-Plus. Su informe técnico titulado “On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability” detalla cómo logran estabilidad y eficiencia en el proceso.

Ambos modelos adoptan un enfoque híbrido de atención, combinando 75% de atención lineal y 25% de atención completa. Utilizan un índice comprimido para seleccionar contexto, limitado a 2.048 tokens, y amplían el flujo residual en cuatro ramas con puertas. Además, ambos emplean el optimizador Muon, con matrices de parámetros fusionadas y divididas antes de su ortogonalización. Aunque la estructura general es muy similar, una diferencia clave radica en la escala de parámetros activos: GLM-5.3-Flash activa más parámetros por token, mientras que Qwen3.8-Flash-Next prioriza eficiencia en el uso de recursos.

Para el lector peruano, este desarrollo evidencia una convergencia global en el diseño de modelos de inteligencia artificial, donde los principales actores tecnológicos están adoptando patrones comunes para optimizar rendimiento y costo. Aunque los modelos aún no están disponibles en mercados latinoamericanos, su evolución puede influir en el futuro de servicios de asistencia, automatización de tareas y análisis de datos. En un contexto donde el acceso a tecnologías avanzadas se vuelve más accesible, el Perú podría beneficiarse al seguir desarrollando capacidades digitales en sectores como finanzas, administración y educación, aprovechando las innovaciones que se materializan en el diseño de estos sistemas.