CLOSED
S&PNASDAQDOWR2KVIXAAPLMSFTNVDAGOOGLMETAAMZNTSLAAVGOGOLDWTIUSDPEN
Yahoo · 60s · delay ~15min
LIVE
BTCETHSOLXRPADABNBDOGE
CoinGecko · 30s
DeepSeek-V4.1-Flash: Avance en IA con contexto de 1 millón de tokens
Papers

DeepSeek-V4.1-Flash: Avance en IA con contexto de 1 millón de tokens

MarkTechPost (AI/ML News)10 de setiembre de 2026Cortesia de MarkTechPost (AI/ML News)

Según MarkTechPost (AI/ML News), el equipo de DeepSeek ha presentado una nueva versión de su modelo de inteligencia artificial, DeepSeek-V4.1-Flash, diseñada específicamente para resolver una limitante crítica en el procesamiento de lenguaje de modelos grandes. Este avance se centra en reducir el consumo de memoria y el uso de recursos de almacenamiento, especialmente en entornos donde los modelos deben manejar secuencias de texto extremadamente largas. La versión actual cuenta con una arquitectura de 552 mil millones de parámetros en su núcleo y 196 mil millones adicionales de parámetros de engrama, permitiendo un contexto de hasta un millón de tokens. Durante la fase de prellenado, se activan 8 mil millones de parámetros por token, mientras que en la fase de decodificación se activan 16 mil millones. El uso de caché de vectores de claves (KV) se mantiene a una carga promedio de 890 bytes por token, una reducción significativa frente a versiones anteriores: aproximadamente un cuarto del tamaño de DeepSeek-V4-Flash y unas 437 veces menor que el modelo inicial DeepSeek-V1.

La innovación se basa en una división estratégica del modelo de 40 capas: 20 capas como codificador causal y 20 como decodificador. Este diseño, inspirado en YOCO, evita que el decodificador calcule su propia versión global del caché de claves y valores. En su lugar, cada capa utiliza proyecciones de peso para derivar el estado del caché directamente del último estado oculto del codificador. Así, los tokens del prompt se procesan únicamente en el codificador, reduciendo casi al medio el trabajo computacional necesario en la fase de prellenado. Aunque todos los decodificadores mantienen atención con ventana deslizante de 128 tokens, se reconstruyen los estados mediante la reproducción de solo los 128 últimos tokens del prompt. Este mecanismo se denomina "reproducción acotada de atención en el decodificador".

Adicionalmente, el modelo incorpora una variante avanzada de atención comprimida, denominada Compressed Sparse Attention 2 (CSA2). Cada capa de CSA2 opera en uno de tres modos: "Completo", donde se calcula el propio caché principal y se seleccionan los índices más relevantes; "Reindex", que reutiliza el caché de la capa anterior pero recalcula los índices con sus propios pesos de consulta; y "Reuse", que reutiliza tanto el caché como los índices sin recálculo. Esta estrategia permite optimizar el espacio en capas, reduciendo de forma efectiva la demanda de memoria sin sacrificar la precisión del resultado.

Para el lector peruano, este avance representa un punto clave en la evolución de las tecnologías de IA. Aunque los modelos de gran tamaño aún no están accesibles para usuarios comunes, su mejora en eficiencia permite que más empresas, desde pymes hasta instituciones financieras, puedan integrar soluciones de IA sin depender de infraestructuras de alto costo. En un contexto donde el acceso a herramientas de análisis de datos y predicción es clave para decisiones en sectores como el crédito, el retail o el comercio electrónico, este tipo de innovaciones podría democratizar el uso de inteligencia artificial, permitiendo a empresas más pequeñas competir con tecnologías que antes solo estaban disponibles para grandes corporaciones.