CLOSED
S&PNASDAQDOWR2KVIXAAPLMSFTNVDAGOOGLMETAAMZNTSLAAVGOGOLDWTIUSDPEN
Yahoo · 60s · delay ~15min
LIVE
BTCETHSOLXRPADABNBDOGE
CoinGecko · 30s
DeepSeek Lanza V4-Flash con Mejoras en Agentes y Codificación
Papers

DeepSeek Lanza V4-Flash con Mejoras en Agentes y Codificación

MarkTechPost (AI/ML News)1 de agosto de 2026Cortesia de MarkTechPost (AI/ML News)

Segun MarkTechPost (AI/ML News), DeepSeek ha lanzado una versión actualizada de su modelo DeepSeek-V4-Flash, denominada DeepSeek-V4-Flash-0731, disponible en Hugging Face desde el 31 de julio de 2026. Este lanzamiento no implica una arquitectura distinta ni un aumento en el tamaño del modelo, sino una reentrenamiento posterior que otorga avances significativos en funcionalidades agencias y generación de código. La documentación oficial especifica que esta versión reemplaza a la prueba previa, manteniendo intacta la estructura original del sistema. El modelo cuenta con un módulo denominado DSpark, integrado desde el inicio, que permite una ejecución más eficiente en tareas de decodificación especulativa. El repositorio registrado en Hugging Face indica un total de 304 mil millones de parámetros, compuestos por una base de 284 mil millones y el módulo DSpark añadido.

La disponibilidad del modelo a través de la API se ha ampliado a una fase beta pública, permitiendo su uso directo para aplicaciones que requieran interacciones en tiempo real. La nueva versión soporta nativamente el formato de respuestas de la API y ha sido optimizada para integrarse con entornos de desarrollo de código. Sin embargo, las versiones V4-Pro, así como las aplicaciones y modelos web, no han sido actualizadas. En términos de costos, el modelo DeepSeek-V4-Flash se ofrece a $0.14 por un millón de tokens de entrada en caso de fallo de caché, $0.0028 en caso de acierto, y $0.28 por un millón de tokens de salida. Este precio representa aproximadamente un tercio del costo de salida de la versión V4-Pro ($0.87). La disponibilidad de este modelo por API abre la posibilidad a emprendimientos en etapa inicial, desarrolladores independientes y equipos internos de plataformas que puedan operar bucles de agentes sin necesidad de inversiones en hardware de alto rendimiento.

Por su parte, la posibilidad de autogestión del modelo requiere infraestructura considerable. Aunque los pesos están licenciados bajo MIT y sin barreras, el modelo mantiene una carga significativa en la memoria, ya que alrededor de 13 mil millones de parámetros se activan por token. Para su ejecución en entornos locales, se requiere una combinación de al menos 110 gigabytes de memoria RAM y VRAM. Soluciones como Unsloth permiten reducir el tamaño mediante cuantización, llegando a 162 gigabytes en versión de 8 bits y 103 gigabytes en versión de 3 bits. Esto implica que solo entidades de tamaño mediano o grande, con acceso a clústeres de servidores o equipos de alto rendimiento, podrán operar el modelo de forma autónoma.

Para los usuarios del Perú, este avance representa una oportunidad clave en el acceso a tecnologías de inteligencia artificial de vanguardia. Aunque los costos por uso son bajos, el modelo aún requiere una comprensión técnica sólida para su implementación. Empresas de servicios digitales, agencias de innovación o startups que buscan automatizar procesos de soporte técnico o generación de código pueden aprovechar la disponibilidad económica y funcional del modelo sin necesidad de inversiones masivas. El hecho de que el modelo esté abierto y accesible fomenta la experimentación, lo cual puede impulsar el desarrollo de soluciones locales en sectores como educación, salud o servicios financieros.