CLOSED
S&PNASDAQDOWR2KVIXAAPLMSFTNVDAGOOGLMETAAMZNTSLAAVGOGOLDWTIUSDPEN
Yahoo · 60s · delay ~15min
LIVE
BTCETHSOLXRPADABNBDOGE
CoinGecko · 30s
Thinking Machines Lanza Modelo Multimodal para Acceso Abierto
Papers

Thinking Machines Lanza Modelo Multimodal para Acceso Abierto

MarkTechPost (AI/ML News)3 de agosto de 2026Cortesia de MarkTechPost (AI/ML News)

Segun MarkTechPost (AI/ML News), el laboratorio Thinking Machines Lab ha presentado Inkling-Small, un modelo multimodal basado en mezcla de expertos (MoE) con 276 mil millones de parámetros totales y 12 mil millones activos. Este tamaño representa aproximadamente un cuarto del de Inkling, cuya arquitectura posee 975 mil millones de parámetros totales y 41 mil millones activos. La formación del modelo se llevó a cabo en sistemas NVIDIA GB300 NVL72, destacando su eficiencia en infraestructura de alto rendimiento. La capacidad de razonamiento nativa abarca textos, imágenes y audio, con un tamaño de contexto de hasta un millón de tokens. El esfuerzo computacional se puede ajustar según las necesidades del uso, y los pesos están disponibles bajo licencia Apache 2.0 en Hugging Face.

El modelo permite la ejecución en entornos de producción, especialmente gracias a su versión cuantizada. El checkpoint en formato BF16 requiere al menos 600 GB de memoria VRAM, un requisito que puede cumplirse con cuatro unidades NVIDIA B300 o ocho NVIDIA H200. La versión NVFP4 reduce este umbral a 180 GB, permitiendo su ejecución en una sola unidad B300 con soporte de arquitectura SM100+, o en dos unidades H200 con configuración W4A16. Las plataformas compatibles incluyen SGLang, vLLM, TokenSpeed, Unsloth y Hugging Face. Esta configuración transforma el acceso a un modelo de 276 mil millones de parámetros, que antes se consideraba fuera del alcance de entidades pequeñas o medianas.

La arquitectura de Inkling-Small se compone de 42 capas de decodificador, con un backbone de MoE sparsa que asigna cada token a seis de 256 expertos, además de dos expertos compartidos activos en cada token. La atención se integra mediante una combinación de capas locales y globales, eliminando la necesidad de un módulo de codificador. Las imágenes son divididas en parches de 40x40 píxeles y procesadas mediante una capa hiperbólica ligera (hMLP), mientras que el audio se representa como espectrogramas dMel. Ambos tipos de datos pasan por una capa ligera de embeddings y se combinan directamente con tokens de texto. El modelo soporta formatos numéricos como BF16, MXFP8 y NVFP4, con entrada de audio en formato WAV a 16 kHz, idealmente de menos de dos minutos. La salida es exclusivamente textual.

Para el lector peruano, este avance en modelos abiertos y eficientes ofrece una oportunidad real de acceso a inteligencia artificial de alto rendimiento sin depender de infraestructuras costosas. Empresas locales, especialmente en sectores como servicios financieros, salud, telecomunicaciones o gestión pública, pueden implementar soluciones personalizadas sin necesidad de inversiones masivas. La capacidad de procesar imágenes y audio en un solo modelo abre puertas a aplicaciones prácticas, como automatización de llamadas, análisis de documentos o resumen de reuniones, con un costo operativo más manejable. Así, la tecnología deja de ser exclusiva de centros de investigación y se convierte en herramienta viable para el día a día de los negocios peruanos.

Thinking Machines Lanza Modelo Multimodal para Acceso Abierto | Reditua