Segun MarkTechPost (AI/ML News), H Company ha presentado NeoMME, una familia de modelos multimodales que simplifica la arquitectura de recuperación visual eliminando componentes redundantes. Este avance se centra en modelos de 260 millones y 800 millones de parámetros, diseñados como encoders bidireccionales que procesan texto y imágenes sin necesidad de un módulo de visión independiente ni un decodificador causal. La innovación radica en que ambos modos —texto y imágenes— pasan por las mismas capas de una única red Transformer, entrenadas desde cero a partir de inicialización aleatoria.
La versión de 260 millones de parámetros logra una puntuación de 0.523 en nDCG@10 en el conjunto ViDoRe v3, un estándar para evaluación de recuperación de documentos visuales. Este resultado se consigue sin módulos adicionales como fusiones de parches ni estructuras como SigLIP2. Los datos de rendimiento muestran que el modelo puede indexar 51,3 páginas por segundo en una sola unidad NVIDIA L40S, y procesar una consulta en solo 78,3 milisegundos con un equipo que no incluya GPU. La implementación se ofrece bajo licencia Apache 2.0, permitiendo su uso inmediato en entornos de desarrollo y producción.
El sistema emplea un embedding factorizado inspirado en ALBERT para el texto, proyectado a 256 dimensiones, y un módulo de proyección basado en una red MLP de dos capas para las imágenes, divididas en parches de 32×32 sin superposición. Ambos modelos admiten un contexto de hasta 16.384 tokens, suficiente para representar dos imágenes en resolución 4K (3840×2160) tras la división en parches. La atención se aplica de forma simétrica en las capas, con una ventana deslizante que se activa cada sexta capa y en la última. Además, se integran técnicas como atención por grupos, normalización de consulta, atención con puerta y embeddings rotatoras en dos dimensiones, junto con una función de activación de tipo squared-ReLU.
Los conteos exactos de parámetros son de 262.937.906 para el modelo pequeño y 793.715.032 para el de 800 millones. El vocabulario del tokenizador, construido desde cero, contiene 131.072 entradas y utiliza un BPE sin restricciones espaciales, entrenado sobre el conjunto FLORES-200, que incluye 14 idiomas objetivo.
Para el lector peruano, esta evolución en inteligencia artificial tiene implicaciones directas en el acceso a información visual en entornos como el sector financiero, la educación o el comercio digital. Muchas empresas locales aún dependen de sistemas obsoletos para procesar documentos como contratos o informes. NeoMME ofrece una alternativa más eficiente, con menor consumo de recursos y mayor capacidad de integración, lo que podría acelerar la digitalización de procesos administrativos y de toma de decisiones en pequeñas y medianas empresas. Aunque aún no está disponible en el mercado peruano, su estructura abierta y su rendimiento prometedor hacen que sea una pieza clave para el futuro de la automatización en entornos locales.
