Segun MarkTechPost (AI/ML News), Nums AI ha presentado Causilo, un modelo de aprendizaje automático basado en tablas que supera a otros modelos individuales en pruebas de rendimiento. Este modelo, diseñado para tareas de clasificación y regresión, cuenta con una interfaz compatible con scikit-learn, licencia Apache-2.0 y pesos preentrenados disponibles en Hugging Face. En la plataforma TabArena, Causilo alcanza el mayor nivel Elo entre modelos aislados en ambas tareas. Su estructura permite operar en entornos de investigación y evaluación actualmente, tanto en dispositivos con CUDA como en CPU. Para su uso comercial, en producción o mediante APIs gestionadas, se requiere una licencia adicional de Nums AI.
Causilo opera mediante un mecanismo de aprendizaje en contexto, donde la acción de entrenar no modifica los pesos predefinidos. En su lugar, el modelo almacena las filas de entrenamiento como contexto y realiza predicciones en una sola pasada hacia adelante. Según su registro en TabArena, el entrenamiento se realiza exclusivamente con datos sintéticos, sin incluir conjuntos de datos reales de la plataforma. Esto implica que los inputs pueden ser arrays de NumPy o DataFrames de pandas, incluso con características categóricas y valores ausentes. La clasificación soporta hasta 10 clases, mientras que en regresión se devuelve por defecto una predicción media. La versión 1.0.1 introduce además salidas basadas en mediana y cuantiles, calculados mediante 999 cuantiles nativos.
La arquitectura de Causilo se divide en tres fases: refinamiento, compresión y aprendizaje en contexto. Las características se agrupan en conjuntos de tres elementos. Cada valor es representado mediante 16 frecuencias aprendidas de senos y cosenos. Los valores ausentes reciben un vector propio entrenado. Dos etapas de columnas resumen cada grupo de características. En cada una, 128 slots latentes leen exclusivamente las filas de entrenamiento y transmiten la información a todas las filas. Entre estas etapas, un módulo de fila permite que los grupos de características interactúen mediante 4 tokens latentes. Este diseño emplea atención cruzada en lugar de atención autónoma completa, lo que según Nums AI mantiene el costo de cálculo lineal respecto al número de características. Posteriormente, un bloque de agregación reduce cada fila a un vector fijo de 512 dimensiones. Las etiquetas se añaden a las filas de entrenamiento, y un bloque de predicción de 12 capas permite que las filas de consulta atiendan a esas etiquetas, sin permitir cambios en el contexto de entrenamiento ni en las relaciones entre consultas.
Para el lector peruano, este avance representa una herramienta potencialmente útil en sectores como el crédito, donde se requieren modelos que clasifiquen riesgos en base a datos tabulares, o en el análisis de ventas, donde se deben predecir tendencias. Aunque aún no está disponible para uso comercial directo, su estructura eficiente y su capacidad para manejar datos reales con valores faltantes ofrecen ventajas en entornos de negocios que operan con datos estructurados. La clave para su aplicación será la integración adecuada con sistemas existentes, especialmente en empresas que aún no han adoptado tecnologías de inteligencia artificial avanzada.
