Segun MarkTechPost (AI/ML News), Adaption Labs ha presentado una novedad en el ámbito de la inteligencia artificial: "Invent a Dataset", una herramienta que permite crear conjuntos de datos estructurados a partir de una descripción de comportamiento deseado, sin necesidad de un corpus inicial ni esquema predefinido. Esta innovación permite que los desarrolladores y equipos técnicos generen datos de entrenamiento directamente a partir de la funcionalidad que desean que aprenda un modelo, evitando los pasos tradicionales de etiquetado, filtrado y adaptación de datos existentes.
La funcionalidad se encuentra disponible actualmente en la aplicación oficial de Adaption y a través de su interfaz de programación en Python, así como mediante un servicio de API REST. Los resultados generados se ofrecen en formatos como JSONL, JSON, CSV o Parquet, garantizando que el producto final sea portátil y completamente propiedad del usuario. Aunque el proceso de generación se ejecuta en una plataforma hosteada por Adaption, no se ha documentado una versión que permita ejecutar el sistema en entornos locales. Los usuarios deben consumir créditos para cada generación, lo que implica un costo claro por uso.
El núcleo de esta tecnología radica en desafiar la forma tradicional de crear conjuntos de datos. En los flujos habituales, los equipos comienzan con información ya existente, que luego se transforma mediante tareas de etiquetado y limpieza. Sin embargo, en muchos casos, los datos relevantes se encuentran en sistemas internos, en textos no estructurados o en registros de procesos, sin una forma clara de convertirse en conjuntos de entrenamiento eficaces. Adaption Labs argumenta que esta barrera limita el rendimiento de los modelos, especialmente en tareas especializadas o de alto valor, donde el conocimiento está disperso y no está organizado.
La operación se lleva a cabo mediante una llamada directa al módulo datasets.invent, que inicia el proceso y devuelve inmediatamente un estado "running". El usuario debe luego realizar consultas periódicas a datasets.get hasta que el estado cambie a "succeeded" o "failed", momento en que se puede descargar el conjunto generado. La selección de dominios es clave para definir el contexto, con opciones disponibles a través de datasets.invent_domains. Se pueden elegir categorías como "medical" o subdominios específicos como "medical.symptoms_diagnosis". Al menos un dominio o subdominio debe ser especificado para que el sistema funcione.
Para el lector peruano, esta herramienta representa una oportunidad clave en contextos de innovación local. Empresas en sectores como salud, agricultura o servicios financieros, donde los datos operativos están en sistemas digitales sin estructura clara, podrían aprovechar esta solución para desarrollar modelos personalizados sin depender de grandes volúmenes de datos históricos. Esto permite acelerar la creación de soluciones tecnológicas adaptadas a necesidades reales, sin sacrificar calidad o precisión.
