Según arXiv q-fin, un estudio reciente analiza cómo se mide la fiabilidad de agentes de inteligencia artificial en entornos operativos, utilizando datos reales de entrevistas automatizadas. El trabajo examina 2.611 evaluaciones basadas en criterios estructurados, obtenidas de sesiones de entrevista en formato audiovisual, junto con registros de revisiones humanas, historiales de actualizaciones del sistema y tickets de soporte. Los resultados revelan que los jueces humanos varían significativamente en sus calificaciones: dos revisores evaluando el mismo conjunto de entrevistas difieren en 0.79 desviaciones estándar en la puntuación compuesta. Este sesgo se intensifica cuando cambia el equipo de evaluadores, lo que distorsiona la tendencia observable. Al corregir estos efectos y aplicar un suavizado a los datos por lotes, la fiabilidad del rendimiento del agente aumenta en 0.53 desviaciones estándar entre marzo y agosto de 2026. Además, el comportamiento de la fiabilidad cambia notablemente tras cada actualización del sistema. Aunque los cambios en el rendimiento no son directamente medibles, se estima que la incertidumbre en las proyecciones alcanza el nivel más grande registrado tras aproximadamente cinco semanas de operación, basándose en un número reducido de cambios discretos. Un indicador independiente que refleja el desempeño del agente, la reducción de tickets de soporte relacionados con entrevistas, disminuye en un 10% mensual respecto a los problemas técnicos.
Este hallazgo es particularmente relevante para el contexto peruano, donde las empresas en sectores como servicios, comercio o salud están ampliando el uso de tecnologías automatizadas para mejorar eficiencia. Las instituciones que implementan sistemas de inteligencia artificial deben entender que las evaluaciones humanas no son neutrales: su variabilidad puede distorsionar el análisis del progreso real del sistema. Por eso, es esencial validar no solo que los evaluadores sean consistentes entre sí, sino que las métricas sigan siendo útiles a lo largo del tiempo, incluso cuando el sistema evoluciona. La coincidencia entre los resultados de evaluación y los indicadores operativos, como la reducción de incidencias, ofrece una verificación externa que aumenta la confianza en los datos. Para los gestores de negocios peruanos, esto implica adoptar un enfoque más riguroso: no basta con revisar el rendimiento de una IA cada cierto tiempo, sino que deben monitorearse los cambios en el entorno, los ajustes del sistema y las respuestas del personal al uso de estas herramientas. Solo así se puede garantizar que las decisiones basadas en inteligencia artificial sean precisas, sostenibles y alineadas con los objetivos reales del negocio.