Segun MarkTechPost (AI/ML News), Anthropic ha lanzado una nueva metodología de evaluación para plugins en Claude Code, diseñada para medir con precisión el rendimiento de habilidades integradas. Esta herramienta permite a los desarrolladores evaluar si una función de plugin se activa correctamente, si persiste tras modificaciones o cambios de modelo, y si supera el rendimiento de una versión básica sin plugin. El proceso se ejecuta directamente en versiones posteriores a v2.1.269 del entorno Claude Code, pudiendo aplicarse a cualquier directorio que contenga un archivo manifest como plugin.json o .claude-plugin/plugin.json, o un directorio de habilidades.
La estructura de evaluación se organiza dentro de una carpeta evaluaciones (evals/) dentro del repositorio del plugin. Cada caso se almacena en una subcarpeta, incluyendo un archivo prompt.md y una carpeta de evaluadores (graders/). El contenido del prompt se envía directamente a Claude sin procesar, manteniendo intactos los mencionados mediante @path. El frontmatter del prompt permite establecer parámetros como el número máximo de turnos (por defecto 10), tiempo de espera (300 segundos), modelo específico, etiquetas y herramientas permitidas. Los evaluadores, definidos como archivos en formato markdown, incluyen un frontmatter que especifica el tipo de evaluación, un peso opcional y un brazo (arm) para comparar resultados.
Se identifican seis tipos de evaluadores. Cuatro son de costo cero, derivados automáticamente del registro del chat y del estado de los archivos: coincidencia por expresión regular, uso de herramientas, orden de ejecución y existencia de archivos. Dos requieren llamadas a un modelo de juicio y generan cargos reales: el tipo llm, que evalúa la respuesta frente a criterios de redacción definidos por el desarrollador, y el tipo baseline, que compara la salida contra una respuesta de referencia. El comando claude plugin eval init permite al equipo definir qué resultado es adecuado, proponer casos y evaluadores, probarlos y generar automáticamente los archivos necesarios. En entornos de integración continua (CI), se puede usar la opción --bare para crear un modelo de plantilla vacía.
El indicador clave de esta evaluación es Δ, que representa la diferencia entre dos ejecuciones: una con el plugin activo y otra sin él. Este valor cuantifica el aporte real del plugin. Por defecto, cada caso se ejecuta dos veces, permitiendo así medir el impacto neto de la integración. Si un caso obtiene una puntuación de 1.0 en ambas versiones, el resultado indica que el plugin no aporta valor funcional.
Para inversores y profesionales del sector peruano, esta evolución en IA aplicada a desarrollo de software refleja un avance clave en la calidad de las herramientas de automatización. En un contexto donde las empresas buscan optimizar costos y aumentar la eficiencia operativa, el uso de evaluaciones automatizadas permite detectar mejoras en procesos antes de su implementación. Esto es especialmente relevante para PYMEs que adoptan tecnologías digitales, ya que les brinda un marco claro para medir el retorno de inversión en soluciones de inteligencia artificial.
