CLOSED
S&PNASDAQDOWR2KVIXAAPLMSFTNVDAGOOGLMETAAMZNTSLAAVGOGOLDWTIUSDPEN
Yahoo · 60s · delay ~15min
LIVE
BTCETHSOLXRPADABNBDOGE
CoinGecko · 30s
Supabase Lanza Herramienta Abierta para Evaluar Agentes de IA
Papers

Supabase Lanza Herramienta Abierta para Evaluar Agentes de IA

MarkTechPost (AI/ML News)1 de agosto de 2026Cortesia de MarkTechPost (AI/ML News)

Segun MarkTechPost (AI/ML News), Supabase ha lanzado Supabase Evals, un marco abierto para medir el rendimiento de agentes de inteligencia artificial al ejecutar tareas reales en entornos similares a los de producción. La herramienta pone a prueba modelos como Claude Code, Codex y OpenCode, enfrentándolos a escenarios prácticos como la creación de esquemas de base de datos, la corrección de funciones fallidas en Edge Functions o el ajuste de políticas de seguridad en RLS. Los resultados se evalúan mediante un sistema de puntuación que combina verificaciones determinísticas con análisis de lenguaje. La iniciativa se presenta como un sistema operativo en tiempo real, con un tablero público disponible en supabase.com/evals y un conjunto interno de pruebas que se actualiza diariamente.

El marco se estructura en tres ejes: productos (como base de datos, autenticación, almacenamiento y funciones en la frontera), temas (como seguridad, migraciones, SQL y políticas de RLS) y fases del ciclo (construcción, despliegue, investigación y resolución). A partir de este diseño, se seleccionó un conjunto mínimo de escenarios que tocan cada dimensión, basado en tickets de soporte, reportes de errores y incidencias de GitHub. Los escenarios se dividen en dos categorías: uno enfocado en la cobertura general, publicado y disponible para todos, y otro que abarca fallos conocidos, actualizado diariamente y que no modifica las puntuaciones ya publicadas. Cada prueba se ejecuta en un entorno real, simulando condiciones de producción mediante contenedores que replican una pila de servicios.

La herramienta permite a los desarrolladores probar actualizaciones de documentación, validar cambios en habilidades de agentes y comparar distintos entornos de ejecución. Su uso es especialmente útil en sectores donde errores en políticas de seguridad pueden tener consecuencias graves, como en finanzas o salud. Los desarrolladores pueden integrarla para validar el comportamiento de sus herramientas de automatización, evitando fallos en entornos críticos. La implementación requiere un entorno local con Docker, claves de acceso a proveedores y el rango de puertos 54321 a 54329 libre. El código está disponible bajo licencia Apache-2.0 y se puede ejecutar localmente mediante pnpm.

Para los profesionales del sector peruano, esta evolución en IA agente representa una oportunidad para mejorar la calidad de los sistemas de desarrollo. En un contexto donde las startups y empresas de servicios tecnológicos enfrentan crecientes exigencias de seguridad y eficiencia, herramientas como esta permiten validar que los sistemas automatizados no solo generan código, sino que lo hacen de forma segura y funcional. Aunque aún se encuentra en fases iniciales, su disponibilidad abierta y su enfoque práctico la posicionan como una pieza clave en el desarrollo de plataformas más robustas y confiables.