← Volver al catálogo
Agentes IASistemaAvanzadoEn el pase

Arnés de Evaluación (Desarrollo Dirigido por Evals)

Marco formal de evaluación para sesiones de Claude Code que aplica los principios del desarrollo dirigido por evals (EDD): tratar las evals como los tests unitarios del trabajo con IA. Sirve para definir criterios de éxito, medir la fiabilidad del agente con métricas pass@k y crear suites de regresión ante cambios de prompt o de agente. Para equipos que quieren medir y no adivinar el rendimiento de sus agentes.

Comprobando acceso…

Incluida en el Pase · para Claude Code

// resultado_de_ejemplo
Abrir en una pestaña nueva ↗

// qué_hace

Proporciona un marco para definir, ejecutar y medir evaluaciones de tareas de agente con criterios pass/fail y métricas de fiabilidad.

// cómo_lo_hace

Distingue evals de capacidad y de regresión, define criterios de éxito antes de implementar, usa graders basados en código y métricas pass@k, y mantiene suites de regresión para detectar cambios entre versiones.

// ejemplo_de_uso

Úsala antes de tocar el prompt o el modelo de un agente para saber si una mejora rompe lo que ya funcionaba. Ej.: defines 20 casos pass/fail y, al cambiar de modelo, detectas que la fiabilidad cae del 90% al 75% antes de publicarlo.

// plataformas

Claude Code
Categoría
Agentes IA
Tipo
Sistema
Nivel
Avanzado
Licencia
MIT
Seguridad
seguro · riesgo bajo
Versión
1.0.0

// opiniones_de_la_comunidad

Opiniones

Cargando opiniones…