LAB AE06

Construye un Eval Pipeline

Crea un eval dataset completo, un runner con checks programáticos, y un CI gate.

1

Crea el eval dataset

Mínimo 15 casos: 8 golden, 4 edge, 3 adversarial. Formato JSONL.

jsonl
💡 Framework 5-3-3-2: 5 golden, 3 edge, 3 adversarial, 2 regression por behavior.
2

Implementa el eval runner

Lee JSONL, ejecuta cada caso contra el agente, verifica checks programáticos.

python
💡 Cada check es determinístico y gratuito. LLM-as-judge solo para criterios subjetivos.
3

Genera reporte

Imprime pass/fail por caso con razón de fallo.

python
💡 Threshold: golden ≥85%, adversarial ≥95%, regression =100%.
4

CI gate

Script que bloquea si el score está por debajo del threshold.

python
💡 En GitHub Actions: ejecutar en cada PR que toque docs/prompts/ o src/agents/.

Checklist de completación