LAB AE06
Construye un Eval Pipeline
Crea un eval dataset completo, un runner con checks programáticos, y un CI gate.
1
Crea el eval dataset
Mínimo 15 casos: 8 golden, 4 edge, 3 adversarial. Formato JSONL.
jsonl
💡 Framework 5-3-3-2: 5 golden, 3 edge, 3 adversarial, 2 regression por behavior.
2
Implementa el eval runner
Lee JSONL, ejecuta cada caso contra el agente, verifica checks programáticos.
python
💡 Cada check es determinístico y gratuito. LLM-as-judge solo para criterios subjetivos.
3
Genera reporte
Imprime pass/fail por caso con razón de fallo.
python
💡 Threshold: golden ≥85%, adversarial ≥95%, regression =100%.
4
CI gate
Script que bloquea si el score está por debajo del threshold.
python
💡 En GitHub Actions: ejecutar en cada PR que toque docs/prompts/ o src/agents/.
✓