Lab AE06: Evaluación y Testing
Crea un dataset de evaluación, define métricas de calidad y diseña tests automatizados para tu agente.
Necesitas
- El agente diseñado en labs anteriores
- 5-10 ejemplos reales de uso
- Acceso a ChatGPT, Claude o Gemini
- 25 minutos de tiempo
Pasos
Crea un conjunto de casos de prueba con inputs y outputs esperados.
Establece cómo medir si el agente funciona bien.
Define cómo ejecutar las evaluaciones automáticamente antes de cada deploy.
Checklist de calidad
Comparte con tu equipo
Pide a tu equipo que añada casos de prueba al dataset. Los mejores eval datasets se construyen con inputs reales que el equipo encuentra en producción. Establece un proceso para añadir nuevos casos cada semana.
Resultado final
Un dataset de evaluación JSONL, métricas con umbrales de deploy y un diseño de pipeline CI/CD para testing continuo de tu agente.
🚀 ¿Quieres todos los módulos completos?
Este laboratorio es parte de IAcademy: módulos con vídeo, contenido, quiz y laboratorio práctico para integrar la IA en tu empresa con criterio.