Lab AE06: Evaluación y Testing

Crea un dataset de evaluación, define métricas de calidad y diseña tests automatizados para tu agente.

Tu reto: Crea una suite de evaluación completa para tu agente IA

Necesitas

  • El agente diseñado en labs anteriores
  • 5-10 ejemplos reales de uso
  • Acceso a ChatGPT, Claude o Gemini
  • 25 minutos de tiempo

Pasos

Paso 1: Genera el dataset de evaluación

Crea un conjunto de casos de prueba con inputs y outputs esperados.

Genera un dataset de evaluación en formato JSONL para mi agente: Nombre: [NOMBRE DEL AGENTE] Objetivo: [OBJETIVO] Input schema: [DESCRIBE EL FORMATO DE ENTRADA] Output esperado: [DESCRIBE EL FORMATO DE SALIDA] Genera 10 casos de prueba: - 5 happy path (uso normal) - 3 edge cases (datos incompletos, formatos raros) - 2 adversariales (intentos de inyección, inputs maliciosos) Formato JSONL: {"input": {...}, "expected_output": {...}, "category": "happy|edge|adversarial"}
Paso 2: Define las métricas de evaluación

Establece cómo medir si el agente funciona bien.

Para el agente "[NOMBRE]", define métricas de evaluación: 1. Accuracy: ¿cómo medimos si la respuesta es correcta? 2. Latencia: ¿cuál es el tiempo máximo aceptable? 3. Coste por ejecución: ¿cuántos tokens consume en promedio? 4. Tasa de escalación: ¿qué % de casos escala a humano? 5. Tasa de error: ¿cuál es el umbral de error aceptable? Para cada métrica: fórmula de cálculo, umbral mínimo (gate para deploy) y frecuencia de medición.
Paso 3: Diseña el pipeline de CI/CD para evals

Define cómo ejecutar las evaluaciones automáticamente antes de cada deploy.

Diseña un pipeline de CI/CD para evaluación de mi agente IA: Dataset: 10 casos (del Paso 1) Métricas: [LISTA DEL PASO 2] Umbral de deploy: accuracy >= [X]% Genera: 1. Pseudocódigo del script de evaluación 2. Criterios de gate (qué bloquea el deploy) 3. Formato del reporte de resultados 4. Estrategia de regresión (comparar con versión anterior) 5. Alertas cuando las métricas degradan

Checklist de calidad

Comparte con tu equipo

Pide a tu equipo que añada casos de prueba al dataset. Los mejores eval datasets se construyen con inputs reales que el equipo encuentra en producción. Establece un proceso para añadir nuevos casos cada semana.

Resultado final

Un dataset de evaluación JSONL, métricas con umbrales de deploy y un diseño de pipeline CI/CD para testing continuo de tu agente.

🚀 ¿Quieres todos los módulos completos?

Este laboratorio es parte de IAcademy: módulos con vídeo, contenido, quiz y laboratorio práctico para integrar la IA en tu empresa con criterio.

Ver planes Recursos gratuitos