Lab AE07: Producción y Operaciones

Diseña el plan operativo para llevar tu agente a producción: observabilidad, alertas, runbooks y rollback.

Tu reto: Crea el runbook operativo y el plan de observabilidad de tu agente

Necesitas

  • El diseño completo del agente
  • Conocimiento de tu infraestructura
  • Acceso a ChatGPT, Claude o Gemini
  • 20 minutos de tiempo

Pasos

Paso 1: Diseña el plan de observabilidad

Define qué métricas, logs y trazas necesitas para operar el agente en producción.

Diseña el plan de observabilidad para un agente IA en producción: Agente: [NOMBRE] Infraestructura: [CLOUD/ON-PREM, STACK] Volumen esperado: [N ejecuciones/día] Define: 1. Métricas clave: latencia p50/p95/p99, tokens/ejecución, tasa de error, coste/hora 2. Logs estructurados: campos obligatorios por cada ejecución 3. Trazas distribuidas: spans por cada tool call y decisión del agente 4. Dashboards: 3 paneles esenciales (salud, coste, calidad) 5. Alertas: condiciones, umbrales y canales de notificación
Paso 2: Escribe el runbook

Documenta los procedimientos para incidentes comunes del agente.

Genera un runbook operativo para el agente "[NOMBRE]" con estos escenarios: 1. El agente no responde (timeout) 2. La tasa de error supera el 10% 3. El coste se dispara (2x normal) 4. Un usuario reporta output incorrecto 5. El modelo LLM subyacente no está disponible Para cada escenario: - Síntomas (cómo lo detectas) - Diagnóstico (qué verificar primero) - Acción inmediata (mitigación en < 5 min) - Resolución definitiva - Post-mortem (qué documentar)
Paso 3: Define la estrategia de deploy y rollback

Planifica cómo desplegar nuevas versiones del agente de forma segura.

Define la estrategia de deploy para el agente "[NOMBRE]": 1. Canary deployment: % de tráfico inicial y criterios de promoción 2. Feature flags: qué capacidades se activan gradualmente 3. Rollback automático: condiciones que disparan un rollback 4. Ventana de mantenimiento: horarios de menor impacto 5. Checklist pre-deploy: verificaciones obligatorias antes de cada release

Checklist de calidad

Comparte con tu equipo

Simula un incidente con tu equipo de operaciones usando el runbook. Crónometra el tiempo de diagnóstico y acción. Si el tiempo supera 15 minutos, el runbook necesita más detalle o automatización.

Resultado final

Un plan de observabilidad con dashboards y alertas, un runbook operativo y una estrategia de deploy con rollback para tu agente en producción.

🚀 ¿Quieres todos los módulos completos?

Este laboratorio es parte de IAcademy: módulos con vídeo, contenido, quiz y laboratorio práctico para integrar la IA en tu empresa con criterio.

Ver planes Recursos gratuitos