Ponte en Contacto

Temario del curso

Introducción a la IA Agéntica para Operaciones

  • De guiones de ejecución (runbooks) estáticos a agentes de razonamiento: la evolución de la automatización de TI
  • Anatomía del agente: ciclo de razonamiento, uso de herramientas, memoria y planificación
  • Cuándo automatizar vs. cuándo mantener la intervención humana (human-in-the-loop)

Marcos y Arquitecturas de Agentes

  • Patrones de agente único: ReAct, Plan-and-Execute y bucles de llamada a herramientas
  • Arquitecturas multiagente: patrones de supervisor, jerárquicos y de enjambre (swarm)
  • Comparación de marcos (frameworks): LangGraph, CrewAI, AutoGen y agentes personalizados
  • Construcción del primer agente operativo: consultar monitoreo, diagnosticar y proponer

Integración de Herramientas para Operaciones de TI

  • Conexión de agentes a APIs de Prometheus, Grafana, Datadog y PagerDuty
  • Consultas de registros con agentes: integración con Elasticsearch, Loki y Splunk
  • Uso de herramientas de infraestructura: kubectl, Terraform, Ansible mediante acciones del agente
  • Diseño de interfaces de herramientas seguras con validación de parámetros y idempotencia

Automatización de la Respuesta a Incidentes

  • Triaje de incidentes automatizado: clasificación de severidad y enrutamiento
  • Generación de hipótesis de causa raíz y recopilación de evidencia
  • Remediación automatizada: acciones de reinicio, escalado, reversión (rollback) y conmutación por fallo (failover)
  • Creación de un agente de runbook de incidentes con niveles de autonomía progresivos

Seguridad, Salvaguardas e Intervención Humana

  • Clasificación de acciones: solo lectura, bajo riesgo, alto riesgo y destructivas
  • Puntos de aprobación y políticas de escalado para operaciones críticas
  • Patrones de salvaguardas: listas de permisos de acciones, límites de alcance (blast radius) y garantías de reversión
  • Registros de auditoría y trazabilidad de decisiones para cumplimiento normativo

Orquestación Multiagente para Incidentes Complejos

  • Coordinación de agentes especializados: agente de triaje, agente de diagnóstico, agente de remediación
  • Comunicación entre agentes y gestión de contexto compartido
  • Resolución de conflictos cuando los agentes proponen acciones contradictorias
  • Simulación de un incidente mayor de extremo a extremo con respuesta multiagente

Observabilidad y Evaluación

  • Trazado de cadenas de razonamiento de agentes para depuración y auditoría
  • Evaluación de la calidad de las decisiones del agente: precisión, recall, tiempo de resolución
  • Bucles de retroalimentación: aprendizaje de anulación por operadores y resultados
  • Seguimiento de costos y economía de tokens para agentes operativos

Despliegue en Producción y Operaciones

  • Despliegue de agentes como servicios: APIs, webhooks y trabajos programados
  • Despliegue gradual de autonomía: de modo sombra (shadow mode) a remediación totalmente automática
  • Runbook para fallos de agentes: ¿qué hacer cuando el propio agente falla?
  • Construcción del caso de negocio y medición del ROI para operaciones autónomas

Requerimientos

  • Experiencia en operaciones de TI, DevOps o prácticas SRE.
  • Conocimiento de scripting en Python y APIs REST.
  • Comprensión básica de las capacidades de los LLM (Modelos de Lenguaje de Gran Escala) y la ingeniería de prompts.

Público Objetivo

  • Ingenieros SRE y DevOps que exploran la automatización basada en IA.
  • Ingenieros de plataforma que construyen infraestructura de auto-reparación (self-healing).
  • Líderes de operaciones de TI que evalúan la IA agéntica para la gestión de incidentes.
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas