Contacta con nosotros

Temario del curso

Infraestructura como Código para EXO

  • Visión general de los patrones de implementación de EXO: nodo único, multiplo y clústeres con RDMA.
  • Automatización de la instalación de dependencias (Xcode, uv, Node.js, Rust) con gestión de configuraciones.
  • Uso de flakes de Nix para construcciones reproducibles de EXO y entornos de desarrollo.
  • Escritura de playbooks de Ansible o scripts de shell para el aprovisionamiento no supervisado de clústeres.

Construcciones Reproducibles e Integración con CI

  • Fijar dependencias y construir el dashboard en las tuberías de CI.
  • Ejecutar pruebas humo (smoke tests) de EXO en ejecutores de GitHub Actions o GitLab CI.
  • Crear imágenes doradas y flujos de reversión basados en instantáneas para máquinas virtuales de macOS y Linux.
  • Versionar tarjetas de modelos personalizados junto con el código de la aplicación.

Descubrimiento del Clúster y Automatización de Redes

  • Configuración de mDNS y DNS estático para un descubrimiento confiable de nodos libp2p.
  • Automatización de la creación de perfiles de red y gestión de puentes Thunderbolt en macOS.
  • Uso de espacios de nombres personalizados (EXO_LIBP2P_NAMESPACE) para separar clústeres de desarrollo, staging y producción.
  • Reglas de firewall y segmentación de red para entornos multiinquilino.

Gestión de Ciclo de Vida de Almacenamiento y Modelos

  • Diseño de estrategias para EXO_MODELS_DIRS y EXO_MODELS_READ_ONLY_DIRS.
  • Montar comparticiones NFS o SAN como repositorios de modelos de solo lectura para un aprovisionamiento rápido.
  • Colección de basura de cachés obsoletos y políticas de retención de pesos versionados.
  • Automatizar la pre-descarga de modelos y verificaciones de salud antes de actualizaciones progresivas.

Monitoreo y Alertas

  • Enviar logs de EXO a registro centralizado (ELK, Loki o Splunk).
  • Crear dashboards de Grafana a partir de la salida EXO_TRACING_ENABLED.
  • Configurar alertas por cambios en la membresía del clúster, eventos OOM y picos de latencia de inferencia.
  • Correlacionar telemetría de hardware de macmon con regresiones de rendimiento de modelos.

Actualización, Reversión y Recuperación ante Desastres

  • Preparar actualizaciones del binario EXO en un nodo canario antes del despliegue en toda la flota.
  • Reversión a nivel de modelo: alternar entre versiones cuantizadas sin volver a descargar.
  • Copias de seguridad y restauración del estado del clúster, espacios de nombres personalizados y pesos almacenados en caché.
  • Documentar manuales de recuperación para escenarios de reconstrucción total del clúster.

Endurecimiento de Seguridad y Cumplimiento

  • Aplicar TLS en la capa de proxy inverso (nginx, traefik) para el dashboard y la API.
  • Implementar limitación de velocidad de API y listados blancos de IP para los puntos finales de EXO.
  • Aislar clústeres con VLANs y políticas de red de confianza cero.
  • Auditar accesos y mantener un inventario de modelos desplegados y sus versiones.

Requerimientos

  • Experiencia con prácticas DevOps (CI/CD, IaC, orquestación de contenedores).
  • Familiaridad con la administración de sistemas y gestión de paquetes en macOS o Linux.
  • Comprensión de conceptos de redes, DNS y almacenamiento.

Público Objetivo

  • Ingenieros DevOps.
  • Arquitectos de infraestructura.
  • SREs responsables de cargas de trabajo de IA en instalaciones propias (on-premise).
 21 Horas

Número de participantes


Precio por participante

Reseñas (2)

Próximos cursos

Categorías Relacionadas