Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Infraestructura como Código para EXO
- Visión general de los patrones de implementación de EXO: nodo único, multiplo y clústeres con RDMA.
- Automatización de la instalación de dependencias (Xcode, uv, Node.js, Rust) con gestión de configuraciones.
- Uso de flakes de Nix para construcciones reproducibles de EXO y entornos de desarrollo.
- Escritura de playbooks de Ansible o scripts de shell para el aprovisionamiento no supervisado de clústeres.
Construcciones Reproducibles e Integración con CI
- Fijar dependencias y construir el dashboard en las tuberías de CI.
- Ejecutar pruebas humo (smoke tests) de EXO en ejecutores de GitHub Actions o GitLab CI.
- Crear imágenes doradas y flujos de reversión basados en instantáneas para máquinas virtuales de macOS y Linux.
- Versionar tarjetas de modelos personalizados junto con el código de la aplicación.
Descubrimiento del Clúster y Automatización de Redes
- Configuración de mDNS y DNS estático para un descubrimiento confiable de nodos libp2p.
- Automatización de la creación de perfiles de red y gestión de puentes Thunderbolt en macOS.
- Uso de espacios de nombres personalizados (EXO_LIBP2P_NAMESPACE) para separar clústeres de desarrollo, staging y producción.
- Reglas de firewall y segmentación de red para entornos multiinquilino.
Gestión de Ciclo de Vida de Almacenamiento y Modelos
- Diseño de estrategias para EXO_MODELS_DIRS y EXO_MODELS_READ_ONLY_DIRS.
- Montar comparticiones NFS o SAN como repositorios de modelos de solo lectura para un aprovisionamiento rápido.
- Colección de basura de cachés obsoletos y políticas de retención de pesos versionados.
- Automatizar la pre-descarga de modelos y verificaciones de salud antes de actualizaciones progresivas.
Monitoreo y Alertas
- Enviar logs de EXO a registro centralizado (ELK, Loki o Splunk).
- Crear dashboards de Grafana a partir de la salida EXO_TRACING_ENABLED.
- Configurar alertas por cambios en la membresía del clúster, eventos OOM y picos de latencia de inferencia.
- Correlacionar telemetría de hardware de macmon con regresiones de rendimiento de modelos.
Actualización, Reversión y Recuperación ante Desastres
- Preparar actualizaciones del binario EXO en un nodo canario antes del despliegue en toda la flota.
- Reversión a nivel de modelo: alternar entre versiones cuantizadas sin volver a descargar.
- Copias de seguridad y restauración del estado del clúster, espacios de nombres personalizados y pesos almacenados en caché.
- Documentar manuales de recuperación para escenarios de reconstrucción total del clúster.
Endurecimiento de Seguridad y Cumplimiento
- Aplicar TLS en la capa de proxy inverso (nginx, traefik) para el dashboard y la API.
- Implementar limitación de velocidad de API y listados blancos de IP para los puntos finales de EXO.
- Aislar clústeres con VLANs y políticas de red de confianza cero.
- Auditar accesos y mantener un inventario de modelos desplegados y sus versiones.
Requerimientos
- Experiencia con prácticas DevOps (CI/CD, IaC, orquestación de contenedores).
- Familiaridad con la administración de sistemas y gestión de paquetes en macOS o Linux.
- Comprensión de conceptos de redes, DNS y almacenamiento.
Público Objetivo
- Ingenieros DevOps.
- Arquitectos de infraestructura.
- SREs responsables de cargas de trabajo de IA en instalaciones propias (on-premise).
21 Horas
Reseñas (2)
El conocimiento y experiencia del consultor ya que se abordan los temas teóricos aplicándolos a la realidad de los procesos. El curso contiene un programa de mucho valor en la gestión de las tecnologías de información.
Luis Castro Gamboa - Cooperativa De Ahorro Y Credito Ande No. 1 R.L.
Curso - Site Reliability Engineering (SRE) Foundation®
Que fue muy claro en cada especificación