Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Introducción a EXO y Clustering de IA Local
- Visión general del marco EXO y el ecosistema exo-explore
- Comparación entre inferencia centralizada en la nube e inferencia local distribuida
- Arquitectura: descubrimiento de dispositivos libp2p, backend MLX, panel de control y capas de API
- Requisitos de hardware: Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, almacenamiento compartido
Instalación de EXO en macOS
- Configuración de Xcode, Metal Toolchain y prerequisitos de macOS
- Instalación de uv, Node.js y Rust toolchain nightly
- Instalación del fork pinhead macmon para la monitorización de Apple Silicon
- Clonar el repositorio y construir el panel de control con npm
- Ejecutar EXO desde el código fuente y verificar el panel en localhost:52415
Instalación de EXO en Linux
- Instalación de dependencias mediante apt o Homebrew en Linux
- Configuración de uv, Node.js 18+ y Rust nightly
- Construcción del panel de control y ejecución de EXO en modo solo CPU
- Estructura de directorios: rutas XDG Base Directory para configuración, datos, caché y registros
Descubrimiento Automático de Dispositivos y Formación del Cluster
- Comprensión del auto-descubrimiento basado en libp2p a través de redes locales
- Configuración de namespaces personalizados con EXO_LIBP2P_NAMESPACE para el aislamiento del cluster
- Verificación de la membresía del nodo en la vista del cluster del panel de control
- Gestión de fallos de descubrimiento y problemas de segmentación de red
Habilitación de RDMA sobre Thunderbolt 5
- Arquitectura RDMA y la afirmación de reducción del 99 por ciento en latencia
- Habilitación de RDMA en el modo de recuperación de macOS con rdma_ctl
- Requisitos de cables y restricciones de topología de puertos en Mac Studio
- Concordancia de versiones de macOS entre todos los nodos del cluster
- Solución de problemas de descubrimiento de RDMA y configuración DHCP
Despliegue de Modelos de Vanguardia
- Uso del panel de control para cargar y fragmentar modelos DeepSeek v3.1, Qwen3-235B y la familia Llama
- Vista previa de asignaciones de instancias con el punto final /instance/previews de la API
- Creación de instancias de modelo con fragmentación por pipeline o paridad tensorial
- Configuración de tarjetas de modelo personalizadas desde HuggingFace hub
Monitorización y Solución de Problemas
- Lectura de registros EXO y comprensión del rastreo distribuido
- Interpretación de la salud del cluster en la vista del cluster del panel de control
- Diagnóstico de fallos en nodos trabajadores y comportamiento de reconexión
- Uso de EXO_TRACING_ENABLED para el análisis de cuellos de botella de rendimiento
Mantenimiento y Actualización del Cluster
- Actualización de binarios EXO y procedimientos de reconstrucción del panel de control
- Migración de cachés de modelos y gestión de modelos descargados previamente sobre NFS
- Eliminación ordenada de nodos y reequilibrio de cargas de trabajo
Requerimientos
- Comprensión de los fundamentos de redes (IP, subnetting, firewalls)
- Experiencia con la administración de línea de comandos en macOS o Linux
- Familiaridad con la gestión de paquetes de Python (pip/uv) y herramientas de Node.js
Público Objetivo
- Administradores de sistemas
- Ingenieros DevOps
- Arquitectos de infraestructura de IA responsables del despliegue de LLM on-premise
21 Horas