Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Duración 14 horas
Temario del curso
Fundamentos de Producción de Tencent Hunyuan
- Visión general de los escenarios de servicio de modelos de Tencent Hunyuan
- Características de producción de modelos grandes y MoE
- Cuellos de botella comunes en latencia, throughput y costos
- Definición de objetivos de nivel de servicio (SLO) para cargas de trabajo de inferencia
Arquitectura de Despliegue y Flujo de Servicio
- Componentes centrales de una pila de inferencia en producción
- Elegir entre modelos de despliegue con contenedores, on-premise o en la nube
- Fundamentos de carga de modelos, enrutamiento de solicitudes y asignación de GPU
- Diseño para confiabilidad y simplicidad operativa
Optimización de Latencia en la Práctica
\r- Uso de motores de inferencia optimizados como TensorRT cuando sea aplicable
- Conceptos de KV-cache y ajuste práctico del caché
- Reducción de sobrecargas de inicio, calentamiento (warmup) y respuesta
- Medición del tiempo hasta el primer token (TTFT) y la velocidad de generación de tokens
Throughput, Batching y Eficiencia de GPU
- Estrategias de continuous batching y request batching
- Gestión de concurrencia y comportamiento de colas
- Mejora de la utilización de GPU sin afectar la experiencia del usuario
- Manejo de solicitudes con contexto largo y cargas de trabajo mixtas
Cuantización y Control de Costos
- Por qué es importante la cuantización para el servicio en producción
- Compensaciones prácticas entre FP16, INT8 y otras opciones de precisión comunes
- Equilibrio entre calidad del modelo, latencia y costo de infraestructura
- Construcción de una lista de verificación simple para optimización de costos
Operaciones, Monitoreo y Revisión de Estado
- Activadores de autoscaling para servicios de inferencia
- Monitoreo de latencia, throughput, uso de caché y salud de la GPU
- Fundamentos de logging, alertas y respuesta a incidentes
- Revisión de un despliegue de referencia y creación de un plan de mejora
Requerimientos
- Comprensión básica de los flujos de trabajo de despliegue e inferencia de modelos de lenguaje grande (LLM)
- Experiencia con contenedores, infraestructura en la nube o on-premise y servicios basados en API
- Conocimiento práctico de Python o tareas de ingeniería de sistemas
Audiencia Objetivo
- Ingenieros de ML que despliegan LLMs en producción
- Ingenieros de plataforma responsables de servicios de inferencia basados en GPU
- Arquitectos de soluciones que diseñan plataformas escalables para servir modelos de IA