Ponte en Contacto

Temario del curso

Fundamentos de Producción de Tencent Hunyuan

  • Visión general de los escenarios de servicio de modelos de Tencent Hunyuan
  • Características de producción de modelos grandes y MoE
  • Cuellos de botella comunes en latencia, throughput y costos
  • Definición de objetivos de nivel de servicio (SLO) para cargas de trabajo de inferencia

Arquitectura de Despliegue y Flujo de Servicio

  • Componentes centrales de una pila de inferencia en producción
  • Elegir entre modelos de despliegue con contenedores, on-premise o en la nube
  • Fundamentos de carga de modelos, enrutamiento de solicitudes y asignación de GPU
  • Diseño para confiabilidad y simplicidad operativa

Optimización de Latencia en la Práctica

\r
  • Uso de motores de inferencia optimizados como TensorRT cuando sea aplicable
  • Conceptos de KV-cache y ajuste práctico del caché
  • Reducción de sobrecargas de inicio, calentamiento (warmup) y respuesta
  • Medición del tiempo hasta el primer token (TTFT) y la velocidad de generación de tokens

Throughput, Batching y Eficiencia de GPU

  • Estrategias de continuous batching y request batching
  • Gestión de concurrencia y comportamiento de colas
  • Mejora de la utilización de GPU sin afectar la experiencia del usuario
  • Manejo de solicitudes con contexto largo y cargas de trabajo mixtas

Cuantización y Control de Costos

  • Por qué es importante la cuantización para el servicio en producción
  • Compensaciones prácticas entre FP16, INT8 y otras opciones de precisión comunes
  • Equilibrio entre calidad del modelo, latencia y costo de infraestructura
  • Construcción de una lista de verificación simple para optimización de costos

Operaciones, Monitoreo y Revisión de Estado

  • Activadores de autoscaling para servicios de inferencia
  • Monitoreo de latencia, throughput, uso de caché y salud de la GPU
  • Fundamentos de logging, alertas y respuesta a incidentes
  • Revisión de un despliegue de referencia y creación de un plan de mejora

Requerimientos

  • Comprensión básica de los flujos de trabajo de despliegue e inferencia de modelos de lenguaje grande (LLM)
  • Experiencia con contenedores, infraestructura en la nube o on-premise y servicios basados en API
  • Conocimiento práctico de Python o tareas de ingeniería de sistemas

Audiencia Objetivo

  • Ingenieros de ML que despliegan LLMs en producción
  • Ingenieros de plataforma responsables de servicios de inferencia basados en GPU
  • Arquitectos de soluciones que diseñan plataformas escalables para servir modelos de IA
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas