Contacta con nosotros

Temario del curso

Introducción al Aprendizaje por Refuerzo a partir de Retorno Humano (RLHF)

  • ¿Qué es RLHF y por qué es importante?
  • Comparación con métodos de ajuste fino supervisado
  • Aplicaciones del RLHF en sistemas modernos de IA

Modelado de recompensas con retorno humano

  • Recopilación y estructuración del retorno humano
  • Construcción y entrenamiento de modelos de recompensa
  • Evaluación de la efectividad de los modelos de recompensa

Entrenamiento con Optimización Política Cercana (PPO)

  • Visión general de los algoritmos PPO para RLHF
  • Implementación de PPO con modelos de recompensa
  • Ajuste iterativo y seguro de modelos

Ajuste fino práctico de modelos de lenguaje

  • Preparación de conjuntos de datos para flujos de trabajo de RLHF
  • Ajuste fino en vivo de un pequeño modelo de lenguaje (LLM) utilizando RLHF
  • Desafíos y estrategias de mitigación

Escalar el RLHF a sistemas productivos

  • Consideraciones sobre infraestructura y capacidad de cómputo
  • Aseguramiento de la calidad y bucles de retroalimentación continua
  • Mejores prácticas para despliegue y mantenimiento

Consideraciones éticas y mitigación del sesgo

  • Abordaje de riesgos éticos en el retorno humano
  • Estrategias de detección y corrección de sesgos
  • Aseguramiento de la alineación y salidas seguras

Casos de estudio y ejemplos del mundo real

  • Caso de estudio: Ajuste fino de ChatGPT con RLHF
  • Otras implementaciones exitosas de RLHF
  • Lecciones aprendidas e insights del sector

Resumen y próximos pasos

Requerimientos

  • Comprensión de los fundamentos del aprendizaje supervisado y por refuerzo
  • Experiencia en ajuste fino de modelos y arquitecturas de redes neuronales
  • Conocimiento básico de la programación en Python y marcos de aprendizaje profundo (por ejemplo, TensorFlow, PyTorch)

Público objetivo

  • Ingenieros de aprendizaje automático
  • Pesquisadores de IA
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas