Contacta con nosotros

Temario del curso

Introducción a la IA Multimodal

  • Visión general de la IA multimodal y aplicaciones prácticas.
  • Desafíos en la integración de datos de texto, imagen y audio.
  • Estado del arte en investigación y avances recientes.

Procesamiento de Datos e Ingeniería de Características

  • Manejo de conjuntos de datos de texto, imagen y audio.
  • Técnicas de preprocesamiento para el aprendizaje multimodal.
  • Extracción de características y estrategias de fusión de datos.

Construcción de Modelos Multimodales con PyTorch y Hugging Face

  • Introducción a PyTorch para el aprendizaje multimodal.
  • Uso de Transformers de Hugging Face para tareas de PLN y visión por computadora.
  • Combinación de diferentes modalidades en un modelo de IA unificado.

Implementación de Fusión de Voz, Visión y Texto

  • Integración de OpenAI Whisper para reconocimiento de voz.
  • Aplicación de DeepSeek-Vision para procesamiento de imágenes.
  • Técnicas de fusión para el aprendizaje entre modalidades (cross-modal learning).

Entrenamiento y Optimización de Modelos de IA Multimodal

  • Estrategias de entrenamiento de modelos para IA multimodal.
  • Técnicas de optimización y ajuste de hiperparámetros.
  • Abordaje del sesgo y mejora de la generalización de los modelos.

Despliegue de IA Multimodal en Aplicaciones Prácticas

  • Exportación de modelos para su uso en producción.
  • Despliegue de modelos de IA en plataformas en la nube.
  • Monitoreo del rendimiento y mantenimiento de los modelos.

Temas Avanzados y Tendencias Futuras

  • Aprendizaje con cero ejemplos (zero-shot) y con pocos ejemplos (few-shot) en IA multimodal.
  • Consideraciones éticas y desarrollo responsable de la IA.
  • Tendencias emergentes en la investigación de IA multimodal.

Resumen y Próximos Pasos

Requerimientos

  • Sólida comprensión de los conceptos de aprendizaje automático y aprendizaje profundo.
  • Experiencia con frameworks de IA como PyTorch o TensorFlow.
  • Familiaridad con el procesamiento de datos de texto, imagen y audio.

Dirigido a

  • Desarrolladores de IA.
  • Ingenieros de aprendizaje automático.
  • Investigadores.
 21 Horas

Número de participantes


Precio por participante

Reseñas (1)

Próximos cursos

Categorías Relacionadas