Temario del curso
Introducción a la IA Multimodal
- Visión general de la IA multimodal y aplicaciones prácticas.
- Desafíos en la integración de datos de texto, imagen y audio.
- Estado del arte en investigación y avances recientes.
Procesamiento de Datos e Ingeniería de Características
- Manejo de conjuntos de datos de texto, imagen y audio.
- Técnicas de preprocesamiento para el aprendizaje multimodal.
- Extracción de características y estrategias de fusión de datos.
Construcción de Modelos Multimodales con PyTorch y Hugging Face
- Introducción a PyTorch para el aprendizaje multimodal.
- Uso de Transformers de Hugging Face para tareas de PLN y visión por computadora.
- Combinación de diferentes modalidades en un modelo de IA unificado.
Implementación de Fusión de Voz, Visión y Texto
- Integración de OpenAI Whisper para reconocimiento de voz.
- Aplicación de DeepSeek-Vision para procesamiento de imágenes.
- Técnicas de fusión para el aprendizaje entre modalidades (cross-modal learning).
Entrenamiento y Optimización de Modelos de IA Multimodal
- Estrategias de entrenamiento de modelos para IA multimodal.
- Técnicas de optimización y ajuste de hiperparámetros.
- Abordaje del sesgo y mejora de la generalización de los modelos.
Despliegue de IA Multimodal en Aplicaciones Prácticas
- Exportación de modelos para su uso en producción.
- Despliegue de modelos de IA en plataformas en la nube.
- Monitoreo del rendimiento y mantenimiento de los modelos.
Temas Avanzados y Tendencias Futuras
- Aprendizaje con cero ejemplos (zero-shot) y con pocos ejemplos (few-shot) en IA multimodal.
- Consideraciones éticas y desarrollo responsable de la IA.
- Tendencias emergentes en la investigación de IA multimodal.
Resumen y Próximos Pasos
Requerimientos
- Sólida comprensión de los conceptos de aprendizaje automático y aprendizaje profundo.
- Experiencia con frameworks de IA como PyTorch o TensorFlow.
- Familiaridad con el procesamiento de datos de texto, imagen y audio.
Dirigido a
- Desarrolladores de IA.
- Ingenieros de aprendizaje automático.
- Investigadores.
Reseñas (1)
Nuestro instructor, Yashank, era increíblemente conocedor. Adaptó el currículo para que se ajustara a lo que realmente necesitábamos aprender y tuvimos una excelente experiencia de aprendizaje con él. Su comprensión del dominio que estaba enseñando fue impresionante; compartió insights basados en experiencias reales y nos ayudó a resolver problemas reales que estábamos enfrentando en nuestro trabajo.
Ahmed Nazeem - Maldives Pension Administration Office
Curso - Multimodal AI for Enhanced User Experience
Traducción Automática