Contacta con nosotros

Temario del curso

PySpark & Aprendizaje Automático 

Módulo 1: Fundamentos de Big Data y Spark

  • Visión general del ecosistema de Big Data y el rol de Spark en las plataformas modernas de datos
  • Comprensión de la arquitectura de Spark: controlador, ejecutores, gestor de clústeres, evaluación diferida, DAG y planificación de ejecución
  • Diferencias entre las APIs de RDD y DataFrame y cuándo utilizar cada enfoque
  • Creación y configuración de SparkSession y comprensión de los fundamentos de la configuración de aplicaciones

Módulo 2: DataFrames en PySpark

  • Lectura y escritura de datos desde fuentes empresariales y formatos (CSV, JSON, Parquet, Delta)
  • Trabajo con DataFrames en PySpark: transformaciones, acciones, expresiones de columnas, filtrado, uniones y agregaciones
  • Implementación de operaciones avanzadas como funciones de ventana, manejo de marcas de tiempo y trabajo con datos anidados
  • Aplicación de controles de calidad de datos y escritura de código PySpark reutilizable y mantenible

Módulo 3: Procesamiento eficiente de grandes conjuntos de datos

  • Comprensión de los fundamentos del rendimiento: estrategias de particionado, comportamiento del shuffle, caché y persistencia
  • Uso de técnicas de optimización incluyendo uniones difusas (broadcast joins) y análisis del plan de ejecución
  • Procesamiento eficiente de grandes conjuntos de datos y mejores prácticas para flujos de trabajo de datos escalables
  • Comprensión de la evolución del esquema y los formatos de almacenamiento modernos utilizados en entornos empresariales

Módulo 4: Ingeniería de características a escala

  • Realización de ingeniería de características con Spark MLlib: manejo de valores faltantes, codificación de variables categóricas y escalado de características
  • Diseño de pasos de preprocesamiento reutilizables y preparación de conjuntos de datos para pipelines de aprendizaje automático
  • Introducción a la selección de características y manejo de conjuntos de datos desbalanceados

Módulo 5: Aprendizaje Automático con Spark MLlib

  • Comprensión de la arquitectura de MLlib y el patrón Estimador/Transformador
  • Entrenamiento de modelos de regresión y clasificación a escala (Regresión Lineal, Regresión Logística, Árboles de Decisión, Bosques Aleatorios)
  • Comparación de modelos e interpretación de resultados en flujos de trabajo de aprendizaje automático distribuido

Módulo 6: Pipelines de extremo a extremo para ML

  • Construcción de pipelines completos de aprendizaje automático combinando preprocesamiento, ingeniería de características y modelado
  • Aplicación de estrategias de división entrenamiento/validación/prueba
  • Realización de validación cruzada y ajuste de hiperparámetros utilizando búsqueda por grilla y búsqueda aleatoria
  • Estructuración de experimentos de aprendizaje automático reproducibles

Módulo 7: Evaluación de modelos y toma de decisiones prácticas en ML

  • Aplicación de las métricas de evaluación adecuadas para problemas de regresión y clasificación
  • Identificación de sobreajuste (overfitting) e insuficiente ajuste (underfitting) y toma de decisiones prácticas en la selección de modelos
  • Interpretación de la importancia de las características y comprensión del comportamiento del modelo

Módulo 8: Prácticas en producción y empresariales

  • Persistencia y carga de modelos en Spark
  • Implementación de flujos de trabajo de inferencia por lotes sobre grandes conjuntos de datos
  • Comprensión del ciclo de vida del aprendizaje automático en entornos empresariales
  • Introducción al versionado, conceptos de seguimiento de experimentos y estrategias básicas de pruebas

 

Resultado Práctico

  • Capacidad para trabajar de manera autónoma con PySpark
  • Capacidad para procesar grandes conjuntos de datos de forma eficiente
  • Capacidad para realizar ingeniería de características a escala
  • Capacidad para construir pipelines escalables de aprendizaje automático

Requerimientos

Los participantes deben contar con el siguiente conocimiento previo:

Conocimientos básicos de programación en Python, incluyendo el uso de funciones, estructuras de datos y librerías
Comprensión fundamental de conceptos de análisis de datos como conjuntos de datos, transformaciones y agregaciones
Conocimientos básicos de SQL y conceptos de datos relacionales
Comprensión introductoria de los conceptos de aprendizaje automático, como conjuntos de datos de entrenamiento, características y métricas de evaluación Familiaridad con entornos de línea de comandos y prácticas básicas de desarrollo de software; se recomienda haberla tenido.

Seval ser útil la experiencia con Pandas, NumPy o librerías similares de procesamiento de datos, aunque no es obligatoria.

 21 Horas

Número de participantes


Precio por participante

Reseñas (1)

Próximos cursos

Categorías Relacionadas