Contacta con nosotros

Temario del curso

Introducción

Comprensión del Big Data

Visión general de Spark

Visión general de Python

Visión general de PySpark

  • Distribución de datos usando el marco Resilient Distributed Datasets (RDD).
  • Distribución de cómputo mediante operadores de la API de Spark.

Configuración de Python con Spark

Configuración de PySpark

Uso de instancias EC2 de Amazon Web Services (AWS) para Spark

Configuración de Databricks

Configuración del clúster AWS EMR

Aprendizaje de los conceptos básicos de la programación en Python

  • Iniciación con Python.
  • Uso del Notebook Jupyter.
  • Uso de variables y tipos de datos simples.
  • Trabajo con listas.
  • Uso de sentencias if.
  • Manejo de entradas del usuario.
  • Trabajo con bucles while.
  • Implementación de funciones.
  • Trabajo con clases.
  • Trabajo con archivos y excepciones.
  • Gestión de proyectos, datos y APIs.

Aprendizaje de los conceptos básicos de Spark DataFrame

  • Iniciación con Spark DataFrames.
  • Implementación de operaciones básicas con Spark.
  • Uso de Groupby y operaciones de agregación.
  • Trabajo con marcas de tiempo (timestamps) y fechas.

Ejercicio práctico con un proyecto en Spark DataFrame

Comprensión del aprendizaje automático (Machine Learning) con MLlib

Uso de MLlib, Spark y Python para Machine Learning

Comprensión de las regresiones

  • Aprendizaje de la teoría de Regresión Lineal.
  • Implementación del código de evaluación de regresión.
  • Ejercicio práctico de ejemplo de Regresión Lineal.
  • Aprendizaje de la teoría de Regresión Logística.
  • Implementación del código de Regresión Logística.
  • Ejercicio práctico de ejemplo de Regresión Logística.

Comprensión de los Bosques Aleatorios (Random Forests) y Árboles de Decisión

  • Aprendizaje de la teoría de métodos de árboles.
  • Implementación de códigos para Árboles de Decisión y Bosques Aleatorios.
  • Ejercicio práctico de ejemplo de clasificación con Bosque Aleatorio.

Trabajo con agrupamiento K-means

  • Comprensión de la teoría del agrupamiento K-means.
  • Implementación del código de agrupamiento K-means.
  • Ejercicio práctico de ejemplo de agrupamiento.

Trabajo con sistemas de recomendación

Implementación de procesamiento del lenguaje natural

  • Comprensión del Procesamiento del Lenguaje Natural (NLP).
  • Visión general de las herramientas NLP.
  • Ejercicio práctico de ejemplo de NLP.

Streaming con Spark en Python

  • Visión general del streaming con Spark.
  • Ejercicio práctico de ejemplo de Spark Streaming.

Comentarios finales

Requerimientos

  • Habilidades generales de programación.

Público objetivo

  • Desarrolladores.
  • Profesionales de TI.
  • Científicos de datos.
 21 Horas

Número de participantes


Precio por participante

Reseñas (6)

Próximos cursos

Categorías Relacionadas