Streaming de Datos y Procesamiento en Tiempo Real
Vista General del Curso
Este curso ofrece una introducción práctica y estructurada al desarrollo de sistemas de transmisión de datos en tiempo real. Cubre conceptos fundamentales, patrones de arquitectura y herramientas industriales utilizadas para procesar datos continuos a gran escala. Los participantes aprenderán cómo diseñar, implementar y optimizar tuberías de streaming (pipelines) utilizando frameworks modernos. El curso avanza desde ideas básicas hasta aplicaciones prácticas, permitiendo a los aprendices construir con confianza soluciones en tiempo real listas para producción.
Formato del Curso
• Sesiones dirigidas por instructores con explicaciones guiadas
• Explicación de conceptos con ejemplos del mundo real
• Demostraciones prácticas y ejercicios de programación
• Laboratorios progresivos alineados con los temas diarios
• Discusiones interactivas y sesiones de preguntas y respuestas
Objetivos del Curso
• Comprender los conceptos de streaming de datos en tiempo real y la arquitectura del sistema
• Diferenciar entre modelos de procesamiento por lotes (batch) y streaming de datos
• Diseñar tuberías de streaming escalables y tolerantes a fallos
• Trabajar con herramientas y frameworks distribuidos para streaming
• Aplicar procesamiento por tiempo de evento, ventanas (windowing) y operaciones con estado
• Desarrollar y optimizar soluciones de datos en tiempo real para casos de uso empresariales
Temario del curso
Temario del Curso - Día 1
• Introducción a los conceptos de streaming de datos
• Fundamentos del procesamiento por lotes vs. en tiempo real
• Conceptos básicos de arquitectura dirigida por eventos
• Casos de uso comunes en la industria
• Panorama general del ecosistema de streaming
Día 2
• Patrones de diseño para arquitecturas de streaming
• Fundamentos de los sistemas de mensajería distribuida
• Productores y consumidores
• Temas, particiones y flujo de datos
• Estrategias de ingesta de datos
Día 3
• Conceptos y frameworks de procesamiento de streams
• Tiempo de evento vs. tiempo de procesamiento
• Técnicas de ventanas (windowing) y casos de uso
• Procesamiento de streaming con estado
• Conceptos básicos de tolerancia a fallos y puntos de control
Día 4
• Transformación de datos en tuberías de streaming
• ETL y ELT en sistemas en tiempo real
• Gestión y evolución de esquemas
• Uniones de flujos (stream joins) y enriquecimiento de datos
• Introducción a los servicios de streaming basados en la nube
Día 5
• Monitoreo y observabilidad en sistemas de streaming
• Conceptos básicos de seguridad y control de acceso
• Sintonización y optimización del rendimiento
• Revisión integral del diseño de la tubería (pipeline)
• Casos de uso del mundo real, como detección de fraude y procesamiento de IoT
Los cursos públicos requieren más de 5 participantes.
Streaming de Datos y Procesamiento en Tiempo Real - Reserva
Streaming de Datos y Procesamiento en Tiempo Real - Consulta
Streaming de Datos y Procesamiento en Tiempo Real - Solicitud de consultoría
Reseñas (2)
Un viaje por el mundo de Spark: un curso muy intenso. DSL, Spark SQL, particionamiento versus agrupación para mí.
Georgiana Elisabeta
Curso - Apache Spark Fundamentals
Traducción Automática
Ejercicios prácticos. La clase debería haber durado 5 días, pero los 3 días fueron útiles para aclarar muchas de las preguntas que tenía al trabajar con NiFi.
James - BHG Financial
Curso - Apache NiFi for Administrators
Traducción Automática
Próximos cursos
Cursos Relacionados
Apache Iceberg Avanzado
21 HorasEsta formación en vivo con instructores en Argentina (en línea o presencial) está dirigida a profesionales de los datos de nivel avanzado que deseen optimizar sus flujos de procesamiento de datos, garantizar la integridad de los mismos e implementar soluciones robustas de lakehouse capaces de manejar las complejidades de las aplicaciones modernas de big data.
Al finalizar esta formación, los participantes podrán:
- Comprender en profundidad la arquitectura de Iceberg, incluida la gestión de metadatos y la distribución de archivos.
- Configurar Iceberg para lograr un rendimiento óptimo en diversos entornos e integrarlo con múltiples motores de procesamiento de datos.
- Gestionar tablas Iceberg a gran escala, realizar cambios complejos en el esquema y manejar la evolución de las particiones.
- Dominar técnicas para optimizar el rendimiento de las consultas y la eficiencia del escaneo de datos en conjuntos grandes.
- Implementar mecanismos que garanticen la consistencia de los datos, administrar garantías transaccionales y manejar fallos en entornos distribuidos.
Fundamentos de Apache Iceberg
14 HorasEsta capacitación en vivo con instructores en Argentina (en línea o presencial) está dirigida a profesionales de los datos de nivel principiante que desean adquirir los conocimientos y habilidades necesarios para utilizar eficazmente Apache Iceberg en la gestión de conjuntos de datos a gran escala, garantizando la integridad de los datos y optimizando los flujos de procesamiento.
Al finalizar esta capacitación, los participantes podrán:
- Comprender en profundidad la arquitectura, características y beneficios de Apache Iceberg.
- Aprender sobre formatos de tablas, particionamiento, evolución del esquema y la capacidad de viaje en el tiempo (time travel).
- Instalar y configurar Apache Iceberg en diferentes entornos.
- Crear, gestionar y manipular tablas de Iceberg.
- Comprender el proceso de migración de datos desde otros formatos de tabla hacia Iceberg.
Análisis de Big Data con Google Colab y Apache Spark
14 HorasEsta formación en vivo dirigida por instructores en Argentina (en línea o presencial) está dirigida a científicos de datos e ingenieros de nivel intermedio que desean utilizar Google Colab y Apache Spark para el procesamiento y análisis de big data.
Al finalizar esta formación, los participantes serán capaces de:
- Configurar un entorno de big data utilizando Google Colab y Spark.
- Procesar y analizar grandes conjuntos de datos de manera eficiente con Apache Spark.
- Visualizar big data en un entorno colaborativo.
- Integrar Apache Spark con herramientas basadas en la nube.
Inteligencia de Negocios de Big Data para Agencias del Gobierno
35 HorasLos avances tecnológicos y el creciente volumen de información están transformando la forma en que se realizan las operaciones comerciales en muchas industrias, incluido el gobierno. Las tasas de generación de datos y el archivo digital por parte del gobierno están en aumento debido al rápido crecimiento de los dispositivos móviles y las aplicaciones, los sensores y dispositivos inteligentes, las soluciones de computación en la nube y los portales dirigidos a los ciudadanos. A medida que la información digital se expande y se vuelve más compleja, la gestión, el procesamiento, el almacenamiento, la seguridad y la disposición de dicha información también se vuelven más complejos. Nuevas herramientas de captura, búsqueda, descubrimiento y análisis están ayudando a las organizaciones a obtener información valiosa de sus datos no estructurados. El mercado gubernamental está en un punto de inflexión, al darse cuenta de que la información es un activo estratégico, y los gobiernos deben proteger, aprovechar y analizar tanto la información estructurada como la no estructurada para servir mejor y cumplir con los requisitos de sus misiones. A medida que los líderes gubernamentales se esfuerzan por evolucionar hacia organizaciones basadas en datos para cumplir exitosamente con sus misiones, están sentando las bases para correlacionar las dependencias entre eventos, personas, procesos e información.
Las soluciones de alto valor para el gobierno se crearán mediante una combinación de las tecnologías más disruptivas:
- Dispositivos móviles y aplicaciones
- Servicios en la nube
- Tecnologías y redes de negocios sociales
- Big Data y analítica
El Big Data es una de las soluciones inteligentes de la industria que permite al gobierno tomar mejores decisiones actuando en función de los patrones revelados mediante el análisis de grandes volúmenes de datos, ya sean relacionados o no, estructurados o no estructurados.
Sin embargo, lograr estos hazaños requiere mucho más que simplemente acumular cantidades masivas de datos. "Dar sentido a estos volúmenes de Big Data requiere herramientas y tecnologías de vanguardia que puedan analizar y extraer conocimiento útil de flujos vastos y diversos de información", escribieron Tom Kalil y Fen Zhao de la Oficina de Política de Ciencia y Tecnología de la Casa Blanca en una publicación en el blog de OSTP.
La Casa Blanca dio un paso hacia ayudar a las agencias a encontrar estas tecnologías al establecer la Iniciativa Nacional de Investigación y Desarrollo de Big Data en 2012. La iniciativa incluyó más de $200 millones para aprovechar al máximo la explosión del Big Data y las herramientas necesarias para analizarlo.
Los desafíos que presenta el Big Data son casi tan abrumadores como alentadora es su promesa. Almacenar los datos de manera eficiente es uno de estos desafíos. Como siempre, los presupuestos son ajustados, por lo que las agencias deben minimizar el costo por megabyte del almacenamiento y mantener los datos fácilmente accesibles para que los usuarios puedan obtenerlos cuando lo deseen y de la forma en que lo necesiten. La copia de seguridad de cantidades masivas de datos intensifica este desafío.
Analizar los datos de manera efectiva es otro gran desafío. Muchas agencias emplean herramientas comerciales que les permiten cribar las montañas de datos, identificando tendencias que pueden ayudarlas a operar con mayor eficiencia. (Un estudio reciente de MeriTalk descubrió que los ejecutivos de TI federales creen que el Big Data podría ayudar a las agencias a ahorrar más de $500 mil millones mientras también cumplen con los objetivos de sus misiones).
Las herramientas personalizadas de Big Data también están permitiendo a las agencias abordar la necesidad de analizar sus datos. Por ejemplo, el Grupo de Análisis de Datos Computacionales del Laboratorio Nacional de Oak Ridge ha puesto su sistema de análisis de datos Piranha a disposición de otras agencias. El sistema ha ayudado a los investigadores médicos a encontrar un vínculo que pueda alertar a los médicos sobre aneurismas aórticos antes de que se manifiesten. También se utiliza para tareas más cotidianas, como cribar currículos para conectar candidatos con gerentes de contratación.
Una introducción práctica al análisis de datos y Big Data - 3 días
21 HorasLos participantes que completen esta formación en vivo impartida por un instructor en Argentina adquirirán una comprensión práctica y aplicada del Big Data, así como de sus tecnologías, metodologías y herramientas relacionadas.
Los participantes tendrán la oportunidad de aplicar estos conocimientos mediante ejercicios prácticos. La interacción grupal y los comentarios del instructor son componentes importantes del curso.
El curso comienza con una introducción a los conceptos elementales del Big Data, luego avanza hacia los lenguajes de programación y las metodologías utilizadas para realizar el análisis de datos. Finalmente, discutimos las herramientas e infraestructura que permiten el almacenamiento de Big Data, el procesamiento distribuido y la escalabilidad.
Big Data y Análisis Avanzado
42 HorasEl Big Data y el Análisis Avanzado aplican técnicas y herramientas sofisticadas para analizar conjuntos de datos grandes y complejos, obteniendo información accionable y apoyo para la toma de decisiones estratégicas.
Esta formación en vivo con instructor (en línea o presencial) está dirigida a profesionales de datos avanzados que desean aprovechar métodos analíticos de vanguardia y tecnologías big data para análisis predictivos, prescriptivos y en tiempo real.
Al finalizar esta capacitación, los participantes podrán:
- Diseñar e implementar pipelines de procesamiento de datos a gran escala para datos estructurados y no estructurados.
- Aplicar técnicas avanzadas de aprendizaje automático (machine learning) y aprendizaje profundo a conjuntos de datos masivos.
- Aprovechar marcos de computación distribuida para análisis en tiempo real y procesamiento de flujos de datos.
- Integrar el análisis big data en sistemas de inteligencia empresarial y toma de decisiones.
Formato del curso
- Clase interactiva y discusión.
- Muchas prácticas de ejercicios.
- Implementación práctica en un entorno de laboratorio en vivo.
Opciones de personalización del curso
- Para solicitar una capacitación personalizada para este curso, contáctanos para coordinarlo.
Apache NiFi para administradores
21 HorasApache NiFi es una plataforma de integración de datos y procesamiento de eventos basada en flujos, de código abierto. Permite el enrutamiento automático en tiempo real, la transformación y la mediación entre sistemas diversos, con una interfaz web y control fino.
Esta formación presencial o remota impartida por un instructor está dirigida a administradores e ingenieros de nivel intermedio que deseen desplegar, administrar, asegurar y optimizar flujos de datos de NiFi en entornos de producción.
Al finalizar esta formación, los participantes serán capaces de:
- Instalar, configurar y mantener clústers de Apache NiFi.
- Diseñar y gestionar flujos de datos desde diversas fuentes y destinos.
- Implementar automatización del flujo, lógica de enrutamiento y transformación.
- Optimizar el rendimiento, monitorear operaciones y resolver problemas.
Formato del Curso
- Conferencia interactiva con discusión de arquitectura en casos reales.
- Laboratorios prácticos: construcción, despliegue y gestión de flujos.
- Ejercicios basados en escenarios en un entorno de laboratorio en vivo.
Opciones de Personalización del Curso
- Para solicitar una formación personalizada para este curso, contáctenos para organizarla.
PySpark y Aprendizaje Automático
21 HorasEsta capacitación ofrece una introducción práctica para construir flujos de trabajo escalables de procesamiento de datos y aprendizaje automático utilizando PySpark. Los participantes aprenden cómo opera Apache Spark dentro de ecosistemas modernos de Big Data y cómo procesar eficientemente conjuntos de datos grandes aplicando principios de computación distribuida.
Fundamentos de Apache Spark
21 HorasEsta formación en vivo, impartida por un instructor Argentina (en línea o presencial), está dirigida a ingenieros que deseen configurar e implementar un sistema Apache Spark para procesar grandes volúmenes de datos.
Al finalizar esta formación, los participantes podrán:
- Instalar y configurar Apache Spark.
- Procesar y analizar rápidamente conjuntos de datos muy grandes.
- Comprender las diferencias entre Apache Spark y Hadoop MapReduce y saber cuándo utilizar cada uno.
- Integrar Apache Spark con otras herramientas de aprendizaje automático.
Administración de Apache Spark
35 HorasEsta formación en vivo impartida por un instructor en Argentina (en línea o presencial) está dirigida a administradores de sistemas de nivel principiante e intermedio que deseen desplegar, mantener y optimizar clústeres de Spark.
Al finalizar esta formación, los participantes podrán:
- Instalar y configurar Apache Spark en diversos entornos.
- Gestionar los recursos del clúster y supervisar las aplicaciones de Spark.
- Optimizar el rendimiento de los clústeres de Spark.
- Implementar medidas de seguridad y garantizar la alta disponibilidad.
- Depurar y resolver problemas comunes de Spark.
Apache Spark en la nube
21 HorasLa curva de aprendizaje de Apache Spark es lenta al principio, ya que requiere mucho esfuerzo para obtener los primeros resultados. Este curso tiene como objetivo saltarse esa primera etapa difícil. Tras completar este curso, los participantes comprenderán los fundamentos de Apache Spark, podrán diferenciar claramente entre RDD y DataFrame, aprenderán a usar las API de Python y Scala, entenderán los conceptos de ejecutores y tareas, etc. Además, siguiendo las mejores prácticas, el curso se enfoca fuertemente en el despliegue en la nube, Databricks y AWS. Los estudiantes también comprenderán las diferencias entre AWS EMR y AWS Glue, uno de los servicios más recientes de Spark ofrecidos por AWS.
DIRIGIDO A:
Ingenieros de Datos, DevOps, Científicos de Datos
Python y Spark para Big Data (PySpark)
21 HorasEn esta capacitación en vivo e impartida por un instructor en Argentina, los participantes aprenderán cómo utilizar Python y Spark conjuntamente para analizar big data, mientras realizan ejercicios prácticos.
Al finalizar este curso, los participantes podrán:
- Aprender a usar Spark con Python para analizar Big Data.
- Trabajar en ejercicios que simulan casos del mundo real.
- Utilizar distintas herramientas y técnicas para el análisis de big data mediante PySpark.
Python, Spark y Hadoop para Big Data
21 HorasEsta formación en vivo impartida por un instructor en Argentina (en línea o presencial) está dirigida a desarrolladores que deseen utilizar e integrar Spark, Hadoop y Python para procesar, analizar y transformar conjuntos de datos grandes y complejos.
Al finalizar esta formación, los participantes podrán:
- Configurar el entorno necesario para comenzar a procesar big data con Spark, Hadoop y Python.
- Comprender las características, componentes principales y arquitectura de Spark y Hadoop.
- Aprender cómo integrar Spark, Hadoop y Python para el procesamiento de grandes datos.
- Explorar las herramientas del ecosistema de Spark (Spark MLlib, Spark Streaming, Kafka, Sqoop, Kafka y Flume).
- Construir sistemas de recomendación basados en filtrado colaborativo similares a los utilizados por Netflix, YouTube, Amazon, Spotify y Google.
- Utilizar Apache Mahout para escalar algoritmos de aprendizaje automático.
Stratio: Módulos Rocket e Intelligence con PySpark
14 HorasStratio es una plataforma centrada en datos que integra big data, IA y gobernanza en una solución única. Sus módulos Rocket e Intelligence permiten una rápida exploración, transformación y análisis avanzado de datos en entornos empresariales.
Esta formación impartida por un instructor (en línea o presencial) está dirigida a profesionales de datos de nivel intermedio que deseen utilizar eficazmente los módulos Rocket e Intelligence de Stratio con PySpark, centrándose en estructuras de bucle, funciones definidas por el usuario y lógica avanzada de datos.
Al finalizar esta formación, los participantes podrán:
- Navegar y trabajar dentro de la plataforma Stratio utilizando los módulos Rocket e Intelligence.
- Aplicar PySpark en el contexto de ingesta, transformación y análisis de datos.
- Utilizar bucles y lógica condicional para controlar flujos de trabajo y tareas de ingeniería de características.
- Crear y gestionar funciones definidas por el usuario (UDF) para operaciones de datos reutilizables en PySpark.
Formato del curso
- Conferencia interactiva y discusión.
- Numerous ejercicios y práctica.
- Implementación práctica en un entorno de laboratorio en vivo.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso, contáctenos para coordinarlo.