Ponte en Contacto

Temario del curso

Cada sesión es de 2 horas

Día 1: Sesión -1: Visión general de negocios sobre por qué Business Intelligence de Big Data en Gobierno

  • Casos de estudio de NIH, DoE
  • Tasa de adaptación de Big Data en Agencias Gubernamentales y cómo están alineando sus operaciones futuras en torno al Big Data Predictive Analytics
  • Áreas de aplicación a gran escala en DoD, NSA, IRS, USDA, etc.
  • Interfaz de Big Data con datos heredados (legacy)
  • Comprensión básica de las tecnologías habilitadoras en analítica predictiva
  • Integración de Datos y visualización de tableros (dashboards)
  • Gestión de fraudes
  • Generación de Reglas de Negocio / Detección de fraudes
  • Detección de amenazas y perfilado
  • Análisis costo-beneficio para la implementación de Big Data

Día 1: Sesión-2 : Introducción a Big Data-1

  • Principales características de Big Data: volumen, variedad, velocidad y veracidad. Arquitectura MPP para el volumen.
  • Almacenes de Datos (Data Warehouses) – esquema estático, conjunto de datos que evoluciona lentamente
  • Bases de datos MPP como Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
  • Soluciones Basadas en Hadoop – sin condiciones sobre la estructura del conjunto de datos.
  • Patrón típico : HDFS, MapReduce (crunch), recuperación desde HDFS
  • Por lotes (Batch) - apto para analítico/no interactivo
  • Volumen : CEP streaming data
  • Opciones típicas – productos CEP (ej. Infostreams, Apama, MarkLogic, etc.)
  • Menos listo para producción – Storm/S4
  • Bases de Datos NoSQL – (columnares y clave-valor): Más adecuadas como complemento analítico del almacén de datos/base de datos

Día 1 : Sesión -3 : Introducción a Big Data-2

Soluciones NoSQL

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (Jerárquico) - GT.m, Cache
  • KV Store (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Base de Datos de Objetos - ZopeDB, DB40, Shoal
  • Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Variedades de Datos: Introducción al problema de la limpieza de datos en Big Data

  • RDBMS – estructura/esquema estático, no fomenta un entorno ágil y exploratorio.
  • NoSQL – semi estructurado, suficiente estructura para almacenar datos sin un esquema exacto antes de almacenarlos
  • Problemas de limpieza de datos

Día 1 : Sesión-4 : Introducción a Big Data-3 : Hadoop

  • ¿Cuándo seleccionar Hadoop?
  • ESTRUCTURADO - Los almacenes/bases de datos empresariales pueden almacenar datos masivos (a un costo) pero imponen estructura (no bueno para la exploración activa)
  • Datos SEMI ESTRUCTURADOS – difícil de manejar con soluciones tradicionales (DW/DB)
  • Almacenamiento de datos = MUCHO esfuerzo y estático incluso después de la implementación
  • Para la variedad y el volumen de datos, procesados en hardware de commodity – HADOOP
  • Hardware de commodity necesario para crear un Clúster Hadoop

Introducción a Map Reduce /HDFS

  • MapReduce – distribución de cómputo sobre múltiples servidores
  • HDFS – hace que los datos estén disponibles localmente para el proceso de cómputo (con redundancia)
  • Datos – pueden ser no estructurados/sin esquema (a diferencia de RDBMS)
  • Responsabilidad del desarrollador de darle sentido a los datos
  • Programación MapReduce = trabajar con Java (pros/contras), carga manual de datos en HDFS

Día 2: Sesión-1: Ecosistema de Big Data-Construcción de Big Data ETL: universo de Herramientas de Big Data-¿cuál usar y cuándo?

  • Hadoop vs. Otras soluciones NoSQL
  • Para acceso interactivo y aleatorio a los datos
  • Hbase (base de datos orientada a columnas) sobre Hadoop
  • Acceso aleatorio a los datos pero con restricciones impuestas (máx. 1 PB)
  • No bueno para analítica ad-hoc, bueno para registro (logging), conteo, series temporales
  • Sqoop - Importación desde bases de datos a Hive o HDFS (acceso JDBC/ODBC)
  • Flume – Flujo de datos (ej. datos de registro) a HDFS

Día 2: Sesión-2: Sistema de Gestión de Big Data

  • Movimiento de piezas, inicio/fallo de nodos de cómputo :ZooKeeper - Para servicios de configuración/coordinación/nombres
  • Tubería/flujo de trabajo complejo: Oozie – gestionar flujo de trabajo, dependencias, cadena de operaciones
  • Despliegue, configuración, gestión de clúster, actualización, etc. (administrador de sistemas) :Ambari
  • En la Nube : Whirr

Día 2: Sesión-3: Analítica predictiva en Business Intelligence -1: Técnicas Fundamentales y BI basado en Aprendizaje Automático :

  • Introducción al Aprendizaje Automático
  • Aprendizaje de técnicas de clasificación
  • Predicción Bayesiana-preparación del archivo de entrenamiento
  • Máquina de Soporte Vectorial (SVM)
  • KNN p-Tree Algebra y minería vertical
  • Red Neuronal
  • Problema de variables grandes en Big Data -Bosque Aleatorio (RF)
  • Problema de automatización en Big Data – Ensamble de modelos múltiples RF
  • Automatización a través de Soft10-M
  • Herramienta de análisis de texto-Treeminer
  • Aprendizaje ágil
  • Aprendizaje basado en agentes
  • Aprendizaje distribuido
  • Introducción a Herramientas de Código Abierto para analítica predictiva : R, Rapidminer, Mahut

Día 2: Sesión-4 Ecosistema de analítica predictiva-2: Problemas comunes de analítica predictiva en Gobierno.

  • Análisis de información (Insight analytic)
  • Análisis de visualización
  • Análisis predictivo estructurado
  • Análisis predictivo no estructurado
  • Perfilado de amenazas/fraudulentes/proveedores
  • Motor de Recomendaciones
  • Detección de patrones
  • Descubrimiento de Reglas/Escenarios –fallos, fraudes, optimización
  • Descubrimiento de causa raíz
  • Análisis de sentimiento
  • Análisis de CRM
  • Análisis de red/network
  • Análisis de Texto
  • Revisión asistida por tecnología
  • Análisis de fraudes
  • Análisis en Tiempo Real

Día 3 : Sesión-1 : Analítica en Tiempo Real y Escalable Sobre Hadoop

  • Por qué los algoritmos de análisis comunes fallan en Hadoop/HDFS
  • Apache Hama- para cómputo distribuido Sincronizado por Lotes (Bulk Synchronous)
  • Apache SPARK- para cómputo de clúster para analítica en tiempo real
  • CMU Graphics Lab2- Enfoque asincrónico basado en gráficos para cómputo distribuido
  • Enfoque basado en KNN p-Algebra desde Treeminer para reducir el costo de hardware de operación

Día 3: Sesión-2: Herramientas para eDiscovery y Forense

  • eDiscovery sobre Big Data vs. datos Legacy – una comparación de costo y rendimiento
  • Codificación predictiva y revisión asistida por tecnología (TAR)
  • Demostración en vivo de un producto Tar ( vMiner) para entender cómo funciona TAR para un descubrimiento más rápido
  • Indexación más rápida a través de HDFS –velocidad de los datos
  • NLP o Procesamiento de Lenguaje Natural –varias técnicas y productos de código abierto
  • eDiscovery en idiomas extranjeros-tecnología para el procesamiento de idiomas extranjeros

Día 3 : Sesión 3: Business Intelligence de Big Data para la Ciberseguridad – Entendiendo la visión completa de 360 grados de la rápida recopilación de datos a la identificación de amenazas

  • Comprensión de los fundamentos del análisis de seguridad-superficie de ataque, configuración errónea de seguridad, defensas del host
  • Infraestructura de red/ Gran tubería de datos/ ETL de respuesta para analítica en tiempo real
  • Prescriptivo vs predictivo – Reglas fijas basadas en reglas vs auto-descubrimiento de reglas de amenazas desde Metadatos

Día 3: Sesión 4: Big Data en USDA : Aplicación en Agricultura

  • Introducción a IoT ( Internet de las Cosas) para agricultura-Big Data basado en sensores y control
  • Introducción a la imagen satelital y su aplicación en agricultura
  • Integración de datos de sensores e imágenes para fertilidad del suelo, recomendaciones de cultivo y pronósticos
  • Seguro agrícola y Big Data
  • Pronóstico de Pérdidas de Cosecha

Día 4 : Sesión-1: BI de prevención de fraudes desde Big Data en Gobierno-Análisis de fraudes:

  • Clasificación básica de los análisis de fraudes- basado en reglas vs analítica predictiva
  • Aprendizaje automático supervisado vs no supervisado para la detección de patrones de fraude
  • Fraude de proveedores/cobros excesivos por proyectos
  • Fraude de Medicare y Medicaid- técnicas de detección de fraude para el procesamiento de reclamos
  • Fraudes en reembolsos de viajes
  • Fraudes en reembolsos de IRS
  • Se proporcionarán casos de estudio y demostraciones en vivo siempre que haya datos disponibles.

Día 4 : Sesión-2: Analítica de Medios Sociales- Recopilación e inteligencia y análisis

  • API de Big Data ETL para extraer datos de medios sociales
  • Texto, imagen, metadatos y video
  • Análisis de sentimiento de las transmisiones de medios sociales
  • Filtrado contextual y no contextual de las transmisiones de medios sociales
  • Tablero (Dashboard) de Medios Sociales para integrar diversos medios sociales
  • Perfilado automatizado del perfil de medios sociales
  • Se realizará una demostración en vivo de cada análisis a través de la Herramienta Treeminer.

Día 4 : Sesión-3: Analítica de Big Data en el procesamiento de imágenes y flujos de video

  • Técnicas de Almacenamiento de Imágenes en Big Data- Solución de almacenamiento para datos que superan los petabytes
  • LTFS y LTO
  • GPFS-LTFS ( Solución de almacenamiento por capas para datos de imágenes de Big Data)
  • Fundamentos de analítica de imágenes
  • Reconocimiento de objetos
  • Segmentación de imágenes
  • Rastreo de movimiento
  • Reconstrucción de imágenes 3-D

Día 4: Sesión-4: Aplicaciones de Big Data en NIH:

  • Áreas emergentes de Bioinformática
  • Meta-genómica y problemas de minería de Big Data
  • Analítica Predictiva de Big Data para Farmacogenómica, Metabolómica y Proteómica
  • Big Data en el proceso de Genómica aguas abajo (downstream)
  • Aplicación de la analítica predictiva de Big data en Salud Pública

Tablero (Dashboard) de Big Data para acceso rápido a datos diversos y visualización :

  • Integración de la plataforma de aplicaciones existente con el Tablero de Big Data
  • Gestión de Big Data
  • Caso de Estudio de Tablero de Big Data: Tableau y Pentaho
  • Usar aplicaciones de Big Data para impulsar servicios basados en ubicación en Gobierno.
  • Sistema de seguimiento y gestión

Día 5 : Sesión-1: Cómo justificar la implementación de Business Intelligence de Big Data dentro de una organización:

  • Definiendo el ROI para la implementación de Big Data
  • Casos de estudio para ahorrar Tiempo del Analista para la recopilación y preparación de Datos –aumento de la ganancia de productividad
  • Casos de estudio de ganancia de ingresos por ahorro en el costo de la base de datos licenciada
  • Ganancia de ingresos de servicios basados en ubicación
  • Ahorro de la prevención de fraudes
  • Un enfoque integrado de hoja de cálculo para calcular el gasto aproximado vs. ganancia de ingresos/ahorro de la implementación de Big Data.

Día 5 : Sesión-2: Procedimiento paso a paso para reemplazar el sistema de datos legado por un Sistema de Big Data:

  • Entendiendo el Hoja de Ruta práctica de Migración a Big Data
  • Qué información importante se necesita antes de diseñar una implementación de Big Data
  • Cuáles son las diferentes formas de calcular el volumen, la velocidad, la variedad y la veracidad de los datos
  • Cómo estimar el crecimiento de los datos
  • Casos de estudio

Día 5: Sesión 4: Revisión de Proveedores de Big Data y revisión de sus productos. Sesión de P/R:

  • Accenture
  • APTEAN (Anteriormente CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Anteriormente 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Parte de EMC)

Requerimientos

  • Conocimiento básico de la operación de negocios y los sistemas de datos del gobierno en su área de dominio
  • Comprensión básica de SQL/Oracle o de bases de datos relacionales
  • Comprensión básica de Estadística (a nivel de hoja de cálculo)
 35 Horas

Número de participantes


Precio por participante

Reseñas (1)

Próximos cursos

Categorías Relacionadas