Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Cada sesión es de 2 horas
Día 1: Sesión -1: Visión general de negocios sobre por qué Business Intelligence de Big Data en Gobierno
- Casos de estudio de NIH, DoE
- Tasa de adaptación de Big Data en Agencias Gubernamentales y cómo están alineando sus operaciones futuras en torno al Big Data Predictive Analytics
- Áreas de aplicación a gran escala en DoD, NSA, IRS, USDA, etc.
- Interfaz de Big Data con datos heredados (legacy)
- Comprensión básica de las tecnologías habilitadoras en analítica predictiva
- Integración de Datos y visualización de tableros (dashboards)
- Gestión de fraudes
- Generación de Reglas de Negocio / Detección de fraudes
- Detección de amenazas y perfilado
- Análisis costo-beneficio para la implementación de Big Data
Día 1: Sesión-2 : Introducción a Big Data-1
- Principales características de Big Data: volumen, variedad, velocidad y veracidad. Arquitectura MPP para el volumen.
- Almacenes de Datos (Data Warehouses) – esquema estático, conjunto de datos que evoluciona lentamente
- Bases de datos MPP como Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
- Soluciones Basadas en Hadoop – sin condiciones sobre la estructura del conjunto de datos.
- Patrón típico : HDFS, MapReduce (crunch), recuperación desde HDFS
- Por lotes (Batch) - apto para analítico/no interactivo
- Volumen : CEP streaming data
- Opciones típicas – productos CEP (ej. Infostreams, Apama, MarkLogic, etc.)
- Menos listo para producción – Storm/S4
- Bases de Datos NoSQL – (columnares y clave-valor): Más adecuadas como complemento analítico del almacén de datos/base de datos
Día 1 : Sesión -3 : Introducción a Big Data-2
Soluciones NoSQL
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (Jerárquico) - GT.m, Cache
- KV Store (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- Base de Datos de Objetos - ZopeDB, DB40, Shoal
- Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Variedades de Datos: Introducción al problema de la limpieza de datos en Big Data
- RDBMS – estructura/esquema estático, no fomenta un entorno ágil y exploratorio.
- NoSQL – semi estructurado, suficiente estructura para almacenar datos sin un esquema exacto antes de almacenarlos
- Problemas de limpieza de datos
Día 1 : Sesión-4 : Introducción a Big Data-3 : Hadoop
- ¿Cuándo seleccionar Hadoop?
- ESTRUCTURADO - Los almacenes/bases de datos empresariales pueden almacenar datos masivos (a un costo) pero imponen estructura (no bueno para la exploración activa)
- Datos SEMI ESTRUCTURADOS – difícil de manejar con soluciones tradicionales (DW/DB)
- Almacenamiento de datos = MUCHO esfuerzo y estático incluso después de la implementación
- Para la variedad y el volumen de datos, procesados en hardware de commodity – HADOOP
- Hardware de commodity necesario para crear un Clúster Hadoop
Introducción a Map Reduce /HDFS
- MapReduce – distribución de cómputo sobre múltiples servidores
- HDFS – hace que los datos estén disponibles localmente para el proceso de cómputo (con redundancia)
- Datos – pueden ser no estructurados/sin esquema (a diferencia de RDBMS)
- Responsabilidad del desarrollador de darle sentido a los datos
- Programación MapReduce = trabajar con Java (pros/contras), carga manual de datos en HDFS
Día 2: Sesión-1: Ecosistema de Big Data-Construcción de Big Data ETL: universo de Herramientas de Big Data-¿cuál usar y cuándo?
- Hadoop vs. Otras soluciones NoSQL
- Para acceso interactivo y aleatorio a los datos
- Hbase (base de datos orientada a columnas) sobre Hadoop
- Acceso aleatorio a los datos pero con restricciones impuestas (máx. 1 PB)
- No bueno para analítica ad-hoc, bueno para registro (logging), conteo, series temporales
- Sqoop - Importación desde bases de datos a Hive o HDFS (acceso JDBC/ODBC)
- Flume – Flujo de datos (ej. datos de registro) a HDFS
Día 2: Sesión-2: Sistema de Gestión de Big Data
- Movimiento de piezas, inicio/fallo de nodos de cómputo :ZooKeeper - Para servicios de configuración/coordinación/nombres
- Tubería/flujo de trabajo complejo: Oozie – gestionar flujo de trabajo, dependencias, cadena de operaciones
- Despliegue, configuración, gestión de clúster, actualización, etc. (administrador de sistemas) :Ambari
- En la Nube : Whirr
Día 2: Sesión-3: Analítica predictiva en Business Intelligence -1: Técnicas Fundamentales y BI basado en Aprendizaje Automático :
- Introducción al Aprendizaje Automático
- Aprendizaje de técnicas de clasificación
- Predicción Bayesiana-preparación del archivo de entrenamiento
- Máquina de Soporte Vectorial (SVM)
- KNN p-Tree Algebra y minería vertical
- Red Neuronal
- Problema de variables grandes en Big Data -Bosque Aleatorio (RF)
- Problema de automatización en Big Data – Ensamble de modelos múltiples RF
- Automatización a través de Soft10-M
- Herramienta de análisis de texto-Treeminer
- Aprendizaje ágil
- Aprendizaje basado en agentes
- Aprendizaje distribuido
- Introducción a Herramientas de Código Abierto para analítica predictiva : R, Rapidminer, Mahut
Día 2: Sesión-4 Ecosistema de analítica predictiva-2: Problemas comunes de analítica predictiva en Gobierno.
- Análisis de información (Insight analytic)
- Análisis de visualización
- Análisis predictivo estructurado
- Análisis predictivo no estructurado
- Perfilado de amenazas/fraudulentes/proveedores
- Motor de Recomendaciones
- Detección de patrones
- Descubrimiento de Reglas/Escenarios –fallos, fraudes, optimización
- Descubrimiento de causa raíz
- Análisis de sentimiento
- Análisis de CRM
- Análisis de red/network
- Análisis de Texto
- Revisión asistida por tecnología
- Análisis de fraudes
- Análisis en Tiempo Real
Día 3 : Sesión-1 : Analítica en Tiempo Real y Escalable Sobre Hadoop
- Por qué los algoritmos de análisis comunes fallan en Hadoop/HDFS
- Apache Hama- para cómputo distribuido Sincronizado por Lotes (Bulk Synchronous)
- Apache SPARK- para cómputo de clúster para analítica en tiempo real
- CMU Graphics Lab2- Enfoque asincrónico basado en gráficos para cómputo distribuido
- Enfoque basado en KNN p-Algebra desde Treeminer para reducir el costo de hardware de operación
Día 3: Sesión-2: Herramientas para eDiscovery y Forense
- eDiscovery sobre Big Data vs. datos Legacy – una comparación de costo y rendimiento
- Codificación predictiva y revisión asistida por tecnología (TAR)
- Demostración en vivo de un producto Tar ( vMiner) para entender cómo funciona TAR para un descubrimiento más rápido
- Indexación más rápida a través de HDFS –velocidad de los datos
- NLP o Procesamiento de Lenguaje Natural –varias técnicas y productos de código abierto
- eDiscovery en idiomas extranjeros-tecnología para el procesamiento de idiomas extranjeros
Día 3 : Sesión 3: Business Intelligence de Big Data para la Ciberseguridad – Entendiendo la visión completa de 360 grados de la rápida recopilación de datos a la identificación de amenazas
- Comprensión de los fundamentos del análisis de seguridad-superficie de ataque, configuración errónea de seguridad, defensas del host
- Infraestructura de red/ Gran tubería de datos/ ETL de respuesta para analítica en tiempo real
- Prescriptivo vs predictivo – Reglas fijas basadas en reglas vs auto-descubrimiento de reglas de amenazas desde Metadatos
Día 3: Sesión 4: Big Data en USDA : Aplicación en Agricultura
- Introducción a IoT ( Internet de las Cosas) para agricultura-Big Data basado en sensores y control
- Introducción a la imagen satelital y su aplicación en agricultura
- Integración de datos de sensores e imágenes para fertilidad del suelo, recomendaciones de cultivo y pronósticos
- Seguro agrícola y Big Data
- Pronóstico de Pérdidas de Cosecha
Día 4 : Sesión-1: BI de prevención de fraudes desde Big Data en Gobierno-Análisis de fraudes:
- Clasificación básica de los análisis de fraudes- basado en reglas vs analítica predictiva
- Aprendizaje automático supervisado vs no supervisado para la detección de patrones de fraude
- Fraude de proveedores/cobros excesivos por proyectos
- Fraude de Medicare y Medicaid- técnicas de detección de fraude para el procesamiento de reclamos
- Fraudes en reembolsos de viajes
- Fraudes en reembolsos de IRS
- Se proporcionarán casos de estudio y demostraciones en vivo siempre que haya datos disponibles.
Día 4 : Sesión-2: Analítica de Medios Sociales- Recopilación e inteligencia y análisis
- API de Big Data ETL para extraer datos de medios sociales
- Texto, imagen, metadatos y video
- Análisis de sentimiento de las transmisiones de medios sociales
- Filtrado contextual y no contextual de las transmisiones de medios sociales
- Tablero (Dashboard) de Medios Sociales para integrar diversos medios sociales
- Perfilado automatizado del perfil de medios sociales
- Se realizará una demostración en vivo de cada análisis a través de la Herramienta Treeminer.
Día 4 : Sesión-3: Analítica de Big Data en el procesamiento de imágenes y flujos de video
- Técnicas de Almacenamiento de Imágenes en Big Data- Solución de almacenamiento para datos que superan los petabytes
- LTFS y LTO
- GPFS-LTFS ( Solución de almacenamiento por capas para datos de imágenes de Big Data)
- Fundamentos de analítica de imágenes
- Reconocimiento de objetos
- Segmentación de imágenes
- Rastreo de movimiento
- Reconstrucción de imágenes 3-D
Día 4: Sesión-4: Aplicaciones de Big Data en NIH:
- Áreas emergentes de Bioinformática
- Meta-genómica y problemas de minería de Big Data
- Analítica Predictiva de Big Data para Farmacogenómica, Metabolómica y Proteómica
- Big Data en el proceso de Genómica aguas abajo (downstream)
- Aplicación de la analítica predictiva de Big data en Salud Pública
Tablero (Dashboard) de Big Data para acceso rápido a datos diversos y visualización :
- Integración de la plataforma de aplicaciones existente con el Tablero de Big Data
- Gestión de Big Data
- Caso de Estudio de Tablero de Big Data: Tableau y Pentaho
- Usar aplicaciones de Big Data para impulsar servicios basados en ubicación en Gobierno.
- Sistema de seguimiento y gestión
Día 5 : Sesión-1: Cómo justificar la implementación de Business Intelligence de Big Data dentro de una organización:
- Definiendo el ROI para la implementación de Big Data
- Casos de estudio para ahorrar Tiempo del Analista para la recopilación y preparación de Datos –aumento de la ganancia de productividad
- Casos de estudio de ganancia de ingresos por ahorro en el costo de la base de datos licenciada
- Ganancia de ingresos de servicios basados en ubicación
- Ahorro de la prevención de fraudes
- Un enfoque integrado de hoja de cálculo para calcular el gasto aproximado vs. ganancia de ingresos/ahorro de la implementación de Big Data.
Día 5 : Sesión-2: Procedimiento paso a paso para reemplazar el sistema de datos legado por un Sistema de Big Data:
- Entendiendo el Hoja de Ruta práctica de Migración a Big Data
- Qué información importante se necesita antes de diseñar una implementación de Big Data
- Cuáles son las diferentes formas de calcular el volumen, la velocidad, la variedad y la veracidad de los datos
- Cómo estimar el crecimiento de los datos
- Casos de estudio
Día 5: Sesión 4: Revisión de Proveedores de Big Data y revisión de sus productos. Sesión de P/R:
- Accenture
- APTEAN (Anteriormente CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (Anteriormente 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Parte de EMC)
Requerimientos
- Conocimiento básico de la operación de negocios y los sistemas de datos del gobierno en su área de dominio
- Comprensión básica de SQL/Oracle o de bases de datos relacionales
- Comprensión básica de Estadística (a nivel de hoja de cálculo)
35 Horas
Reseñas (1)
La capacidad del formador de alinear el curso con los requisitos de la organización, y no solo proporcionarlo por el mero hecho de impartirlo.
Masilonyane - Revenue Services Lesotho
Curso - Big Data Business Intelligence for Govt. Agencies
Traducción Automática