Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Cada sesión dura 2 horas
Día 1: Sesión 1: Visión general empresarial sobre por qué utilizar Inteligencia Empresarial con Big Data en el Gobierno
- Casos de estudio del NIH y del DoE
- Tasa de adopción de Big Data en agencias gubernamentales y cómo están alineando sus operaciones futuras en torno a la Analítica Predictiva de Big Data
- Áreas amplias de aplicación en el DoD, NSA, IRS, USDA, etc.
- Interfaz de Big Data con datos heredados (legacy)
- Comprensión básica de las tecnologías habilitadoras en la analítica predictiva
- Integración de datos y visualización en paneles de control (dashboards)
- Gestión del fraude
- Generación de reglas comerciales / detección de fraude
- Detección de amenazas y perfiles
- Análisis de costo-beneficio para la implementación de Big Data
Día 1: Sesión 2: Introducción al Big Data - 1
- Características principales del Big Data: volumen, variedad, velocidad y veracidad. Arquitectura MPP para el volumen.
- Martillos de datos (Data Warehouses) – esquema estático, conjunto de datos que evoluciona lentamente
- Bases de datos MPP como Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
- Soluciones basadas en Hadoop – sin condiciones sobre la estructura del conjunto de datos.
- Patrón típico: HDFS, MapReduce (crunch), recuperación desde HDFS
- Lotes (Batch): adecuados para analítica no interactiva
- Volumen: flujo de datos CEP
- Opciones típicas – productos CEP (ej. Infostreams, Apama, MarkLogic, etc.)
- Menos listos para producción – Storm/S4
- Bases de datos NoSQL (columnares y clave-valor): las más adecuadas como complemento analítico al data warehouse/base de datos
Día 1: Sesión 3: Introducción al Big Data - 2
Soluciones NoSQL
- Almacén KV - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- Almacén KV - Dynamo, Voldemort, Dynomite, SubRecord, MongoDB, DovetailDB
- Almacén KV (Jerárquico) - GT.m, Cache
- Almacén KV (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- Caché KV - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Almacén de tuplas - Gigaspaces, Coord, Apache River
- Bases de datos de objetos - ZopeDB, DB40, Shoal
- Almacén de documentos - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, Bases de datos XML, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Almacén ancho columnar (Wide Columnar Store) - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Variaciones de datos: Introducción al problema de limpieza de datos en el Big Data
- RDBMS – estructura/esquema estático, no fomenta un entorno ágil y exploratorio.
- NoSQL – semiestructurado, suficiente estructura para almacenar datos sin un esquema exacto previo al almacenamiento
- Problemas de limpieza de datos
Día 1: Sesión 4: Introducción al Big Data - 3: Hadoop
- ¿Cuándo seleccionar Hadoop?
- ESTRUCTURADO - Los almacenes/bases de datos empresariales pueden almacenar datos masivos (con un costo) pero imponen estructura (no es bueno para la exploración activa)
- Datos SEMIESTRUCTURADOS – difíciles de manejar con soluciones tradicionales (DW/DB)
- Almacenamiento en data warehouse = ESFUERZO ENORME y estático incluso después de la implementación
- Para variedad y volumen de datos, procesados en hardware comercial – HADOOP
- Hardware comercial necesario para crear un clúster de Hadoop
Introducción a MapReduce / HDFS
- MapReduce – distribución de la computación en múltiples servidores
- HDFS – hacer que los datos estén disponibles localmente para el proceso de computación (con redundancia)
- Datos – pueden ser no estructurados/sin esquema (a diferencia del RDBMS)
- Responsabilidad del desarrollador dar sentido a los datos
- Programar MapReduce implica trabajar con Java (pros/contras), cargar manualmente datos en HDFS
Día 2: Sesión 1: Ecosistema de Big Data - Construcción de la ETL de Big Data: universo de herramientas de Big Data, cuál usar y cuándo?
- Hadoop vs. otras soluciones NoSQL
- Para acceso interactivo y aleatorio a los datos
- Hbase (base de datos orientada a columnas) sobre Hadoop
- Acceso aleatorio a los datos pero con restricciones impuestas (máx. 1 PB)
- No es bueno para analítica ad-hoc, sí para registro de eventos, conteo, series temporales
- Sqoop: Importar desde bases de datos a Hive o HDFS (acceso JDBC/ODBC)
- Flume – Correr datos (ej. datos de log) hacia HDFS
Día 2: Sesión 2: Sistema de Gestión de Big Data
- Piezas móviles, nodos de computación que inician/fallan: ZooKeeper - Para servicios de configuración/coordinación/naming
- Pipeline/flujo de trabajo complejo: Oozie – gestionar flujo de trabajo, dependencias, cadena de flores (daisy chain)
- Despliegue, configuración, gestión de clústeres, actualización, etc. (sys admin): Ambari
- En la Nube: Whirr
Día 2: Sesión 3: Analítica predictiva en Inteligencia Empresarial - 1: Técnicas fundamentales y BI basado en aprendizaje automático
- Introducción al aprendizaje automático
- Aprendizaje de técnicas de clasificación
- Predicción Bayesiana – preparación del archivo de entrenamiento
- Máquinas de Soporte Vectorial (SVM)
- KNN p-Tree Álgebra y minería vertical
- Redes neuronales
- Problema de variables grandes en Big Data - Bosque aleatorio (RF)
- Problema de automatización en Big Data – Bosque aleatorio de ensemble multimodelo
- Automatización a través de Soft10-M
- Herramienta de análisis de texto - Treeminer
- Aprendizaje ágil
- Aprendizaje basado en agentes
- Aprendizaje distribuido
- Introducción a herramientas de código abierto para analítica predictiva: R, Rapidminer, Mahout
Día 2: Sesión 4: Ecosistema de analítica predictiva - 2: Problemas comunes de analítica predictiva en el Gobierno
- Analítica de percepciones (insight)
- Analítica visual
- Analítica predictiva estructurada
- Analítica predictiva no estructurada
- Perfiles de amenaza/fraude/proveedor
- Motor de recomendación
- Detección de patrones
- Detección de reglas/escenarios – fallo, fraude, optimización
- Detección de la causa raíz
- Análisis de sentimiento
- Analítica CRM
- Analítica de redes
- Analítica de texto
- Revisión asistida por tecnología
- Analítica de fraude
- Analítica en tiempo real
Día 3: Sesión 1: Analítica escalable y en tiempo real sobre Hadoop
- Por qué fallan los algoritmos analíticos comunes en Hadoop/HDFS
- Apache Hama - para computación distribuida sincronizada masivamente
- Apache SPARK - para computación de clústeres para analítica en tiempo real
- CMU Graphics Lab2 - Enfoque asíncrono basado en grafos para computación distribuida
- Enfoque basado en p-Algebra KNN desde Treeminer para reducir el costo operativo de hardware
Día 3: Sesión 2: Herramientas para eDiscovery y Forense
- eDiscovery sobre Big Data vs. datos heredados – una comparación de costos y rendimiento
- Codificación predictiva y revisión asistida por tecnología (TAR)
- Demostración en vivo de un producto TAR (vMiner) para entender cómo funciona el TAR para un descubrimiento más rápido
- Indexación más rápida a través de HDFS – velocidad de los datos
- PNL o Procesamiento del Lenguaje Natural – varias técnicas y productos de código abierto
- eDiscovery en idiomas extranjeros: tecnología para el procesamiento de idiomas extranjeros
Día 3: Sesión 3: Inteligencia Empresarial con Big Data para Ciberseguridad – Entendiendo la visión completa de 360 grados desde la recopilación rápida de datos hasta la identificación de amenazas
- Comprensión de los fundamentos de la analítica de seguridad: superficie de ataque, mala configuración de seguridad, defensas de host
- Infraestructura de red / Gran tubería de datos / Respuesta ETL para analítica en tiempo real
- Predictivo vs. prescriptivo – Reglas fijas basadas en reglas Vs. descubrimiento automático de reglas de amenaza a partir de metadatos
Día 3: Sesión 4: Big Data en el USDA: Aplicaciones en Agricultura
- Introducción al IoT (Internet de las Cosas) para la agricultura, Big Data basado en sensores y control
- Introducción a la imágenes satelitales y sus aplicaciones en la agricultura
- Integración de datos de sensores e imágenes para fertilidad del suelo, recomendaciones de cultivo y pronósticos
- Seguros agrícolas y Big Data
- Pronóstico de pérdida de cosechas
Día 4: Sesión 1: BI de prevención de fraude desde Big Data en el Gobierno - Analítica de fraude:
- Clasificación básica de la analítica de fraude: basada en reglas vs. analítica predictiva
- Aprendizaje automático supervisado y no supervisado para la detección de patrones de fraude
- Fraude de proveedores / cobro excesivo por proyectos
- Fraude en Medicare y Medicaid, técnicas de detección de fraude para el procesamiento de reclamaciones
- Fraudes en reembolsos de viajes
- Fraudes en reembolsos del IRS
- Se proporcionarán casos de estudio y demostraciones en vivo donde los datos estén disponibles.
Día 4: Sesión 2: Analítica de Redes Sociales, recopilación y análisis de inteligencia
- API ETL de Big Data para extraer datos de redes sociales
- Texto, imagen, metadatos y video
- Análisis de sentimiento a partir del feed de redes sociales
- Filtrado contextual y no contextual del feed de redes sociales
- Panel de control (Dashboard) de Redes Sociales para integrar diversas fuentes de redes sociales
- Perfilamiento automático de perfiles de redes sociales
- Se proporcionará una demostración en vivo de cada analítica a través de la herramienta Treeminer.
Día 4: Sesión 3: Analítica de Big Data en procesamiento de imágenes y flujos de video
- Técnicas de almacenamiento de imágenes en Big Data - Solución de almacenamiento para datos que exceden los petabytes
- LTFS y LTO
- GPFS-LTFS (Solución de almacenamiento en capas para grandes datos de imagen)
- Fundamentos del análisis de imágenes
- Reconocimiento de objetos
- Segmentación de imágenes
- Rastreo de movimiento
- Reconstrucción de imagen 3D
Día 4: Sesión 4: Aplicaciones de Big Data en el NIH:
- Áreas emergentes de la bioinformática
- Metagenómica y problemas de minería de datos masivos
- Analítica predictiva de Big Data para farmacogenómica, metabolómica y proteómica
- Big Data en procesos genómicos posteriores
- Aplicación de la analítica predictiva de Big Data en salud pública
Panel de control (Dashboard) de Big Data para accesibilidad rápida y visualización de datos diversos:
- Integración de plataformas de aplicaciones existentes con el Panel de control de Big Data
- Gestión de Big Data
- Caso de estudio del Panel de control de Big Data: Tableau y Pentaho
- Utilice la aplicación de Big Data para impulsar servicios basados en ubicación en el gobierno
- Sistema de seguimiento y gestión
Día 5: Sesión 1: Cómo justificar la implementación de Inteligencia Empresarial con Big Data dentro de una organización:
- Definición del ROI para la implementación de Big Data
- Casos de estudio sobre el ahorro de tiempo del analista para la recopilación y preparación de datos – aumento en la ganancia de productividad
- Casos de estudio de ganancias de ingresos al ahorrar costos de bases de datos con licencia
- Ganancias de ingresos por servicios basados en ubicación
- Ahorros por prevención de fraude
- Un enfoque integrado de hojas de cálculo para calcular el gasto aprox. vs. la ganancia/ahorro de ingresos de la implementación de Big Data.
Día 5: Sesión 2: Procedimiento paso a paso para reemplazar sistemas de datos heredados por sistemas de Big Data:
- Comprensión del mapa de ruta práctico de migración de Big Data
- ¿Qué información importante se necesita antes de diseñar una implementación de Big Data?
- ¿Cuáles son las diferentes formas de calcular el volumen, velocidad, variedad y veracidad de los datos?
- Cómo estimar el crecimiento de los datos
- Casos de estudio
Día 5: Sesión 4: Revisión de proveedores de Big Data y reseña de sus productos. Sesión de preguntas y respuestas:
- Accenture
- APTEAN (anteriormente CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (anteriormente 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (parte de EMC)
Requerimientos
- Conocimientos básicos sobre el funcionamiento empresarial y los sistemas de datos gubernamentales en su ámbito
- Comprensión básica de SQL/Oracle o bases de datos relacionales
- Comprensión básica de Estadísticas (a nivel de hojas de cálculo)
35 Horas
Reseñas (1)
La capacidad del formador de alinear el curso con los requisitos de la organización, y no solo proporcionarlo por el mero hecho de impartirlo.
Masilonyane - Revenue Services Lesotho
Curso - Big Data Business Intelligence for Govt. Agencies
Traducción Automática