Temario del curso
Día 01
Visión general de Inteligencia de negocios de Big Data para el análisis de inteligencia criminal
- Estudios de caso de aplicación de la ley: Policía predictiva
- Tasa de adopción de Big Data en agencias de aplicación de la ley y cómo están alineando sus operaciones futuras alrededor del Análisis Predictivo con Big Data
- Soluciones tecnológicas emergentes como sensores de disparos, video de vigilancia y redes sociales
- Uso de la tecnología Big Data para mitigar la sobrecarga de información
- Interfaz entre Big Data y datos heredados (Legacy)
- Comprensión básica de las tecnologías habilitadoras en el análisis predictivo
- Integración de datos y visualización en tableros dinámicos (dashboards)
- Gestión de fraude
- Reglas de negocio y detección de fraude
- Detección de amenazas y perfiles
- Análisis costo-beneficio para la implementación de Big Data
Introducción a Big Data
- Características principales de Big Data: VOLUMEN, VARIEDAD, VELOCIDAD Y VERACIDAD.
- Arquitectura MPP (Procesamiento Masivamente Paralelo)
- Almacenes de datos (Data Warehouses) – esquema estático, conjunto de datos que evoluciona lentamente
- Bases de datos MPP: Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
- Soluciones basadas en Hadoop – sin restricciones sobre la estructura del conjunto de datos.
- Patrón típico: HDFS, MapReduce (crunch), recuperación desde HDFS
- Apache Spark para procesamiento en tiempo real (streaming)
- Lote (Batch): adecuado para análisis no interactivo
- Volumen: datos de streaming CEP (Procesamiento de Eventos Complejos)
- Opciones típicas – productos CEP (ej. Infostreams, Apama, MarkLogic, etc.)
- Menos maduros para producción – Storm/S4
- Bases de datos NoSQL (columnares y clave-valor): mejor adaptadas como complemento analítico al almacén de datos/basededatos
Soluciones NoSQL
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (Jerárquico) - GT.m, Cache
- KV Store (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- Base de datos de objetos - ZopeDB, DB40, Shoal
- Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Variedades de datos: Introducción a los problemas de limpieza de datos en Big Data
- RDBMS – estructura/esquema estático, no fomenta un entorno ágil y exploratorio.
- NoSQL – semi-estructurado, con suficiente estructura para almacenar datos sin un esquema exacto previo al almacenamiento
- Problemas de limpieza de datos
Hadoop
- ¿Cuándo seleccionar Hadoop?
- DATOS ESTRUCTURADOS - Los almacenes/bases de datos empresariales pueden almacenar enormes cantidades de datos (a costa de ello) pero imponen estructura (no ideal para exploración activa)
- DATOS SEMI-ESTRUCTURADOS – difíciles de procesar con soluciones tradicionales (DW/DB)
- Almacenamiento en almacén de datos = Esfuerzo ENORME y estático incluso después de la implementación
- Para variedad y volumen de datos, comprimidos en hardware genérico – HADOOP
- Hardware genérico (Commodity H/W) necesario para crear un clúster de Hadoop
Introducción a Map Reduce / HDFS
- MapReduce – distribuir el cómputo entre múltiples servidores
- HDFS – hacer los datos disponibles localmente para el proceso de cómputo (con redundancia)
- Datos – pueden ser no estructurados/sin esquema (a diferencia de RDBMS)
- Responsabilidad del desarrollador dar sentido a los datos
- Programar MapReduce = trabajar con Java (pros/contras), carga manual de datos en HDFS
Día 02
Ecosistema de Big Data: Construcción de ETL para Big Data (Extracción, Transformación, Carga) – ¿Qué herramientas de Big Data usar y cuándo?
- Hadoop vs. Otras soluciones NoSQL
- Para acceso interactivo e aleatorio a los datos
- Hbase (base de datos orientada a columnas) sobre Hadoop
- Acceso aleatorio a los datos pero con restricciones impuestas (max 1 PB)
- No ideal para análisis ad-hoc, bueno para registros, conteos y series temporales
- Sqoop - Importar desde bases de datos a Hive o HDFS (acceso JDBC/ODBC)
- Flume – Transmitir datos (ej. datos de registro) a HDFS
Sistema de gestión de Big Data
- Componentes móviles, nodos de cómputo inicio/fallo: ZooKeeper - Para configuración/coordinación/servicios de nomenclatura
- Pipeline/workflow complejo: Oozie – gestionar workflow, dependencias, cadena Daisy (daisy chain)
- Desplegar, configurar, gestión de clústeres, actualizaciones, etc. (admin sys): Ambari
- En la nube: Whirr
Análisis Predictivo – Técnicas fundamentales e Inteligencia de negocios basada en Aprendizaje Automático
- Introducción al Aprendizaje Automático
- Aprendizaje de técnicas de clasificación
- Predicción Bayesiana – preparación de un archivo de entrenamiento
- Máquina de Vectores de Soporte (Support Vector Machine)
- Álgebra p-Tree KNN y minería vertical
- Redes Neuronales
- Problema de grandes variables en Big Data – Bosque Aleatorio (RF)
- Problema de automatización en Big Data – Bosque Aleatorio multi-modelo
- Automatización a través de Soft10-M
- Herramienta de análisis textual - Treeminer
- Aprendizaje ágil
- Aprendizaje basado en agentes
- Aprendizaje distribuido
- Introducción a herramientas de código abierto para análisis predictivo: R, Python, Rapidminer, Mahut
Ecosistema de Análisis Predictivo y su aplicación en el análisis de inteligencia criminal
- Tecnología y proceso de investigación
- Análisis insight (perspicaz)
- Analítica de visualización
- Análisis predictivo estructurado
- Análisis predictivo no estructurado
- Perfilamiento de amenaza/fraudstar/proveedor
- Motor de recomendaciones
- Detección de patrones
- Descubrimiento de reglas/escenarios – falla, fraude, optimización
- Descubrimiento de la causa raíz
- Análisis de sentimiento
- Análítica CRM
- Análítica de red
- Análisis textual para obtener información de transcripciones, declaraciones de testigos, chatter en internet, etc.
- Revisión asistida por tecnología
- Análisis de fraude
- Análisis en tiempo real
Día 03
Analítica en tiempo real y escalable sobre Hadoop
- Por qué fallan los algoritmos analíticos comunes en Hadoop/HDFS
- Apache Hama - para cómputo distribuido sincrónico masivo (Bulk Synchronous)
- Apache SPARK - para cómputo en clústeres y análisis en tiempo real
- CMU Graphics Lab2 - Enfoque asincrónico basado en grafos para el cómputo distribuido
- KNN p – Enfoque algebraico de Treeminer para reducir costos de operación de hardware
Herramientas eDiscovery y Forensia
- eDiscovery sobre Big Data vs. datos heredados – una comparación de costo y rendimiento
- Codificación predictiva y Revisión Asistida por Tecnología (TAR)
- Demo en vivo de vMiner para comprender cómo TAR permite un descubrimiento más rápido
- Indexación más rápida a través de HDFS – Velocidad de los datos
- PNL (Procesamiento del Lenguaje Natural) – productos y técnicas de código abierto
- eDiscovery en idiomas extranjeros – tecnología para el procesamiento de lenguas extranjeras
BI de Big Data para Ciberseguridad – Obtener una vista integral de 360 grados, recolección rápida de datos e identificación de amenazas
- Comprensión de los fundamentos del análisis de seguridad: superficie de ataque, configuración incorrecta de seguridad, defensas hostiles
- Infraestructura de red / Gran tubería de datos (datapipe) / ETL de respuesta para análisis en tiempo real
- Prescriptivo vs predictivo – Reglas fijas basadas en reglas vs descubrimiento automático de reglas de amenaza a partir de metadatos
Recopilación de datos dispares para el Análisis de Inteligencia Criminal
- Uso de IoT (Internet de las Cosas) como sensores para capturar datos
- Uso de imágenes satelitales para vigilancia doméstica
- Uso de datos de vigilancia e imagen para identificación criminal
- Otras tecnologías de recopilación de datos – drones, cámaras corporales, sistemas de etiquetado GPS y tecnología de imagen térmica
- Combinar la recuperación automatizada de datos con datos obtenidos de informantes, interrogatorios e investigación
- Pronosticar actividad criminal
Día 04
Prevención de fraude BI desde Big Data en Análisis de Fraude
- Clasificación básica del Análisis de Fraude: basado en reglas vs analítica predictiva
- Aprendizaje supervisado vs no supervisado para la detección de patrones de fraude
- Fraude entre empresas, fraude en reclamos médicos, fraude de seguros, evasión fiscal y lavado de dinero
Análisis de Redes Sociales – Recopilación y análisis de inteligencia
- Cómo los criminales usan las redes sociales para organizarse, reclutar y planificar
- API ETL de Big Data para extraer datos de redes sociales
- Texto, imagen, metadatos y video
- Análisis de sentimiento a partir del feed de redes sociales
- Filtrado contextual y no contextual del feed de redes sociales
- Tablero dinámico (Dashboard) de Redes Sociales para integrar diversas plataformas
- Perfilamiento automatizado de perfiles de redes sociales
- Demo en vivo de cada análisis se realizará a través de la herramienta Treeminer
Análisis de Big Data en procesamiento de imágenes y flujos de video
- Técnicas de almacenamiento de imágenes en Big Data – Solución de almacenamiento para datos que exceden petabytes
- LTFS (Linear Tape File System) y LTO (Linear Tape Open)
- GPFS-LTFS (Sistema de Archivos Paralelo General - Sistema de Archivos de Cinta Lineal) – solución de almacenamiento en capas para datos de imagen grande
- Fundamentos del análisis de imágenes
- Reconocimiento de objetos
- Segmentación de imagen
- Rastreo de movimiento
- Reconstrucción de imagen 3D
Biometría, ADN y Programas de Identificación de Nueva Generación
- Más allá de las huellas dactilares y el reconocimiento facial
- Reconocimiento de voz, ritmo de teclado (análisis del patrón de escritura de un usuario) y CODIS (Sistema Combinado de Índice de ADN)
- Más allá de la coincidencia de ADN: uso de la fenotipificación forense de ADN para construir un rostro a partir de muestras de ADN
Tablero dinámico (Dashboard) de Big Data para acceso rápido a diversos datos y visualización :
- Integración de la plataforma de aplicaciones existente con el Tablero de Big Data
- Gestión de Big Data
- Caso de Estudio del Tablero de Big Data: Tableau y Pentaho
- Uso de la aplicación Big Data para impulsar servicios basados en ubicación en el gobierno
- Sistema de seguimiento y gestión
Día 05
Cómo justificar la implementación de BI de Big Data dentro de una organización:
- Definir el ROI (Retorno sobre la Inversión) para implementar Big Data
- Estudios de caso para ahorrar tiempo del analista en la recopilación y preparación de datos – aumentando la productividad
- Ganancia de ingresos por menor costo de licencias de bases de datos
- Ganancia de ingresos por servicios basados en ubicación
- Ahorro de costos por prevención de fraude
- Un enfoque integrado de hojas de cálculo para calcular gastos aproximados vs. Ganancia de ingresos/ahorro de la implementación de Big Data.
Procedimiento paso a paso para reemplazar un sistema de datos heredado (legacy) con un sistema de Big Data
- Hoja de ruta para la migración de Big Data
- ¿Qué información crítica se necesita antes de diseñar un sistema de Big Data?
- ¿Cuáles son las diferentes formas de calcular el Volumen, Velocidad, Variedad y Veracidad de los datos?
- Cómo estimar el crecimiento de datos
- Estudios de caso
Revisión de proveedores de Big Data y revisión de sus productos.
- Accenture
- APTEAN (anteriormente CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (anteriormente 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (parte de EMC)
Sesión de preguntas y respuestas
Requerimientos
- Conocimiento de los procesos de aplicación de la ley y sistemas de datos
- Comprensión básica de SQL/Oracle o bases de datos relacionales
- Comprensión básica de estadísticas (nivel hoja de cálculo)
Público objetivo
- Especialistas en aplicación de la ley con formación técnica
Reseñas (3)
fundamentos y amó los documentos y ejercicios preparados
Rekha Nallam - GE Medical Systems Polska Sp. z o.o.
Curso - Introduction to Predictive AI
Traducción Automática
Que fue muy priactico.
Alfonso Ramos - Banco de Mexico
Curso - Fundamentos de Integración de Datos Pentaho
Deepthi estaba muy atenta a mis necesidades, podía percibir cuándo añadir capas de complejidad y cuándo mantenerse atrás y adoptar un enfoque más estructurado. Deepthi realmente trabajó a mi ritmo y aseguró que pudiera utilizar las nuevas funciones/herramientas por mí mismo, primero mostrándome y luego dejándome recrear los elementos por mí mismo, lo cual ayudó mucho a consolidar la formación. ¡No podría estar más satisfecho con los resultados de esta capacitación y con el nivel de experiencia de Deepthi!
Deepthi - Invest Northern Ireland
Curso - IBM Cognos Analytics
Traducción Automática