← Minería de Datos
Clase 03
M.C. José Concepción Roberto Olvera López · Fecha: 8 sep 2026 · Tema 2 (continuación) — Servidores de bases de datos, On-Premise vs. Nube, Data Lake vs. Data Warehouse, ecosistema Big Data (Kafka, Spark, Hadoop/HDFS/MapReduce). Exposiciones de KDD: News Corp, Bwood, Nu Bank.
En corto
- Servidores de BD: SAP HANA/Sybase IQ (columnares con 80–90% de compresión), Oracle, IBM, Microsoft SQL Server.
- On-Premise vs. Cloud: On-Premise (~30% del mercado) = baja latencia, sistemas de producción físicos · Cloud = escalabilidad, costo inicial $10–20 K MXN, rápida implementación.
- Data Lake vs. DW: Data Lake = datos crudos/no estructurados (imágenes, JSON), flexibilidad · Data Warehouse = estructurado, esquemas definidos, consultas de negocio.
- Big Data: Spark (procesamiento en memoria ultra rápido) · Kafka (eventos en tiempo real) · Hadoop/HDFS/MapReduce (distribución por nodos).
- KDD aplicado: News Corp (clustering + series de tiempo) · Bwood/Delivery (clasificación + regresión) · Nu Bank (LightGBM/XGBoost + Isolation Forest + PCA + RFM + SHAP).
- Examen: Solo Tema 1 y Tema 2 (NO Tema 3). Énfasis en Cloud/On-Prem, Data Lake/DW, ecosistema Big Data, validación cruzada, ROC/AUC, KS.
🎯 Para el examen
- Arquitecturas On-Premise vs. Cloud: casos de uso, costos, latencia, escalabilidad.
- Data Lake vs. Data Warehouse: diferencia fundamental, cuándo usar cada uno, flexibilidad vs. estructura.
- Ecosistema Big Data: Kafka (eventos en tiempo real), Spark (procesamiento en memoria), Hadoop/HDFS/MapReduce (distribución).
- Validación de modelos: validación cruzada (Cross-Validation), balanceo de clases (SMOTE), métricas ROC/AUC/KS.
- Nota crítica: El Tema 3 (Métodos y algoritmos) NO entra en el examen. Se impartirá después del examen.
Servidores de bases de datos — Architeturas columnares
- SAP HANA y Sybase IQ: sistemas columnares que comprimen datos de forma drástica (80–90% de compresión). Ejemplo: 100 GB sin comprimir → 10–20 GB comprimidos. Basados en almacenamiento por columna en lugar de por fila.
- Oracle Database: servidor relacional tradicional, soporta datos de empresa, compatible con aplicaciones legacy.
- IBM Db2 / Informix: alternativa de datos en memoria para transacciones de alta velocidad.
- Microsoft SQL Server: integración con ecosistema Azure, soporta OLTP y OLAP.
- PostgreSQL / MySQL: opciones open-source de bajo costo para startups y proyectos sin presupuesto elevado.
Arquitecturas On-Premise vs. Nube (Cloud)
On-Premise (~30% del mercado):
- Requisito de baja latencia: sistemas de cotización en bolsa de valores requieren respuesta en milisegundos.
- Sistemas de producción físicos: bases de datos que deben permanecer en instalaciones del cliente por regulación o seguridad.
- Control total de hardware, infraestructura y datos.
- Costo inicial alto, mantenimiento de personal TI/DBA en sitio.
Cloud (~70% del mercado):
- Rápida implementación: provisionar servidores en minutos, no en meses.
- Escalabilidad automática: Google atiende 100 millones de usuarios simultáneos; Ticketmaster cae con 10,000 conexiones.
- Costo inicial accesible: $10,000–20,000 MXN para infraestructura inicial (AWS, Azure, Oracle Cloud, IBM Cloud).
- Pago por consumo (pay-as-you-go), sin inversión en hardware físico.
- Responsabilidad compartida de seguridad y actualizaciones con el proveedor.
Decisión de Gerentes TI/DBAs: evaluación de infraestructura preexistente, compatibilidad con stack tecnológico actual y comparativa de costos de almacenamiento para Data Lakes.
Data Lake vs. Data Warehouse
Data Lake (Lago de Datos):
- Almacena datos crudos y no estructurados: imágenes, documentos PDF, archivos JSON, logs de aplicación, datos de sensores IoT.
- Alta flexibilidad: "ingesta primero, preguntas después" (schema-on-read).
- Volumen masivo: petabytes de datos históricos sin depuración previa.
- Menor costo de almacenamiento (archivos comprimidos en HDFS o S3).
- Riesgo: convertirse en "swamp" (pantano) sin gobernanza y catalogación.
Data Warehouse (Almacén de Datos):
- Almacena datos estructurados, limpios y esquematizados para consultas de negocio ejecutivas.
- Requiere esquemas definidos a priori (schema-on-write): tablas de dimensiones y hechos (Kimball, Star Schema).
- Optimizado para reportes y análisis OLAP (Online Analytical Processing).
- Mayor costo de almacenamiento, pero consultas más rápidas y confiables.
- Excelente para toma de decisiones gerencial con datos validados.
Analogía: Data Lake es la cantera de minerales; Data Warehouse es la joyería terminada y pulida.
Ecosistema Big Data — Kafka, Spark, Hadoop
Apache Kafka: plataforma de streaming de eventos en tiempo real.
- Ingesta masiva de eventos desde múltiples fuentes simultáneas (IoT, transacciones, logs de aplicación).
- Modelo productor-consumidor desacoplado: productores no esperan confirmación de consumidores.
- Tolerancia a fallos mediante replicación de particiones entre brokers de Kafka.
- Casos de uso: monitoreo de alertas, recomendaciones en tiempo real, detección de fraude en transacciones.
Apache Spark: procesamiento distribuido en memoria ultra rápido.
- 100x más rápido que Hadoop MapReduce clásico porque mantiene datos en RAM entre iteraciones.
- Soporta SQL, Python (PySpark), Scala, Java.
- APIs de alto nivel: DataFrames, Datasets, SQL queries.
- Casos de uso: transformación de datos (ETL), machine learning a escala, análisis exploratorio de datasets grandes.
Hadoop / HDFS / MapReduce: distribución por nodos para procesamiento batch.
- HDFS (Hadoop Distributed File System): almacena datos replicados en múltiples nodos (3 réplicas por defecto). Tolera fallos de hardware automáticamente.
- MapReduce: paradigma de programación que divide un problema grande en tareas pequeñas (Map) y agrega resultados (Reduce). Funciona en paralelo en múltiples nodos.
- Más lento que Spark pero altamente confiable para procesamiento batch nocturno de petabytes.
- Fundamento de gran parte de la infraestructura de Big Data histórica (2008–2015).
Caso 1: News Corporation (Equipo 3)
Problema de Negocio:
- Caída de confianza en noticieros del 75% (2018) al 46% (2022).
- Causa: incremento de programación de opinión (entretenimiento) vs. reportaje informativo.
- Riesgo paradójico: los programas de opinión generan 30% de los ingresos totales, pero erosionan credibilidad de marca.
Métodos Analíticos Aplicados:
- K-Means: agrupar audiencias por preferencias (noticias duras vs. opinión).
- Reglas de Asociación: identificar patrones: si ven noticia X, ¿qué programa suele seguir?
- Análisis de Redes: conectividad entre temas y programas en redes sociales.
- Series de Tiempo: tendencia mensual de confianza vs. % de programación de opinión.
- Regresión: cuantificar relación entre incremento de opinión y caída de confianza.
- Redes Neuronales: predicción no lineal de confianza futura bajo distintos escenarios de programación.
- Modelos de Optimización: balancear ingreso (30% de opinión) vs. credibilidad (máx. confianza).
Solución Recomendada: reducir programas de opinión en 15% e incrementar programación informativa/noticias para recuperar índice de confianza sin sacrificar ingresos críticos.
Caso 2: Bwood / App de Delivery (Equipo 1)
Problema de Negocio:
- Inexactitud en tiempos de entrega estimados: cliente pide comida en 30 min, pero llega en 45 min → frustración y cancelaciones.
- Desbalance entre oferta y demanda: picos de pedidos sin suficientes repartidores disponibles.
- Fricciones operacionales: retrasos acumulativos en cocina, tráfico, asignación de rutas.
Métodos Analíticos Aplicados:
- Clasificación Binaria: ¿Entregado a tiempo (SÍ/NO)? ¿Cancelado (SÍ/NO)? Entrenamiento con histórico de 50,000 pedidos.
- Regresión: predicción de duración del pedido en minutos (integración de horario, zona geográfica, demanda actual).
- Clusterización (K-Means): agrupar comportamientos similares (usuarios que siempre piden entre 6–8 PM, pedidos desde zona norte, etc.).
- Árboles de Decisión: identificar factores críticos de retraso (repartidor sin GPS, cocina saturada, tráfico vehicular).
Validación del Modelo:
- Validación cruzada (5-fold Cross-Validation) con datos históricos de 3 meses.
- Criterios de despliegue: velocidad de desarrollo (1 semana), facilidad de implementación en API, bajo costo de mantenimiento.
Impacto Esperado: mejora en predicción de tiempos (±5 minutos de error), reducción de cancelaciones, mejor asignación de repartidores en tiempo real.
Caso 3: Nu Bank (Equipo 10) — Evaluación de Riesgo Crediticio
Problema de Negocio:
- Mercado latinoamericano (México, Brasil, Colombia) con millones de personas sin historial crediticio documentado.
- Riesgo: otorgar crédito a solicitantes sin Buró de Crédito confiable. Alternativa: usar datos alternativos (comportamiento de gasto, transacciones móviles, datos demográficos).
- Regulación: CNBV (México) y Banxico requieren explicabilidad del modelo de decisión crediticia (no "caja negra").
Métodos Analíticos Aplicados:
- LightGBM y XGBoost: modelos de gradient boosting para predicción de probabilidad de incumplimiento (Default Rate).
- Regresión Logística Regularizada (Ridge/Lasso): interpretable, fácil de implementar en producción.
- Isolation Forest: detección de valores atípicos (anomalías crediticias, intentos de fraude organizado).
- PCA (Análisis de Componentes Principales): reducción de dimensionalidad en features demográficas/transaccionales (de 150 variables → 20 componentes).
- Segmentación RFM: Recency (última transacción), Frequency (frecuencia de uso), Monetary (monto gastado) para agrupar usuarios por valor y riesgo.
Validación y Métricas:
- ROC/AUC: sensibilidad vs. especificidad (capturar morosos sin rechazar buenos clientes).
- Estadístico KS (Kolmogorov-Smirnov): discriminación entre buenos y malos pagadores (target ≥ 0.30 típicamente).
- SMOTE: balanceo de clases (los morosos son ~2–5% de la población, imbalance).
- SHAP (SHapley Additive exPlanations): explicabilidad por contrato regulatorio (mostrar por qué se aprobó/rechazó cada solicitud a cliente y regulador).
Impacto Esperado: ampliar acceso crediticio a millones de usuarios bancarizados sin historial formal, mantener tasa de incumplimiento baja (< 3%), cumplir regulación de explicabilidad.
Rúbrica y Logística del Proyecto Arquitectura de Datos
Reorganización de Equipos: el profesor coordinó la reconfiguración de integrantes en los equipos para el Proyecto 1 (Presentación de KDD).
Estructura del Proyecto:
- Presentación en PowerPoint: 10 diapositivas máximo, duración de exposición 7 minutos máximo (regla ejecutiva).
- Documento Técnico (Anexo): rigor matemático, detalles de algoritmos, matrices de confusión, código, formatos de datos (JSON, CSV, bases relacionales).
- Presentación ejecutiva: enfocada en Director General / Tomadores de decisiones. Texto minimalista, imágenes corporativas, conclusiones de negocio.
Criterios de Calificación:
- Contenido técnico del documento anexo.
- Claridad y impacto visual (PowerPoint).
- Dominio del conocimiento temático.
- Desenvolvimiento, seguridad y confianza al hablar.
Fecha de Examen: confirmada al cierre de la clase (consúltalo con tus compañeros).
Contexto — no examen
- (Contexto) Experiencia con SAP HANA: el profesor relató su experiencia laboral implementando sistemas SAP HANA y Sybase IQ, destacando la capacidad de compresión de 80–90% en bases columnares.
- (Contexto) Latencia en Casas de Bolsa: explicación de cómo los algoritmos de trading requieren respuesta en milisegundos, imposibilitando arquitecturas con latencia o dependencia de Cloud remoto.
- (Contexto) Escalabilidad: Google vs. Ticketmaster: comparación dramática entre Google (100 millones de usuarios simultáneos) y Ticketmaster (colapso con 10,000 conexiones simultáneas para compra de boletos).
- (Contexto) Decisiones de Infraestructura: gerentes de TI y DBAs negocian con proveedores (AWS, Azure, Oracle) basándose en costo de almacenamiento para Data Lakes y compatibilidad con stack tecnológico existente.
Pendiente / próximas clases
- Tema 3 (El proceso de minería de datos): completamente pendiente de impartir. Se abordará tras el examen de Temas 1 y 2.
- Secuencia 3.5: metodología detallada de Identificar modelo → Identificar método → Identificar algoritmo → Generar → Validar → Mejorar.
- Los 7 métodos (3.4): profundización en Clasificación, Regresión, Agrupación, Sumarización, Dependencia/Correlación, Reglas de Asociación y Detección de Cambios.
- Validación Cruzada (Tema 4): estrategias avanzadas de validación, comparación de esquemas, evaluación de predicción numérica, LDM.