← Minería de Datos
Clase 02
M.C. José Concepción Roberto Olvera López · 3 sep 2026 · Tema 2 — Arquitectura de minería de datos · repositorio vs. base de datos, Data Warehouse, Data Mart, virtualización de datos, ERP y Data Lake. Presentaciones de los equipos 9, 13, 12 y 11.
En corto
- Base de datos (transaccional) → Repositorio (histórico, metadatos, gobernanza, TB–PB) → Data Warehouse (empresarial, integrado, estructurado, "única fuente confiable") → Data Lake (datos crudos y no estructurados en formato nativo).
- Data Mart = un Data Warehouse acotado a un área de negocio (RR. HH., Finanzas) con usuarios limitados a esa área.
- Virtualización de datos: consultar los datos en su origen en tiempo real sin moverlos; el usuario ve una vista reducida (p. ej. 14 campos de 180). ~70 % de los datos se manejan así hoy.
- ERP (p. ej. SAP) = núcleo de la empresa: finanzas, nómina, facturación, inventarios. Alimenta los procesos de minería.
- ETL vs. ELT: la Extracción-Transformación-Carga es solo una forma de alimentar un Warehouse.
🎯 Para el examen
- Diseñar esquemas de arquitectura de datos (obligatorio): diagramas con redes, servidores, capas de seguridad (firewalls) y acceso restringido por roles y horarios.
- Distinguir técnicamente: Base de Datos (transaccional) · Repositorio (histórico / gobernanza) · Data Warehouse (empresarial / estructurado) · Data Lake (no estructurado / crudo).
- Gobernanza: la seguridad moderna limita el acceso no solo por tabla, sino por columna y por tiempo de respuesta.
- Transacciones distribuidas: Two-Phase Commit (2PC) para garantizar que los registros queden grabados correctamente en sistemas distribuidos.
- ETL vs. ELT como formas de alimentar el Warehouse.
Arquitectura de minería de datos — repositorios y gobernanza
- Repositorio de datos: contenedor de grandes volúmenes de información con esquemas de seguridad y gobernanza mucho más amplios que una base de datos básica. Se caracteriza por: uso de metadatos, almacenamiento de información histórica y capacidad para manejar volúmenes muy altos (terabytes o petabytes).
- Gobernanza: el acceso se restringe por rol, por tabla, por columna y por horario; se controla también el tiempo de respuesta de las consultas.
Data Warehouse, Data Mart y virtualización
- Data Warehouse (almacén de datos): repositorio centralizado que recopila, integra y organiza grandes cantidades de datos actuales e históricos de múltiples fuentes para facilitar el análisis y la toma de decisiones. Debe ser la "única fuente confiable" de la verdad en la empresa.
- Data Mart: versión de un repositorio enfocada exclusivamente en un área de negocio específica (RR. HH., Finanzas), con usuarios limitados a esa área.
- Virtualización de datos: técnica que permite consultar los datos en su origen en tiempo real sin moverlos físicamente al repositorio. El usuario ve una estructura (p. ej. 14 campos) aunque el origen tenga otra (p. ej. 180 campos). Se estima que ~70 % de los datos se manejan así actualmente.
- ETL / ELT: Extracción, Transformación y Carga es solo una de las formas de alimentar un Warehouse.
Sistemas ERP
- ERP (Enterprise Resource Planning): el corazón o núcleo de la empresa (p. ej. SAP). Integra la parte financiera, nómina, facturación e inventarios.
- Es fundamental para alimentar los procesos de minería.
Data Lake
- Data Lake (lago de datos): repositorio para datos no estructurados (imágenes, audio, documentos, redes sociales) que se almacenan en su formato nativo sin procesar.
- No tiene reglas estrictas de organización como el Warehouse, lo que facilita el almacenamiento rápido de petabytes de información.
- Contrapartida: al no estar estructurado, encontrar y explotar la información es más difícil.
Presentaciones de los equipos (casos de estudio)
Continuación de los casos de la Clase 1. Cada equipo expone problemática, datos, limpieza, transformación y algoritmos.
Equipo 9 — Scitum / Telmex (ciberseguridad).
- Problema: alto número de falsos positivos en las alertas de un SOC.
- Datos: tráfico de red, logs de firewalls y servidores (JSON, CSV, texto), IPs, fechas y horas.
- Limpieza: no eliminar valores faltantes (un campo
malware vacío puede ser relevante) ni outliers (pueden ser ataques reales); solo eliminar duplicados de intentos de conexión fallidos.
- Transformación: variables como "intentos fallidos por minuto"; segmentación por geolocalización.
- Algoritmos: clasificación (falso positivo vs. amenaza) y series de tiempo para predecir el patrón normal de tráfico.
Equipo 13 — LEGO (manufactura).
- Problema: reducir la huella ecológica por sobredimensionamiento de empaques y exceso de piezas de repuesto.
- Datos: materia prima (plástico), volumen de empaque, manuales, telemetría de sensores IoT en fábricas.
- Limpieza: evitar sets atípicos (p. ej. de 65 000 piezas); ID único por pieza sin repetición.
- Algoritmos: K-Means (3 clases: óptimos, sobredimensionados, exceso de piezas); Silhouette Score para priorizar; Random Forest para predecir qué clientes aceptarían manuales digitales (más probable en sets pequeños/medianos).
Equipo 12 — SmartFit (retail / salud).
- Problema: abandono de clientes (churn rate) por saturación en horas pico.
- Datos: tendencia de asistencia, biométricos (huella), índice de saturación de equipos, CRM de pagos.
- Limpieza: eliminar registros biométricos dobles; imputar salidas faltantes con la media del usuario; eliminar estancias atípicas (muy cortas o muy largas).
- Transformación: normalización a escala 0–1; discretización de horas pico.
- Algoritmos: Naïve Bayes (probabilidad de deserción); K-Means para perfiles (asistentes de inicio de mes, de hora pico, desertores).
Equipo 11 — CEMEX (construcción).
- Problema: disminuir el uso de agua potable en la producción de concreto.
- Metas: scripts en Python y dashboards en Power BI para auditar el consumo por metro cúbico.
- Limpieza: valores faltantes → valor medio entre la hora anterior y la posterior; outliers → distinguir error de lectura de fuga masiva.
- Algoritmos: K-Means (plantas eficientes vs. no eficientes); Z-Score para detectar fugas en tiempo real; regresión lineal múltiple para los factores que aumentan el consumo.
- Validación: Silhouette Score y comparación de predicciones contra el histórico real para evitar sobreajuste.
Contexto — no examen
- En una presentación ejecutiva, un error de ortografía puede hundir un proyecto millonario: los directivos pierden confianza en el detalle técnico si ven descuido en lo básico.
- Las láminas no deben saturarse de texto: el cliente tiene poco tiempo (máx. ~20 min) y debe captar la esencia; el detalle técnico se queda en el documento de soporte. Elevator pitch: poder transmitir la idea central en lo que dura un viaje en elevador (1–2 min).
Pendiente / próxima clase
- Continúan las presentaciones de los equipos restantes el próximo martes.
- Proyecto 2: el martes se asignan proveedores tecnológicos (Oracle, Amazon, Google…). Cada equipo se "pone la camiseta" de su marca y vende técnicamente su solución al resto del grupo.
- Investigar y complementar por cuenta propia Data Warehouse y Data Lake para dominar los términos técnicos.