M.C. José Concepción Roberto Olvera López · 1 sep 2026 · Temas 1 y 2 — introducción a la minería de datos y al proceso KDD (con 5 casos de estudio de los equipos) y arranque de la arquitectura de minería de datos.
Cadena de valor: datos crudos → modelos → patrones → predicciones → mejores decisiones.
En el audio quedó un término sin identificar ("GS", para "ver tendencias por sucursal") y frases fragmentadas de los expositores; el resto del contenido se pudo reconstruir del contexto.
Cada equipo aplicó el proceso KDD (entender el negocio → datos → limpieza → transformación → algoritmos → validación) a una empresa real:
| Caso | Problema | Algoritmos | Validación |
|---|---|---|---|
| Retail — inventario y venta cruzada (Equipo 7) | Fuga de capital por sobrestock de baja rotación; ventas perdidas por desabasto de alta demanda | FP-Growth para market basket analysis (venta cruzada, reglas cross-selling); regresión para pronóstico de demanda por zona y periodo | Reglas de asociación, análisis de ROI, monitoreo de precisión, evaluación empresarial |
| Netflix — retención de usuarios (Equipo 2) | Fatiga de contenido y cancelación (churn) en los primeros 30 días; cold start (usuario nuevo sin historial → recomendaciones genéricas) | Regresión logística (predicción de churn, fácil de interpretar); K-Means (segmentar: maratonistas, ocasionales, indecisos); Apriori (géneros consumidos juntos) | Metas: bajar cancelación de 20 % a 12 %, +20 % de tiempo de reproducción; variables derivadas: tiempo de decisión = inicio de reproducción − inicio de sesión; tasa de finalización = minutos vistos / duración total |
| Jugos Boing — expansión internacional (Cooperativa Pascual) | No saber a qué países expandirse; riesgo de invertir a ciegas (EE. UU. concentra el 41 % de las exportaciones) | K-Means (agrupar países por nivel comercial, valor de mercado, costo logístico); Apriori (patrones de sabor: zonas con migrantes mexicanos aceptan guayaba); árboles de decisión / regresión logística (score de viabilidad); series de tiempo (demanda mensual por país); modelo prescriptivo (sabor óptimo bajo presupuesto y NOM-051) | Recall y matriz de confusión; Lift en reglas de asociación; MAE en regresión (error < 20 %); validación cruzada contra overfitting; explicabilidad SHAP / LIME; comparación con baseline (promedio móvil) para justificar el modelo complejo |
| Mercado Libre — última milla (Equipo PMA) | Costos altos y entregas fallidas en zonas rurales, serranas e insulares de difícil acceso | Muestreo estratificado (solo zonas inaccesibles); Expectation-Maximization (EM) para estimar coordenadas cuando se pierde GPS; PCA (sintetizar clima, INEGI y demografía en componentes); clustering jerárquico (microzonas logísticas); priorización de reintentos (el fallido pasa a primer punto de la siguiente ruta); SARIMA (demanda estacional, p. ej. Navidad); VRP (moto / auto / camión según terreno) | MAE y RMSE (costos); precisión y recall (intentos de entrega); índice de silueta (consistencia de microzonas); backtesting con histórico; explicabilidad SHAP |
| Zara — inventario global (Equipo 8, Inditex) | Punto de equilibrio del stock: sobrestock inmoviliza capital; stockout genera ventas perdidas | Series de tiempo (demanda futura, estacionalidad, tendencias de color/print por región y clima); regresión lineal (sensibilidad de la demanda a precio y descuento); árboles de decisión (tendencia por color/tipo de prenda). Atributo derivado: indicador de rotación | Métricas estándar de precisión de la regresión + validación empresarial de la rentabilidad de las compras |
Minería de datos (definición formal del profesor): "proceso de análisis de grandes conjuntos de datos". Los datos son "la carnita, la esencia, el argumento" de cualquier análisis o decisión industrial.
Ecosistema heterogéneo: las empresas operan con un "mix de tecnologías": AWS, Google Cloud, Azure, SAP, bases relacionales (Oracle, SQL Server), Excel, y entornos analíticos masivos (Hadoop, Data Warehouses). Hoy ≈ 70 % de la información corporativa global vive y se procesa en la nube; la migración va de servidores locales (on-premises) a Data Warehouses y Data Lakes en la nube.
Taxonomía de bases de datos especializadas: