← Todas las materias

Minería de Datos

M.C. José Concepción Roberto Olvera López · Grupo 3 · Martes y jueves · 15:00–17:00 · Salón A306

Material

Diapositivas del profesor

Entregas

PDFs que ya entregaste

Plan de estudios

Clave FI: 2933

Objetivo: el alumno evaluará los principios del enfoque del aprendizaje en máquinas para diseñar e implementar diversos algoritmos de minería de datos.

Núm.TemaHoras
1Introducción al descubrimiento del conocimiento en bases de datos (KDD) y la minería de datos8.0
2Arquitectura de minería de datos12.0
3El proceso de minería de datos18.0
4Evaluación14.0
5Aplicación en la minería de datos12.0
Bibliografía básica
Proyecto 2 — Arquitectura de Datos en Minería de Datos

Propósito: presentación que muestre la estrategia del software de BD asignado, cubriendo:

  1. Diagrama de la arquitectura de datos, describiendo: a) características del repositorio/servidor de datos, b) capacidades de ETL / Kafka / Spark / conectores requeridos, c) capacidades de tiempo real / streaming, d) repositorios de Data Warehouse / Big Data, e) capacidades de minería de datos, f) herramientas de consulta y monitoreo.
  2. Esquemas de soporte técnico, seguridad y garantías.
  3. Conclusión con los beneficios de adquirir el software propuesto.

Entregable: PDF con PowerPoint de ~10 láminas para la presentación + documento anexo complementario. Nombre de archivo: FI.Proyecto 2.[número de equipo] [nombre de la base de datos asignada]. Fecha límite (Classroom): viernes 18 sep, 2:00 pm. Exposiciones en clase a partir del martes 22 sep.

Asignación de base de datos por equipo:

EquipoBase de datos / plataforma
1Databricks
2Azure MS ⭐ mi equipo
3IBM InfoSphere
4MongoDB
5Oracle Real Time
6Pinecone (BD vectores)
7Google BigQuery
8SAP HANA
9Amazon
10Cloudera
11Milvus (BD vectores)
12Snowflake
13Apache Cassandra

Todos los temas y subtemas del plan. En azul, lo que ya se vio en clase (enlaza a la clase). En gris, lo que falta.

Tema 1 — Introducción al descubrimiento del conocimiento en base de datos (KDD) y la minería de datos · Clase 01
Tema 2 — Arquitectura de minería de datos · Clases 01–04

Visto en las Clase 02, Clase 03 y Clase 04: repositorio vs. base de datos, Data Warehouse, Data Mart, virtualización de datos, ERP y Data Lake; ETL/ELT, gobernanza por columna/horario, Two-Phase Commit, servidores columnares (SAP HANA), On-Premise vs. Cloud, Big Data (Kafka, Spark, Hadoop/HDFS/MapReduce); bases de datos vectoriales/embeddings, vectorización de imagen/audio/video, bases de datos de conocimiento, arquitectura de datos para IA.

Tema 3 — El proceso de minería de datos · sin ver
  • 3.1 Aprendizaje supervisado y no supervisado.
  • 3.2 Modelos predictivos.
  • 3.3 Modelos descriptivos.
  • 3.4 Métodos y algoritmos de minería de datos.
    • 3.4.1 Clasificación.
    • 3.4.2 Regresión.
    • 3.4.3 Agrupación.
    • 3.4.4 Sumarización.
    • 3.4.5 Modelos de dependencia, correlación.
    • 3.4.6 Reglas de asociación.
    • 3.4.7 Detección de cambios y desviaciones.
  • 3.5 Proceso de minería de datos.
    • 3.5.1 Identificar el modelo predictivo o descriptivo.
    • 3.5.2 Identificar el método.
    • 3.5.3 Identificar el algoritmo.
    • 3.5.4 Generar el modelo.
    • 3.5.5 Validar el modelo.
    • 3.5.6 Mejorar el modelo.
Tema 4 — Evaluación · sin ver
  • 4.1 Entrenamiento y verificación.
  • 4.2 Predicción del rendimiento.
  • 4.3 Validación cruzada.
  • 4.4 Comparación de esquemas de minería de datos.
  • 4.5 Predicción de probabilidades.
  • 4.6 Conteo del costo.
  • 4.7 Evaluación de predicción numérica.
  • 4.8 El principio de la descripción de longitud mínima (LDM).
  • 4.9 Aplicación de la LDM a agrupamientos.
Tema 5 — Aplicación en la minería de datos · sin ver
  • 5.1 Inferencia de reglas rudimentarias.
  • 5.2 Modelación estadística.
  • 5.3 Construcción de árboles de decisión.
  • 5.4 Algoritmos de cobertura: Reglas de construcción.
  • 5.5 Reglas de asociación.
  • 5.6 Modelos lineales.
  • 5.7 Aprendizaje basado en ocurrencias.

Clases grabadas, en orden. Cada tarjeta abre la página completa de esa clase.

Clase 011 sep 2026 · Temas 1 y 2Introducción a la minería de datos y al proceso KDD (regresión, clustering, clasificación; limpieza, outliers, transformación, validación) con 5 casos de estudio de los equipos; arranque de la arquitectura de minería de datos (ecosistema, taxonomía de BD, repositorios). Clase 023 sep 2026 · Tema 2Arquitectura de datos: repositorio vs. base de datos, Data Warehouse, Data Mart, virtualización de datos (~70 %), ERP (SAP) y Data Lake; ETL/ELT, gobernanza por columna y horario, Two-Phase Commit. Presentaciones de los equipos 9 (Scitum), 13 (LEGO), 12 (SmartFit) y 11 (CEMEX). Clase 038 sep 2026 · Tema 2 (continuación)Servidores de BD columnares (SAP HANA/Sybase IQ con 80–90% de compresión), On-Premise (~30% mercado) vs. Cloud (~70%), Data Lake vs. Data Warehouse, ecosistema Big Data (Kafka eventos en tiempo real, Spark procesamiento en memoria, Hadoop/HDFS/MapReduce distribución por nodos). Exposiciones de KDD: News Corp (clustering + series de tiempo), Bwood/Delivery (clasificación + regresión), Nu Bank (LightGBM/XGBoost + Isolation Forest + PCA + SHAP). Examen: solo Tema 1 y 2. Clase 0410 sep 2026 · Tema 2 (continuación)Bases de datos vectoriales y embeddings (chunking, búsqueda por similitud), vectorización de imagen (CNN, ReLU, Softmax), audio y video, bases de datos de conocimiento (templates, onboarding), arquitectura de datos para IA. Exposición propia: modelo crediticio de Nu (Kafka + Spark + XGBoost + SHAP/WoE).