M.C. José Concepción Roberto Olvera López · Grupo 3 · Martes y jueves · 15:00–17:00 · Salón A306
Clave FI: 2933
Objetivo: el alumno evaluará los principios del enfoque del aprendizaje en máquinas para diseñar e implementar diversos algoritmos de minería de datos.
| Núm. | Tema | Horas |
|---|---|---|
| 1 | Introducción al descubrimiento del conocimiento en bases de datos (KDD) y la minería de datos | 8.0 |
| 2 | Arquitectura de minería de datos | 12.0 |
| 3 | El proceso de minería de datos | 18.0 |
| 4 | Evaluación | 14.0 |
| 5 | Aplicación en la minería de datos | 12.0 |
Propósito: presentación que muestre la estrategia del software de BD asignado, cubriendo:
Entregable: PDF con PowerPoint de ~10 láminas para la presentación + documento anexo complementario. Nombre de archivo: FI.Proyecto 2.[número de equipo] [nombre de la base de datos asignada]. Fecha límite (Classroom): viernes 18 sep, 2:00 pm. Exposiciones en clase a partir del martes 22 sep.
Asignación de base de datos por equipo:
| Equipo | Base de datos / plataforma |
|---|---|
| 1 | Databricks |
| 2 | Azure MS ⭐ mi equipo |
| 3 | IBM InfoSphere |
| 4 | MongoDB |
| 5 | Oracle Real Time |
| 6 | Pinecone (BD vectores) |
| 7 | Google BigQuery |
| 8 | SAP HANA |
| 9 | Amazon |
| 10 | Cloudera |
| 11 | Milvus (BD vectores) |
| 12 | Snowflake |
| 13 | Apache Cassandra |
Todos los temas y subtemas del plan. En azul, lo que ya se vio en clase (enlaza a la clase). En gris, lo que falta.
Visto en las Clase 02, Clase 03 y Clase 04: repositorio vs. base de datos, Data Warehouse, Data Mart, virtualización de datos, ERP y Data Lake; ETL/ELT, gobernanza por columna/horario, Two-Phase Commit, servidores columnares (SAP HANA), On-Premise vs. Cloud, Big Data (Kafka, Spark, Hadoop/HDFS/MapReduce); bases de datos vectoriales/embeddings, vectorización de imagen/audio/video, bases de datos de conocimiento, arquitectura de datos para IA.
Clases grabadas, en orden. Cada tarjeta abre la página completa de esa clase.
Clase 011 sep 2026 · Temas 1 y 2Introducción a la minería de datos y al proceso KDD (regresión, clustering, clasificación; limpieza, outliers, transformación, validación) con 5 casos de estudio de los equipos; arranque de la arquitectura de minería de datos (ecosistema, taxonomía de BD, repositorios). Clase 023 sep 2026 · Tema 2Arquitectura de datos: repositorio vs. base de datos, Data Warehouse, Data Mart, virtualización de datos (~70 %), ERP (SAP) y Data Lake; ETL/ELT, gobernanza por columna y horario, Two-Phase Commit. Presentaciones de los equipos 9 (Scitum), 13 (LEGO), 12 (SmartFit) y 11 (CEMEX). Clase 038 sep 2026 · Tema 2 (continuación)Servidores de BD columnares (SAP HANA/Sybase IQ con 80–90% de compresión), On-Premise (~30% mercado) vs. Cloud (~70%), Data Lake vs. Data Warehouse, ecosistema Big Data (Kafka eventos en tiempo real, Spark procesamiento en memoria, Hadoop/HDFS/MapReduce distribución por nodos). Exposiciones de KDD: News Corp (clustering + series de tiempo), Bwood/Delivery (clasificación + regresión), Nu Bank (LightGBM/XGBoost + Isolation Forest + PCA + SHAP). Examen: solo Tema 1 y 2. Clase 0410 sep 2026 · Tema 2 (continuación)Bases de datos vectoriales y embeddings (chunking, búsqueda por similitud), vectorización de imagen (CNN, ReLU, Softmax), audio y video, bases de datos de conocimiento (templates, onboarding), arquitectura de datos para IA. Exposición propia: modelo crediticio de Nu (Kafka + Spark + XGBoost + SHAP/WoE).