← Minería de Datos
Clase 04
M.C. José Concepción Roberto Olvera López · Fecha: 10 sep 2026 · Tema 2 (continuación) — Bases de datos vectoriales y embeddings, vectorización de imagen/audio/video, bases de datos de conocimiento, arquitectura de datos para IA/minería. Exposición KDD: Nu Bank (evaluación crediticia en tiempo real).
En corto
- Bases de datos vectoriales: almacenan y gestionan embeddings (vectores numéricos de alta dimensión) para búsqueda por similitud semántica, no coincidencia exacta.
- Embedding y chunking: transformación de datos no estructurados dividiéndolos en fragmentos (chunks) y convirtiéndolos a vectores matemáticos.
- Visión por computadora (CNN): procesa imágenes a vectores usando convolución, ReLU y Softmax para clasificación probabilística.
- Vectores de audio y video: extracción de frecuencia/timbre/ritmo para voz; procesamiento por frames para vigilancia y análisis deportivo.
- Base de datos de conocimiento: almacén especializado para centralizar información organizacional mediante plantillas (templates) y cuestionarios.
- Arquitectura de datos para IA/minería: conecta fuentes de origen, ETL, motores de almacenamiento, componentes de red (APIs, Gateways) y analítica.
- Caso Nu: evaluación crediticia en tiempo real con ingesta continua (Kafka), procesamiento en flujo (Spark), modelos de ensamble (Random Forest, XGBoost) y explicabilidad (SHAP, WoE).
🎯 Para el examen
- Búsqueda tradicional (SQL) vs. vectorial: tradicional = coincidencia exacta/estructurada (ej.
edad > 48) con índices B-Tree/Hash; vectorial = similitud semántica aproximada, con clustering para crear índices por zonas y evitar recorrer toda la base.
- Pasos obligatorios para diseñar una arquitectura de minería de datos (pregunta explícita de examen): 1) requerimientos funcionales/no funcionales (rendimiento, seguridad, escalabilidad, tolerancia a fallos) → 2) selección del tipo de BD (relacional, no relacional, vectorial, especializada) → 3) diseño del esquema y relaciones → 4) infraestructura (nube vs. local) y escalabilidad → 5) seguridad y control de accesos por roles → 6) plan de pruebas de volumen/rendimiento/optimización.
- Componentes de red en arquitecturas: API (protocolo/reglas para acceder a funciones o datos de forma segura, vía conectores propietarios: Oracle, IBM, Python) · Gateway (elemento de red/IP que enruta tráfico entrante/saliente hacia servicios autorizados) · ETL Batch (extracción, transformación —estandarización de formatos, fórmulas—, carga masiva).
Bases de datos vectoriales y embeddings
- Embedding: tomar datos no estructurados (PDFs, texto libre, imágenes, voz, video) y transformarlos en vectores numéricos de miles de dimensiones. Cada vector captura el contexto semántico o las características esenciales del objeto.
- Chunking (fragmentación): división previa del contenido en fragmentos lógicos (chunks). Al consultar, el sistema convierte la pregunta del usuario en un vector de búsqueda y busca por similitud los chunks más cercanos para armar la respuesta — es el mecanismo base de los sistemas LLM/ChatGPT.
- Índices y eficiencia de búsqueda: a diferencia de los métodos relacionales exactos, el índice vectorial genera clusters mediante algoritmos de agrupamiento. La consulta no revisa millones de registros uno a uno, sino que entra directamente al cluster correspondiente, permitiendo búsquedas por similitud ultrarrápidas.
Vectorización de imagen, audio y video
Imágenes (Redes Neuronales Convolucionales — CNN):
- Se procesa la matriz de píxeles mediante capas de convolución que reducen y extraen patrones visuales.
- Se aplica la función de activación ReLU para filtrar qué características pasan a la siguiente etapa.
- La capa final clasifica aplicando Softmax, entregando un vector de probabilidades (ej. 70% perro, 20% caballo, 10% otro).
- Aplicaciones: reconocimiento facial (distancias biométricas entre ojos y nariz), detección de fraudes, control de calidad en manufactura (ej. validación al 99% de precisión en salpicaderas de vehículos).
Audio y voz:
- Extrae parámetros físicos: frecuencia, timbre, ritmo, forma de la onda sonora.
- Permite identificar a un hablante específico diferenciando su huella vocal única de otros tonos.
Video:
- Divide la secuencia en marcos individuales (frames).
- Aplicaciones: vigilancia de seguridad (alertas automáticas si un vector indica que se cruzó una línea delimitada) y analítica deportiva (ej. el Bayern Múnich registrando posiciones y recorridos para ajustar tácticas).
Bases de datos de conocimiento (Knowledge Bases)
- Definición: bases especializadas para almacenar y consultar información temático-organizacional.
- Analogía con Excel: una base de datos de conocimiento, al comprarse, viene "vacía" — igual que una hoja de Excel: no sabe hacer cálculos por sí sola hasta que se configuran reglas, fórmulas y datos.
- Estructuración mediante cuestionarios y plantillas: la carga se hace con plantillas (templates) preconfiguradas por área (RRHH, Finanzas, Ventas) que guían la captura de documentos, imágenes, enciclopedias/glosarios internos (ej. definición de ROI) y reglamentos.
- Casos de uso empresariales: Onboarding — evaluación de nuevos empleados sobre reglamentos internos y confidencialidad mediante exámenes interactivos basados en los documentos cargados. Normatividad y cumplimiento — capacitaciones obligatorias periódicas (cada 6 meses) en empresas grandes (ej. 3,000 empleados) sobre políticas de seguridad y divulgación de información.
Arquitectura de datos para minería e IA
- Estructura multicapa: desde sistemas de origen (Excel, servicios nube AWS/Google, sensores IoT), pasando por tuberías ETL, almacenamiento en Data Lakes/Data Warehouses, hasta las capas de servicio y visualización.
- Caso práctico — monitoreo IoT en tiempo real: 500 sensores de electricidad, temperatura, gas y agua transmitiendo datos cada 20 segundos. Los datos llegan vía Internet a un Data Warehouse donde modelos analíticos predictivos detectan variaciones de temperatura y disparan alertas operacionales (color amarillo) al supervisor antes de una falla crítica.
Caso de estudio: modelo crediticio en Nu (exposición propia)
Contexto operativo: cartera de 135 millones de clientes y 37.2 billones de dólares en créditos, entidad financiera 100% digital.
Problemática: incremento de morosidad temprana (incumplimiento de 15 a 90 días) de 4.1% a 5%, aumentando las provisiones un 33%. Los modelos tradicionales rechazaban al 70% de los solicitantes por carecer de historial convencional.
Propuesta técnica (metodología CRISP-DM):
- Variables: historial de pagos, uso de la línea de crédito, antigüedad, patrones de comportamiento digital en la App.
- Modelos evaluados: Regresión Logística, Random Forest (múltiples árboles de decisión en paralelo), XGBoost (árboles por segmento).
- Explicabilidad y métricas: coeficiente Gini, estadístico KS, valores SHAP y Weight of Evidence (WoE) para justificar la puntuación ante el usuario y el regulador.
- Arquitectura de solución: ingesta continua con Kafka → procesamiento en flujo con Spark → Data Lake/Data Warehouse → API de scoring en la nube con disponibilidad del 99.5%.
Contexto — no examen
- (Contexto) Anécdota del profesor en selección de personal: relató haber contratado a más de 200 personas como director; no perdía tiempo con preguntas técnicas (ya filtradas por sus colaboradores), sino que hacía solo 3 preguntas clave para evaluar confianza, claridad de ideas y metas de vida del postulante. Comentó cómo hoy los sistemas de IA evalúan por video la postura y gestos del candidato antes de pasar a la entrevista humana.
- (Contexto) Búsqueda vectorial en archivos y bibliotecas: un alumno comentó que hace su servicio social digitalizando libros analógicos para búsqueda semántica en biblioteca. El profesor mencionó el almacenamiento vectorial de 20 años de noticias de periódicos en Alemania para estudiar tendencias históricas de enfermedades.
- (Contexto) Retroalimentación a mi exposición: el profesor y la clase felicitaron por meterse en el rol de vendedor/director proponiendo el proyecto a la directiva y por la limpieza visual de la presentación; como mejora, sugirieron mantener mayor contacto visual con la audiencia en lugar de mirar la pantalla.
Pendiente / próxima clase
- Entrega de Proyecto del Tema 2 (Proyecto 2): fecha límite viernes 18 de septiembre de 2026, 2:00 pm (confirmado en Classroom). La revisión/cierre del tema será a partir del 22 de septiembre.
- Próxima sesión — exposiciones de proveedores Nube/BD: presentaciones de 8 minutos por equipo en rol de venta técnica. Sofía y su equipo expondrán AWS (incluyendo TimeStream y el Data Warehouse de Amazon). Equipos 6 y 11 presentarán sus temas sobre repositorios y bases de datos especializadas.