← Reconocimiento de Patrones
Clase 04
Ing. Rubén Omar Azuara Domínguez · 7 sep 2026 · Tema 4 — Evaluación de modelos. Matriz de confusión y métricas, curva ROC / AUC, sesgo–varianza, datos desbalanceados, esquemas de validación, fuga de datos y data drift. Repaso de cierre de LDA al inicio.
🔢 Numeración del profesor: corresponde a sus diapositivas Clase 7 (Evaluación de modelos) — no coincide 1:1 con "Clase 04" de este sitio.
En corto
- Construir el modelo es el 50 % del trabajo; el otro 50 % es evaluarlo para saber si generaliza a datos no vistos.
- La exactitud sola engaña en problemas desbalanceados (predecir "todos sanos" da 95 % y detecta 0 casos).
- Matriz de confusión: filas = clase real, columnas = predicción. Diagonal = aciertos. Error Tipo I = FP; Error Tipo II = FN (suele ser el más grave).
- Métricas: Precisión = VP/(VP+FP) · Recall = VP/(VP+FN) · Especificidad = VN/(VN+FP) · F₁ = media armónica de precisión y recall · Exactitud balanceada = (Sensibilidad + Especificidad)/2.
- ROC: TPR (=Recall) vs. FPR (=1−Especificidad) variando el umbral. AUC: 0.5 = azar; →1 = perfecto; <0.5 = predicción invertida.
- Sesgo alto → underfitting (error alto en train y val). Varianza alta → overfitting (error bajo en train, alto en val).
- Validación: Hold-out → K-Fold → Stratified K-Fold (conserva proporción de clases; obligatorio con datos desbalanceados).
- Data leakage (temporal / de procesamiento / del target) y data drift (sudden, gradual, incremental, recurrente).
🎯 Para el examen
- Matriz de confusión: construir e interpretar (filas = real, columnas = predicción), ubicar VP/VN/FP/FN y calcular todas las métricas derivadas.
- Tipos de error: distinguir Error Tipo I (FP) y Error Tipo II (FN) y argumentar cuál es más crítico según el dominio (diagnóstico médico vs. sistema de alarma).
- ROC / AUC: ejes (TPR vs. FPR), significado de la diagonal aleatoria (AUC = 0.5), escala de interpretación del AUC y qué hacer si AUC < 0.5 (invertir la predicción).
- Sesgo vs. varianza: diagnosticar underfitting / overfitting con los errores de train y val, y las técnicas de solución de cada caso (regularización, dropout, early stopping, más datos, más/menos complejidad).
- Validación: explicar Hold-out, K-Fold y cuándo es necesario Stratified K-Fold.
- Leakage y drift: identificar las fuentes de fuga (temporal, procesamiento, target) y las estrategias de monitoreo / reentrenamiento ante el drift.
Repaso de cierre — reducción de dimensionalidad
- PCA (no supervisado, maximiza la varianza proyectada) vs. LDA (supervisado, usa etiquetas, maximiza la separabilidad entre clases).
- Tres supuestos de LDA: 1) distribución gaussiana; 2) matriz de covarianza idéntica entre clases; 3) separabilidad lineal.
- QDA = LDA sin el supuesto de covarianza única: cada clase tiene su propia matriz de covarianza.
- t-SNE (visualización) y Kernel PCA (kernel trick → proyectar a mayor dimensión donde sea linealmente separable, luego PCA).
Matriz de confusión y tipos de error
Matriz de confusión: tabla de contingencia que resume las predicciones de un clasificador. Filas = clases reales (ground truth); columnas = clases predichas. Diagonal principal = aciertos; triángulos = errores.
- VP (verdadero positivo): era positivo y se predijo positivo.
- FN (falso negativo): era positivo y se predijo negativo — Error Tipo II (p. ej. no activar la alarma habiendo incendio; suele ser el más peligroso).
- FP (falso positivo): era negativo y se predijo positivo — Error Tipo I (p. ej. activar la alarma sin fuego).
- VN (verdadero negativo): era negativo y se predijo negativo.
Métricas de evaluación
Exactitud (Accuracy) = (VP + VN) / (VP + FN + FP + VN)
Precisión = VP / (VP + FP) (de lo predicho positivo, cuánto lo era)
Recall / Sensibilidad = VP / (VP + FN) (de lo positivo real, cuánto se capturó)
Especificidad = VN / (VN + FP) (de lo negativo real, cuánto se identificó)
F1-Score = 2 · (Precisión · Recall) / (Precisión + Recall) (media armónica)
Exactitud balanceada = (Sensibilidad + Especificidad) / 2
El F₁ penaliza fuerte los desequilibrios extremos entre precisión y recall. La exactitud balanceada es útil en conjuntos desbalanceados.
Ejemplo — Spam vs. No Spam (modelo equilibrado): Accuracy 90 % · Precisión 85.7 % · Recall 85.7 % · F₁ 85.7 %.
Curva ROC y AUC
La curva ROC (Receiver Operating Characteristic) evalúa un clasificador probabilístico a lo largo de distintos umbrales de decisión.
Eje X = FPR (tasa de falsos positivos) = FP / (FP + VN) = 1 − Especificidad
Eje Y = TPR (tasa de verdaderos positivos) = VP / (VP + FN) = Recall = Sensibilidad
AUC (área bajo la curva ROC), escala de interpretación:
AUC = 1.0 — clasificador perfecto.
0.9 ≤ AUC < 1.0 — excelente · 0.7 ≤ AUC < 0.9 — bueno · 0.5 ≤ AUC < 0.7 — regular.
AUC = 0.5 — equivale al azar (la diagonal).
AUC < 0.5 — peor que el azar: la predicción está invertida (el modelo distingue muy bien la clase contraria → invertir la predicción).
Sesgo, varianza, underfitting y overfitting
- Sesgo (bias): error sistemático por suposiciones incorrectas o simplificación excesiva. Analogía: arquero que siempre dispara desfasado a la izquierda (consistentemente inexacto).
- Varianza (variance): sensibilidad excesiva al ruido del conjunto de entrenamiento. Analogía: arquero que dispara en todas direcciones.
- Underfitting (alto sesgo): el modelo es demasiado simple → error alto en train y en val.
- Overfitting (alta varianza): el modelo memoriza el ruido → error muy bajo en train, alto en val.
Partición de datos: Entrenamiento (60–80 %, ajusta los parámetros) · Validación (10–20 %, ajusta hiperparámetros y mide generalización) · Prueba (10–20 %, intocado hasta la evaluación final).
Degradación normal (no patológica): Accuracy Train 95 % → Val 91 % → Test 87 %.
Analogía de estudio: underfitting = memorizar una sola fórmula (el determinante) para todo el examen; overfitting = memorizar al pie de la letra los exámenes de los últimos 5 años y fallar cuando cambian los números.
Datos desbalanceados
Ejemplos reales: detección de fraude, cáncer, intrusiones en red.
Ejemplo — detección de cáncer: 1 000 pacientes (950 sanos = 95 %, 50 enfermos = 5 %). Un modelo que predice "todos sanos" → Accuracy = 950/1000 = 95 %, pero detecta 0 de 50 casos de cáncer (50 falsos negativos). La exactitud alta esconde un modelo inútil.
Estrategias: usar métricas adecuadas (F₁, balanced accuracy, ROC) · pesos de clase (class weights) · re-muestreo (resampling) · ajuste de umbrales.
Esquemas de validación
- Hold-out: división fija en Train / Val / Test. Limitación: el resultado depende de cómo cayó la partición.
- K-Fold Cross Validation: se parte el entrenamiento en
K folds; en K iteraciones, un fold distinto es validación y los K−1 restantes son entrenamiento. K suele ser impar (5, 7, 9).
- Stratified K-Fold: conserva la proporción original de las clases en cada fold. Necesario con datos desbalanceados.
Fuga de datos y data drift
Fuga de datos (data leakage): contaminar el entrenamiento con información de validación o prueba.
- Temporal: usar información del futuro para predecir el pasado.
- De procesamiento: calcular normalización / PCA con estadísticas del conjunto global en vez de solo las de entrenamiento.
- Del target: incluir como característica de entrada variables derivadas directamente de la variable objetivo.
Data drift: cambio en las propiedades estadísticas de los datos en producción respecto a la distribución de entrenamiento. Se detecta con monitoreo estadístico y se maneja con reentrenamiento periódico. Tipos: sudden (repentino), gradual, incremental, recurrent.
Pendiente / próxima clase
- Viernes: exposición y revisión de la práctica.
- Lunes: inicio formal del bloque de clasificadores.