← Reconocimiento de Patrones

Clase 02

Ing. Rubén Omar Azuara Domínguez · 31 ago 2026 · Tema 3 — Selección y reducción de dimensionalidad · métodos Wrapper (Forward / Backward / Exhaustive), métodos embebidos (Lasso, árboles), PCA, cómo elegir K y PCA por SVD.

🔢 Numeración del profesor: corresponde a sus diapositivas Clase 5 (Selección y Reducción de Dimensionalidad) — no coincide 1:1 con "Clase 02" de este sitio.

📄 Diapositivas Clase 5 (prof.)

En corto

🎯 Para el examen

Métodos de filtrado

Evalúan cada característica de forma independiente del algoritmo de aprendizaje, antes de entrenar: 1) calcular una medida de relevancia, 2) ordenar por puntuación, 3) quedarse con las k mejores o las que superan un umbral.

Correlación de Pearson — relación lineal entre dos variables cuantitativas continuas.

r = Σ(xᵢ − x̄)(yᵢ − ȳ) / √( Σ(xᵢ − x̄)² · Σ(yᵢ − ȳ)² )
   r > 0 correlación positiva · r = 0 sin correlación lineal · r < 0 negativa

Chi-cuadrado (χ²) — dependencia entre variables categóricas: compara frecuencias observadas Oᵢ vs. esperadas Eᵢ bajo la hipótesis nula de no asociación.

χ² = Σ (Oᵢ − Eᵢ)² / Eᵢ          Eᵢ = (total fila × total columna) / total general

Ejemplo (compra sí/no × hombre/mujer, 200 casos): esperados = 55/45; χ² = 4.09 + 5.00 + 4.09 + 5.00 = 18.18. Grados de libertad gl = (filas−1)(columnas−1) = 1; χ²crítico (α = 0.05) = 3.841. Como 18.18 > 3.841 → variables dependientes → característica relevante.

ANOVA F-score — compara la varianza entre grupos con la varianza dentro de los grupos; F = varianza entre grupos / varianza dentro de los grupos. F alto → las medias de los grupos difieren → la variable aporta.

MétricaTipo de característicaTipo de objetivo
Correlación de PearsonContinuaContinua
Chi-cuadradoCategóricaCategórica
ANOVA F-scoreContinuaCategórica
Información mutuaCualquieraCualquiera
Métodos Wrapper (de envoltura)

Usan un algoritmo de aprendizaje como caja negra para evaluar iterativamente el rendimiento (exactitud del clasificador) de distintos subconjuntos de variables. El orden de las características en la matriz de entrada no importa para el modelo (A+B = B+A).

Forward Selection (hacia adelante): iniciar con subconjunto vacío (o con 1 característica; ej. B → 70 %). Añadir una variable a la vez, entrenar y evaluar; consolidar si mejora (B+A mejora; B+A+C → 80 %). Parar cuando añadir empeora (B+A+C+D baja 1 %). Óptimo: {B, A, C}.

Backward Selection (hacia atrás): iniciar con todas ({A,B,C,D} → 82 %). Quitar una variable a la vez; consolidar la remoción si mejora o mantiene (quitar A → 83 %; quitar D → 84 %). Parar cuando quitar cualquiera de las restantes desploma el desempeño (quitar B −24 %, quitar C −14 %). Óptimo: {B, C} con 84 %.

Exhaustive Feature Selection: evaluar todas las combinaciones (individuales, parejas sin repetir, tríos, todas). Complejidad O(2^d). Ventaja: garantiza el óptimo global ({B,C} 84 % > 82 % con las 4). Desventaja: un modelo entrenado por combinación → inviable con más de ~15–20 características.

MétodoCuándo convieneDesventaja
ForwardSe espera que pocas características sean relevantes; ahorra cómputoUna vez añadida, no la puede quitar → conserva redundantes / omite interacciones
BackwardSe sospecha que la mayoría son relevantes; base sólida, capta interaccionesCostoso (entrenamientos con todas); inviable con miles de características
ExhaustiveSe necesita el óptimo globalSolo viable con un clasificador simple (bayesiano > red neuronal)
Métodos Embebidos

La selección ocurre durante el entrenamiento: el propio modelo tiene un algoritmo de selección intrínseco que asigna pesos / importancias y penaliza o elimina las variables que no aportan.

Regularización Lasso (norma L1)Least Absolute Shrinkage and Selection Operator. Modifica la función de pérdida (qué tanto te equivocas: predicción vs. realidad) añadiendo el término Σ |Wⱼ|.

Árboles de decisión — reglas de umbral Xⱼ ≤ t (según se cumpla, el flujo va al nodo hijo izquierdo o derecho).

Criterios de diseño (selección de características)

No hay regla fija: la elección del método depende de los recursos de cómputo y de la naturaleza de los datos. Sin poder de cómputo → usar métodos embebidos o filtrado previo al entrenamiento (wrapper/exhaustive resultan inviables). En la práctica es válido y recomendable comparar 2 o más métodos sobre el mismo problema para contrastar resultados y justificar las decisiones de diseño.

Reducción de dimensionalidad — qué es y por qué

A diferencia de la selección (conserva intactas las variables originales), la reducción de dimensionalidad proyecta los datos a un espacio nuevo de menor dimensión mediante combinaciones matemáticas: las nuevas variables ya no representan lo mismo (ya no son peso, edad o género, sino combinaciones de ellas).

Importa porque operar con vectores de alta dimensión provoca: mucho más tiempo de cómputo, mucho más almacenamiento, y sobre todo degradación del rendimiento de los modelos (maldición de la dimensionalidad).

examenPCA — Análisis de Componentes Principales

Transforma variables posiblemente correlacionadas en componentes principales no correlacionados, ordenados por la varianza que explican. Asume que la dirección de máxima varianza es la más informativa (ahí los patrones de las clases quedan más separados).

Combinación lineal: Z = A₁X₁ + A₂X₂ + …Xᵢ variables originales, Aᵢ coeficientes (escalares), Z variable transformada.

Vectores y valores propios: un vector propio v mantiene su dirección al multiplicarlo por la matriz A, solo cambia de magnitud; ese factor es el valor propio λ.

A v = λ v            (A = matriz de covarianza; v = dirección; λ = varianza en esa dirección)
Z = W · X           (W = matriz de vectores propios; X = datos originales; Z = proyección)

Algoritmo (método de la matriz de covarianza):

  1. Centrar y escalar los datos: restar la media de cada característica (y opcionalmente dividir entre su desviación estándar). Indispensable para que variables con escalas grandes (salarios de 15 000 a 1 000 000) no dominen sobre las pequeñas (edades de 18 a 65).
  2. Matriz de covarianza con X centrada de N×D: Σ = (1/(N−1)) Xᵀ X. Es cuadrada; mide la variabilidad conjunta entre parejas de variables.
  3. Ecuación característica det(Σ − λI) = 0 (evita la solución trivial) → valores propios λ₁, λ₂, … y vectores propios v₁, v₂, …
  4. Ordenar los λ de forma descendente por varianza explicada; tomar los primeros K vectores propios → matriz W_K. Proyección: X_nuevo = X · W_K, dimensiones N×K con K < D.

PC1 = dirección de máxima varianza. PC2 = segunda mayor varianza, estrictamente ortogonal a PC1. Todos los componentes son ortogonales entre sí (base ortogonal; ninguno se obtiene por combinación lineal de los otros).

PCA — ejemplos numéricos (diapositivas Clase 5)

Ejemplo 1: Σ = [[4, 2], [2, 3]]

det(Σ − λI) = (4−λ)(3−λ) − 4 = λ² − 7λ + 8 = 0   →   (λ−1)(λ−8) = 0   →   λ₁ = 8 , λ₂ = 1

λ₁ = 8:  (Σ − 8I) w = 0  →  fila 1:  −4 w₁ + 2 w₂ = 0  →  w₂ = 2 w₁
         v₁ = [1, 2]ᵀ      normalizado:  v₁ = (1/√5) [1, 2]ᵀ
λ₂ = 1:  (Σ − I) w = 0   →  fila 1:  3 w₁ + 2 w₂ = 0   →  w₂ = −(3/2) w₁
         v₂ = [2, −3]ᵀ     normalizado:  v₂ = (1/√13) [2, −3]ᵀ

Ejemplo 2: Σ = [[4, 1], [2, 3]]

det(Σ − λI) = (4−λ)(3−λ) − 2 = λ² − 7λ + 10 = 0   →   λ₁ = 5 , λ₂ = 2
   v₁ = [1, 1]ᵀ ,  v₂ = [1, −2]ᵀ

Recordatorio de las diapositivas: la suma de todos los valores propios = varianza total; varianza explicada acumulada = (Σᵢ₌₁..ₖ λᵢ) / (Σᵢ₌₁..d λᵢ).

examenCómo elegir K (número de componentes)
varianza explicada (individual) = λᵢ / Σ λⱼ        (la acumulada llega a 1.0 = 100 %)
  1. Regla del codo (Elbow): graficar la varianza acumulada por componente; el "codo" es donde la pendiente cambia bruscamente y la curva se aplana. Ej.: 13 componentes, codo en el 5.º → K = 5.
  2. Umbral de varianza: fijar de antemano el % a retener (típico 90 %); tomar los componentes acumulativos necesarios (ej. 8 componentes explican el 91 %).
  3. Criterio de Kaiser: conservar solo los componentes con λ > 1 (aportan más que una sola variable original).
examenPCA por SVD (Descomposición en Valores Singulares)
X = U Σ Vᵀ
   U   = vectores singulares izquierdos
   Vᵀ  = transpuesta de los vectores singulares derechos
   Σ   = matriz DIAGONAL con los valores singulares en orden descendente
Cierre — próxima clase

Siguiente sesión: LDA (Análisis Discriminante Lineal).

Estructurado según el Tema 3 del programa del profesor.