Ing. Rubén Omar Azuara Domínguez · 31 ago 2026 · Tema 3 — Selección y reducción de dimensionalidad · métodos Wrapper (Forward / Backward / Exhaustive), métodos embebidos (Lasso, árboles), PCA, cómo elegir K y PCA por SVD.
🔢 Numeración del profesor: corresponde a sus diapositivas Clase 5 (Selección y Reducción de Dimensionalidad) — no coincide 1:1 con "Clase 02" de este sitio.
O(2^d)).Σ|Wⱼ|; peso → 0 = variable descartada) y árboles (importancia por reducción de impureza, normalizada a suma 1, umbral).X = UΣVᵀ): forma estable de calcular PCA; V = componentes, valores singulares = √λ.σᵢ² / Σσⱼ². Error muy común olvidarlo. (En el método de covarianza los λ se usan directos.)O(2^d); inviable con más de ~15–20 características.λ > 1).Evalúan cada característica de forma independiente del algoritmo de aprendizaje, antes de entrenar: 1) calcular una medida de relevancia, 2) ordenar por puntuación, 3) quedarse con las k mejores o las que superan un umbral.
Correlación de Pearson — relación lineal entre dos variables cuantitativas continuas.
r = Σ(xᵢ − x̄)(yᵢ − ȳ) / √( Σ(xᵢ − x̄)² · Σ(yᵢ − ȳ)² )
r > 0 correlación positiva · r = 0 sin correlación lineal · r < 0 negativa
Chi-cuadrado (χ²) — dependencia entre variables categóricas: compara frecuencias observadas Oᵢ vs. esperadas Eᵢ bajo la hipótesis nula de no asociación.
χ² = Σ (Oᵢ − Eᵢ)² / Eᵢ Eᵢ = (total fila × total columna) / total general
Ejemplo (compra sí/no × hombre/mujer, 200 casos): esperados = 55/45; χ² = 4.09 + 5.00 + 4.09 + 5.00 = 18.18. Grados de libertad gl = (filas−1)(columnas−1) = 1; χ²crítico (α = 0.05) = 3.841. Como 18.18 > 3.841 → variables dependientes → característica relevante.
ANOVA F-score — compara la varianza entre grupos con la varianza dentro de los grupos; F = varianza entre grupos / varianza dentro de los grupos. F alto → las medias de los grupos difieren → la variable aporta.
| Métrica | Tipo de característica | Tipo de objetivo |
|---|---|---|
| Correlación de Pearson | Continua | Continua |
| Chi-cuadrado | Categórica | Categórica |
| ANOVA F-score | Continua | Categórica |
| Información mutua | Cualquiera | Cualquiera |
Usan un algoritmo de aprendizaje como caja negra para evaluar iterativamente el rendimiento (exactitud del clasificador) de distintos subconjuntos de variables. El orden de las características en la matriz de entrada no importa para el modelo (A+B = B+A).
Forward Selection (hacia adelante): iniciar con subconjunto vacío (o con 1 característica; ej. B → 70 %). Añadir una variable a la vez, entrenar y evaluar; consolidar si mejora (B+A mejora; B+A+C → 80 %). Parar cuando añadir empeora (B+A+C+D baja 1 %). Óptimo: {B, A, C}.
Backward Selection (hacia atrás): iniciar con todas ({A,B,C,D} → 82 %). Quitar una variable a la vez; consolidar la remoción si mejora o mantiene (quitar A → 83 %; quitar D → 84 %). Parar cuando quitar cualquiera de las restantes desploma el desempeño (quitar B −24 %, quitar C −14 %). Óptimo: {B, C} con 84 %.
Exhaustive Feature Selection: evaluar todas las combinaciones (individuales, parejas sin repetir, tríos, todas). Complejidad O(2^d). Ventaja: garantiza el óptimo global ({B,C} 84 % > 82 % con las 4). Desventaja: un modelo entrenado por combinación → inviable con más de ~15–20 características.
| Método | Cuándo conviene | Desventaja |
|---|---|---|
| Forward | Se espera que pocas características sean relevantes; ahorra cómputo | Una vez añadida, no la puede quitar → conserva redundantes / omite interacciones |
| Backward | Se sospecha que la mayoría son relevantes; base sólida, capta interacciones | Costoso (entrenamientos con todas); inviable con miles de características |
| Exhaustive | Se necesita el óptimo global | Solo viable con un clasificador simple (bayesiano > red neuronal) |
La selección ocurre durante el entrenamiento: el propio modelo tiene un algoritmo de selección intrínseco que asigna pesos / importancias y penaliza o elimina las variables que no aportan.
Regularización Lasso (norma L1) — Least Absolute Shrinkage and Selection Operator. Modifica la función de pérdida (qué tanto te equivocas: predicción vs. realidad) añadiendo el término Σ |Wⱼ|.
Wⱼ. W alto (15–20) → muy importante. Si W baja (0.5) o llega a exactamente 0 → el modelo descarta la variable. El algoritmo ajusta los W dinámicamente para optimizar la clasificación.Árboles de decisión — reglas de umbral Xⱼ ≤ t (según se cumpla, el flujo va al nodo hijo izquierdo o derecho).
Σ (muestras del nodo / total) × reducción de impureza, sumada sobre todos los nodos que usan esa variable.No hay regla fija: la elección del método depende de los recursos de cómputo y de la naturaleza de los datos. Sin poder de cómputo → usar métodos embebidos o filtrado previo al entrenamiento (wrapper/exhaustive resultan inviables). En la práctica es válido y recomendable comparar 2 o más métodos sobre el mismo problema para contrastar resultados y justificar las decisiones de diseño.
A diferencia de la selección (conserva intactas las variables originales), la reducción de dimensionalidad proyecta los datos a un espacio nuevo de menor dimensión mediante combinaciones matemáticas: las nuevas variables ya no representan lo mismo (ya no son peso, edad o género, sino combinaciones de ellas).
Importa porque operar con vectores de alta dimensión provoca: mucho más tiempo de cómputo, mucho más almacenamiento, y sobre todo degradación del rendimiento de los modelos (maldición de la dimensionalidad).
Transforma variables posiblemente correlacionadas en componentes principales no correlacionados, ordenados por la varianza que explican. Asume que la dirección de máxima varianza es la más informativa (ahí los patrones de las clases quedan más separados).
Combinación lineal: Z = A₁X₁ + A₂X₂ + … — Xᵢ variables originales, Aᵢ coeficientes (escalares), Z variable transformada.
Vectores y valores propios: un vector propio v mantiene su dirección al multiplicarlo por la matriz A, solo cambia de magnitud; ese factor es el valor propio λ.
A v = λ v (A = matriz de covarianza; v = dirección; λ = varianza en esa dirección)
Z = W · X (W = matriz de vectores propios; X = datos originales; Z = proyección)
Algoritmo (método de la matriz de covarianza):
X centrada de N×D: Σ = (1/(N−1)) Xᵀ X. Es cuadrada; mide la variabilidad conjunta entre parejas de variables.det(Σ − λI) = 0 (evita la solución trivial) → valores propios λ₁, λ₂, … y vectores propios v₁, v₂, …λ de forma descendente por varianza explicada; tomar los primeros K vectores propios → matriz W_K. Proyección: X_nuevo = X · W_K, dimensiones N×K con K < D.PC1 = dirección de máxima varianza. PC2 = segunda mayor varianza, estrictamente ortogonal a PC1. Todos los componentes son ortogonales entre sí (base ortogonal; ninguno se obtiene por combinación lineal de los otros).
Ejemplo 1: Σ = [[4, 2], [2, 3]]
det(Σ − λI) = (4−λ)(3−λ) − 4 = λ² − 7λ + 8 = 0 → (λ−1)(λ−8) = 0 → λ₁ = 8 , λ₂ = 1
λ₁ = 8: (Σ − 8I) w = 0 → fila 1: −4 w₁ + 2 w₂ = 0 → w₂ = 2 w₁
v₁ = [1, 2]ᵀ normalizado: v₁ = (1/√5) [1, 2]ᵀ
λ₂ = 1: (Σ − I) w = 0 → fila 1: 3 w₁ + 2 w₂ = 0 → w₂ = −(3/2) w₁
v₂ = [2, −3]ᵀ normalizado: v₂ = (1/√13) [2, −3]ᵀ
Ejemplo 2: Σ = [[4, 1], [2, 3]]
det(Σ − λI) = (4−λ)(3−λ) − 2 = λ² − 7λ + 10 = 0 → λ₁ = 5 , λ₂ = 2
v₁ = [1, 1]ᵀ , v₂ = [1, −2]ᵀ
Recordatorio de las diapositivas: la suma de todos los valores propios = varianza total; varianza explicada acumulada = (Σᵢ₌₁..ₖ λᵢ) / (Σᵢ₌₁..d λᵢ).
varianza explicada (individual) = λᵢ / Σ λⱼ (la acumulada llega a 1.0 = 100 %)
K = 5.λ > 1 (aportan más que una sola variable original).X = U Σ Vᵀ
U = vectores singulares izquierdos
Vᵀ = transpuesta de los vectores singulares derechos
Σ = matriz DIAGONAL con los valores singulares en orden descendente
V) = las direcciones principales (componentes de PCA). Los valores singulares = raíz cuadrada de los valores propios de la matriz de covarianza.X (restar la media); (2) aplicar SVD directo sobre X centrada; (3) obtener Σ y V.σᵢ² / Σ σⱼ². Olvidarlo da resultados erróneos (error muy común en exámenes y en código).Xᵀ X (costoso); eficiente para datasets masivos con N ≫ D o D ≫ N. Es lo que usan la mayoría de las bibliotecas.Siguiente sesión: LDA (Análisis Discriminante Lineal).
Estructurado según el Tema 3 del programa del profesor.