← Reconocimiento de Patrones
Clase 05
Ing. Rubén Omar Azuara Domínguez · 11 sep 2026 · Tema 3 (continuación) — Presentación y evaluación de la Práctica 1: PCA, SVD, estandarización y reconstrucción en datasets sintéticos, Iris, Wine y Olivetti Faces.
🔢 Numeración del profesor: sin diapositivas propias — sesión de presentación/evaluación de la práctica, no de teoría nueva.
📝 Nota personal: no grabé mi propia exposición. El profesor me hizo preguntas durante la evaluación y no supe responderlas — me costó trabajo. Me falta estudiar más a fondo estos temas.
En corto
- Centrado vs. estandarización: centrar resta la media para llevar el origen a (0,0); estandarizar además divide entre la desviación estándar para igualar escalas.
- Número de autovectores: PCA siempre genera exactamente tantos autovectores como características tenga el dataset original.
- Matriz de proyección W: para N características, W tiene dimensión N×K, con K = número de componentes elegidos.
- Sensibilidad a la escala: en datasets no estandarizados con variables de magnitudes muy distintas (ej. Wine), la primera componente absorbe casi toda la varianza (~99.8%), anulando las demás.
- Ortogonalidad: se comprueba con producto punto = 0 entre autovectores distintos, y con W·Wᵀ ≈ I.
- Eigenfaces: las primeras componentes capturan la geometría general del rostro; las últimas, detalles finos o ruido.
- Rostro promedio en reconstrucción: con pocas componentes, la reconstrucción se parece al rostro promedio porque al revertir el centrado es obligatorio sumar el vector de medias original.
🎯 Para el examen
- Centrar vs. estandarizar (pregunta directa del profesor): centrar = x − μ (desplaza el centro de masa al origen); estandarizar = (x − μ)/σ (además ajusta la escala para evitar distorsión por magnitudes dispares).
- Regla de cuántos autovectores da PCA: sin importar el método (covarianza, SVD, scikit-learn), el número de autovectores siempre es igual a N (número de características originales).
- Dimensiones exactas de las matrices: con X_C de M×N (M muestras, N características), W debe ser N×K para que la proyección Z = X_C·W resulte M×K.
- Por qué PCA necesita estandarización con escalas distintas: en Wine (13 variables), la variable de magnitud más grande domina la matriz de covarianza, haciendo que el primer componente absorba 99.81% de la varianza y dejando inútiles a los demás.
- Causa matemática del "rostro promedio" con pocas componentes: en la reconstrucción inversa, con K pequeño la señal proyectada (Z·Wᵀ) aporta poco; al sumar μ para revertir el centrado, ese término domina y produce visualmente la cara promedio.
Fundamentos de PCA: centrado, estandarización y covarianza
- Centrado de datos: calcular el vector de medias originales y restárselo a cada muestra (xᵢ − μ). Ubica el centro geométrico de la nube de puntos en el origen.
- Estandarización: dividir cada variable centrada entre su desviación estándar (σ). Imprescindible cuando las variables tienen unidades o magnitudes muy distintas, para evitar sesgos por escala.
- Matriz de covarianza: dimensión N×N; varianzas en la diagonal, covarianzas cruzadas fuera de ella. Identifica qué variables varían juntas y en qué direcciones se concentra la mayor dispersión.
- Comprobación de ortogonalidad de los vectores propios (independientes y ortogonales entre sí): 1) producto punto entre dos vectores propios distintos = 0 (v₁ᵀv₂ = 0); 2) el producto de la matriz de autovectores por su transpuesta aproxima la identidad (W·Wᵀ ≈ I).
Criterios para elegir K (datasets Iris y Wine)
- Regla del codo (Elbow Rule): graficar el % de varianza explicada/acumulada vs. número de componentes (Scree Plot) y elegir el punto donde la curva cae abruptamente y se aplana.
- Criterio de Kaiser: conservar solo componentes con valor propio λ > 1, o que expliquen más de un umbral específico de varianza.
- Umbral de varianza acumulada: fijar un % deseado (90% o 95%) y elegir el mínimo de componentes que lo alcance.
Iris (4 características): PC1 explica 92.46%, PC2 explica 5.3%. Con umbral 90% basta 1 componente; con 95% se requieren 2 componentes (reducción del 50% de la dimensión original reteniendo 97.7% de la varianza).
Wine (13 características, datos estandarizados): la regla del codo y el criterio de Kaiser coinciden en 3 componentes. Con el umbral de varianza se necesitan 8 componentes para el 90% y 10 para el 95%.
Sensibilidad a la escala, reconstrucción y equivalencia de algoritmos
- Efecto de no estandarizar: en Wine (13 variables en escalas distintas) sin estandarizar, la primera componente absorbe 99.81% de la varianza total, dejando las demás virtualmente nulas y destruyendo la estructura multidimensional.
- Reconstrucción y MSE: el error cuadrático medio entre datos originales y reconstruidos disminuye gradualmente conforme aumenta K, hasta llegar a 0 cuando K = N.
- Equivalencia de implementaciones: covarianza manual, SVD y scikit-learn dan exactamente los mismos valores propios. Los vectores propios pueden diferir en signo (×−1) — no es un error, es la misma recta/eje con orientación opuesta.
PCA en imágenes de alta dimensión: Olivetti Faces (Eigenfaces)
- Estructura del conjunto: 400 imágenes de rostros en escala de grises de 64×64 píxeles, como vectores fila de 4096 características (matriz 400×4096).
- Rostro promedio: valor medio de intensidad de cada uno de los 4096 píxeles a través de las 400 imágenes; es el punto de referencia respecto al cual PCA calcula las desviaciones.
- Interpretación de las Eigenfaces: las primeras 10 absorben la mayor varianza y representan la geometría/estructura global del rostro (silueta, ojos, mandíbula); las últimas retienen varianza mínima — detalles finos, iluminación o ruido.
- Calidad de reconstrucción visual: con 10 componentes, forma facial borrosa e indistinguible; entre 50–100, se notan rasgos específicos del individuo; entre 200–300, reconstrucción prácticamente idéntica al original.
- Mecanismo matemático del rostro promedio: reconstrucción X̂ = Z·Wᵀ + μ. Con K pequeño, el término de proyección Z·Wᵀ aporta poca variabilidad; al sumar obligatoriamente μ para revertir el centrado, la imagen resultante muestra predominantemente la cara promedio del conjunto.
Álgebra matricial de PCA y proyecciones
- Matriz de datos centrados (X_C): dimensión M×N (M muestras, N características originales).
- Matriz de transformación (W): columnas de los autovectores seleccionados, dimensión N×K (K = componentes a conservar).
- Proyección: Z = X_C·W, con Z de dimensión M×K.
Contexto — no examen
- (Contexto) Los alumnos expusieron resultados de sus códigos con gráficas comparativas de proyección en 2D, histogramas de características y reconstrucciones de imágenes.
- (Contexto) Durante las exposiciones, varios compañeros comentaron que al inicio les confundió encontrar signos opuestos al comparar autovectores de su implementación manual contra los de scikit-learn, hasta aclarar que representan la misma dirección vectorial multiplicada por −1.
Pendiente / próxima clase
- Próxima sesión: el lunes.
- Equipos de trabajo: el profesor pidió que dos alumnos se integren en un solo equipo, para quedar en dos equipos para la siguiente práctica.