← Reconocimiento de Patrones
Clase 06
Ing. Rubén Omar Azuara Domínguez · 14 sep 2026 · Tema 5 — Funciones de decisión lineales y multiclase, interpretación geométrica en espacios de características y pesos, algoritmo de aprendizaje y sistemas de funciones ortogonales.
🔢 Numeración del profesor: corresponde a sus diapositivas Clase 8 (Funciones de decisión) — no coincide 1:1 con "Clase 06" de este sitio.
En corto
- Función de decisión g(x): modelo matemático que recibe un vector de características y devuelve un escalar cuyo signo determina la clase.
- 1 vs. Resto: c funciones de decisión para c clases; se asigna la clase i solo si su función es positiva y todas las demás negativas.
- Regiones de ambigüedad: zonas donde no se puede clasificar porque varias funciones son positivas o todas son negativas.
- Máquina Lineal: elimina las ambigüedades asignando la clase con el valor escalar máximo (gᵢ(x) > gⱼ(x)).
- Espacio de características vs. espacio de pesos: en el primero los puntos son patrones; en el segundo, los puntos son clasificadores completos.
- Ortogonalidad de w: el vector de pesos es perpendicular al hiperplano g(x)=0; el escalar de g(x) mide la distancia a ese hiperplano.
- Funciones ortogonales: descomponen funciones de decisión complejas en combinaciones lineales de polinomios base (Legendre, Laguerre, Hermite).
🎯 Para el examen
- Regla del signo: g(x) = wᵀx + w₀ — g(x)>0 → clase 1, g(x)<0 → clase 2. Si g(x)=0, cae en la frontera; se decide según el costo del error (ej. en diagnóstico médico, prefiere falso positivo sobre falso negativo).
- Criterio estricto 1 vs. Resto: clase i solo si Dᵢ(x)>0 y Dⱼ(x)<0 para todo j≠i. Dos o más positivos, o todos negativos → región de ambigüedad.
- Criterio de Máquina Lineal: asigna a ωᵢ si gᵢ(x) > gⱼ(x) para todo j≠i — divide el espacio en c regiones sin zonas ambiguas.
- Espacio de características (ejes = variables medibles, puntos = patrones) vs. espacio de pesos (ejes = w₀..wₙ, puntos = clasificadores completos).
- Distancia al hiperplano: depende del vector unitario ortogonal w y de la magnitud escalar de g(x).
- Dominios de los polinomios ortogonales (pregunta frecuente): Legendre → [-1,1] · Laguerre → [0,∞) · Hermite → (-∞,∞).
- Clasificación (supervisado, requiere x e y) vs. Agrupamiento/Clustering (no supervisado, solo x) vs. Reconocimiento de Patrones (término integral: detección, extracción, clasificación y clustering).
Repaso de la clase anterior — métricas, evaluación y validación cruzada
- Sesgo/varianza describen cómo aprende el clasificador; exactitud (accuracy) mide el rendimiento global. Repaso de precisión, recall, especificidad, F1 y exactitud balanceada.
- Precisión vs. recall: precisión = TP/(TP+FP) (de lo predicho positivo, cuánto es real); recall = de todo lo real positivo, cuánto capturó el modelo.
- Matriz de confusión: diagonal = aciertos, triángulos = errores. Ejemplo de la alarma de incendio: falso positivo = suena sin fuego; falso negativo = hay incendio y no suena.
- ROC/AUC: escala de interpretación — 1.0 perfecto, 0.9–1.0 excelente, 0.7–0.9 bueno/regular, 0.5 aleatorio, <0.5 predicción invertida.
- K-Fold Cross Validation: divide el entrenamiento en K subconjuntos e itera permutando los folds, para que el modelo no dependa de una partición particular.
Pipeline de reconocimiento y funciones de decisión (lineales, cuadráticas, no lineales)
- Pipeline: patrones/objetos → extracción de características (vector x ∈ ℝⁿ) → selección/reducción de dimensionalidad → clasificador.
- Función de decisión: g(x) recibe x ∈ ℝⁿ y produce un escalar cuyo signo asigna la clase.
- Función lineal: g(x) = w₁x₁ + w₂x₂ + ... + wₙxₙ + w₀ = wᵀx + w₀. w₀ es la ordenada al origen (nivel promedio). Geométricamente es un hiperplano. Ventaja: simple, rápida, interpretable. Desventaja: solo sirve si las clases son linealmente separables.
- Función cuadrática: xᵀAx + bᵀx + c — más flexible para fronteras complejas, pero más parámetros y riesgo de sobreajuste.
- Funciones no lineales: forma arbitraria, máxima adaptabilidad pero difíciles de entrenar e interpretar. Enfoque clásico: transformar/reducir a un nuevo espacio donde sí sean linealmente separables.
- Interpretación de pesos: wᵢ = importancia de xᵢ para discriminar la clase. g(x)>0 → clase 1; g(x)<0 → clase 2; g(x)=0 → frontera (decisión aleatoria o según costo del error, ej. diagnóstico médico prefiere falso positivo).
Clasificación multiclase: 1 vs. Resto, 1 vs. 1 y Máquinas Lineales
- 1 vs. Resto: c funciones D₁(x)...D_c(x). Pertenece a la clase i solo si Dᵢ(x)>0 y Dⱼ(x)<0 para todo j≠i.
- 1 vs. 1: compara pares de clases con Dᵢⱼ(x). Se asigna a la clase i si Dᵢⱼ(x)>0 para todo j≠i.
- Regiones de ambigüedad: cuando no se cumple la condición estricta (más de una positiva, o todas negativas).
- Máquina Lineal: evalúa g₁(x)...g_c(x) y asigna a ωᵢ cuyo valor sea el máximo absoluto — no depende del signo sino de la magnitud, sin dejar zonas ambiguas.
- Funciones generalizadas / ensambles: g(x) = Σwᵢfᵢ(x) = wᵀx*, donde x* son los resultados de modelos base y wᵢ representa la confianza/voto de cada clasificador.
Ejercicios resueltos en clase
Binario (ℝ²): w = [-3, 0.75, 1]ᵀ → g(x) = -3 + 0.75x₁ + x₂.
- Punto (4,3): g = -3+0.75(4)+1(3) = 3 > 0 → Clase 1.
- Origen (0,0): g = -3 < 0 → Clase 2.
Multiclase 1 vs. Resto (ℝ²): D₁(x)=-x₁+x₂, D₂(x)=x₁+x₂-5, D₃(x)=-x₂+1.
- (6,5): D₁=-1(-), D₂=6(+), D₃=-4(-) → solo D₂ positivo → Clase 2.
- (0,2): D₁=2(+), D₂=-3(-), D₃=-1(-) → solo D₁ positivo → Clase 1.
- (6,4): D₁=-2(-), D₂=5(+), D₃=-3(-) → solo D₂ positivo → Clase 2.
- (2,-2) — evaluado por mí: D₁=-4(-), D₂=-5(-), D₃=3(+) → solo D₃ positivo → Clase 3.
- (2,6) — evaluado por Jorge: D₁=4(+), D₂=3(+), D₃=-5(-) → D₁ y D₂ positivos → región de ambigüedad.
- Los puntos evaluados por Santiago y Sebastián también cayeron en regiones indeterminadas — demuestra en la práctica las limitaciones de 1 vs. Resto.
Interpretación geométrica y comparación de espacios
- Hiperplano de decisión: g(x)=wᵀx+w₀ define g(x)=0; el vector w es perpendicular a esa superficie.
- Distancia al hiperplano: r = g(x)/|w| — evaluar la función de decisión equivale a medir la distancia dirigida del patrón al hiperplano.
- Espacio de características (ℝⁿ): ejes = variables medibles, puntos = patrones, grupos de puntos = clases. Pregunta: ¿dónde está cada patrón?
- Espacio de pesos: ejes = coeficientes w₀..wₙ, puntos = clasificadores completos, regiones = clasificadores válidos. Pregunta: ¿qué clasificador separa las clases?
- Clase (Cᵢ): donde Dᵢ(x) supera a Dⱼ(x) para todo j≠i. Región de decisión: subespacio de una sola clase. Frontera: donde g(x)=0 o gᵢ(x)=gⱼ(x).
Algoritmo de aprendizaje de pesos (regla de actualización del perceptrón)
- Inicialización: w en ceros o valores aleatorios pequeños.
- Evaluación: para cada par (xᵢ, yᵢ), se evalúa el signo de g(xᵢ).
- Actualización si el signo predicho difiere del real:
w_nuevo = w_anterior + α · error · xᵢ, donde α es la tasa de aprendizaje (learning rate).
- Iteración hasta converger (error mínimo aceptable o máximo de iteraciones).
- Inferencia: para un patrón nuevo, se calcula g(x) y se aplica la regla del signo.
Sistemas de funciones ortogonales
Propósito: aproximar funciones de decisión complejas como combinación lineal de funciones base ortogonales: g(x) = Σwₖφₖ(x).
Ventajas: sin redundancia (cada base es independiente) · compresión eficiente (pocos coeficientes) · cálculo desacoplado (wₖ se calculan independientemente) · estabilidad numérica.
Familias y dominios:
- Legendre: x ∈ [-1, 1]. Aplicaciones: clasificación de formas geométricas, contornos, análisis de imágenes.
- Laguerre: x ∈ [0, ∞).
- Hermite: x ∈ (-∞, ∞). Aplicaciones: reconocimiento de voz, audio, visión computacional, datos con distribución normal/gaussiana.
Clasificación vs. Agrupamiento vs. Reconocimiento de Patrones
- Clasificación (supervisado): recibe x con etiquetas y explícitas; genera un modelo que predice la clase.
- Agrupamiento/Clustering (no supervisado): recibe x sin etiquetas; busca agrupaciones naturales (grupo 1, 2, 3...).
- Reconocimiento de Patrones: proceso integral — adquisición de señales/imágenes, extracción de características, clasificación supervisada y clustering no supervisado.
Contexto — no examen
- (Contexto) El profesor usó el ejemplo del diagnóstico de cáncer para explicar el manejo de g(x)=0: es preferible un falso positivo (alerta en paciente sano) que un falso negativo (no detectar a un paciente enfermo).
- (Contexto) Durante los ejercicios en el pizarrón, el profesor asignó casos específicos a varios compañeros (a mí me tocó el punto (2,-2), a Jorge el (2,6)) para calcular las funciones de decisión en tiempo real, mostrando en vivo cómo surgen las regiones de ambigüedad.
- (Contexto) La idea de combinaciones lineales ponderadas de clasificadores (g(x)=Σwᵢfᵢ(x)) se presentó como antesala al concepto de ensambles de modelos, donde varios clasificadores "votan" según la confianza que se les otorga.
Pendiente / próxima clase
- Próxima sesión: viernes.
- Tema a iniciar: métodos de clasificación no supervisada (Clustering) — primero clasificadores basados en funciones de distancia, luego funciones de similitud.
- No se asignaron tareas ni fechas límite de prácticas adicionales en esta sesión.