Definición
Un modelo de aprendizaje supervisado que identifica un hiperplano separador óptimo entre clases maximizando el margen entre los puntos más cercanos (vectores de soporte); la no linealidad se acomoda mediante funciones kernel que mapean implícitamente las entradas a espacios de mayor dimensión. Usado para clasificación, regresión y detección de anomalías.
Principio
Principio
Maximizar el margen geométrico entre clases produce clasificadores con buenas cotas de generalización; el truco del kernel permite construir fronteras de decisión no lineales manteniendo la optimización convexa.
Demostración
Demostración
Escenario ilustrativo: un clasificador binario separa informes fraudulentos de legítimos. Una SVM lineal encuentra el hiperplano que maximiza el margen en características escaladas; si las clases no son linealmente separables se aplica un kernel RBF para permitir una frontera no lineal. Los vectores de soporte determinan la frontera y la esparsidad del modelo.
Aplicación incorrecta
Aplicación incorrecta
No escalar las características antes de ajustar, usar las salidas de la SVM como probabilidades bien calibradas sin calibración explícita, o aplicar kernels por defecto en conjuntos de datos muy grandes sin ajuste de hiperparámetros y validación puede producir resultados pobres o engañosos.
Consecuencia
Consecuencia
Las SVM rinden bien en entornos de alta dimensión y suelen proporcionar soluciones esparsas determinadas por vectores de soporte; requieren sin embargo preprocesamiento cuidadoso, selección de kernel y regularización, y normalmente no ofrecen interpretación probabilística directa sin calibración.
Inversión
Inversión
Para conjuntos de datos muy grandes o entradas altamente estructuradas (imágenes, audio crudo), las arquitecturas de aprendizaje profundo escalables o los métodos por ensamblado pueden superar a las SVM; cuando se necesitan predicciones probabilísticas por defecto, son necesarios otros modelos o procedimientos de calibración.
Límite
Límite
Claramente dentro: clasificación/regresión supervisada sobre vectores de características donde el concepto de margen se aplica y el tamaño del conjunto permite optimización convexa. Caso límite: datos en streaming o no estacionarios que requieren reentrenamiento o variantes online. Claramente fuera: aprendizaje de extremo a extremo sobre señales crudas y muy dimensionales sin featurización adecuada donde las redes profundas son más apropiadas.
Tensión semántica
Tensión semántica
Tensión entre la robustez basada en margen geométrico y la necesidad de salidas probabilísticas calibradas, fácilmente interpretables, o la escalabilidad a conjuntos de datos muy grandes.
Síntesis
Síntesis
Las SVM intercambian generalización basada en margen y flexibilidad de kernel por la necesidad de un preprocesamiento cuidadoso, ajuste de hiperparámetros y pasos adicionales para obtener probabilidades calibradas y reglas de decisión interpretables.