Saltar al contenido principal
AsturIA
Fundamentos de Inteligencia Artificial

Introducción al aprendizaje supervisado

machine-learningsupervisado

Clasificación vs. regresión

El aprendizaje supervisado se divide en dos grandes familias según el tipo de salida que se quiere predecir:

  • Clasificación: la salida es una categoría discreta (¿es spam o no es spam?).
  • Regresión: la salida es un valor numérico continuo (¿cuál será el precio de esta vivienda?).

Por qué separar entrenamiento, validación y test

Entrenar y evaluar un modelo con los mismos datos siempre da resultados optimistas: el modelo puede simplemente memorizar. Por eso se separan tres conjuntos:

  1. Entrenamiento: el modelo ajusta sus parámetros con estos datos.
  2. Validación: se usa para comparar distintos modelos/hiperparámetros sin "contaminar" la evaluación final.
  3. Test: se usa una única vez, al final, para estimar el rendimiento real con datos nunca vistos.

Reflexión

Lo que más me ha costado interiorizar no es la parte matemática, sino la disciplina de no mirar el conjunto de test hasta tener el modelo definitivo — es tentador "espiar" para mejorar el resultado, pero eso invalida la evaluación.