Definición
Método de aprendizaje supervisado en conjunto que construye una agregación de árboles de decisión entrenados sobre muestras estilo bootstrap y subconjuntos de características aleatorios en cada división; las predicciones se forman por voto mayoritario en clasificación o por promedio en regresión.

Principio

Principio
La reducción de varianza y la mejora de la generalización se logran promediando muchos aprendices base (árboles) decorrelacionados que individualmente pueden sobreajustar; la aleatorización en el muestreo y la selección de características produce la diversidad necesaria para que el promedio del conjunto sea efectivo.

Demostración

Demostración
Entrenar muchos árboles profundos sobre distintas muestras extraídas con reemplazo del conjunto de datos y seleccionar un subconjunto aleatorio de características en cada división produce un bosque cuyas predicciones agregadas en datos de validación reducen típicamente la varianza y el sobreajuste respecto a un solo árbol.

Aplicación incorrecta

Aplicación incorrecta
Usar el método sin controlar el sesgo (por ejemplo, profundidad de árbol inadecuada o muestreo de características mal calibrado) o interpretar de forma ingenua las medidas de importancia de variables como indicadores causales; también es inadecuado para etiquetas altamente desbalanceadas o datos con dependencias temporales complejas sin ajustes.

Consecuencia

Consecuencia
Bien configurados, los bosques aleatorios proporcionan un rendimiento robusto en datos tabulares, medidas internas de incertidumbre predictiva (dispersión del conjunto) y métricas no paramétricas de importancia de características, a costa de interpretabilidad y mayor consumo de memoria/cálculo.

Inversión

Inversión
Un único árbol profundo o un clasificador determinista basado en reglas: pueden ofrecer interpretabilidad pero suelen presentar mayor varianza y peor rendimiento fuera de muestra que un conjunto promediado de árboles aleatorizados.

Límite

Límite
Diseñado para tareas predictivas supervisadas sobre conjuntos de datos fijos; no es directamente adecuado para streaming en línea, modelado secuencial estructurado sin ingeniería temporal o tareas que requieren salidas probabilísticas fuertemente calibradas sin postprocesamiento.

Tensión semántica

Tensión semántica
Contrasta con ensamblajes secuenciales de boosting (p. ej. gradient boosting): los bosques aleatorios construyen árboles de forma independiente y reducen la varianza mediante promedio, mientras que el boosting construye árboles secuencialmente para reducir el sesgo corrigiendo residuos previos, con mayor riesgo de sobreajuste.

Síntesis

Síntesis
Un bosque aleatorio es un conjunto de árboles de decisión aleatorizados entrenados sobre datos remuestreados y selecciones aleatorias de características cuyas predicciones agregadas reducen la varianza y mejoran la generalización respecto a un árbol individual.