 ##  [Bosque Aleatorio](/es/node/57760) 

 Definición

Método de aprendizaje supervisado en conjunto que construye una agregación de árboles de decisión entrenados sobre muestras estilo bootstrap y subconjuntos de características aleatorios en cada división; las predicciones se forman por voto mayoritario en clasificación o por promedio en regresión.

 

 

 

 

 

 





## Principio

Principio

La reducción de varianza y la mejora de la generalización se logran promediando muchos aprendices base (árboles) decorrelacionados que individualmente pueden sobreajustar; la aleatorización en el muestreo y la selección de características produce la diversidad necesaria para que el promedio del conjunto sea efectivo.

 

 

 

 

 





## Demostración

Demostración

Entrenar muchos árboles profundos sobre distintas muestras extraídas con reemplazo del conjunto de datos y seleccionar un subconjunto aleatorio de características en cada división produce un bosque cuyas predicciones agregadas en datos de validación reducen típicamente la varianza y el sobreajuste respecto a un solo árbol.

 

 

 

 

## Aplicación incorrecta

Aplicación incorrecta

Usar el método sin controlar el sesgo (por ejemplo, profundidad de árbol inadecuada o muestreo de características mal calibrado) o interpretar de forma ingenua las medidas de importancia de variables como indicadores causales; también es inadecuado para etiquetas altamente desbalanceadas o datos con dependencias temporales complejas sin ajustes.

 

 

 

 

 





## Consecuencia

Consecuencia

Bien configurados, los bosques aleatorios proporcionan un rendimiento robusto en datos tabulares, medidas internas de incertidumbre predictiva (dispersión del conjunto) y métricas no paramétricas de importancia de características, a costa de interpretabilidad y mayor consumo de memoria/cálculo.

 

 

 

 

## Inversión

Inversión

Un único árbol profundo o un clasificador determinista basado en reglas: pueden ofrecer interpretabilidad pero suelen presentar mayor varianza y peor rendimiento fuera de muestra que un conjunto promediado de árboles aleatorizados.

 

 

 

 

 





## Límite

Límite

Diseñado para tareas predictivas supervisadas sobre conjuntos de datos fijos; no es directamente adecuado para streaming en línea, modelado secuencial estructurado sin ingeniería temporal o tareas que requieren salidas probabilísticas fuertemente calibradas sin postprocesamiento.

 

 

 

 

 





## Tensión semántica

Tensión semántica

Contrasta con ensamblajes secuenciales de boosting (p. ej. gradient boosting): los bosques aleatorios construyen árboles de forma independiente y reducen la varianza mediante promedio, mientras que el boosting construye árboles secuencialmente para reducir el sesgo corrigiendo residuos previos, con mayor riesgo de sobreajuste.

 

 

 

 

 





## Síntesis

Síntesis

Un bosque aleatorio es un conjunto de árboles de decisión aleatorizados entrenados sobre datos remuestreados y selecciones aleatorias de características cuyas predicciones agregadas reducen la varianza y mejoran la generalización respecto a un árbol individual.