Définition
Méthode d'ensemble supervisée construisant une agrégation d'arbres de décision entraînés sur des échantillons de type bootstrap et des sous-ensembles de caractéristiques aléatoires à chaque fractionnement ; les prédictions résultent d'un vote majoritaire pour la classification ou d'une moyenne pour la régression.

Principe

Principe
La réduction de variance et l'amélioration de la généralisation s'obtiennent en moyennant de nombreux apprenants de base (arbres) décorrelés qui, individuellement, peuvent surajuster ; la randomisation lors de l'échantillonnage et de la sélection des caractéristiques produit la diversité nécessaire à une mise en commun efficace.

Démonstration

Démonstration
En entraînant de nombreux arbres profonds sur différents échantillons tirés avec remise et en sélectionnant à chaque scission un sous-ensemble aléatoire de variables, on obtient une forêt dont les prédictions agrégées sur des données de validation réduisent typiquement la variance et le surapprentissage par rapport à un arbre unique.

Mauvaise application

Mauvaise application
Utiliser la méthode sans contrôler le biais (par exemple profondeur d'arbre inadéquate ou échantillonnage de caractéristiques mal réglé) ou interpréter naïvement les mesures d'importance des variables comme des indicateurs causaux ; l'appliquer sans tenir compte de classes fortement déséquilibrées ou de dépendances temporelles complexes est également inadapté.

Conséquence

Conséquence
Bien configurées, les forêts aléatoires offrent de bonnes performances prêtes à l'emploi sur données tabulaires, des indicateurs internes d'incertitude prédictive (dispersion de l'ensemble) et des métriques non paramétriques d'importance des variables, au prix d'une interprétabilité réduite et d'une consommation accrue de mémoire/calcul.

Inversion

Inversion
Un arbre de décision unique profondément développé ou un classificateur déterministe basé sur des règles : ils peuvent être interprétables mais présentent généralement une variance plus élevée et des performances hors-échantillon moindres comparés à un ensemble moyenné d'arbres randomisés.

Limite

Limite
Conçue pour des tâches prédictives supervisées sur jeux de données fixes ; peu adaptée au traitement direct de flux en ligne, à la modélisation séquentielle structurée sans ingénierie temporelle, ou aux tâches exigeant des sorties probabilistes fortement calibrées sans post-traitement.

Tension sémantique

Tension sémantique
Se distingue des ensembles de type boosting (p. ex. gradient boosting) : les forêts aléatoires construisent des arbres indépendamment et réduisent la variance par moyenne, tandis que le boosting construit des arbres séquentiellement pour réduire le biais en corrigeant les résidus précédents, souvent au risque accru de surapprentissage.

Synthèse

Synthèse
Une forêt aléatoire est un ensemble d'arbres de décision randomisés entraînés sur des données rééchantillonnées et des choix aléatoires de caractéristiques dont les prédictions agrégées réduisent la variance et améliorent la généralisation par rapport à un arbre unique.