Définition
Une méthode non paramétrique pour estimer une densité de probabilité inconnue en plaçant des fonctions noyau lisses et mises à l'échelle aux points d'échantillon observés et en les sommant.
Principe
Principe
Remplacer chaque point d'échantillon par une bosse localisée (noyau) dont la largeur (bandwidth) contrôle la lissage ; la somme approxime la densité continue sous-jacente lorsque la taille d'échantillon augmente.
Démonstration
Démonstration
Étant donné des échantillons x_i et un noyau K, l'estimateur en x est (1/nh) Σ_i K((x−x_i)/h) ; les choix de K et du paramètre h déterminent le compromis biais–variance.
Mauvaise application
Mauvaise application
Utiliser une largeur de noyau trop petite produit des multimodalités artificielles et du surapprentissage, tandis qu'une largeur trop grande efface la structure réelle et sous‑ajuste.
Conséquence
Conséquence
Fournit une estimation lisse et flexible de la densité utile pour la visualisation, la détection de modes et comme brique en inférence non paramétrique et classification.
Inversion
Inversion
Au lieu de lisser des points discrets pour obtenir une densité, décomposer une densité cible lisse en contributions pondérées par noyau pour retrouver des composants générateurs d'échantillons.
Limite
Limite
Appropriée lorsque les données sont des échantillons d'un support continu et que les hypothèses de lissage sont satisfaites ; problématique pour des données mixte discret‑continu, en grande dimension sans réduction, ou pour le biais aux bords du support.
Tension sémantique
Tension sémantique
Concurrence l'ajustement paramétrique lorsque une famille de modèles spécifique est justifiée ; la KDE échange parcimonie du modèle contre flexibilité et exige une sélection soignée de la largeur.
Synthèse
Synthèse
Une technique de lissage simple et pilotée par les données qui reconstruit une approximation continue d'une densité inconnue en agrégeant des contributions locales de noyau centrées sur les observations.