Définition
Une méthode non paramétrique pour estimer une densité de probabilité inconnue en plaçant des fonctions noyau lisses et mises à l'échelle aux points d'échantillon observés et en les sommant.

Principe

Principe
Remplacer chaque point d'échantillon par une bosse localisée (noyau) dont la largeur (bandwidth) contrôle la lissage ; la somme approxime la densité continue sous-jacente lorsque la taille d'échantillon augmente.

Démonstration

Démonstration
Étant donné des échantillons x_i et un noyau K, l'estimateur en x est (1/nh) Σ_i K((x−x_i)/h) ; les choix de K et du paramètre h déterminent le compromis biais–variance.

Mauvaise application

Mauvaise application
Utiliser une largeur de noyau trop petite produit des multimodalités artificielles et du surapprentissage, tandis qu'une largeur trop grande efface la structure réelle et sous‑ajuste.

Conséquence

Conséquence
Fournit une estimation lisse et flexible de la densité utile pour la visualisation, la détection de modes et comme brique en inférence non paramétrique et classification.

Inversion

Inversion
Au lieu de lisser des points discrets pour obtenir une densité, décomposer une densité cible lisse en contributions pondérées par noyau pour retrouver des composants générateurs d'échantillons.

Limite

Limite
Appropriée lorsque les données sont des échantillons d'un support continu et que les hypothèses de lissage sont satisfaites ; problématique pour des données mixte discret‑continu, en grande dimension sans réduction, ou pour le biais aux bords du support.

Tension sémantique

Tension sémantique
Concurrence l'ajustement paramétrique lorsque une famille de modèles spécifique est justifiée ; la KDE échange parcimonie du modèle contre flexibilité et exige une sélection soignée de la largeur.

Synthèse

Synthèse
Une technique de lissage simple et pilotée par les données qui reconstruit une approximation continue d'une densité inconnue en agrégeant des contributions locales de noyau centrées sur les observations.