Définition
Un statistic sans dimension r qui mesure l'association linéaire entre deux variables aléatoires en divisant leur covariance par le produit de leurs écarts-types ; r prend des valeurs dans l'intervalle [-1,1].

Principe

Principe
La standardisation de chaque variable supprime les unités de sorte que le produit attendu des déviations standardisées quantifie la dépendance linéaire sur une échelle normalisée sans unité.

Démonstration

Démonstration
Deux signaux standardisés identiques ont r = 1 ; pour de nombreuses paires de variables indépendantes à moyenne nulle, l'espérance de r est zéro, reflétant l'absence d'association linéaire.

Mauvaise application

Mauvaise application
Interpréter un r non nul comme une preuve d'influence causale, ou utiliser r pour exclure une dépendance non linéaire ou basée sur les rangs, sont des usages fréquents impropres.

Conséquence

Conséquence
Fournit une mesure simple et comparable d'association linéaire utilisée pour le diagnostic de modèles linéaires, le criblage de prédicteurs et comme base d'essais paramétriques lorsque les hypothèses sont satisfaites.

Inversion

Inversion
Les mesures de corrélation basées sur les rangs opèrent sur l'ordre plutôt que sur les valeurs brutes et détectent ainsi des relations monotones que Pearson peut manquer, au prix d'une moindre sensibilité à un étalonnage linéaire.

Limite

Limite
Exige des moments seconds finis et est indéfini si l'une des variables a une variance nulle ; il est sensible aux valeurs aberrantes et ne capture pas les structures de dépendance non linéaires.

Tension sémantique

Tension sémantique
Équilibre interprétabilité et comparabilité contre une cécité à de nombreuses formes de dépendance ; facile à rapporter mais susceptible de sous-estimer l'association pour des relations non linéaires.

Synthèse

Synthèse
Le coefficient r de Pearson est le produit attendu normalisé des déviations standardisées qui quantifie la force et le signe d'une relation linéaire entre deux variables sur une échelle bornée.