Definition
Für ein spezifiziertes Nullmodell und eine aus Daten berechnete Teststatistik ist der p-Wert die Wahrscheinlichkeit, unter dem Nullmodell eine Teststatistik zu beobachten, die mindestens so extrem ist wie der beobachtete Wert.

Prinzip

Prinzip
Der p-Wert misst die Extremheit der Daten relativ zu einem Nullmodell; er ist eine Randsumme (Tail Probability), berechnet unter den Annahmen, die dieses Modell und die Stichprobenverteilung der Statistik festlegen.

Demonstration

Demonstration
Beim t-Test zum Vergleich einer Stichprobenmittel zum Nullmittel berechnet man die t-Statistik; der p-Wert ist dann die Wahrscheinlichkeit unter der unter dem Nullmodell geltenden Student-Verteilung, den beobachteten t-Betrag oder mehr zu erhalten.

Fehlanwendung

Fehlanwendung
Den p-Wert als Wahrscheinlichkeit dafür zu interpretieren, dass die Nullhypothese wahr ist, oder als Maß für die praktische Relevanz des Effekts, oder ein willkürliches Schwellenwert ohne Berücksichtigung von Teststärke und multiplen Tests zu verwenden.

Konsequenz

Konsequenz
Bei korrekter Anwendung liefert er ein kalibriertes Maß für die Unverträglichkeit zwischen Daten und Nullmodell, das Entscheidungen über das Zurückweisen des Nuls leiten kann, bei gleichzeitiger Kontrolle von Fehlerquoten über Wiederholungen.

Umkehrung

Umkehrung
Ein großer p-Wert zeigt an, dass die Daten unter dem Nullmodell nicht unwahrscheinlich sind; das bestätigt den Null nicht, sondern liefert lediglich kein Gegenbeweis.

Abgrenzung

Abgrenzung
Hängt vom genau spezifizierten Nullmodell, der Wahl der Teststatistik und Annahmen (Unabhängigkeit, Verteilungsform) ab; ohne vollständig spezifizierten Null und Testprozedur nicht definiert.

Semantische Spannung

Semantische Spannung
Wird oft gegen Maße der Effektgröße oder bayesianische Posterior-Wahrscheinlichkeiten gestellt; p-Werte behandeln Stichprobenextremität unter einem Modell, nicht direkte Wahrscheinlichkeiten von Hypothesen oder Effektgrößen.

Synthese

Synthese
Ein p-Wert ist die unter einem spezifizierten Nullmodell und einer Teststatistik berechnete Randsumme, die quantifiziert, wie extrem die beobachteten Daten im Vergleich zu diesem Modell sind.