Eine geführte Einführung in den p-Wert anhand eines einzigen durchgehenden Beispiels: eines Zwei-Gruppen-Vergleichs. Zwei Simulationen machen die Definition und die Grenzen des p-Werts direkt erlebbar, statt sie nur zu behaupten.
Die Definition
p = P(Daten, die mindestens so extrem sind wie die beobachteten | H₀ ist wahr). Das ist eine bedingte Wahrscheinlichkeit über Daten, keine Aussage über die Wahrscheinlichkeit von H₀ selbst — eine der häufigsten Verwechslungen überhaupt (siehe Mythos ①).
Abschnitt ①: Wiederholte Ziehung unter H₀
Jeder Klick auf "Stichprobe ziehen" simuliert zwei neue Gruppen, zwischen denen in Wahrheit kein Unterschied besteht (H₀ trifft in der Simulation garantiert zu). Der resultierende t-Wert wird auf der t-Verteilung markiert; die Trefferquote "mindestens so extrem wie unser t" konvergiert mit wachsender Anzahl Ziehungen gegen den formal berechneten p-Wert.
Abschnitt ②: Der p-Wert-Tanz
Jetzt mit einem echten, festen Effekt (Regler). Jede "Replikation" zieht neue Stichproben aus exakt derselben Population und berechnet einen neuen p-Wert. Das Ergebnis: selbst bei identischem wahren Effekt streuen die p-Werte stark — ein einzelner p-Wert ist kein verlässliches Maß für die Stärke oder Replizierbarkeit eines Befunds (Geoff Cummings "Dance of the p-values").
Statistischer Test im Hintergrund
Alle Simulationen verwenden einen ungepaarten Zwei-Stichproben-t-Test mit gleicher Gruppengröße n und angenommener Varianzhomogenität: t = (M₁−M₂)/(SD·√(2/n)), df = 2n−2, zweiseitiger p-Wert über die t-Verteilung.
Literatur
Fisher, R. A. (1925). Statistical Methods for Research Workers. Oliver & Boyd. Neyman, J. & Pearson, E. S. (1933). On the problem of the most efficient tests of statistical hypotheses. Philosophical Transactions of the Royal Society A, 231, 289–337. Cumming, G. (2014). The new statistics: Why and how. Psychological Science, 25(1), 7–29.
Unsere Studie
n = 25 pro Gruppe
MKontrolle = 100.0
MIntervention = 107.0
SD = 12.0 (gepoolt)
t(48) = 2.062
p = .045
Kernaussage
Ein p-Wert ist eine Aussage über Daten unter H₀ — nicht über die Wahrscheinlichkeit, dass H₀ (oder H₁) stimmt.
Was ist eigentlich ein p-Wert? p = die Wahrscheinlichkeit, ein Ergebnis mindestens so extrem wie das beobachtete zu erhalten, wenn die Nullhypothese H₀ (kein wahrer Unterschied) zuträfe. Das ist eine sehr spezifische, bedingte Aussage über Daten — und wird trotzdem ständig mit ganz anderen Aussagen verwechselt (dazu unten mehr). Am besten versteht man sie nicht durch die Formel, sondern durch Wiederholung: was würde passieren, wenn wir dieselbe Studie unter H₀ immer wieder durchführen könnten?
📋 Beispiel — Lernprogramm & Merkfähigkeit
Ein neues Lernprogramm soll die Merkfähigkeit verbessern. Kontrollgruppe (klassisches Lernen, n=25) vs. Interventionsgruppe (neues Programm, n=25), Testergebnis 0–150 Punkte. Beobachtet: MKontrolle=100, MIntervention=107, SD=12 (gepoolt) → t(48)=2.06, p=.045. Knapp signifikant bei α=.05 — aber was heißt das eigentlich?
① Wiederholte Ziehung unter H₀: Was der p-Wert wirklich zählt
Stell dir vor, das Lernprogramm hätte in Wahrheit keinen Effekt (H₀ trifft zu). Jeder Klick unten zieht zwei neue, fiktive Gruppen aus derselben Population und berechnet deren t-Wert. Beobachte, wie oft ein Ergebnis mindestens so extrem wie unser t=2.06 rein zufällig auftritt.
x-Achse: simulierter t-Wert · Kurve = theoretische t-Verteilung unter H₀ (df=48) · rote Fläche = "mindestens so extrem wie unser t=2.06" (das ist unser p-Wert) · graue Punktlinie = α=.05-Grenze (t=±2.01) zum Vergleich — hier fast deckungsgleich, aber begrifflich etwas anderes
Noch keine Stichprobe gezogen.
Konvergenz gegen den p-Wert
Mit wachsender Anzahl Ziehungen nähert sich der simulierte Anteil "mindestens so extrem" dem formal berechneten p=.045 an. Das ist die Definition — keine Interpretation, keine Zusatzannahme über die Nullhypothese selbst. p ist eine Eigenschaft der Daten unter H₀, nicht eine Eigenschaft von H₀.
Wichtig für die Grafik: Die rote Fläche beginnt bei unserem eigenen beobachteten t=2.06 — nicht bei der α=.05-Grenze (graue Punktlinie, t=±2.01). Das sind zwei verschiedene Dinge, die hier nur zufällig fast zusammenfallen: t=±2.01 ist die feste Grenze, ab der irgendein Ergebnis als "signifikant" gilt; t=2.06 ist unser tatsächliches Ergebnis, und der Flächenanteil ab genau diesem Wert ist per Definition unser p-Wert. Wäre unser t z. B. 3.0 gewesen, läge die rote Fläche entsprechend weiter außen (kleinerer p-Wert) — die α-Grenze bliebe bei ±2.01.
Take-Home-Message: Generell gilt, egal wo man die "kritische" Grenze setzt — .05, .045 oder jeder andere Wert: Wenn H₀ zutrifft, hat bei wiederholter Ziehung von Stichproben genau der entsprechende Anteil aller Stichproben zufällig einen p-Wert, der so klein oder noch kleiner (extremer) ist. Siehe die Verteilung der p-Werte weiter unten (③ Die Form der p-Wert-Verteilung).
② Der p-Wert-Tanz: Wie stabil ist ein einzelner p-Wert?
Jetzt umgekehrt: Es gibt einen echten, festen Effekt — aber jede Replikation zieht neue, zufällige Stichproben. Wie sehr springt der p-Wert von Replikation zu Replikation, obwohl der wahre Effekt sich nie ändert?
Wahrer Effekt d0.50
n pro Gruppe25
Oben: jeder Punkt eine Replikation (p-Wert, 0–1) · unten: Histogramm aller bisherigen p-Werte, dieselbe x-Achse · grüne Kurve = theoretisch erwartete Dichte bei aktuellem d und n (bei d=0 flach, sonst linkssteil) · gestrichelte Linie = α=.05
Noch keine Replikation gezogen.
③ Die Form der p-Wert-Verteilung
Die grüne Kurve im unteren Panel zeigt die theoretisch erwartete Dichte der p-Werte für den aktuell eingestellten wahren Effekt d und n — nicht simuliert, sondern exakt berechnet. Bei d=0 (H₀ stimmt exakt) ist sie flach, mit konstanter Dichte 1 über das gesamte Intervall [0,1] — eine Gleichverteilung, egal wie groß n ist. Das ist plausibel, sobald man sich klarmacht, was ein p-Wert per Definition ist — unter H₀ ist jeder p-Wert zwischen 0 und 1 gleich wahrscheinlich, und setzt man die Signifikanzgrenze α bei 5%, liegen deshalb per Konstruktion auch genau 5% aller p-Werte darunter (das ist die Falsch-positiv-Rate, nicht mehr und nicht weniger). Erhöhst du d, wird die Kurve zunehmend linkssteil: kleine p-Werte werden wahrscheinlicher, große seltener — und je größer d (oder n), desto steiler. Die Umkehrung ist die Grundlage der p-Curve-Analyse: Stimmt H₀ über eine Reihe von Studien hinweg nicht, sollten deutlich mehr als 5% der publizierten p-Werte unter .05 liegen und die Verteilung linkssteil statt flach sein. Wenn H₀ nicht stimmt, sollten genau deshalb p-Werte knapp unterhalb von α kaum vorkommen, sondern deutlich kleiner sein — eine Methode, um echte Effekte von reinem p-Hacking zu unterscheiden (Simonsohn, Nelson & Simmons, 2014). Die blauen/roten Balken sind die tatsächlich gezogenen Replikationen; klicke ein paar Mal auf "automatisch" und beobachte, wie sich das Histogramm der grünen Kurve annähert.
Mythen vs. Fakten
Mythos"p ist die Wahrscheinlichkeit, dass H₀ stimmt."
Faktp = P(Daten | H₀), nicht P(H₀ | Daten). Diese beiden bedingten Wahrscheinlichkeiten sind nur in Ausnahmefällen gleich groß — eine Verwechslung, die in der Bayes-Statistik besonders sichtbar wird.
Mythos"p<.05 heißt: der Effekt ist praktisch bedeutsam."
Faktp hängt von Effektgröße und Stichprobengröße ab. Ein winziger, irrelevanter Effekt wird bei genug Daten fast immer signifikant.
n pro Gruppe (bei festem, winzigem d=0.05)20
—
Mythos"1−p ist die Wahrscheinlichkeit, dass sich der Befund repliziert."
FaktSiehe Abschnitt ② oben — der p-Wert-Tanz zeigt direkt, wie wenig ein einzelner p-Wert über eine Replikation aussagt (siehe auch Lernkarte "Ein p-Wert ist kein Replizierbarkeits-Maß" unten).
Mythos"Nicht signifikant heißt: es gibt keinen Effekt."
FaktAbsence of evidence ist nicht evidence of absence. Oft fehlt schlicht die Power, einen realen Effekt zu entdecken — ein n.s.-Ergebnis kann ebenso gut "kein Effekt" wie "zu wenig Daten, um ihn zu sehen" bedeuten.
Ein tieferliegender Grund kommt hinzu: der p-Wert wird unter der Annahme berechnet, dass H₀ zutrifft — H₀ ist die feste Prämisse des gesamten Verfahrens, nicht dessen Ergebnis. Ein Test, der H₀ von vornherein voraussetzt, kann strukturell keine Evidenz für H₀ liefern, sondern höchstens sie nicht verwerfen. Wer tatsächlich quantifizieren will, wie stark Daten für H₀ (statt nur "nicht gegen sie") sprechen, braucht ein anderes Werkzeug, z. B. einen Bayes-Faktor. → Bayes Thinking Lab · → Power & Stichprobengröße
Mythos"Ein kleinerer p-Wert bedeutet einen größeren Effekt."
Faktp vermengt Effektgröße und Stichprobengröße — zwei Studien mit demselben p können völlig unterschiedliche Effektgrößen haben:
Fisher verstand den p-Wert als graduelles Evidenzmaß gegen H₀. Neyman & Pearson entwickelten unabhängig davon ein Entscheidungsschema mit vorab fixierten Fehlerraten α und β. Die heutige Praxis vermischt beide Ansätze unsauber zu einem Hybrid — eine Hauptursache vieler Missverständnisse.
α ist fix, p ist zufällig
α wird vor der Studie als feste Fehlerrate für die Entscheidungsregel festgelegt. p wird aus den Daten berechnet und schwankt von Stichprobe zu Stichprobe (siehe Abschnitt ②). Die beiden zu verwechseln führt zu genau den Mythen oben.
Ein p-Wert ist kein Replizierbarkeits-Maß
Bei realistischer Power (z. B. 50–70 %) ist es normal, dass eine knapp signifikante Replikation direkt gefolgt wird von einer, die es nicht ist — obwohl der wahre Effekt konstant bleibt. Ein einzelner p-Wert sagt fast nichts darüber aus, wie ein zweiter Versuch ausgehen würde. Das ist als "Dance of the p-values" bekannt (Geoff Cumming) — direkt erlebbar in Abschnitt ② oben.
Ein- vs. zweiseitig testen
Ein einseitiger Test hat mehr Power in die erwartete Richtung, ignoriert aber Effekte in die Gegenrichtung vollständig. Die Richtung muss vor der Datenerhebung feststehen — nachträglicher Wechsel je nach Ergebnis ist eine Form von p-Hacking.
Was statt nur p berichten?
Aktuelle Leitlinien (u. a. das ASA-Statement 2016) empfehlen, Effektgröße und Konfidenzintervall gemeinsam mit p zu berichten — p allein sagt weder etwas über die Größe noch über die Präzision eines Effekts.
Wenn p nicht reicht: Bayes
Bayes-Faktoren beantworten direkt die Frage, die viele fälschlich in p hineinlesen: wie stark sprechen die Daten für H₁ gegenüber H₀? → Lindley's Paradox zeigt einen Fall, in dem beide Antworten auseinanderfallen. Oft noch informativer als ein einzelner Bayes-Faktor ist die bayesianische Parameterschätzung: statt nur H₀ vs. H₁ gegeneinander abzuwägen, liefert sie eine vollständige Posterior-Verteilung des Effekts selbst — inklusive Unsicherheit, ganz ohne den Umweg über eine Nullhypothese. → Bayes Thinking Lab
Verwandte Tools
Mehrfachtestung und der Zusammenhang zur "Anzahl an Chancen" auf einen Zufallstreffer: → Data Dredging. Wie Stichprobenumfang und Effektgröße gemeinsam über Power entscheiden: → Power & Stichprobengröße.