Eine geführte Einführung in Effektgrößen für Mittelwertsvergleiche — anhand eines durchgehenden Beispiels, dessen Parameter per Slider verändert werden können. Für exakte Berechnungen mit eigenen Daten (CSV-Upload, Konfidenzintervalle nach Bonett/Rosenthal/NCT, alle Korrekturen) siehe den Effektgrößen-Rechner.
Das laufende Beispiel
Eine Psychologin untersucht, ob ein 8-wöchiges Achtsamkeitstraining das Wohlbefinden steigert. Between: Trainingsgruppe vs. Warteliste-Kontrollgruppe, je n Personen. Within: dieselben Personen vor (Prä) und nach (Post) dem Training, mit Prä-Post-Korrelation r. Alle Mittelwerte, Streuungen, n (und r) sind frei einstellbar — die Zahlen im Beispiel sind ein plausibler Startpunkt, keine feste Vorgabe.
Was zeigt der Plot?
Die beiden Kurven sind die angenommenen Populationsverteilungen der beiden Gruppen auf der tatsächlichen Messwert-Skala (x-Achse) — mit ihren jeweils eingestellten Mittelwerten und Streuungen. Eine schmalere, höhere Kurve hat eine kleinere Streuung; das ist keine Verzerrung, sondern korrekt: die Fläche unter jeder Kurve ist immer gleich groß (= 100% dieser Gruppe). Die grau schattierte Fläche ist der Bereich, in dem sich beide Verteilungen überschneiden — je mehr Überlappung, desto schwerer lässt sich anhand eines einzelnen Werts erkennen, aus welcher Gruppe eine Person stammt. Der Pfeil zeigt den rohen Mittelwertsunterschied auf der Originalskala; die Zahl d daneben ist derselbe Unterschied, standardisiert an einer Streuung (siehe unten) — deshalb ohne Einheit und über Studien hinweg vergleichbar.
d = (M₁ − M₂) / SD. Das Vorzeichen zeigt die Richtung (hier: positiv = Zunahme), der Betrag die Größe. Cohens (1988) informelle Konvention: |d| ≈ 0.2 klein, 0.5 mittel, 0.8 groß — als grobe Orientierung gedacht, nicht als feste Schwelle; die praktische Bedeutsamkeit hängt immer vom Feld und der Fragestellung ab.
Warum mehrere Standardisierungen bei Messwiederholung?
Bei unabhängigen Gruppen gibt es einen naheliegenden Nenner: die gepoolte Streuung beider Gruppen. Bei Messwiederholung dagegen ist unklar, wessen Streuung standardisiert werden soll. Drei Konventionen haben sich etabliert:
dz — Differenzen-SD als Nenner; direkt nutzbar für t-Test-Power und CLES nach Wuensch. drm — dz · √(2(1−r)) (Becker 1988): gleich dav bei Varianzhomogenität, gleich dz bei r = .5. dav — mittlere SD von Prä und Post als Nenner (Lakens 2013); kein r im Nenner.
Die drei Werte fallen umso stärker auseinander, je höher die Prä-Post-Korrelation r ist — das lässt sich im Within-Modus direkt am Regler beobachten.
d_av und Vergleichbarkeit mit Between-Designs
dav ist am ehesten mit Between-Designs vergleichbar. Da die Prä-Post-Korrelation nicht in den Nenner eingeht, ist dav — ceteris paribus — identisch mit Cohen's d aus einem unabhängigen Gruppenvergleich. Das ermöglicht eine direkte Gegenüberstellung über Designs hinweg: ein Within-dav von 0.5 bedeutet dasselbe wie ein Between-ds von 0.5. dz und drm hingegen hängen von r ab und sind designspezifisch — deshalb verwendet dieses Tutorial dav als Effektgröße im Plot und in der Umrechnungstabelle.
Korrekturen für kleine Stichproben
Cohens d ist ein nach oben verzerrter Schätzer der wahren Populations-Effektgröße δ — die Verzerrung hängt von den Freiheitsgraden ab, nicht vom wahren Effekt. Drei gebräuchliche Korrekturfaktoren überführen d in ein "Hedges' g":
j (Hedges 1981) — j = 1 − 3/(4df−1); am gebräuchlichsten. nag (Nakagawa & Cuthill 2007) — eigene df-Zählung, empfohlen speziell für Messwiederholungen. Bon (Bonett 2015) — Bon = √((n−2)/(n−1)); basiert auf Varianz-Unbiasedness statt auf dem Erwartungswert von d, tendenziell konservativer.
Bei n ≥ 40 unterscheiden sich die drei kaum; bei sehr kleinem n (z. B. < 15) können sie spürbar auseinanderfallen — probiere es mit dem n-Regler aus.
Beide übersetzen d in eine Wahrscheinlichkeit und sind oft leichter zu kommunizieren als d selbst.
U₃ = Φ(d) — der Anteil der Vergleichsgruppe (M₁), den der Mittelwert der anderen Gruppe (M₂) übertrifft (bei d = 0.5 also 69.1%). CLES = Φ(d/√2) — die Wahrscheinlichkeit, dass eine zufällig gezogene Person aus Gruppe 2 einen höheren Wert hat als eine zufällig gezogene Person aus Gruppe 1.
Weitere Umrechnungen
r = d/√(d²+4) — punktbiseriale Korrelation zwischen Gruppenzugehörigkeit und Messwert. r² bzw. η² — Anteil der durch die Gruppierung aufgeklärten Varianz. OR = exp(d·π/√3) — Odds Ratio unter Normalverteilungsannahme, verbreitet in Medizin und Epidemiologie.
Vorzeichen: r, OR, U₃ und CLES folgen alle demselben Vorzeichen wie d. Ist d negativ (M₂ < M₁, hier: eine Abnahme), fallen U₃ und CLES unter 50 %, OR unter 1, und r wird negativ — das ist kein Fehler, sondern zeigt konsistent dieselbe Richtung wie d an. Nur r² und η² sind vorzeichenunabhängig, weil sie aufgeklärte Varianz (quadrierte Größen) ausdrücken. Ob man Effektgrößen mit Vorzeichen berichtet oder den Betrag nimmt, ist selbst eine Konvention: das Vorzeichen sollte stehen bleiben, wenn die Richtung inhaltlich informativ ist (z. B. Zu- vs. Abnahme) — nur beim reinen Abgleich mit den klein/mittel/groß-Schwellen (die per Definition Beträge sind) wird auf den Betrag geschaut.
Für die eigene Studie
Dieses Tutorial arbeitet mit einem festen (aber frei einstellbaren) Beispiel und zeigt keine Konfidenzintervalle. Für exakte Berechnungen mit eigenen Daten — CSV-Upload, Konfidenzintervalle nach Bonett, Rosenthal und exakter nichtzentraler t-Verteilung — siehe den Effektgrößen-Rechner.
Design
Zwei unabhängige Gruppen — der einfachere Fall: ein Nenner, eine Standardisierung.
Populationsparameter
M₁45.8
M₂52.4
SD₁8.4
SD₂9.6
n40
r (Prä-Post).65
Was ist eine Effektgröße? Ein p-Wert sagt nur, ob ein Unterschied von Null verschieden ist — nichts über seine praktische Bedeutsamkeit. Eine Effektgröße drückt aus, wie groß ein Unterschied ist, unabhängig von der verwendeten Skala und der Stichprobengröße. Die gebräuchlichste Effektgröße für Mittelwertsvergleiche ist Cohen's d: die Differenz zweier Mittelwerte, standardisiert an einer Streuung. d = 0.5 heißt: die beiden Verteilungen liegen im Mittel eine halbe Standardabweichung auseinander — egal ob es um Testpunkte oder Körpergröße geht. Das macht Effekte über Studien und Maße hinweg vergleichbar.
Visualisierung: Wie stark unterscheiden sich die Gruppen?
x-Achse: Wohlbefinden-Score (fiktive Skala, wie im Beispiel) · Kurven = angenommene Populationsverteilungen beider Gruppen
Punktschätzer — Cohen's d (n−1 gepoolte SD)
dz — Differenzen-SD als Nenner
drm — korrigiert für Messwiederholung (Becker 1988)
dav — mittlere SD als Nenner (Lakens 2013), am ehesten mit Between vergleichbar
Was bedeuten diese Zahlen?
① Unkorrigiert vs. korrigiert
Die Spalte "unkorr." ist das rohe Cohen's d — ein leicht nach oben verzerrter Schätzer, besonders bei kleinem n. Die drei Korrekturspalten (g·j, g·nag, g·Bon) ziehen den Wert etwas näher an Null. Bei n = 40 ist der Unterschied klein; bei n < 15 kann er relevant werden — probiere es mit dem n-Regler aus.
② Drei Standardisierungen, eine Entscheidung
Bei Messwiederholung liefern dz, drm und dav unterschiedliche Werte — und keiner ist grundsätzlich "richtig". Erhöhe r im Regler: dz wird größer (die Differenzen-Streuung schrumpft), dav bleibt unverändert (r geht nicht in den Nenner ein). drm liegt dazwischen und trifft bei r = .5 genau dz. Für Vergleiche mit Between-Designs (z. B. in einer Meta-Analyse) ist dav die richtige Wahl, weil r nicht in den Nenner eingeht.
② Effektgröße in andere Maße übersetzen
Cohen's d lässt sich in weitere gebräuchliche Maße umrechnen — je nachdem, was im eigenen Feld üblich ist oder besser kommuniziert werden kann. r und η² sind aus der Varianzaufklärung bekannt, OR aus der Logistik-/Epidemiologie-Welt, U₃ und CLES sind Wahrscheinlichkeits-basierte Maße ("wie oft übertrifft eine Person aus Gruppe 1 eine aus Gruppe 2?") und oft leichter zu vermitteln als d selbst.
③ Konventionen sind kein Naturgesetz
Die Spalte "Konvention" in der Tabelle oben (0.2 / 0.5 / 0.8 für klein/mittel/groß) stammt von Cohen (1988) — eine grobe Faustregel, gemittelt über sehr unterschiedliche Verhaltens- und Sozialwissenschaften, gedacht für Situationen, in denen sonst gar keine Orientierung verfügbar war. Es ist keine feste Schwelle und keine empirisch hergeleitete Grenze. Derselbe Wert d = 0.3 kann in einem Kontext vernachlässigbar sein (z. B. bei einem folgenlosen Persönlichkeitsmerkmal) und in einem anderen enorm bedeutsam (z. B. bei einer Sterblichkeitsreduktion in einer Medikamentenstudie, oder einem kleinen Effekt, der über Millionen Nutzer:innen skaliert). Ob ein Effekt praktisch bedeutsam ist, lässt sich nicht aus der Statistik allein ablesen — das ist immer eine inhaltliche Entscheidung: abhängig vom Feld, von den Kosten und Risiken einer Intervention, vom Vergleich mit bereits bekannten Effekten in genau diesem Forschungsbereich, und von den praktischen Konsequenzen für die betroffenen Personen.
Konzepte & Grenzen
Warum ist Cohen's d verzerrt?
Das rohe d überschätzt die wahre Populations-Effektgröße δ systematisch — stärker bei kleinem n. Die Verzerrung hängt von den Freiheitsgraden ab, nicht von der Größe des wahren Effekts. Deshalb gibt es mehrere Korrekturformeln statt einer einzigen: sie treffen leicht unterschiedliche Annahmen über die Stichprobenverteilung.
Hedges' j-Korrektur
j = 1 − 3/(4df−1) (Hedges 1981). Die gebräuchlichste Korrektur, asymptotisch exakt und in den meisten Statistik-Programmen (z. B. R-Paket effsize) als Standard hinterlegt. Ergebnis wird als Hedges' g bezeichnet.
Nakagawa & Cuthill-Korrektur
Eigene df-Zählung, die speziell für Messwiederholungsdesigns hergeleitet wurde (Nakagawa & Cuthill 2007). Berücksichtigt, dass bei Within-Designs effektiv mit den Paaren, nicht mit unabhängigen Beobachtungen gerechnet wird.
Bonett-Korrektur
Bon = √((n−2)/(n−1)) (Bonett 2015). Beruht nicht auf dem Erwartungswert von d, sondern auf Varianz-Unbiasedness — einer anderen statistischen Zielgröße. Tendenziell etwas konservativer als j oder nag. Wird typischerweise bei Within-Designs herangezogen, wo sie neben j und nag als dritte Korrekturoption angeboten wird (siehe Tabellen oben).
U₃ = Φ(d): der Anteil der Referenzgruppe, den der Mittelwert der anderen Gruppe übertrifft. Bei d = 0 liegt U₃ bei 50%, bei d = 0.8 (großer Effekt) bei rund 78.8%. Leicht als "wie viel Prozent der Kontrollgruppe liegen unter dem Trainings-Mittelwert?" zu vermitteln.
CLES = Φ(d/√2) (McGraw & Wong 1992): die Wahrscheinlichkeit, dass eine zufällig gezogene Person aus der einen Gruppe einen höheren Wert hat als eine zufällig gezogene Person aus der anderen. Anders als U₃ vergleicht CLES zwei einzelne Personen statt eine Person mit einer ganzen Verteilung.
r, r² und η²
d lässt sich als punktbiseriale Korrelation r zwischen Gruppenzugehörigkeit und Messwert ausdrücken. r² (bzw. η² bei mehr als zwei Gruppen) ist der Anteil der durch die Gruppierung aufgeklärten Varianz — dasselbe Konzept wie bei linearer Regression, nur mit einer binären statt kontinuierlichen Prädiktorvariable.
OR = exp(d·π/√3) approximiert die Umrechnung zwischen Cohen's d und dem Chancenverhältnis unter der Annahme, dass eine zugrundeliegende Normalverteilung logistisch dichotomisiert wurde. Verbreitet in Medizin und Epidemiologie, wo Ergebnisse oft ohnehin als Odds Ratios berichtet werden.
Grenzen standardisierter Effektgrößen
d ist nur vergleichbar, wenn die Populationsstreuungen ähnlich sind. Bei hochselektiven Stichproben (Range Restriction) unterschätzt d den wahren Effekt. Messfehler zieht d durch Attenuierung zusätzlich nach unten.
Für die eigene Studie
Der Effektgrößen-Rechner berechnet exakte Werte aus eigenen Daten (CSV-Upload) — inklusive Konfidenzintervallen nach Bonett, Rosenthal und exakter nichtzentraler t-Verteilung.
Unstandardisiert ist auch eine Effektgröße
Standardisierung macht d einheitenlos und über Studien vergleichbar — aber genau dabei geht die Originalskala verloren. Eine unstandardisierte Mittelwertsdifferenz (im Plot oben: "Rohwertdiff. = …") oder ein unstandardisierter Regressionskoeffizient b sind oft unmittelbarer interpretierbar, weil sie in der Metrik der abhängigen Variable selbst vorliegen — einer Metrik, die man im eigenen Feld in der Regel gut kennt (Punkte auf einer bekannten Testskala, Tage Krankenhausaufenthalt, Euro Umsatz …). Ein d von 0.4 sagt für sich genommen wenig; ein Unterschied von "6 Punkten auf dem Wohlbefindens-Score" lässt sich dagegen direkt gegen bekannte Referenzwerte einordnen. Am informativsten ist meist, beides zu berichten: die Rohwert-Differenz für die inhaltliche Einordnung, die standardisierte Version für die Vergleichbarkeit über Studien hinweg.