Was zeigt dieses Tool?
Lord's Paradox (1967) ist die Beobachtung, dass zwei korrekte statistische Analysen — die Differenzwert-Methode und ANCOVA — zu gegensätzlichen Schlussfolgerungen führen können. Das Paradox entsteht nicht durch einen Fehler, sondern weil beide Methoden verschiedene kausale Fragen beantworten.
Das laufende Beispiel
Eine Universität vergleicht zwei Kurse: Kurs A (Standardunterricht) und Kurs B (Intensivkurs mit Tutorien). Studierende werden am Semesterbeginn (Prä) und -ende (Post) in Mathematik getestet. Kurs B hat im Schnitt ein höheres Ausgangsniveau — leistungsstärkere Studierende wählen den Intensivkurs.
Die zwei Analysen
Differenzwert (Post − Prä): Wie groß ist die mittlere Verbesserung pro Kurs? Wenn beide Kurse gleich viel verbessern, findet die Differenzwert-Analyse keinen Effekt.
ANCOVA (Post ~ Kurs + Prä): Bei gleichem Ausgangsniveau — schneidet ein Kurs am Ende besser ab? Weil Kurs B mit höherem Ausgangsniveau startet und Regression zur Mitte dies dämpft, erscheint Kurs B im ANCOVA-Vergleich besser.
Die Schlüsselformel — Herleitung
Beide Analysen starten von denselben vier Kennwerten: den Prä- und Post-Mittelwerten je Kurs (ȳpre,A, ȳpost,A, ȳpre,B, ȳpost,B). Eine kleine Umformung zeigt exakt, warum die beiden Methoden auseinanderfallen — keine neue Annahme, reine Algebra.
Schritt 1 — δDiff umschreiben: Mit Δ = mean(Post − Prä) ist δDiff = ΔB − ΔA dasselbe wie:
δ_Diff = (ȳ_post,B − ȳ_pre,B) − (ȳ_post,A − ȳ_pre,A)
= (ȳ_post,B − ȳ_post,A) − (ȳ_pre,B − ȳ_pre,A)
= (ȳ_post,B − ȳ_post,A) − Δ_base
δDiff zieht also den vollen Ausgangsniveauunterschied Δbase von der rohen Post-Differenz ab — es unterstellt implizit, dass sich ein Punkt Vorsprung im Prä-Test 1:1 in einen Punkt Vorsprung im Post-Test überträgt (Steigung = 1).
Schritt 2 — δANCOVA macht dieselbe Korrektur, aber mit geschätzter statt fest angenommener Steigung:
δ_ANCOVA = (ȳ_post,B − ȳ_post,A) − b_w · Δ_base
Statt Δbase voll abzuziehen, gewichtet ANCOVA mit der tatsächlich geschätzten within-group-Steigung bw — wie stark sich ein Prä-Punkt Vorsprung im Mittel wirklich in einen Post-Punkt Vorsprung überträgt.
Schritt 3 — beide Formeln voneinander abziehen (die rohe Post-Differenz kürzt sich exakt heraus):
δ_ANCOVA − δ_Diff = [(ȳ_post,B−ȳ_post,A) − b_w·Δ_base] − [(ȳ_post,B−ȳ_post,A) − Δ_base]
= (1 − b_w) · Δ_base
⟹ δ_ANCOVA = δ_Diff + (1 − b_w) · Δ_base
Der Korrekturterm (1 − bw) · Δbase verschwindet genau dann, wenn entweder bw = 1 ist (keine Regression zur Mitte) oder Δbase = 0 ist (kein Ausgangsniveau-Unterschied, wie meist im RCT).
Was genau ist bw — und warum ≈ ρ?
bw ("within-group slope", pooled) ist die Steigung, die entsteht, wenn man innerhalb jedes Kurses getrennt Post auf Prä regrediert und beide Steigungen über die Kurse hinweg zusammenfasst (poolt) — genau die Steigung, die eine ANCOVA mit gemeinsamer Steigungsannahme (Post ~ Prä + Kurs, ohne Interaktion) intern schätzt.
Für eine bivariate Normalverteilung gilt allgemein für die Regressionssteigung von Y auf X:
b = ρ · (σ_Y / σ_X)
Hier ist Y = Post, X = Prä, also bw = ρ · σpost/σpre. Verändert sich die Streuung vom Prä- zum Post-Test kaum (σpost ≈ σpre — in diesem Tool genau so simuliert, und in vielen Test-Retest-Situationen realistisch), vereinfacht sich das zu bw ≈ ρ. Deshalb wirkt der ρ-Regler links fast direkt auf die Divergenz der beiden Methoden.
Die Intuition: Differenzwert = ANCOVA mit fixierter Steigung
Vergleicht man Schritt 1 und 2, wird der Kern des Paradoxons sichtbar: Differenzwerte sind mathematisch nichts anderes als ANCOVA, bei der man bw nicht schätzt, sondern stur auf 1 fixiert. Ob das gerechtfertigt ist, hängt vom Design ab — im RCT ist Δbase ohnehin ≈ 0, sodass die Fixierung praktisch folgenlos bleibt; bei einer Beobachtungsstudie mit echtem Ausgangsniveau-Unterschied kann eine falsch fixierte Steigung den gesamten Bias ausmachen, den man sich einhandelt.
Bedienung
Δ Ausgangsniveau: Unterschied im Prä-Test (Kurs B minus Kurs A). Wahrer Effekt: Zusätzliche Verbesserung durch den Intensivkurs (über die Semesterverbesserung hinaus). ρ (Pre-Post-Korr.): Je näher an 1, desto stärker stimmen beide Methoden überein. Szenarien: Vier voreingestellte Situationen, die verschiedene Aspekte des Paradoxons zeigen.
Lege Artis: Wann welches Werkzeug?
RCT: ANCOVA ist vorzuziehen (höhere Power, zufällige Baseline-Differenzen werden korrigiert). Observationsstudie: Die Wahl hängt vom Estimanden ab — welche kausale Frage soll beantwortet werden? Ein DAG ist nötig. Beide Methoden können legitim sein — für verschiedene Fragen.
Literatur
Lord, F. M. (1967). A paradox in the interpretation of group comparisons. Psychological Bulletin, 68(5), 304–305.
Vickers, A. J. & Altman, D. G. (2001). Statistics notes: Analysing controlled trials with baseline and follow up measurements. BMJ, 323(7321), 1123–1124.
Senn, S. (2006). Change from baseline and analysis of covariance revisited. Statistics in Medicine, 25(24), 4334–4344.
Pearl, J. (2016). Lord's Paradox Revisited – (Oh Lord! Kumbaya!). Journal of Causal Inference, 4(2).