Lord's Paradox — ANCOVA vs. Differenzwert

Dr. R. Düsing · Universität Osnabrück

Hilfe — Lord's Paradox

Was zeigt dieses Tool?

Lord's Paradox (1967) ist die Beobachtung, dass zwei korrekte statistische Analysen — die Differenzwert-Methode und ANCOVA — zu gegensätzlichen Schlussfolgerungen führen können. Das Paradox entsteht nicht durch einen Fehler, sondern weil beide Methoden verschiedene kausale Fragen beantworten.

Das laufende Beispiel

Eine Universität vergleicht zwei Kurse: Kurs A (Standardunterricht) und Kurs B (Intensivkurs mit Tutorien). Studierende werden am Semesterbeginn (Prä) und -ende (Post) in Mathematik getestet. Kurs B hat im Schnitt ein höheres Ausgangsniveau — leistungsstärkere Studierende wählen den Intensivkurs.

Die zwei Analysen

Differenzwert (Post − Prä): Wie groß ist die mittlere Verbesserung pro Kurs? Wenn beide Kurse gleich viel verbessern, findet die Differenzwert-Analyse keinen Effekt.

ANCOVA (Post ~ Kurs + Prä): Bei gleichem Ausgangsniveau — schneidet ein Kurs am Ende besser ab? Weil Kurs B mit höherem Ausgangsniveau startet und Regression zur Mitte dies dämpft, erscheint Kurs B im ANCOVA-Vergleich besser.

Die Schlüsselformel — Herleitung

Beide Analysen starten von denselben vier Kennwerten: den Prä- und Post-Mittelwerten je Kurs (ȳpre,A, ȳpost,A, ȳpre,B, ȳpost,B). Eine kleine Umformung zeigt exakt, warum die beiden Methoden auseinanderfallen — keine neue Annahme, reine Algebra.

Schritt 1 — δDiff umschreiben: Mit Δ = mean(Post − Prä) ist δDiff = ΔB − ΔA dasselbe wie:

δ_Diff = (ȳ_post,B − ȳ_pre,B) − (ȳ_post,A − ȳ_pre,A) = (ȳ_post,B − ȳ_post,A) − (ȳ_pre,B − ȳ_pre,A) = (ȳ_post,B − ȳ_post,A) − Δ_base

δDiff zieht also den vollen Ausgangsniveauunterschied Δbase von der rohen Post-Differenz ab — es unterstellt implizit, dass sich ein Punkt Vorsprung im Prä-Test 1:1 in einen Punkt Vorsprung im Post-Test überträgt (Steigung = 1).

Schritt 2 — δANCOVA macht dieselbe Korrektur, aber mit geschätzter statt fest angenommener Steigung:

δ_ANCOVA = (ȳ_post,B − ȳ_post,A) − b_w · Δ_base

Statt Δbase voll abzuziehen, gewichtet ANCOVA mit der tatsächlich geschätzten within-group-Steigung bw — wie stark sich ein Prä-Punkt Vorsprung im Mittel wirklich in einen Post-Punkt Vorsprung überträgt.

Schritt 3 — beide Formeln voneinander abziehen (die rohe Post-Differenz kürzt sich exakt heraus):

δ_ANCOVA − δ_Diff = [(ȳ_post,B−ȳ_post,A) − b_w·Δ_base] − [(ȳ_post,B−ȳ_post,A) − Δ_base] = (1 − b_w) · Δ_base ⟹ δ_ANCOVA = δ_Diff + (1 − b_w) · Δ_base

Der Korrekturterm (1 − bw) · Δbase verschwindet genau dann, wenn entweder bw = 1 ist (keine Regression zur Mitte) oder Δbase = 0 ist (kein Ausgangsniveau-Unterschied, wie meist im RCT).

Was genau ist bw — und warum ≈ ρ?

bw ("within-group slope", pooled) ist die Steigung, die entsteht, wenn man innerhalb jedes Kurses getrennt Post auf Prä regrediert und beide Steigungen über die Kurse hinweg zusammenfasst (poolt) — genau die Steigung, die eine ANCOVA mit gemeinsamer Steigungsannahme (Post ~ Prä + Kurs, ohne Interaktion) intern schätzt.

Für eine bivariate Normalverteilung gilt allgemein für die Regressionssteigung von Y auf X:

b = ρ · (σ_Y / σ_X)

Hier ist Y = Post, X = Prä, also bw = ρ · σpostpre. Verändert sich die Streuung vom Prä- zum Post-Test kaum (σpost ≈ σpre — in diesem Tool genau so simuliert, und in vielen Test-Retest-Situationen realistisch), vereinfacht sich das zu bw ≈ ρ. Deshalb wirkt der ρ-Regler links fast direkt auf die Divergenz der beiden Methoden.

Die Intuition: Differenzwert = ANCOVA mit fixierter Steigung

Vergleicht man Schritt 1 und 2, wird der Kern des Paradoxons sichtbar: Differenzwerte sind mathematisch nichts anderes als ANCOVA, bei der man bw nicht schätzt, sondern stur auf 1 fixiert. Ob das gerechtfertigt ist, hängt vom Design ab — im RCT ist Δbase ohnehin ≈ 0, sodass die Fixierung praktisch folgenlos bleibt; bei einer Beobachtungsstudie mit echtem Ausgangsniveau-Unterschied kann eine falsch fixierte Steigung den gesamten Bias ausmachen, den man sich einhandelt.

Bedienung

Δ Ausgangsniveau: Unterschied im Prä-Test (Kurs B minus Kurs A). Wahrer Effekt: Zusätzliche Verbesserung durch den Intensivkurs (über die Semesterverbesserung hinaus). ρ (Pre-Post-Korr.): Je näher an 1, desto stärker stimmen beide Methoden überein. Szenarien: Vier voreingestellte Situationen, die verschiedene Aspekte des Paradoxons zeigen.

Lege Artis: Wann welches Werkzeug?

RCT: ANCOVA ist vorzuziehen (höhere Power, zufällige Baseline-Differenzen werden korrigiert). Observationsstudie: Die Wahl hängt vom Estimanden ab — welche kausale Frage soll beantwortet werden? Ein DAG ist nötig. Beide Methoden können legitim sein — für verschiedene Fragen.

Literatur

Lord, F. M. (1967). A paradox in the interpretation of group comparisons. Psychological Bulletin, 68(5), 304–305.
Vickers, A. J. & Altman, D. G. (2001). Statistics notes: Analysing controlled trials with baseline and follow up measurements. BMJ, 323(7321), 1123–1124.
Senn, S. (2006). Change from baseline and analysis of covariance revisited. Statistics in Medicine, 25(24), 4334–4344.
Pearl, J. (2016). Lord's Paradox Revisited – (Oh Lord! Kumbaya!). Journal of Causal Inference, 4(2).

📋 Beispiel — Förderprogramm-Studie, Mathematikunterricht
Zwei Kurse an einer Universität: 100 Studierende in Kurs A (Standard) und 100 in Kurs B (Intensiv). Kurs B Studierende starten mit im Schnitt 10 Punkte Vorsprung. Beide Kurse verbessern sich um ca. gleich viel — und dennoch liefern zwei Analysen verschiedene Antworten.
Ergebnisse der zwei Analysen
Differenzwert-Analyse
δDiff = Δ̄B − Δ̄A · t-Test
ΔA̅ =   ΔB̅ =
δDiff =
t(—) = —, p = —
ANCOVA
Post ~ Prä + Kurs · Regression
bw =   δANC =
SE =
t(—) = —, p = —
Visualisierung
Mathematischer Zusammenhang
Beide Methoden schätzen denselben Gruppenunterschied — nur auf unterschiedliche Weise berechnet (Schritt ). Der Trick: man kann δANCOVA algebraisch als δDiff plus einen Korrekturterm schreiben (Schritt ) — das erklärt exakt, wie groß die Kluft zwischen beiden ist und wovon sie abhängt (Schritt ). Die vollständige Herleitung steht in der Hilfe.
Die zwei Analysen — beide für sich genommen
δDiff = ΔB ΔA  wobei Δ = mean(Post − Prä) je Kurs
δANCOVA = (ȳpost,B − ȳpost,A) − bw · Δbase
Ineinander umgeformt — warum sie divergieren
δANCOVA = δDiff + (1 − bw ) · Δbase
= + (1 − ) · =
→ Die zwei Methoden weichen hier um Punkte voneinander ab — das ist die Größe des Paradoxons für die aktuelle Einstellung.
Die zwei Zutaten des Korrekturterms
δDiff Differenz der mittl. Veränderungen: ΔB − ΔA
δANCOVA Gruppenkoeff. aus Post ~ Prä + Kurs
bw Within-group Steigung Post auf Prä — hier ≈ ρ, da σpost ≈ σpre (Details in der Hilfe)
Δbase Ausgangsniveauunterschied: ȳpre,B − ȳpre,A
Der Korrekturterm (1 − bw) · Δbase verschwindet nur, wenn einer seiner beiden Faktoren null wird: bw = 1 (keine Regression zur Mitte) oder Δbase = 0 (keine Baseline-Differenz). Im RCT gilt Letzteres näherungsweise per Randomisierung — deshalb stimmen dort beide Methoden meist überein.
Zwei Fragen — Zwei Antworten
Differenzwert fragt:
„Hat sich Kurs B im Schnitt stärker verbessert als Kurs A?"

Schätzt den Unterschied in den mittleren Veränderungen: ΔB̄ − ΔĀ.

Die Frage ist marginal: Sie vergleicht Gruppenmittelwerte — ohne auf das Ausgangsniveau zu konditionieren. Individuelle Unterschiede im Startpunkt werden implizit durch die Differenzbildung herausgekürzt.
ANCOVA fragt:
„Bei gleichem Ausgangsniveau — schneidet Kurs B am Ende besser ab?"

Schätzt den Gruppenunterschied bei fixiertem Prä-Wert: E[Post|Kurs=B, Prä=y] − E[Post|Kurs=A, Prä=y].

Die Frage ist konditional: Sie vergleicht Personen mit identischem Startwert. Das ist sinnvoll, wenn man wissen will, ob der Kurs innerhalb einer Leistungsebene einen Unterschied macht.
DAG — Kausale Struktur
ρ δ (Effekt) Selektion? (obs. Studie) Kurs G Prä-Test Y0 Post-Test Y1 Fähigkeit U (latent, unbeob.) Treatment ANCOVA: adjustiert Outcome
Grüner Bogen (G → Y1): kausaler Effekt δ des Kurses auf das Prüfungsergebnis.   Blauer Pfeil (Y0 → Y1): Regression zur Mitte (Stärke ρ).   Grau gestrichelt: latente Fähigkeit U beeinflusst beide Messzeitpunkte.   Rot gestrichelt (G → Y0): In Observationsstudien wählen stärkere Studierende den Intensivkurs — dieser Pfeil fehlt im RCT.
Lege Artis: Wann welches Werkzeug?
ANCOVA — bevorzugen wenn:
Randomisiertes Experiment (RCT) — Baseline-Unterschiede sind zufällig; ANCOVA erhöht die statistische Power deutlich, ohne Bias einzuführen. Es ist der moderne Standard (Vickers & Altman, 2001, EMA Guidelines).

Observationsstudie mit klar definiertem Confounder — wenn Y₀ (Prä) als einzige relevante Kovariate gilt und G nicht durch Y₀ verursacht wird (d.h. G ⊥ Y₀ | U im DAG).

Die Frage lautet: „Was wäre der Effekt, wenn wir gleiche Startbedingungen hätten?"
Differenzwert — bevorzugen wenn:
Gruppen sind durch ihr Ausgangsniveau definiert — z.B. „leistungsstarke vs. leistungsschwache Studierende". Hier ist der Prä-Wert das gruppendefinierende Merkmal. ANCOVA würde auf genau dieses Merkmal adjustieren und damit den Gruppenunterschied, der die Intervention erst motiviert, herausrechnen — das ist logisch zirkulär.

Individuelle Veränderung ist das Interessante — wenn man wissen will, ob eine Person oder Gruppe sich entwickelt hat, unabhängig vom Startpunkt.

U (Fähigkeit) ist der Hauptconfounder — Differenzwerte eliminieren zeitstabile Confunder implizit (fixed-effects-Logik).
Modernes Fazit (Pearl, 2016, Senn, 2006): Lord's Paradox ist kein Fehler — es ist ein Spiegel. Die beiden Methoden beantworten verschiedene kausale Fragen. Lege artis heute: Kausale Frage zuerst präzisieren, DAG zeichnen, dann Methode wählen. In RCTs ist ANCOVA fast immer vorzuziehen. In Observationsstudien hängt die Antwort vom Estimanden ab.
Konzepte
Frederic Lord (1967) zeigte, dass zwei Statistiker mit demselben Datensatz — beide korrekt rechnend — zu entgegengesetzten Schlüssen kommen können. Statistiker A nutzt Differenzwerte und findet keinen Gruppeneffekt. Statistiker B nutzt ANCOVA und findet einen signifikanten Effekt. Beide liegen richtig — weil sie verschiedene Fragen beantworten.
Der Mechanismus hinter dem Paradox ist Regression zur Mitte: Wer beim Prä-Test extrem hoch oder niedrig war, bewegt sich beim Post-Test in Richtung des Gruppenmittels. Kurs B hat ein höheres Mittel — seine Mitglieder regredieren zu einem anderen Zentrum als Kurs A. ANCOVA „sieht" diesen Unterschied bei fixiertem Prä-Wert; Differenzwerte nicht.
Der Estimand entscheidet
Ein Estimand ist die präzise Definition der Größe, die geschätzt werden soll. ATE (Average Treatment Effect) fragt nach der durchschnittlichen Wirkung in der Population — Differenzwerte kommen dem nahe. CATE (Conditional ATE) fragt nach der Wirkung bei fixiertem Y₀ — ANCOVA schätzt genau das. Ohne vorab definierten Estimanden ist die Methodenwahl willkürlich.
RCT: ANCOVA fast immer besser
Bei randomisierten Experimenten ist ANCOVA dem bloßen t-Test auf Differenzwerte statistisch überlegen: Es reduziert den Restfehler durch Aufklärung von Varianz durch den Prä-Wert. Die geschätzten Gruppenunterschiede sind unverzerrt und präziser. Vickers & Altman (2001, BMJ) empfehlen ANCOVA als Standard für klinische Trials. Differenzwerte sind nur dann gleichwertig, wenn ρ = 1 oder keine Baseline-Varianz existiert.
Observationsstudien: DAG zuerst
In Beobachtungsstudien kann ANCOVA auf Y₀ (Prä) kontraproduktiv sein: Wenn Y₀ ein Mediator des G-Effekts ist (G → Y₀ → Y₁), adjustieren wir auf dem Kausalweg und unterschätzen den Effekt. Wenn Y₀ ein Collider ist (G → Y₀ ← U → Y₁), öffnen wir durch Adjustierung einen Backdoor-Pfad. Ein DAG klärt, welcher Fall vorliegt.
δDiff kennst du schon — aus anderen Tools
Fasst man Prä/Post als zwei Zeitpunkte und Kurs A/B als Kontroll-/Treatmentgruppe auf, ist δDiff exakt der Difference-in-Differences-Schätzer. Ebenso ist es der Interaktionskoeffizient Gruppe×Zeit in einer 2×2-Messwiederholungs-ANOVA — und der Regressionskoeffizient einer dummy-kodierten Gruppenvariable in einer Regression von (Post − Prä) auf Kurs. Drei Namen für dieselbe Zahl, je nach Fachrichtung.

→ Difference-in-Differences · → ANOVA (Dummy- vs. Effektkodierung)