J=5 Schulklassen (Farben), n_j=10 Schüler, X = Lernzeit, Y = Klausurpunkte. Die Regressionsgeraden sind zunächst ausgeblendet — aktivieren Sie die Pooling-Modi einzeln (Reiter „Steuerung"), um sie einzublenden: zuerst einen allein, dann im Vergleich.
Complete Pooling (rot, gestrichelt) → aktivieren
Eine globale OLS-Gerade durch alle N=50 Datenpunkte. Gruppenstruktur wird vollständig ignoriert. Vorteil: einfach. Problem: Standardfehler werden unterschätzt, weil Beobachtungen innerhalb einer Klasse nicht unabhängig sind.
No Pooling (Gruppenfarben, gepunktet) → aktivieren
Jede Klasse bekommt eine eigene Regressionsgerade. In der Praxis: ein Modell mit Gruppe × Prädiktor-Interaktion — bei J Gruppen entstehen so 2J Parameter (J Intercepts + J Slopes). Bei großem J wird das schnell unhandlich; kein Informationsaustausch zwischen Gruppen. Bei n_j=4 werden Schätzungen instabil.
Partial Pooling passiert zweimal — merken Sie sich das Prinzip, nicht zwei Methoden
Beide folgenden Modi sind Partial Pooling: eine Schätzung wird zu ihrem Gesamtmittel geschrumpft, gewichtet danach, wie viel eigene Evidenz die Gruppe hat (siehe Formel unten). Der einzige Unterschied ist, welche Schätzung geschrumpft wird — nur der Intercept, oder Intercept und Steigung zusammen. No Pooling liefert in beiden Fällen den ungeschrumpften Ausgangspunkt.
… nur Intercept (Gruppenfarben, durchgezogen) → aktivieren
Die Gruppen-Intercepts werden zur Grand Mean geschrumpft, aber alle Gruppen teilen denselben Slope γ₁₀ (Random Intercepts) — die Geraden sind daher parallel. Die blaue gestrichelte Gerade zeigt den Fixed Effect (γ₀₀ + γ₁₀·X). Korrekte Standardfehler, Informationsaustausch zwischen Gruppen.
… Intercept + Slope (Gruppenfarben, gestrichelt) → aktivieren
Zusätzlich zum Intercept wird jetzt auch die Steigung pro Gruppe geschrumpft (Random Slopes). Aktivieren Sie beide Modi gleichzeitig: dieselben (geschrumpften) Startpunkte, aber die Steigungen dürfen jetzt individuell abweichen. Dieses Modul startet mit denselben Populationsparametern wie Reiter ③ — dieselben Datenpunkte, dieselbe wahre Steigungsvarianz τ₁. Wechseln Sie zu Reiter ③, um τ₁ und die Intercept-Slope-Korrelation ρ frei zu verändern (das wirkt sich nur auf Reiter ③s eigene Anzeige aus, nicht rückwirkend auf diesen Reiter).
Was beobachten?
· Hohe ICC: CP- und NP-Geraden liegen weit auseinander. PP/RS liegen dazwischen.
· Kleine Gruppen: NP-Geraden schwanken stark, PP/RS-Geraden bleiben stabil.
· Simpson: CP-Gerade zeigt negativen Trend, NP/PP zeigen positiven Within-Effekt. Modul ④ erklärt warum.
Empirical Bayes Shrinkage — die Mathe dahinter
Der Partial-Pooling-Intercept der Gruppe j ist ein gewichtetes Mittel aus No-Pooling-Schätzwert und Grand Mean: α̂_jPP = λ_j · α̂_jNP + (1–λ_j) · γ̂₀₀, wobei der Shrinkage-Faktor λ_j = τ₀² / (τ₀² + σ²/n_j) ist. λ → 1 (kein Shrinkage): große Gruppen (n_j↑) oder starke Zwischen-Varianz (τ₀²↑) — die Gruppe hat genug eigene Evidenz. λ → 0 (starkes Shrinkage): kleine Gruppen oder dominante Within-Varianz — der Prior (Grand Mean) dominiert.
Caterpillar-Plot (oben): jede Klasse ein Punkt (◆ = Partial Pooling, ○ = No Pooling) mit 95%-KI, gestrichelte Linie = γ̂₀₀. Shrinkage-Diagramm (unten): Pfeile zeigen die Verschiebung NP → PP. Schieben Sie τ₀, σ und n_j (Reiter „Steuerung"), um den Effekt live zu beobachten.
Caterpillar-Plot (oben)
Jede Klasse hat einen Punkt (◆ = Partial Pooling, ○ = No Pooling) und ein 95%-KI. Die gestrichelte Linie ist γ̂₀₀ (Grand Mean). Beobachten Sie: PP-Punkte liegen immer näher an der gestrichelten Linie als NP-Punkte — das ist Shrinkage.
Shrinkage-Diagramm (unten)
Pfeile zeigen die Verschiebung NP → PP. Der Faktor λ steht am Pfeil: λ = 1.0 bedeutet kein Shrinkage (Klasse hat genug eigene Evidenz), λ = 0.2 bedeutet starkes Shrinkage (Grand Mean dominiert). Achtung: λ ist bei gleich großen Klassen für alle identisch — trotzdem sehen die Pfeile unterschiedlich lang aus. Das liegt daran, dass λ nur den Anteil der Schrumpfung festlegt (aPP = λ·aNP + (1−λ)·γ̂₀₀); die absolute Pfeillänge hängt zusätzlich davon ab, wie weit der rohe NP-Wert überhaupt von γ̂₀₀ entfernt lag. Eine Klasse mit extremem NP-Wert (wie K3) wird um denselben Anteil, aber in absoluten Punkten deutlich stärker gezogen als eine Klasse nahe am Mittel.
Schieber τ₀ (Zwischen-SD)
Erhöhen Sie τ₀: Klassen unterscheiden sich stärker → ICC steigt → λ steigt → weniger Shrinkage. Schätzer „vertrauen" der Gruppenstruktur.
Schieber σ (Within-SD)
Erhöhen Sie σ: mehr Rauschen innerhalb der Klassen → ICC sinkt → λ sinkt → mehr Shrinkage. Die gruppenspezifische Information ist weniger zuverlässig.
Schieber n_j
Große Gruppen (n_j = 30): λ ≈ 1, kein Shrinkage nötig. Kleine Gruppen (n_j = 3): λ klein, starkes Shrinkage. Ein Kernvorteil von LMM: Es passt sich automatisch an die verfügbare Datenmenge pro Gruppe an.
ICC-Daumenregeln
ICC < 0.05: Gruppenstruktur vernachlässigbar. · ICC 0.05–0.20: Moderate Cluster-Effekte, LMM empfohlen. · ICC > 0.20: Starke Effekte, LMM zwingend. Bildungskontext: typisch ICC ≈ 0.10–0.20.
Farbig durchgezogen = gruppenspezifische Random-Slopes-Schätzung (geschrumpft, dasselbe Modell wie Reiter ① im Modus „Intercept+Slope"). Graue gestrichelte Gerade = Fixed Slope über alle Punkte. Über den Button darunter lassen sich zusätzlich die rohen (ungeschrumpften) NP-Geraden einblenden. Schieben Sie τ₁ und ρ (Reiter „Steuerung"), um Steigungsvariabilität, Intercept-Slope-Korrelation und den Shrinkage-Effekt live zu erkunden.
Was Sie sehen im Detail
Farbig durchgezogen = gruppenspezifische Random-Slopes-Schätzung nach Shrinkage — exakt dieselbe Schätzung, die Reiter ① im Modus „Intercept+Slope" für die dort synchronisierten Default-Daten zeigt. Graue gestrichelte Gerade = der geschätzte Fixed Slope (OLS über alle Punkte, N=J·n_j) — eine gute Annäherung an den wahren Wert γ₁₀, weil sie viel mehr Beobachtungen nutzt als jede einzelne farbige Gerade. Über den Button unter dem Diagramm lassen sich zusätzlich die rohen NP-Geraden einblenden (eine pro Klasse, ungeschrumpft, geschätzt nur aus den n_j Beobachtungen dieser Klasse) — im Vergleich wird sichtbar, wie stark die durchgezogenen Geraden zurück zu γ₁₀ gezogen wurden. Bei τ₁=0 sind die wahren Steigungen aller Klassen identisch — die rohen NP-Geraden können trotzdem leicht unterschiedlich aussehen, weil jede einzelne nur aus n_j=10 verrauschten Beobachtungen geschätzt wird (reines Stichprobenrauschen, keine echte Heterogenität). Genau das ist der Grund für Random-Slopes-Shrinkage: Sie zieht diese zufällig verrauschten NP-Steigungen zurück zu γ₁₀, statt sie für bare Münze zu nehmen — je kleiner τ₁ relativ zum Rauschen, desto stärker weicht die geschrumpfte Gerade von der rohen NP-Geraden ab, in Richtung des Fixed Slope.
Schieber τ₁ (Steigungsvarianz)
τ₁=0: Alle Klassen profitieren gleich von Lernzeit — Random Intercepts genügt.
τ₁>0: Die Steigungen fächern auf (Fan-out oder -in). Inhaltliche Frage: Ist der Lernzeit-Effekt in manchen Klassen stärker als in anderen?
Schieber ρ (Intercept-Slope-Korrelation)
ρ>0 (Fan-out): Klassen mit hohem Ausgangsniveau zeigen auch stärkeren Lernzeit-Effekt. Reichere Klassen werden reicher — Matthäus-Prinzip.
ρ<0 (Kompensation): Klassen mit niedrigem Ausgangsniveau profitieren stärker von Lernzeit — der Unterricht gleicht aus.
ρ=0: Steigung und Intercept variieren unabhängig.
Wann brauche ich Random Slopes?
Theoretisch: wenn der Prädiktor-Effekt nicht für alle Gruppen gleich sein sollte.
Statistisch: Modellvergleich via LRT oder LOOIC. Aber: Random-Slope-Modelle brauchen mehr Daten (bes. große n_j) und können numerisch instabil sein. Im Zweifel: Random Intercepts as default.
Tipp: Uncorrelated RE (||)
Wenn ρ schwer identifizierbar ist (kleine J), können Sie Intercept- und Slope-Random-Effects entkoppeln. In lme4: (1 + X || Klasse). In brms: (1 | Klasse) + (0 + X | Klasse). Das reduziert Parameter und verbessert Konvergenz.
R-Code (lme4 / brms)
Random Intercepts: lmer(Y ~ X + (1 | Klasse), data=df)
Random Slopes (korreliert): lmer(Y ~ X + (1 + X | Klasse), data=df)
Unkorreliert (||): lmer(Y ~ X + (1 + X || Klasse), data=df)
Bayesianisch: brm(Y ~ X + (1 + X | Klasse), family=gaussian(), data=df)
5 Klassen (Farben). Innerhalb jeder Klasse: positiver Trend (β_W > 0). Zwischen den Klassen: negativer Trend (β_B < 0) — die gestrichelte OLS-Linie sieht nur den negativen Between-Trend und schätzt β < 0. Schieben Sie β_W, β_B und den Gruppen-Abstand (Reiter „Steuerung"), um den Vorzeichen-Flip live zu erkunden.
Wie entsteht das Paradox?
OLS vermischt zwei verschiedene Effekte: den Within-Gruppen-Effekt (interessant!) und den Between-Gruppen-Effekt (konfundiert!). Wenn der Between-Effekt das Vorzeichen dominiert und Between-Varianz in X groß ist, kehrt sich das Vorzeichen um.
Wie löst LMM das Problem?
Der Fixed Slope γ₁₀ im LMM schätzt den Within-Effekt — kontrolliert für die Gruppen-Intercepts. Das ist genau der kausal relevante Effekt: „Wenn ein Schüler in derselben Klasse eine Stunde mehr lernt, was ändert sich dann?"
Schieber erkunden
· β_B → 0: Kein Between-Konfunding, OLS und Within stimmen überein.
· Gruppen-Abstand ↓: Klassen überlappen in X, Between-Varianz sinkt → weniger Simpson-Effekt.
· β_W → negativ: Auch der Within-Effekt negativ — kein Paradox mehr, nur schlechte Lernzeit-Wirkung.
Verbindung zu Fixed Effects
In der Ökonometrie: Fixed-Effects-Modell (within-group demeaning) schätzt ebenfalls nur Within-Effekte. LMM (Partial Pooling) liegt dazwischen: berücksichtigt Within-Effekte, erlaubt aber auch Level-2-Prädiktoren (Between-Effekte explizit modellieren).
Referenzlinie "Fixed Effect / Grand Mean"
Aktivieren Sie die Linie unter den Szenarien, um den korrekt spezifizierten Within-Effekt (Steigung β_W, verankert am Gesamtmittelwert) direkt neben der irreführenden OLS-gesamt-Linie zu sehen — der Kontrast, um den es hier eigentlich geht: OLS gesamt in diesem Plot ist Complete Pooling (dieselbe globale Gerade, ignoriert die Gruppenstruktur vollständig), nur unter anderem Namen.
Historische Beispiele
UC-Berkeley (1973): Frauen hatten aggregiert niedrigere Aufnahmequoten. Stratifiziert nach Fach: in den meisten Fächern gleich oder besser. Frauen bewarben sich häufiger für kompetitive Fächer.
Nierenstein-Behandlung: Behandlung A sieht schlechter aus als B. Stratifiziert nach Steingröße: A ist in beiden Gruppen besser. B wurde für einfachere Fälle bevorzugt — Confounding by indication.
20 Klassen, sortiert nach Gruppengröße (x-Achse). Grauer Kreis = wahrer Mittelwert (nur hier bekannt, weil simuliert). Oranger Kreis = No Pooling. Blauer Punkt = Partial Pooling (geschrumpft). Links (kleine n) streuen die orangen Punkte viel weiter — eine klassische „Funnel"-Form.
Was Sie sehen im Detail
20 Klassen, sortiert nach Gruppengröße (x-Achse). Grauer Kreis = wahrer Mittelwert (nur hier bekannt, weil simuliert). Oranger Kreis = No Pooling (roher Klassenmittelwert). Blauer Punkt = Partial Pooling (geschrumpft). Die gepunktete Linie verbindet No Pooling und Partial Pooling derselben Klasse.
Der Trichter
Links (kleine n) streuen die orangen No-Pooling-Punkte viel weiter um γ̂ als rechts (große n) — eine klassische "Funnel"-Form. Das liegt einzig an der Stichprobengröße: derselbe wahre Unterschied τ erzeugt bei kleinem n_j eine viel größere Schätzunsicherheit (SE = σ/√n_j).
Die Pointe
Die blauen Partial-Pooling-Punkte liegen im Schnitt näher am grauen wahren Wert als die orangen No-Pooling-Punkte — besonders links, bei kleinem n. Das ist keine Behauptung, sondern direkt nachrechenbar: siehe "Ø Fehler" links unten, oder klicken Sie "500 Simulationen" für den Beweis über viele Wiederholungen hinweg.
Schieber
· τ (wahre SD) ↓: Klassen unterscheiden sich in Wahrheit kaum → jede Abweichung ist eher Rauschen → mehr Shrinkage lohnt sich.
· σ (Rauschen) ↑: Einzelmessungen werden unzuverlässiger → Shrinkage nimmt bei allen Gruppen zu, bei kleinen am stärksten.
Gelmans Argument
Andrew Gelman verwendet dieses Muster u. a. am Beispiel von Nierenkrebsraten pro US-Landkreis: Landkreise mit den höchsten Raten sind fast immer dünn besiedelt — aber Landkreise mit den niedrigsten Raten sind es ebenfalls. Das ist kein inhaltlicher Widerspruch, sondern reines Stichprobenrauschen: kleine Landkreise (kleines n) haben schlicht die größte Schätzvarianz und produzieren dadurch überproportional oft beide Extreme. Dieselbe Logik gilt für kleine Schulklassen, kleine Filialen, kurze Baseball-Saisons usw. Partial Pooling nutzt diese Erkenntnis aktiv: extreme Schätzungen aus kleinen Gruppen werden stärker zur Grand Mean gezogen, weil sie a priori am unplausibelsten sind. Referenz: Gelman & Hill (2007), Data Analysis Using Regression and Multilevel/Hierarchical Models, Kap. 12. Genau dieses "Rekord-Gemeinden sind winzig"-Muster — unabhängig von Partial Pooling, rein als Wahrscheinlichkeits-Phänomen — wird in einem eigenen Tool vertieft: → Gesetz der kleinen Zahlen.
ICC = τ₀² / (τ₀² + σ²). ICC = 0 bedeutet Gruppen sind nicht ähnlicher als Zufallsstichproben — OLS reicht. ICC > 0.10–0.20 bedeutet starke Clusterstruktur: Individuen innerhalb einer Gruppe sind einander ähnlicher. Dann führt OLS zu zu kleinen Standardfehlern und falschen Inferenzen. Faustregel: ab ICC > 0.05 LMM erwägen; ab ICC > 0.10 LMM zwingend.
lmer(Y ~ X + (1 + X | Gruppe), data = df). Bei kleinem J und kleinem n_j kann ρ schlecht identifiziert sein → || Syntax testen.
lmer(Y ~ X + (1 | Gruppe), data = df).lmer(Y ~ X + (1 + X | Gruppe), data = df).brm(Y ~ X + (1 | Gruppe), family = gaussian(), data = df).summary() zeigt Fixed Effects (γ₀₀, γ₁₀) und Random Effects (τ₀, σ). ICC mit performance::icc(model). Modellvergleich: anova(m_ri, m_rs) oder loo_compare(). Conditional R²: r2_nakagawa() aus dem performance-Paket.
Das Multilevel-Modell-Tool erklärt Linear Mixed Models (LMM) für hierarchisch strukturierte Daten. Beispiel: J=5 Schulklassen mit je n_j=10 Schülern, X=Lernzeit, Y=Klausurpunkte. Fünf interaktive Module führen von der Pooling-Frage über Shrinkage und Random Slopes bis zum Simpson-Paradoxon und der Frage, wann Shrinkage die Vorhersage tatsächlich verbessert.
Dieses Tool nutzt einfache Momentenschätzer (nicht REML / ML). Der Within-Slope γ₁₀ ist das nach Sxx gewichtete Mittel der gruppenspezifischen OLS-Steigungen. Die Residualvarianz σ² wird aus den Residuen zur gemeinsamen Steigung berechnet. τ₀² = max(0, Var(NP-Intercepts) − σ²/n_j). Diese Schätzer sind konsistent, aber weniger effizient als REML — für Lehrzwecke ausreichend.
Gelman, A. & Hill, J. (2007). Data Analysis Using Regression and Multilevel/Hierarchical Models. Cambridge University Press.
Hox, J. J., Moerbeek, M. & van de Schoot, R. (2018). Multilevel Analysis: Techniques and Applications (3. Aufl.). Routledge.
West, B. T., Welch, K. B. & Galecki, A. T. (2022). Linear Mixed Models: A Practical Guide Using Statistical Software (3. Aufl.). Chapman & Hall/CRC.