Multilevel & Mixed Models

Dr. R. Düsing · Universität Osnabrück
N = 50 Schüler:innen J = 5 Klassen (n_j = 10) X = Lernzeit (h/Woche) Y = Klausurleistung
Seed: —
Warum Multilevel? — Complete, No & Partial Pooling
Reicht eine gemeinsame Gerade über alle 50 Schüler:innen — Complete Pooling? Oder muss jede Klasse streng separat betrachtet werden — No Pooling? Oder ein Mittelweg — Partial Pooling?
Daten nach Klasse & Regressionsgeraden
Szenarien
Pooling-Modus (de/aktivieren)
Zwei Extreme ohne Shrinkage:
Partial Pooling (LMM) — dieselbe Schrumpfung, zwei Varianten je nachdem, was geschrumpft wird:
Varianzzerlegung
Zwischen 30%
Innerhalb 70%
ICC = τ₀ = · σ =
γ₀₀
γ₁₀ (Fixed Slope)
τ₀² (Between)
σ² (Within)
LMM — Random Intercepts
Yij = γ₀₀ + γ₁₀·Xij + u0j + εij
u0j ~ N(0,τ₀²)  ·  εij ~ N(0,σ²)
Was Sie sehen

J=5 Schulklassen (Farben), n_j=10 Schüler, X = Lernzeit, Y = Klausurpunkte. Die Regressionsgeraden sind zunächst ausgeblendet — aktivieren Sie die Pooling-Modi einzeln (Reiter „Steuerung"), um sie einzublenden: zuerst einen allein, dann im Vergleich.

▸ Mehr erklären

Complete Pooling (rot, gestrichelt) → aktivieren
Eine globale OLS-Gerade durch alle N=50 Datenpunkte. Gruppenstruktur wird vollständig ignoriert. Vorteil: einfach. Problem: Standard­fehler werden unterschätzt, weil Beobachtungen innerhalb einer Klasse nicht unabhängig sind.

No Pooling (Gruppen­farben, gepunktet) → aktivieren
Jede Klasse bekommt eine eigene Regressionsgerade. In der Praxis: ein Modell mit Gruppe × Prädiktor-Interaktion — bei J Gruppen entstehen so 2J Parameter (J Intercepts + J Slopes). Bei großem J wird das schnell unhandlich; kein Informationsaustausch zwischen Gruppen. Bei n_j=4 werden Schätzungen instabil.

Partial Pooling passiert zweimal — merken Sie sich das Prinzip, nicht zwei Methoden
Beide folgenden Modi sind Partial Pooling: eine Schätzung wird zu ihrem Gesamtmittel geschrumpft, gewichtet danach, wie viel eigene Evidenz die Gruppe hat (siehe Formel unten). Der einzige Unterschied ist, welche Schätzung geschrumpft wird — nur der Intercept, oder Intercept und Steigung zusammen. No Pooling liefert in beiden Fällen den ungeschrumpften Ausgangspunkt.

… nur Intercept (Gruppen­farben, durchgezogen) → aktivieren
Die Gruppen-Intercepts werden zur Grand Mean geschrumpft, aber alle Gruppen teilen denselben Slope γ₁₀ (Random Intercepts) — die Geraden sind daher parallel. Die blaue gestrichelte Gerade zeigt den Fixed Effect (γ₀₀ + γ₁₀·X). Korrekte Standard­fehler, Informations­austausch zwischen Gruppen.

… Intercept + Slope (Gruppen­farben, gestrichelt) → aktivieren
Zusätzlich zum Intercept wird jetzt auch die Steigung pro Gruppe geschrumpft (Random Slopes). Aktivieren Sie beide Modi gleichzeitig: dieselben (geschrumpften) Startpunkte, aber die Steigungen dürfen jetzt individuell abweichen. Dieses Modul startet mit denselben Populationsparametern wie Reiter — dieselben Datenpunkte, dieselbe wahre Steigungsvarianz τ₁. Wechseln Sie zu Reiter , um τ₁ und die Intercept-Slope-Korrelation ρ frei zu verändern (das wirkt sich nur auf Reiter ③s eigene Anzeige aus, nicht rückwirkend auf diesen Reiter).

Was beobachten?
· Hohe ICC: CP- und NP-Geraden liegen weit auseinander. PP/RS liegen dazwischen.
· Kleine Gruppen: NP-Geraden schwanken stark, PP/RS-Geraden bleiben stabil.
· Simpson: CP-Gerade zeigt negativen Trend, NP/PP zeigen positiven Within-Effekt. Modul ④ erklärt warum.

Empirical Bayes Shrinkage — die Mathe dahinter
Der Partial-Pooling-Intercept der Gruppe j ist ein gewichtetes Mittel aus No-Pooling-Schätzwert und Grand Mean: α̂_jPP = λ_j · α̂_jNP + (1–λ_j) · γ̂₀₀, wobei der Shrinkage-Faktor λ_j = τ₀² / (τ₀² + σ²/n_j) ist. λ → 1 (kein Shrinkage): große Gruppen (n_j↑) oder starke Zwischen-Varianz (τ₀²↑) — die Gruppe hat genug eigene Evidenz. λ → 0 (starkes Shrinkage): kleine Gruppen oder dominante Within-Varianz — der Prior (Grand Mean) dominiert.

Wie stark werden Gruppen-Intercepts zur Grand Mean gezogen? Schieben Sie τ₀ und σ und beobachten Sie den Effekt live.
Caterpillar-Plot — Gruppen-Intercepts (95% CI)
Shrinkage: No Pooling → Partial Pooling
Zwischen-SD τ₀ 8.0
Innerhalb-SD σ 8.0
Gruppen-Größe n_j 10
ICC = τ₀² / (τ₀² + σ²)
Zwischen 50%
Innerhalb 50%
ICC = λ̄ =
ICC
λ (Shrinkage-Faktor)
Max. Shrinkage
Ø |NP – PP|
Shrinkage-Formel
λ_j = τ₀² / (τ₀² + σ²/n_j)
α̂_jPP = λ_j·α̂_jNP + (1–λ_j)·γ̂₀₀
Was Sie sehen

Caterpillar-Plot (oben): jede Klasse ein Punkt (◆ = Partial Pooling, ○ = No Pooling) mit 95%-KI, gestrichelte Linie = γ̂₀₀. Shrinkage-Diagramm (unten): Pfeile zeigen die Verschiebung NP → PP. Schieben Sie τ₀, σ und n_j (Reiter „Steuerung"), um den Effekt live zu beobachten.

▸ Mehr erklären

Caterpillar-Plot (oben)
Jede Klasse hat einen Punkt (◆ = Partial Pooling, ○ = No Pooling) und ein 95%-KI. Die gestrichelte Linie ist γ̂₀₀ (Grand Mean). Beobachten Sie: PP-Punkte liegen immer näher an der gestrichelten Linie als NP-Punkte — das ist Shrinkage.

Shrinkage-Diagramm (unten)
Pfeile zeigen die Verschiebung NP → PP. Der Faktor λ steht am Pfeil: λ = 1.0 bedeutet kein Shrinkage (Klasse hat genug eigene Evidenz), λ = 0.2 bedeutet starkes Shrinkage (Grand Mean dominiert). Achtung: λ ist bei gleich großen Klassen für alle identisch — trotzdem sehen die Pfeile unterschiedlich lang aus. Das liegt daran, dass λ nur den Anteil der Schrumpfung festlegt (aPP = λ·aNP + (1−λ)·γ̂₀₀); die absolute Pfeillänge hängt zusätzlich davon ab, wie weit der rohe NP-Wert überhaupt von γ̂₀₀ entfernt lag. Eine Klasse mit extremem NP-Wert (wie K3) wird um denselben Anteil, aber in absoluten Punkten deutlich stärker gezogen als eine Klasse nahe am Mittel.

Schieber τ₀ (Zwischen-SD)
Erhöhen Sie τ₀: Klassen unterscheiden sich stärker → ICC steigt → λ steigt → weniger Shrinkage. Schätzer „vertrauen" der Gruppenstruktur.

Schieber σ (Within-SD)
Erhöhen Sie σ: mehr Rauschen innerhalb der Klassen → ICC sinkt → λ sinkt → mehr Shrinkage. Die gruppenspezifische Information ist weniger zuverlässig.

Schieber n_j
Große Gruppen (n_j = 30): λ ≈ 1, kein Shrinkage nötig. Kleine Gruppen (n_j = 3): λ klein, starkes Shrinkage. Ein Kernvorteil von LMM: Es passt sich automatisch an die verfügbare Datenmenge pro Gruppe an.

ICC-Daumenregeln
ICC < 0.05: Gruppenstruktur vernachlässigbar. · ICC 0.05–0.20: Moderate Cluster-Effekte, LMM empfohlen. · ICC > 0.20: Starke Effekte, LMM zwingend. Bildungskontext: typisch ICC ≈ 0.10–0.20.

Random SlopesEffekt-Heterogenität zwischen Klassen
Hat Lernzeit in jeder Klasse denselben Effekt? τ₁ lässt Steigungen variieren, ρ kontrolliert die Intercept-Slope-Korrelation.
No-Pooling-Geraden (de/aktivieren)
Steigungsvar. τ₁ 1.5
Korrelation ρ 0.00
Fixed Slope γ₁₀ 3.0
γ₁₀ (Ø Steigung)
τ₁ (Slope-SD)
ρ(u₀,u₁)
Steigungsbereich (RS)
Random Intercepts + Slopes
Yij = (γ₀₀+u0j) + (γ₁₀+u1j)·X + ε
Σ = [[τ₀²,ρτ₀τ₁],[ρτ₀τ₁,τ₁²]]
Was Sie sehen

Farbig durchgezogen = gruppenspezifische Random-Slopes-Schätzung (geschrumpft, dasselbe Modell wie Reiter ① im Modus „Intercept+Slope"). Graue gestrichelte Gerade = Fixed Slope über alle Punkte. Über den Button darunter lassen sich zusätzlich die rohen (ungeschrumpften) NP-Geraden einblenden. Schieben Sie τ₁ und ρ (Reiter „Steuerung"), um Steigungsvariabilität, Intercept-Slope-Korrelation und den Shrinkage-Effekt live zu erkunden.

▸ Mehr erklären

Was Sie sehen im Detail
Farbig durchgezogen = gruppenspezifische Random-Slopes-Schätzung nach Shrinkage — exakt dieselbe Schätzung, die Reiter ① im Modus „Intercept+Slope" für die dort synchronisierten Default-Daten zeigt. Graue gestrichelte Gerade = der geschätzte Fixed Slope (OLS über alle Punkte, N=J·n_j) — eine gute Annäherung an den wahren Wert γ₁₀, weil sie viel mehr Beobachtungen nutzt als jede einzelne farbige Gerade. Über den Button unter dem Diagramm lassen sich zusätzlich die rohen NP-Geraden einblenden (eine pro Klasse, ungeschrumpft, geschätzt nur aus den n_j Beobachtungen dieser Klasse) — im Vergleich wird sichtbar, wie stark die durchgezogenen Geraden zurück zu γ₁₀ gezogen wurden. Bei τ₁=0 sind die wahren Steigungen aller Klassen identisch — die rohen NP-Geraden können trotzdem leicht unterschiedlich aussehen, weil jede einzelne nur aus n_j=10 verrauschten Beobachtungen geschätzt wird (reines Stichprobenrauschen, keine echte Heterogenität). Genau das ist der Grund für Random-Slopes-Shrinkage: Sie zieht diese zufällig verrauschten NP-Steigungen zurück zu γ₁₀, statt sie für bare Münze zu nehmen — je kleiner τ₁ relativ zum Rauschen, desto stärker weicht die geschrumpfte Gerade von der rohen NP-Geraden ab, in Richtung des Fixed Slope.

Schieber τ₁ (Steigungsvarianz)
τ₁=0: Alle Klassen profitieren gleich von Lernzeit — Random Intercepts genügt.
τ₁>0: Die Steigungen fächern auf (Fan-out oder -in). Inhaltliche Frage: Ist der Lernzeit-Effekt in manchen Klassen stärker als in anderen?

Schieber ρ (Intercept-Slope-Korrelation)
ρ>0 (Fan-out): Klassen mit hohem Ausgangsniveau zeigen auch stärkeren Lernzeit-Effekt. Reichere Klassen werden reicher — Matthäus-Prinzip.
ρ<0 (Kompensation): Klassen mit niedrigem Ausgangsniveau profitieren stärker von Lernzeit — der Unterricht gleicht aus.
ρ=0: Steigung und Intercept variieren unabhängig.

Wann brauche ich Random Slopes?
Theoretisch: wenn der Prädiktor-Effekt nicht für alle Gruppen gleich sein sollte.
Statistisch: Modellvergleich via LRT oder LOOIC. Aber: Random-Slope-Modelle brauchen mehr Daten (bes. große n_j) und können numerisch instabil sein. Im Zweifel: Random Intercepts as default.

Tipp: Uncorrelated RE (||)
Wenn ρ schwer identifizierbar ist (kleine J), können Sie Intercept- und Slope-Random-Effects entkoppeln. In lme4: (1 + X || Klasse). In brms: (1 | Klasse) + (0 + X | Klasse). Das reduziert Parameter und verbessert Konvergenz.

R-Code (lme4 / brms)
Random Intercepts: lmer(Y ~ X + (1 | Klasse), data=df)
Random Slopes (korreliert): lmer(Y ~ X + (1 + X | Klasse), data=df)
Unkorreliert (||): lmer(Y ~ X + (1 + X || Klasse), data=df)
Bayesianisch: brm(Y ~ X + (1 + X | Klasse), family=gaussian(), data=df)

Simpson-ParadoxonDer Aggregations-Fehler
Der gesamte OLS-Trend kann dem Within-Gruppen-Trend widersprechen — ein Klassiker der konfundierten Gruppenstruktur.
Within-Effekt (gepunktet) vs. OLS gesamt = Complete Pooling (gestrichelt)
Szenarien
Referenzlinie (de/aktivieren)
Within-Effekt β_W 3.0
Between-Offset β_B −6.0
Gruppen-Abstand 7.0
β OLS gesamt (= Complete Pooling)
β Within (Ø)
Vorzeichen-Flip
Zerlegung des OLS-Koeffizienten
β_OLS = β_W·w_W + β_B·w_B
w_W = Anteil Within-Varianz in X
β_OLS = −: obwohl β_W > 0 !
Was Sie sehen

5 Klassen (Farben). Innerhalb jeder Klasse: positiver Trend (β_W > 0). Zwischen den Klassen: negativer Trend (β_B < 0) — die gestrichelte OLS-Linie sieht nur den negativen Between-Trend und schätzt β < 0. Schieben Sie β_W, β_B und den Gruppen-Abstand (Reiter „Steuerung"), um den Vorzeichen-Flip live zu erkunden.

▸ Mehr erklären

Wie entsteht das Paradox?
OLS vermischt zwei verschiedene Effekte: den Within-Gruppen-Effekt (interessant!) und den Between-Gruppen-Effekt (konfundiert!). Wenn der Between-Effekt das Vorzeichen dominiert und Between-Varianz in X groß ist, kehrt sich das Vorzeichen um.

Wie löst LMM das Problem?
Der Fixed Slope γ₁₀ im LMM schätzt den Within-Effekt — kontrolliert für die Gruppen-Intercepts. Das ist genau der kausal relevante Effekt: „Wenn ein Schüler in derselben Klasse eine Stunde mehr lernt, was ändert sich dann?"

Schieber erkunden
· β_B → 0: Kein Between-Konfunding, OLS und Within stimmen überein.
· Gruppen-Abstand ↓: Klassen überlappen in X, Between-Varianz sinkt → weniger Simpson-Effekt.
· β_W → negativ: Auch der Within-Effekt negativ — kein Paradox mehr, nur schlechte Lernzeit-Wirkung.

Verbindung zu Fixed Effects
In der Ökonometrie: Fixed-Effects-Modell (within-group demeaning) schätzt ebenfalls nur Within-Effekte. LMM (Partial Pooling) liegt dazwischen: berücksichtigt Within-Effekte, erlaubt aber auch Level-2-Prädiktoren (Between-Effekte explizit modellieren).

Referenzlinie "Fixed Effect / Grand Mean"
Aktivieren Sie die Linie unter den Szenarien, um den korrekt spezifizierten Within-Effekt (Steigung β_W, verankert am Gesamtmittelwert) direkt neben der irreführenden OLS-gesamt-Linie zu sehen — der Kontrast, um den es hier eigentlich geht: OLS gesamt in diesem Plot ist Complete Pooling (dieselbe globale Gerade, ignoriert die Gruppenstruktur vollständig), nur unter anderem Namen.

Historische Beispiele
UC-Berkeley (1973): Frauen hatten aggregiert niedrigere Aufnahmequoten. Stratifiziert nach Fach: in den meisten Fächern gleich oder besser. Frauen bewarben sich häufiger für kompetitive Fächer.
Nierenstein-Behandlung: Behandlung A sieht schlechter aus als B. Stratifiziert nach Steingröße: A ist in beiden Gruppen besser. B wurde für einfachere Fälle bevorzugt — Confounding by indication.

Shrinkage Extrem — wann Pooling wirklich hilft
📋 Eigenständiges Beispiel — Shrinkage Extrem
20 Schulklassen unterschiedlicher Größe — von n_j=3 bis n_j=40 Schüler:innen — schreiben denselben Test. Eine kleine Klasse mit nur 3 Schüler:innen zeigt einen auffällig hohen (oder tiefen) Mittelwert. Ist das ein echter Unterschied — oder einfach Zufall, weil bei so wenigen Beobachtungen extreme Mittelwerte viel leichter vorkommen? Genau dieses Argument (u. a. bei Gelman & Hill, 2007, anhand von Baseball-Battingdurchschnitten und Krebsraten pro Landkreis illustriert) ist der Kern von Partial Pooling: kleine, extreme Schätzungen sind a priori unplausibler als moderate — deshalb werden sie stärker zum Gesamtmittel geschrumpft, was im Schnitt zu besseren Vorhersagen führt.
Schätzung nach Gruppengröße (Funnel-Plot)
Noch keine Wiederholungen gelaufen.
Wahre SD τ 8.0
Rauschen σ 15.0
Ø Fehler No Pooling
Ø Fehler Partial Pooling
…bei n≤6: No Pooling
…bei n≤6: Partial Pooling
τ̂² (geschätzt)
Empirical-Bayes-Schätzung des Gruppenmittels
ŷ_j = λ_j·ȳ_j + (1−λ_j)·γ̂
λ_j = τ̂² / (τ̂² + σ²/n_j) — dieselbe Formel wie in Modul ②, hier ohne Steigung, nur für Gruppenmittelwerte
Was Sie sehen

20 Klassen, sortiert nach Gruppengröße (x-Achse). Grauer Kreis = wahrer Mittelwert (nur hier bekannt, weil simuliert). Oranger Kreis = No Pooling. Blauer Punkt = Partial Pooling (geschrumpft). Links (kleine n) streuen die orangen Punkte viel weiter — eine klassische „Funnel"-Form.

▸ Mehr erklären

Was Sie sehen im Detail
20 Klassen, sortiert nach Gruppengröße (x-Achse). Grauer Kreis = wahrer Mittelwert (nur hier bekannt, weil simuliert). Oranger Kreis = No Pooling (roher Klassenmittelwert). Blauer Punkt = Partial Pooling (geschrumpft). Die gepunktete Linie verbindet No Pooling und Partial Pooling derselben Klasse.

Der Trichter
Links (kleine n) streuen die orangen No-Pooling-Punkte viel weiter um γ̂ als rechts (große n) — eine klassische "Funnel"-Form. Das liegt einzig an der Stichprobengröße: derselbe wahre Unterschied τ erzeugt bei kleinem n_j eine viel größere Schätzunsicherheit (SE = σ/√n_j).

Die Pointe
Die blauen Partial-Pooling-Punkte liegen im Schnitt näher am grauen wahren Wert als die orangen No-Pooling-Punkte — besonders links, bei kleinem n. Das ist keine Behauptung, sondern direkt nachrechenbar: siehe "Ø Fehler" links unten, oder klicken Sie "500 Simulationen" für den Beweis über viele Wiederholungen hinweg.

Schieber
· τ (wahre SD) ↓: Klassen unterscheiden sich in Wahrheit kaum → jede Abweichung ist eher Rauschen → mehr Shrinkage lohnt sich.
· σ (Rauschen) ↑: Einzelmessungen werden unzuverlässiger → Shrinkage nimmt bei allen Gruppen zu, bei kleinen am stärksten.

Gelmans Argument
Andrew Gelman verwendet dieses Muster u. a. am Beispiel von Nierenkrebsraten pro US-Landkreis: Landkreise mit den höchsten Raten sind fast immer dünn besiedelt — aber Landkreise mit den niedrigsten Raten sind es ebenfalls. Das ist kein inhaltlicher Widerspruch, sondern reines Stichprobenrauschen: kleine Landkreise (kleines n) haben schlicht die größte Schätzvarianz und produzieren dadurch überproportional oft beide Extreme. Dieselbe Logik gilt für kleine Schulklassen, kleine Filialen, kurze Baseball-Saisons usw. Partial Pooling nutzt diese Erkenntnis aktiv: extreme Schätzungen aus kleinen Gruppen werden stärker zur Grand Mean gezogen, weil sie a priori am unplausibelsten sind. Referenz: Gelman & Hill (2007), Data Analysis Using Regression and Multilevel/Hierarchical Models, Kap. 12. Genau dieses "Rekord-Gemeinden sind winzig"-Muster — unabhängig von Partial Pooling, rein als Wahrscheinlichkeits-Phänomen — wird in einem eigenen Tool vertieft: → Gesetz der kleinen Zahlen.

Lernkarten — Multilevel & Mixed Models
ICC — Intraklassen-Korrelation
Der ICC (Intraclass Correlation Coefficient) misst den Anteil der Gesamtvarianz, der zwischen den Gruppen liegt: ICC = τ₀² / (τ₀² + σ²). ICC = 0 bedeutet Gruppen sind nicht ähnlicher als Zufallsstichproben — OLS reicht. ICC > 0.10–0.20 bedeutet starke Clusterstruktur: Individuen innerhalb einer Gruppe sind einander ähnlicher. Dann führt OLS zu zu kleinen Standardfehlern und falschen Inferenzen. Faustregel: ab ICC > 0.05 LMM erwägen; ab ICC > 0.10 LMM zwingend.
Complete · No · Partial Pooling
Complete Pooling ignoriert Gruppen — eine globale OLS-Gerade, SE unterschätzt. No Pooling modelliert als Gruppe × Prädiktor-Interaktion (2J Parameter) — stabil nur bei großen n_j und kleinem J, kein Informationsaustausch. Partial Pooling (LMM) ist der Kompromiss: Gruppen-Intercepts (Random Intercepts) oder auch Slopes (Random Slopes) werden zur Grand Mean geschrumpft (Empirical Bayes). Stärke des Shrinkage: λ = τ₀²/(τ₀²+σ²/n_j). Kleine Gruppen werden stärker angepasst. Ergebnis: regularisierter Schätzer mit besserer Out-of-Sample-Vorhersage und korrekten SE.
Shrinkage & Empirical Bayes
Partial Pooling ist äquivalent zu Empirical Bayes: Gruppen-Intercepts werden als zufällig aus N(0,τ₀²) gezogen betrachtet. Shrinkage-Faktor λ_j = τ₀²/(τ₀²+σ²/n_j). Bei τ₀² ↑ oder n_j ↑ gilt λ → 1 (wenig Shrinkage). Bei kleinen Gruppen oder kleinem τ₀² gilt λ → 0 (starkes Shrinkage). Der Caterpillar-Plot zeigt geschrumpfte Intercepts mit KI. Gruppen weit vom Grand Mean entfernt haben breitere KI und weniger Shrinkage — weil sie mehr eigene Evidenz mitbringen.
Ein Random-Intercept-Modell nimmt an, dass alle Gruppen dieselbe Steigung haben. Random-Slope-Modelle erlauben, dass dieser Effekt variiert: τ₁ = SD der Steigungsverteilung. Der Korrelationsparameter ρ zwischen u₀j und u₁j ist inhaltlich wichtig: ρ > 0 (Fan-out) = hohe Gruppen profitieren mehr; ρ < 0 (Kompensation) = niedrige Gruppen profitieren mehr. In lme4: lmer(Y ~ X + (1 + X | Gruppe), data = df). Bei kleinem J und kleinem n_j kann ρ schlecht identifiziert sein → || Syntax testen.
Simpson-Paradoxon & Within/Between
Der aggregierte OLS-Schätzer mischt Within-Effekte (kausal interessant) mit Between-Effekten (oft konfundiert). Das Simpson-Paradoxon entsteht, wenn beide Effekte gegensätzliche Vorzeichen haben und Between-Varianz in X dominiert. LMM schätzt im Fixed Slope γ₁₀ den Within-Effekt, bereinigt von Gruppenunterschieden. Historische Beispiele: UC-Berkeley-Aufnahme (1973), Nierenstein-Behandlung. Wer nur OLS nutzt, zieht ggf. kausal falsche Schlüsse.
Modellformel & R-Syntax
Random Intercepts: lmer(Y ~ X + (1 | Gruppe), data = df).
Random Slopes: lmer(Y ~ X + (1 + X | Gruppe), data = df).
Bayesianisch (brms): brm(Y ~ X + (1 | Gruppe), family = gaussian(), data = df).
summary() zeigt Fixed Effects (γ₀₀, γ₁₀) und Random Effects (τ₀, σ). ICC mit performance::icc(model). Modellvergleich: anova(m_ri, m_rs) oder loo_compare(). Conditional R²: r2_nakagawa() aus dem performance-Paket.
Shrinkage als Prognoseverbesserung
Der eigentliche Nutzen von Partial Pooling ist keine ästhetische Präferenz, sondern messbar bessere Out-of-Sample-Vorhersage: Weil kleine Gruppen extreme Schätzungen mit hoher Wahrscheinlichkeit rein durch Stichprobenrauschen produzieren, ist ein zur Grand Mean geschrumpfter Schätzer im Mittel näher am wahren Wert (niedrigerer erwarteter quadratischer Fehler) als der ungeschrumpfte No-Pooling-Schätzer — ein klassisches Resultat der Entscheidungstheorie (verwandt mit dem James-Stein-Schätzer). Gelman & Hill (2007) illustrieren das u. a. an Baseball-Battingdurchschnitten und Krebsraten pro Landkreis. Siehe Modul ⑤.
Weiterführend: (G)LMM — Mixed Models Interaktiv
Dieses Tool deckt die Kernideen ab — für eine deutlich umfangreichere Vertiefung (u. a. generalisierte lineare Mixed Models, GLMM, mit binären/zähldaten-Outcomes, weitere Zufallseffekt-Strukturen und Modellvergleiche) bietet das BTL-Schwesterprojekt das interaktive Tool „(G)LMM — Mixed Models Interaktiv" (English version).
? Hilfe — Multilevel & Mixed Models

Was zeigt dieses Tool?

Das Multilevel-Modell-Tool erklärt Linear Mixed Models (LMM) für hierarchisch strukturierte Daten. Beispiel: J=5 Schulklassen mit je n_j=10 Schülern, X=Lernzeit, Y=Klausurpunkte. Fünf interaktive Module führen von der Pooling-Frage über Shrinkage und Random Slopes bis zum Simpson-Paradoxon und der Frage, wann Shrinkage die Vorhersage tatsächlich verbessert.

Die fünf Module

  • ① Pooling-Vergleich — Complete, No und Partial Pooling live vergleichen. ICC-Balken zeigt Varianzzerlegung. Szenarien auf Knopfdruck.
  • ② Shrinkage & ICC — Caterpillar-Plot + Shrinkage-Pfeildiagramm. Slider für τ₀, σ, n_j zeigen, wie λ den Shrinkage steuert.
  • ③ Random Slopes — τ₁ und ρ kontrollieren Steigungsvariabilität und Intercept-Slope-Korrelation. Fan-out / Kompensation live.
  • ④ Simpson-Paradoxon — Within- und Between-Effekte einstellen. Vorzeichen-Flip des OLS-Koeffizienten live erleben.
  • ⑤ Shrinkage Extrem — 20 Gruppen unterschiedlicher Größe, mit sichtbarem wahren Wert. Zeigt direkt, dass Partial Pooling im Schnitt näher an der Wahrheit liegt als No Pooling — besonders bei kleinen Gruppen.

Begriffe

  • ICC: τ₀² / (τ₀² + σ²) — Anteil Zwischen-Varianz an Gesamtvarianz.
  • γ₀₀: Grand Intercept (Fixed Effect) — Gesamtmittelwert über alle Gruppen.
  • γ₁₀: Fixed Slope — gemeinsamer Within-Gruppen-Effekt von X auf Y.
  • u₀j: Random Intercept der Gruppe j — Abweichung vom Grand Mean.
  • u₁j: Random Slope der Gruppe j — Abweichung vom Fixed Slope.
  • τ₀ / τ₁: SD der Random-Intercept / -Slope-Verteilung zwischen Gruppen.
  • σ: Residual-SD (Within-Gruppen-Fehler).
  • λ: Shrinkage-Faktor = τ₀² / (τ₀² + σ²/n_j).
▸ Methoden-of-Moments Schätzer (für Interessierte)

Dieses Tool nutzt einfache Momentenschätzer (nicht REML / ML). Der Within-Slope γ₁₀ ist das nach Sxx gewichtete Mittel der gruppenspezifischen OLS-Steigungen. Die Residualvarianz σ² wird aus den Residuen zur gemeinsamen Steigung berechnet. τ₀² = max(0, Var(NP-Intercepts) − σ²/n_j). Diese Schätzer sind konsistent, aber weniger effizient als REML — für Lehrzwecke ausreichend.

Weiterführend

Literatur

Gelman, A. & Hill, J. (2007). Data Analysis Using Regression and Multilevel/Hierarchical Models. Cambridge University Press.

Hox, J. J., Moerbeek, M. & van de Schoot, R. (2018). Multilevel Analysis: Techniques and Applications (3. Aufl.). Routledge.

West, B. T., Welch, K. B. & Galecki, A. T. (2022). Linear Mixed Models: A Practical Guide Using Statistical Software (3. Aufl.). Chapman & Hall/CRC.