Gesetz der kleinen Zahlenwarum die „Rekord-Gemeinden" winzig sind

Dr. R. Düsing · Universität Osnabrück
Worum geht's

Eine Quote (hier: Anteil Linkshänder) ist in allen Gemeinden gleich groß — sagen wir 10 %. Der gemessene Anteil schwankt aber zufällig von Gemeinde zu Gemeinde. Die entscheidende Frage: Welche Gemeinden haben die höchste und die niedrigste Quote? Antwort: fast immer die kleinen — und zwar an beiden Enden.

Der Mechanismus

Der Standardfehler eines Anteils sinkt mit der Wurzel der Stichprobengröße:

SE = √( p·(1−p) / n )

Kleine Gemeinden (kleines n) haben einen großen SE → ihre Messwerte streuen weit um die wahre Quote. Große Gemeinden liegen fast exakt bei p. Deshalb stammen sowohl die Spitzenreiter als auch die Schlusslichter aus den kleinen Gemeinden — nicht weil dort etwas Besonderes passiert, sondern weil kleine Stichproben stärker schwanken.

Quote (y) gegen Einwohnerzahl (x, logarithmisch). Der „Trichter" sind die ±2-SE-Grenzen: links (kleine Gemeinden) weit, rechts (große Gemeinden) eng. Die Punkte füllen den Trichter aus — die extremsten liegen ganz links. Genau diese Form heißt Funnel-Plot und dient auch zur Aufdeckung von Publikationsbias.

Berühmtes Beispiel (Kahneman)

In US-Daten haben die Bezirke mit der niedrigsten Nierenkrebsrate eines gemeinsam: sie sind ländlich und dünn besiedelt. Verblüffung — bis man sieht, dass die Bezirke mit der höchsten Rate genauso klein sind. Reine Stichprobenstreuung, kein Landluft-Effekt.

Was tun?

Ranglisten von Raten ohne Berücksichtigung von n sind irreführend. Lösung: Funnel-Plot statt nackter Rangliste, Shrinkage (Werte kleiner Einheiten Richtung Gesamtmittel ziehen, → Regression zur Mitte), oder Bayes/Multilevel-Modelle mit partial pooling.

Literatur

Tversky, A. & Kahneman, D. (1971). Belief in the law of small numbers. Psychological Bulletin, 76(2), 105–110. · Kahneman, D. (2011). Schnelles Denken, langsames Denken, Kap. 10.

📋 Schlagzeile aus dem Statistik-Amt
Gemeinde Hintertupfingen hat anteilig die meisten Linkshänder Deutschlands!" Klingt nach einer Entdeckung. Dabei ist der Anteil Linkshänder überall gleich (~10 %, reiner Zufall pro Person). Frage vorab: Sind die Rekord-Gemeinden (höchste und niedrigste Quote) eher große oder kleine Gemeinden? Schau in den Funnel-Plot und die Rangliste.
Kennzahlen
Wahre Quote (überall)
Höchste gemessene Quote
Niedrigste gemessene Quote
Ø Einwohner der 10 Extreme
vs. Gesamt-Ø
Funnel-Plot — Quote gegen Einwohnerzahl
jeder Punkt = eine Gemeinde · x = Einwohner (log) · y = gemessene Quote · Trichter = ±2 SE um die wahre Quote
Links (kleine Gemeinden) ist der Trichter weit — dort liegen die Extreme. Rechts (große Gemeinden) klebt alles an der wahren Quote.
Rangliste — wer ragt heraus?
🔺 Höchste Quote
🔻 Niedrigste Quote
🏙 Größte Gemeinden
Konzepte
Wir erwarten, dass kleine Stichproben so „brav" sind wie große — sind sie aber nicht. Kleine n schwanken stark (SE ∝ 1/√n), daher tauchen sie an beiden Extremen auf.
Der Mechanismus: Standardfehler
Der Standardfehler eines Anteils sinkt mit der Wurzel der Stichprobengröße: SE = √( p·(1−p) / n ) Kleine Gemeinden (kleines n) haben einen großen SE → ihre gemessene Quote streut weit um die wahre Quote p. Große Gemeinden (großes n) liegen fast exakt bei p. Das ist der eigentliche Grund, warum sowohl die höchste als auch die niedrigste gemessene Quote aus kleinen Gemeinden stammt — nicht weil dort etwas Besonderes passiert, sondern weil kleine Stichproben stärker zufällig schwanken.
Warum beide Enden?
Die Streuung ist symmetrisch: eine kleine Gemeinde kann zufällig sehr hoch oder sehr niedrig liegen. Deshalb sind Spitzenreiter und Schlusslichter klein — ein verräterisches Muster.
Wert gegen Stichprobengröße, mit ±2-SE-Trichter. Punkte außerhalb des Trichters sind echte Auffälligkeiten; die Trichterform selbst entlarvt reine Größeneffekte. Auch Standard zur Bias-Diagnose in Meta-Analysen.
Gegenmittel: Shrinkage
Werte kleiner Einheiten Richtung Gesamtmittel ziehen (Empirical Bayes / Multilevel) — extreme Zufalls-Ausreißer werden gedämpft. Das ist Regression zur Mitte in Aktion. → Regression zur Mitte