Data Dredgingsuch lange genug, dann findest du etwas

Dr. R. Düsing · Universität Osnabrück
Data Dredging & Scheinwerfer-Paradoxon — Hilfe
Worum geht's

Wer einen großen Datensatz nach signifikanten Zusammenhängen durchsucht („data dredging", „p-hacking", „fishing expedition"), findet zwangsläufig welche — selbst wenn überhaupt kein wahrer Effekt existiert. Jeder Test hat bei α = 5 % eine 5-%-Chance auf einen Fehlalarm. Bei vielen Tests wird mindestens ein Treffer fast sicher.

Multiple Vergleiche

Bei m unabhängigen Tests unter der Nullhypothese ist die Wahrscheinlichkeit für mindestens einen Fehlalarm:

P(≥ 1 falsch-positiv) = 1 − (1 − α)^m

Bei α = .05 und m = 20 sind das bereits 64 %. Erwartet werden α·m Fehlalarme. Bonferroni korrigiert, indem es die Schwelle verschärft: α' = α/m. HARKing (Hypothesizing After Results are Known): zu einem zufälligen Treffer wird im Nachhinein eine plausibel klingende Theorie erfunden.

Stepwise-Regression (Freedman's Paradox)

Regressiert man eine Zielgröße auf viele reine Rausch-Prädiktoren und behält die „signifikanten", erhält man ein Modell mit beeindruckendem R² — das auf neuen Daten zusammenbricht. Die Auswahl hat sich an Zufallsmuster angepasst (Freedman 1983). Der Modus zeigt R² im Trainingsset vs. in frischen Daten.

Was tun?

Hypothesen vorab festlegen (Präregistrierung), für multiples Testen korrigieren (Bonferroni, FDR/Benjamini-Hochberg), explorative von konfirmatorischen Analysen trennen, und Befunde an unabhängigen Daten replizieren. „Signifikant" ist kein Ersatz für „repliziert".

Literatur

Freedman, D. A. (1983). A note on screening regression equations. The American Statistician, 37(2), 152–155. · Simmons, Nelson & Simonsohn (2011). False-positive psychology. Psychological Science, 22(11). · Gelman & Loken (2014). The garden of forking paths.

📋 Die Angel-Expedition
Du suchst Korrelate von Lebenszufriedenheit und testest dutzende Variablen (Schokolade, Sternzeichen, Schuhgröße …) — alle in Wahrheit unabhängig. Bei genug Tests leuchten einige rot auf: „signifikant". Frage: Sind das Entdeckungen? Dreh an m und schau, was die Formel sagt.
Bilanz der Tests
Tests durchgeführt
Signifikant (p<α)
„Zufallstreffer"
Erwartet per Zufall
α · m
P(≥1 Fehlalarm)
1−(1−α)m
Alle Tests (rot = „signifikant")
HARKing — aus Rauschen eine Geschichte machen
📋 Schrittweise Regression auf reinem Rauschen
Eine Zielgröße und k Rausch-Prädiktoren — keiner hat einen echten Effekt. Die schrittweise Auswahl behält trotzdem die, die im Trainingsset zufällig „signifikant" aussehen; zusammen ergeben sie ein Modell mit beeindruckendem R². Der Lackmustest: Wendet man dieselben Prädiktoren auf eine frische Stichprobe an — bleibt etwas übrig? Rate vorab.
Modellgüte: Trainingsset  vs.  neue Daten
Trainingsset
(hier wurde ausgewählt)
Frische Stichprobe
(dieselben Prädiktoren, neue Daten)
Jeder „gewählte" Prädiktor — und was von ihm bleibt
Konzepte
Multiple Vergleiche
Jeder Test hat bei α=.05 eine 5-%-Fehlalarm-Chance. Bei m Tests: P(≥1)=1−(1−α)m. Schon bei m=14 über 50 %. „Such lange genug, dann findest du etwas."
Hypothesizing After the Results are Known: erst das Zufallsergebnis, dann die „Theorie" dazu. Klingt plausibel, ist aber zirkulär — die Hypothese wurde aus genau den Daten geboren, die sie belegen soll.
Schrittweise Variablenauswahl auf Rauschen liefert „signifikante" Prädiktoren und ein hohes R² — das auf neuen Daten verschwindet. Überanpassung an Zufallsmuster (Freedman 1983).
Gegenmittel
Präregistrieren, für multiples Testen korrigieren (Bonferroni/FDR), explorativ ≠ konfirmatorisch, und an unabhängigen Daten replizieren. Dieselbe Falle lauert bei Modifikationsindizes im Strukturgleichungsmodell (SEM), wenn man das Modell post-hoc datengetrieben statt theoriegeleitet anpasst. → Lindley's Paradox