Der Aufbau
Wir testen den Mittelwert θ einer Normalverteilung mit bekannter Streuung σ. Beobachtet wird der
Stichprobenmittelwert x̄ aus n Beobachtungen, standardisiert als z = (x̄ − μ₀)·√n / σ. Alle Effekte sind
in σ-Einheiten ausgedrückt (σ = 1), der beobachtete Effekt ist δ = (x̄ − μ₀)/σ, also z = δ·√n.
p = 2·(1 − Φ(|z|)) (zweiseitig)
H₀ wird abgelehnt, wenn p < α. Für festes δ > 0 wächst z = δ√n mit n — irgendwann wird jeder
noch so winzige Effekt signifikant. Signifikanz ist also stark von n abhängig.
H₀: θ = 0 (Punkt-Null) gegen H₁: θ ~ N(0, τ²). Der Bayes-Faktor vergleicht, wie gut jede Hypothese die
Daten vorhersagt (marginale Likelihood). Für dieses Normal-Normal-Modell:
BF₀₁ = √(1 + n·τ²) · exp( −½ · z² · n·τ²/(1 + n·τ²) )
BF₀₁ > 1 bedeutet Evidenz für H₀, BF₁₀ = 1/BF₀₁ Evidenz für H₁. Jeffreys-Faustregel: 1–3 anekdotisch,
3–10 moderat, 10–30 stark, >30 sehr stark.
Das Paradox
Hält man das Ergebnis gerade signifikant (z = zkrit, also p = α konstant) und lässt
n wachsen, gilt √(1+nτ²) → ∞, während der Exponentialterm gegen exp(−½ zkrit²) strebt. Also
BF₀₁ → ∞: dasselbe „signifikante" Ergebnis wird zu immer stärkerer Evidenz für H₀.
Anschaulich (Panel ②): Die z-Verteilung unter H₀ bleibt fix N(0,1), die unter H₁ wird mit n immer breiter und
flacher. Ein festes z = 1.96 liegt dann zwar im Ablehnungsbereich von H₀, hat aber unter dem breiten H₁ eine noch
kleinere Dichte — die Daten passen besser zu H₀.
Die Auflösung
p-Wert und Bayes-Faktor beantworten verschiedene Fragen. Der p-Wert bedingt nur auf H₀
(„wie extrem sind die Daten, wenn H₀ gilt?"). Der Bayes-Faktor vergleicht H₀ und H₁ direkt und „bestraft" H₁ für seine
Vagheit (Ockham). Zudem: ein bei großem n gerade signifikanter Effekt ist praktisch null — die Signifikanz sagt
nur, dass θ ≠ 0 exakt gilt. Wer eine relevante Mindestgröße prüfen will, braucht ohnehin ein Intervall/ROPE statt einer
Punkt-Null.
Grenzen dieses Tools
Verwendet wird ein Normalprior unter H₁ (analytisch sauber). Gängige Default-Bayes-Faktoren (JZS, Rouder
et al.) nehmen einen Cauchy-Prior — qualitativ identisches Paradox, andere Zahlen. Der BF hängt sichtbar von τ ab.
Literatur
Lindley, D. V. (1957). A statistical paradox. Biometrika, 44, 187–192.
Jeffreys, H. (1939). Theory of Probability.
Wagenmakers, E.-J. (2007). A practical solution to the pervasive problems of p values. Psychon. Bull. Rev., 14, 779–804.
Rouder et al. (2009). Bayesian t tests. Psychon. Bull. Rev., 16, 225–237.