Was Sie sehen
10 Baseline-Sessions (Phase A, blau) — danach zwei Fortsetzungen desselben Zeitraums: die Projektion (gestrichelt), die einfach den Baseline-Trend fortschreibt, und die tatsächlichen Daten (rot), die entstehen würden, wenn zusätzlich der eingestellte Interventionseffekt wirkt.
Zwei Funktionen der Baseline (Kazdin, 2017)
Deskriptiv: Die Baseline beschreibt das aktuelle Niveau des Zielverhaltens. Prognostisch: Sie sagt vorher, wie sich das Verhalten ohne Intervention weiterentwickeln würde — das ist die gestrichelte Linie. Erst der Vergleich „tatsächlich vs. vorhergesagt" erlaubt eine Aussage über die Wirkung der Intervention.
Trend und Stabilität sind entscheidend
Ziehen Sie Baseline-Trend: Ein Trend, der schon in die gewünschte Richtung zeigt, macht es schwerer, einen zusätzlichen Interventionseffekt zu erkennen — die Vorhersage bewegt sich ja bereits dorthin. Ziehen Sie Baseline-Variabilität hoch: Bei starkem Rauschen verschwindet ein kleiner Effekt im „Schneegestöber" der Baseline-Schwankungen.
Erkennbarkeit
Rechts unten wird die Differenz zwischen tatsächlichem und vorhergesagtem Niveau relativ zur Baseline-Variabilität ausgedrückt — dieselbe Logik wie Cohen's d (→ Effektgrößen): derselbe Interventionseffekt ist bei stabiler Baseline leicht erkennbar, bei instabiler Baseline dagegen kaum von Zufallsschwankungen zu unterscheiden.
Was Sie sehen
Wählen Sie ein Design: AB (nur eine Baseline, dann Intervention — nicht empfehlenswert, da jede zeitgleiche Drittvariable die „Wirkung" erklären könnte), ABA (Rückkehr zur Baseline testet die Vorhersage), ABAB (zusätzliche zweite Interventionsphase repliziert den Effekt), oder BABA (Start mit Intervention).
Die Logik der Umkehr
Jede neue Phase bekommt eine gestrichelte Vorhersagelinie aus der letzten gleichartigen Phase (z. B. A₂ aus A₁, B₂ aus B₁). Stimmt eine neue Phase mit dieser Vorhersage überein, spricht das gegen einen Interventionseffekt; weicht sie systematisch ab, ist das ein Beleg für Kontrolle des Verhaltens durch die Intervention.
Der Umkehr-Schalter
Schalten Sie ↺ Umkehr aus: Die zweite (und jede weitere) A-Phase kehrt nicht vollständig zur ursprünglichen Baseline zurück. Das entspricht Kazdins (2017) zwei Szenarien: Tritt die Umkehr auf, ist der kausale Beleg stark — aber das Verhalten des Klienten verschlechtert sich absichtlich wieder, was ethisch heikel sein kann. Tritt keine Umkehr auf, ist der kausale Schluss schwächer (Alternativerklärungen sind nicht ausgeschlossen) — aber es ist auch nicht per se ein Widerspruch: manches Verhalten bleibt nach erfolgreichem Training einfach erhalten.
Was Sie sehen
Dieselbe Intervention wird bei drei Schüler:innen zu unterschiedlichen Zeitpunkten eingeführt (gesteuert über Versatz). Jede Person bleibt so lange in der Baseline, bis sie „an der Reihe" ist — es muss nie zur ursprünglichen Baseline zurückgekehrt werden, anders als bei ABAB.
Warum ist das kausal aussagekräftig?
Wenn sich das Verhalten jeweils erst nach dem individuellen Interventionsstart ändert — versetzt in der Zeit, bei allen drei Personen gleich stark — dann kann keine einzelne, zu einem festen Zeitpunkt wirkende Drittvariable die Ursache sein. Die zeitversetzte Replikation ist die Kontrollbedingung.
Testen Sie den Gegenfall
Aktivieren Sie ⚡ Externes Ereignis: Ein Störfaktor (z. B. Lehrerwechsel, Ferien) wirkt bei allen drei Personen gleichzeitig, unabhängig vom individuellen Interventionsbeginn. Das Ergebnis ist sofort sichtbar: ein Sprung, der bei allen drei Verläufen exakt an derselben Session auftritt statt versetzt — ein deutliches Warnsignal, dass nicht (nur) die Intervention wirkt, sondern ein gemeinsamer externer Faktor.
Vier visuelle Kriterien (Kazdin, 2017)
① Mittelwert: Unterscheiden sich die Phasenmittelwerte? ② Trend: Ändert sich Anstieg/Abfall der Daten von A zu B? ③ Level: Gibt es einen „Bruch" direkt am Phasenübergang (letzter A- vs. erster B-Wert), unabhängig vom Mittelwert? ④ Latenz: Wie schnell nach Interventionsbeginn zeigt sich die Veränderung? Klicken Sie die vier Buttons oben an, um jedes Kriterium einzeln im Graphen zu markieren.
Warum nicht nur der Mittelwert?
Ein Beispiel: Ziehen Sie Trend in Phase B auf einen hohen Wert bei Interventionseffekt = 0. Die Mittelwerte von A und B können nahezu identisch bleiben — trotzdem verändert sich das Verhalten sichtbar innerhalb von B. Reine Mittelwertvergleiche (wie im klassischen Gruppenvergleich) können das übersehen; deshalb reicht bei SCD ein einzelner Kennwert nicht.
Über die visuelle Inspektion hinaus: PND & Tau-U
PND (Percentage of Non-overlapping Data): Anteil der B-Werte, die den extremsten A-Wert in die gewünschte Richtung übertreffen — einfach, aber nutzt nur einen einzigen Baseline-Punkt.
Tau-U (Parker, Vannest, Davis & Sauber, 2011): vergleicht alle A–B-Paare (verwandt mit Kendalls Tau bzw. Non-overlap of All Pairs, NAP) und nutzt damit die gesamte Baseline, nicht nur ihr Extrem. Werte nahe ±1 bedeuten (fast) vollständige Nichtüberlappung in die jeweilige Richtung, Werte nahe 0 bedeuten starke Überlappung.
PND vergleicht B nur mit dem extremsten A-Wert — einfach, aber verschwenderisch mit
Information. NAP/Tau-U (Parker et al., 2011) nutzen alle A–B-Paare und
sind heute die gebräuchlicheren Kennwerte zur Ergänzung der visuellen Inspektion — nie als deren
Ersatz gedacht.
Randomisierte Gruppenexperimente gelten als Goldstandard, brauchen aber viele Fälle. Single Case (Experimental Research) Designs (SCD) erlauben kausale Rückschlüsse auf Interventionen anhand eines einzelnen Falls (Individuum, aber auch Klasse, Schule, Betrieb, Stadt). Sie sind vor allem dann angemessen, wenn eine Intervention neu ist, Ressourcen knapp sind, oder es speziell um die Veränderung dieser einen Erhebungseinheit geht.
AB — eine Baseline, eine Intervention. Nicht empfehlenswert: keine Kontrolle für Drittvariablen.
ABA / ABAB (Umkehr-/Reversal-Design) — Baseline, Intervention, erneut Baseline (,erneut Intervention). Jede Wiederholung testet die Vorhersage der vorherigen Phase; eine Umkehr des Effekts beim Entzug der Intervention ist starke kausale Evidenz.
Multiple-Baseline-Design — dieselbe Intervention wird zeitversetzt bei mehreren Personen, Verhaltensweisen oder Situationen eingeführt. Ändert sich das Verhalten jeweils erst nach dem individuellen Interventionsbeginn, ist eine gemeinsame externe Ursache unwahrscheinlich — ganz ohne Rückkehr zur Baseline.
Primär durch visuelle Inspektion: Veränderung im Mittelwert, im Trend, im Level (Bruch am Phasenübergang) und die Latenz der Veränderung. Ergänzend haben sich quantitative Kennwerte etabliert:
Diese Kennwerte ersetzen die visuelle Inspektion nicht, sondern ergänzen sie um eine objektivere, reproduzierbare Zahl.
Die am häufigsten genannte Sorge ist die externe Validität: Ergebnisse aus einem oder wenigen Fällen lassen sich nicht ohne Weiteres auf andere Personen verallgemeinern. SCD sind dafür gerade dann geeignet, wenn es um seltene Probleme geht, für die sich ohnehin keine größere, ähnliche Stichprobe rekrutieren lässt.