Einzelfallstudien (Single Case Designs)

Dr. R. Düsing · Universität Osnabrück
N = 1 (Einzelfall) Zielverhalten: Störverhalten im Unterricht (% der Intervalle) Erhebung: fortlaufend, 1 Messung pro Schulstunde (Session)
Seed: —
Baseline: Beschreibung & Vorhersage
Die Basislinie beschreibt das aktuelle Niveau — und sagt vorher, wie es ohne Intervention weiterginge
Session → Störverhalten (% der Intervalle)
Baseline (A) — beobachtet Projektion (kein Interventionseffekt) Tatsächliche Daten mit Intervention
Baseline-Trend 0
Baseline-Variabilität 6
Interventionseffekt −20
Vorhergesagt (B)
Tatsächlich (B)
Tutorial — Baseline: Beschreibung & Vorhersage

Was Sie sehen
10 Baseline-Sessions (Phase A, blau) — danach zwei Fortsetzungen desselben Zeitraums: die Projektion (gestrichelt), die einfach den Baseline-Trend fortschreibt, und die tatsächlichen Daten (rot), die entstehen würden, wenn zusätzlich der eingestellte Interventionseffekt wirkt.

Zwei Funktionen der Baseline (Kazdin, 2017)
Deskriptiv: Die Baseline beschreibt das aktuelle Niveau des Zielverhaltens. Prognostisch: Sie sagt vorher, wie sich das Verhalten ohne Intervention weiterentwickeln würde — das ist die gestrichelte Linie. Erst der Vergleich „tatsächlich vs. vorhergesagt" erlaubt eine Aussage über die Wirkung der Intervention.

Trend und Stabilität sind entscheidend
Ziehen Sie Baseline-Trend: Ein Trend, der schon in die gewünschte Richtung zeigt, macht es schwerer, einen zusätzlichen Interventionseffekt zu erkennen — die Vorhersage bewegt sich ja bereits dorthin. Ziehen Sie Baseline-Variabilität hoch: Bei starkem Rauschen verschwindet ein kleiner Effekt im „Schneegestöber" der Baseline-Schwankungen.

Erkennbarkeit
Rechts unten wird die Differenz zwischen tatsächlichem und vorhergesagtem Niveau relativ zur Baseline-Variabilität ausgedrückt — dieselbe Logik wie Cohen's d (→ Effektgrößen): derselbe Interventionseffekt ist bei stabiler Baseline leicht erkennbar, bei instabiler Baseline dagegen kaum von Zufallsschwankungen zu unterscheiden.

3 Anforderungen an ein auswertbares SCD (Kazdin, 2017): Fortlaufende Messung — multiple Beobachtungen über die Zeit, vor und während der Intervention. Baseline-Messung — ein Erhebungszeitraum vor der Intervention (deskriptiv + prognostisch, s. o.). Stabilität der Performanz — möglichst wenig Trend und wenig Variabilität in der Baseline, damit eine Abweichung überhaupt interpretierbar ist.
AB, ABA & ABAB — Umkehrdesigns
Wiederholte Umkehr von Baseline und Intervention als kausaler Beleg — und was fehlt, wenn die Umkehr ausbleibt
Session → Störverhalten (% der Intervalle) — Phasenverlauf
Phase A (Baseline) Phase B (Intervention) Vorhersage aus vorheriger gleichartiger Phase
Interventionseffekt −25
Variabilität 6
Tutorial — Umkehrdesigns

Was Sie sehen
Wählen Sie ein Design: AB (nur eine Baseline, dann Intervention — nicht empfehlenswert, da jede zeitgleiche Drittvariable die „Wirkung" erklären könnte), ABA (Rückkehr zur Baseline testet die Vorhersage), ABAB (zusätzliche zweite Interventionsphase repliziert den Effekt), oder BABA (Start mit Intervention).

Die Logik der Umkehr
Jede neue Phase bekommt eine gestrichelte Vorhersagelinie aus der letzten gleichartigen Phase (z. B. A₂ aus A₁, B₂ aus B₁). Stimmt eine neue Phase mit dieser Vorhersage überein, spricht das gegen einen Interventionseffekt; weicht sie systematisch ab, ist das ein Beleg für Kontrolle des Verhaltens durch die Intervention.

Der Umkehr-Schalter
Schalten Sie ↺ Umkehr aus: Die zweite (und jede weitere) A-Phase kehrt nicht vollständig zur ursprünglichen Baseline zurück. Das entspricht Kazdins (2017) zwei Szenarien: Tritt die Umkehr auf, ist der kausale Beleg stark — aber das Verhalten des Klienten verschlechtert sich absichtlich wieder, was ethisch heikel sein kann. Tritt keine Umkehr auf, ist der kausale Schluss schwächer (Alternativerklärungen sind nicht ausgeschlossen) — aber es ist auch nicht per se ein Widerspruch: manches Verhalten bleibt nach erfolgreichem Training einfach erhalten.

Multiple-Baseline-Design
Zeitversetzte Einführung derselben Intervention bei drei Personen — Replikation statt Rückkehr zur Baseline
Session → Störverhalten (% der Intervalle) — gestaffelter Interventionsbeginn
Schüler:in 1
Schüler:in 2
Schüler:in 3
Versatz zw. Interventionen 5
Interventionseffekt −25
Variabilität 6
Tutorial — Multiple-Baseline-Design

Was Sie sehen
Dieselbe Intervention wird bei drei Schüler:innen zu unterschiedlichen Zeitpunkten eingeführt (gesteuert über Versatz). Jede Person bleibt so lange in der Baseline, bis sie „an der Reihe" ist — es muss nie zur ursprünglichen Baseline zurückgekehrt werden, anders als bei ABAB.

Warum ist das kausal aussagekräftig?
Wenn sich das Verhalten jeweils erst nach dem individuellen Interventionsstart ändert — versetzt in der Zeit, bei allen drei Personen gleich stark — dann kann keine einzelne, zu einem festen Zeitpunkt wirkende Drittvariable die Ursache sein. Die zeitversetzte Replikation ist die Kontrollbedingung.

Testen Sie den Gegenfall
Aktivieren Sie ⚡ Externes Ereignis: Ein Störfaktor (z. B. Lehrerwechsel, Ferien) wirkt bei allen drei Personen gleichzeitig, unabhängig vom individuellen Interventionsbeginn. Das Ergebnis ist sofort sichtbar: ein Sprung, der bei allen drei Verläufen exakt an derselben Session auftritt statt versetzt — ein deutliches Warnsignal, dass nicht (nur) die Intervention wirkt, sondern ein gemeinsamer externer Faktor.

Auswertung: visuell & quantitativ
Visuelle Inspektion ist die primäre Methode bei SCD — Kennwerte wie PND und Tau-U ergänzen sie
Session → Störverhalten (% der Intervalle)
Interventionseffekt −25
Trend in Phase B 0
Variabilität 6
Wählen Sie oben ein Kriterium.
Tutorial — Auswertung

Vier visuelle Kriterien (Kazdin, 2017)
① Mittelwert: Unterscheiden sich die Phasenmittelwerte? ② Trend: Ändert sich Anstieg/Abfall der Daten von A zu B? ③ Level: Gibt es einen „Bruch" direkt am Phasenübergang (letzter A- vs. erster B-Wert), unabhängig vom Mittelwert? ④ Latenz: Wie schnell nach Interventionsbeginn zeigt sich die Veränderung? Klicken Sie die vier Buttons oben an, um jedes Kriterium einzeln im Graphen zu markieren.

Warum nicht nur der Mittelwert?
Ein Beispiel: Ziehen Sie Trend in Phase B auf einen hohen Wert bei Interventionseffekt = 0. Die Mittelwerte von A und B können nahezu identisch bleiben — trotzdem verändert sich das Verhalten sichtbar innerhalb von B. Reine Mittelwertvergleiche (wie im klassischen Gruppenvergleich) können das übersehen; deshalb reicht bei SCD ein einzelner Kennwert nicht.

Über die visuelle Inspektion hinaus: PND & Tau-U
PND (Percentage of Non-overlapping Data): Anteil der B-Werte, die den extremsten A-Wert in die gewünschte Richtung übertreffen — einfach, aber nutzt nur einen einzigen Baseline-Punkt. Tau-U (Parker, Vannest, Davis & Sauber, 2011): vergleicht alle A–B-Paare (verwandt mit Kendalls Tau bzw. Non-overlap of All Pairs, NAP) und nutzt damit die gesamte Baseline, nicht nur ihr Extrem. Werte nahe ±1 bedeuten (fast) vollständige Nichtüberlappung in die jeweilige Richtung, Werte nahe 0 bedeuten starke Überlappung.

Gewünschte Richtung:
Mittelwertdifferenz
PND
NAP
Tau-U (A vs. B)
PND = Anteil der B-Werte, die den extremsten A-Wert in gewünschter Richtung übertreffen (z. B. bei gewünschter Abnahme: Anteil der B-Werte < min(A)).
NAP (Non-overlap of All Pairs): Für jedes der nA·nB Paare (a,b) zählt 1 Punkt, wenn b gegenüber a eine Verbesserung zeigt, 0.5 Punkte bei einem Unentschieden, 0 Punkte bei einer Verschlechterung. NAP = Summe / (nA·nB) ∈ [0,1].
Tau-U (nur A-vs-B-Nichtüberlappung, ohne Trendkorrektur) = 2·NAP − 1 ∈ [−1,1]. Äquivalent zu Kendalls S/(nA·nB), wobei S = (Anzahl verbessernder Paare) − (Anzahl verschlechternder Paare). Die vollständige Tau-U-Familie (Parker et al., 2011) kann zusätzlich einen unerwünschten Baseline-Trend herausrechnen — das ist hier nicht umgesetzt.
Lernkarten — Einzelfallstudien
Baseline: deskriptiv + prognostisch
Die Baseline beschreibt das aktuelle Niveau (deskriptiv) und schreibt es fort, um vorherzusagen, was ohne Intervention passieren würde (prognostisch). Nur die Abweichung von dieser Vorhersage ist Evidenz für einen Interventionseffekt — nicht die absoluten Werte in Phase B allein.
Trend & Stabilität
Eine Baseline sollte möglichst trend- und schwankungsfrei sein. Ein Trend in die gewünschte Richtung erschwert den Nachweis eines zusätzlichen Effekts; hohe Variabilität macht jede Abweichung schwer von Zufallsrauschen unterscheidbar.
Warum nicht einfach AB?
Ein einfaches AB-Design ist nicht zu empfehlen: Jede Drittvariable, die zufällig zeitgleich mit der Intervention auftritt, ist eine ebenso plausible Erklärung. ABA/ABAB (Rückkehr zur Baseline) oder Multiple-Baseline-Designs (zeitversetzte Replikation) schließen das systematisch aus.
Umkehrdesigns vs. Multiple Baseline
ABAB-Designs verlangen eine Rückkehr zur Baseline — kausal stark, aber manchmal ethisch heikel (das Zielverhalten verschlechtert sich absichtlich wieder) oder unmöglich (irreversible Lerneffekte). Multiple-Baseline-Designs zeigen dieselbe kausale Logik über zeitversetzte Replikation bei mehreren Personen/Verhaltensweisen/Situationen — ganz ohne Rückschritt.
Vier visuelle Kriterien
Veränderung im Mittelwert, im Trend, im Level (Bruch am Phasenübergang) und die Latenz der Veränderung — vier unabhängige Gesichtspunkte der visuellen Inspektion. Ein Effekt kann in einem Kriterium klar und in einem anderen unauffällig sein.
PND, NAP & Tau-U
PND vergleicht B nur mit dem extremsten A-Wert — einfach, aber verschwenderisch mit Information. NAP/Tau-U (Parker et al., 2011) nutzen alle A–B-Paare und sind heute die gebräuchlicheren Kennwerte zur Ergänzung der visuellen Inspektion — nie als deren Ersatz gedacht.
? Hilfe — Einzelfallstudien

Wozu Einzelfallstudien (Single Case Designs)?

Randomisierte Gruppenexperimente gelten als Goldstandard, brauchen aber viele Fälle. Single Case (Experimental Research) Designs (SCD) erlauben kausale Rückschlüsse auf Interventionen anhand eines einzelnen Falls (Individuum, aber auch Klasse, Schule, Betrieb, Stadt). Sie sind vor allem dann angemessen, wenn eine Intervention neu ist, Ressourcen knapp sind, oder es speziell um die Veränderung dieser einen Erhebungseinheit geht.

Drei Anforderungen an das Design (Kazdin, 2017)

  • Fortlaufende Messung — viele Beobachtungen über die Zeit, nicht nur Prä/Post
  • Baseline-Messung — ein Erhebungszeitraum vor der Intervention, deskriptiv und prognostisch zugleich
  • Stabilität der Performanz — wenig Trend, wenig Variabilität in der Baseline

Designs

AB — eine Baseline, eine Intervention. Nicht empfehlenswert: keine Kontrolle für Drittvariablen.

ABA / ABAB (Umkehr-/Reversal-Design) — Baseline, Intervention, erneut Baseline (,erneut Intervention). Jede Wiederholung testet die Vorhersage der vorherigen Phase; eine Umkehr des Effekts beim Entzug der Intervention ist starke kausale Evidenz.

Multiple-Baseline-Design — dieselbe Intervention wird zeitversetzt bei mehreren Personen, Verhaltensweisen oder Situationen eingeführt. Ändert sich das Verhalten jeweils erst nach dem individuellen Interventionsbeginn, ist eine gemeinsame externe Ursache unwahrscheinlich — ganz ohne Rückkehr zur Baseline.

Auswertung

Primär durch visuelle Inspektion: Veränderung im Mittelwert, im Trend, im Level (Bruch am Phasenübergang) und die Latenz der Veränderung. Ergänzend haben sich quantitative Kennwerte etabliert:

  • PND (Percentage of Non-overlapping Data) — Anteil der B-Werte jenseits des extremsten A-Werts
  • NAP (Non-overlap of All Pairs) und Tau-U (Parker, Vannest, Davis & Sauber, 2011, Behavior Therapy) — nutzen alle A–B-Paare statt nur des Extremwerts

Diese Kennwerte ersetzen die visuelle Inspektion nicht, sondern ergänzen sie um eine objektivere, reproduzierbare Zahl.

Grenzen

Die am häufigsten genannte Sorge ist die externe Validität: Ergebnisse aus einem oder wenigen Fällen lassen sich nicht ohne Weiteres auf andere Personen verallgemeinern. SCD sind dafür gerade dann geeignet, wenn es um seltene Probleme geht, für die sich ohnehin keine größere, ähnliche Stichprobe rekrutieren lässt.

Quellen

Verwandte Tools