Messinvarianz — vergleichst du Konstrukte oder Messfehler?
Dr. R. Düsing · Universität Osnabrück
Szenario laden
Benannt nach der höchsten noch erfüllten Stufe: „Skalar verletzt" = nur metrisch (Intercept-DIF), „Metrisch verletzt" = nur konfigural (Ladungs-DIF), „Maskierte Diff." = echte Differenz wird durch Intercept-DIF verdeckt. Danach jeden Regler frei verändern.
Wahre latente Differenz
Δμ = μB − μA0.00
Der echte Unterschied der Gruppen auf dem Konstrukt (μA = 0 als Referenz).
Nicht-Invarianz (DIF) bei Item
Δτ Intercept (Gruppe B)0.80
Δλ Ladung (Gruppe B)0.00
Verschiebt nur ein Item in Gruppe B: Δτ = uniformer DIF (Intercept), Δλ = nicht-uniformer DIF (Ladung). „keins" = volle Invarianz.
Baseline-Messmodell
V1–V4 (Verbal-Subtest aus dem Kognitionstest), ein Faktor, Likert 1–5. Ladungen λ = 0.75 / 0.65 / 0.80 / 0.60 Intercepts τ = 3.00 (alle). In Gruppe A gelten diese Werte exakt; Verletzungen oben betreffen nur Gruppe B.
📋 Worum geht's
Aus dem 8-Item-Kognitionstest (Faktoranalyse, Messmodelle, CFA) greifen wir den Verbal-Subtest V1–V4
heraus und vergleichen zwei Gruppen damit — etwa eine deutsche und eine übersetzte Testversion, oder zwei
Testzeitpunkte. Bevor du Mittelwerte vergleichst, musst du sicher sein, dass der Test in beiden Gruppen
dasselbe und auf gleiche Weise misst. Ist das verletzt (Nicht-Invarianz / DIF), kann eine
„Gruppendifferenz" ein reines Messartefakt sein. Stelle die wahre Differenz und eine Verletzung
ein — und sieh, wie viel des beobachteten Unterschieds echt ist.
Messinvarianz (Faktorielle Invarianz) liegt vor, wenn ein Instrument ein Konstrukt in
verschiedenen Gruppen (Geschlecht, Länder) oder zu verschiedenen Zeitpunkten auf
dieselbe Weise misst — formal: wenn die Parameter des Messmodells (Ladungen λ,
Intercepts τ, Fehlervarianzen θ) über die Gruppen gleich
sind. Wozu? Nur dann bedeutet ein Unterschied im Testwert auch einen Unterschied im
Konstrukt — und nicht bloß im Instrument. Fehlt die Invarianz, vergleicht man Äpfel mit Birnen: eine
„Gruppendifferenz" kann ein reines Messartefakt sein. Geprüft wird sie als genestete
Hierarchie im Mehrgruppen-SEM (Diagramm ② unten): Stufe für Stufe setzt man mehr Parameter über die Gruppen
gleich (grüne Pfade) und prüft, ob das Modell noch passt.
Stufe
was ist gleich?
erlaubt den Vergleich von …
im Pfaddiagramm (②) erkennbar an
Konfigural
nur die Struktur: dieselben Items laden auf denselben Faktor
— (nur: „gleiches Konstrukt, gleiches Muster")
Alle vier Items hängen in beiden Gruppen am selben Faktor ξ. Diese Grundstruktur ist hier immer gegeben.
Metrisch (schwach)
+ Ladungen λ gleich
Zusammenhängen, Kovarianzen, Regressionen
Alle λ-Pfade grün. Ein roterλ-Pfad (Δλ) bricht diese Stufe.
Skalar (stark)
+ Intercepts τ gleich
latenten & beobachteten Mittelwerten
Zusätzlich alle τ in den Item-Boxen grün. Ein rotesτ (Δτ) bricht diese Stufe.
Strikt
+ Fehlervarianzen θ (Residuen ε) gleich
beobachteten Summenscores direkt (gleiche Messpräzision)
Zusätzlich die Residuen ε gruppengleich (hier per Design erfüllt, sobald skalar gilt).
① Was würdest du schließen?
—
Beobachtete Score-Differenz
—
Ø Summenscore B − Ø A
davon echt (latent)
—
Δμ · (Σλ / k)
davon Messartefakt
—
(Δτ + Δμ·Δλ) / k
② Das Messmodell als Mehrgruppen-CFA
Links Gruppe A, rechts Gruppe B — je ein vollständiges Pfaddiagramm (ein Faktor ξ, vier Items), mit den Parameterwerten dieser Gruppe. Grün = der Parameter ist in beiden Gruppen gleich (invariant), rot = er unterscheidet sich zwischen den Gruppen (nicht-invariant). Im Mehrgruppen-SEM setzt man die Parameter testweise gleich; bleibt das Modell passend, besteht auf dieser Stufe Invarianz.
③ Beobachtete Item-Mittelwerte je Gruppe
Graue Balken = Gruppe A, blaue = Gruppe B. Das verletzte Item ist rot umrandet.
④ Zerlegung der beobachteten Differenz
Der blaue Anteil ist die zulässige (latente) Differenz, der orange Anteil das Artefakt. Nur wenn Orange = 0 ist, misst der beobachtete Unterschied wirklich das Konstrukt.
⑤ Vollständige Rechnung: nur Items → Summenscore vs. SEM
Lernkarten
① Die Invarianz-Hierarchie
Konfigural ⊂ metrisch ⊂ skalar ⊂ strikt —
jede Stufe verlangt zusätzlich Gleichheit: konfigural nur dieselbe Struktur, metrisch gleiche Ladungen λ,
skalar zusätzlich gleiche Intercepts τ, strikt zusätzlich gleiche Fehlervarianzen θ.
Geprüft wird genestet, meist per CFA-Mehrgruppenmodell.
② Warum skalar für Mittelwerte?
Ein beobachteter Item-Mittelwert ist τ + λ·μ. Vergleicht man latente Mittelwerte μ,
müssen Intercept τ und Ladung λ gruppengleich sein — sonst ist nicht trennbar, ob ein höherer Score von einem
höheren Konstrukt (μ) oder von einem verschobenen Item (τ) kommt. Genau das macht der
orange Anteil sichtbar.
③ Zwei Fehlerrichtungen: Schein vs. Maskierung
Nicht-Invarianz täuscht in beide Richtungen. Schein-Differenz („Skalar verletzt"):
Δμ = 0, aber ein DIF erzeugt einen Unterschied, wo keiner ist → falsch-positiv.
Maskierung („Maskierte Diff."): Δμ ist echt (+0.5), aber ein gegenläufiges DIF (Δτ = −0.7)
verdeckt sie — der Summenscore zeigt nur +0.175 statt der wahren Differenz → falsch-negativ.
Beide Male ist der rohe Mittelwertvergleich irreführend; das SEM holt aus den Ankern κ_B = 0.5 zurück.
④ Score-Skala ≠ latente Skala
Die latente Differenz Δμ und die beobachtete Score-Differenz leben auf
verschiedenen Metriken. Selbst bei voller Invarianz ist die beobachtete Differenz nur Δμ·(Σλ/k) —
die latente Differenz, skaliert mit der mittleren Ladung (hier ×0.70). Gleich wären beide nur bei mittlerer
Ladung 1. Deshalb ist „davon echt" nicht Δμ selbst, sondern dessen Abbild auf der Score-Skala — und man vergleicht
im SEM die latenten Mittel direkt statt roher Summenscores. Die Kette über den Diagrammen zeigt diese Übersetzung.
⑤ Uniformer vs. nicht-uniformer DIF
Δτ verschiebt das Item für alle gleich stark (uniformer DIF) → verletzt nur die
skalare Stufe. Δλ ändert, wie stark das Item das Konstrukt misst (nicht-uniformer DIF) → verletzt
schon die metrische Stufe und damit auch Zusammenhangsvergleiche. Dasselbe Phänomen heißt in der IRT
Item-DIF.
→ DIF (IRT)
⑥ Partielle Invarianz & Anker
Selten sind alle Items invariant. Mit genug invarianten Anker-Items lässt sich
die latente Skala trotzdem identifizieren und man erlaubt einzelnen Items freie Parameter (partielle Invarianz,
Byrne/Shavelson/Muthén 1989). Faustregel: mindestens zwei invariante Items pro Faktor.
⑦ Wie man es real testet
Modelle nesten und vergleichen: Δχ²-Differenztest (oft zu streng bei großem n) oder
besser ΔCFI ≤ .01 / ΔRMSEA ≤ .015 (Cheung & Rensvold 2002; Chen 2007). Wird eine Stufe nicht
gehalten, ist der entsprechende Gruppenvergleich nicht zulässig — oder man geht zu partieller Invarianz.
Ein einfaktorielles Messmodell mit 4 Items, gemessen in zwei Gruppen. Du stellst die
wahre latente Differenz Δμ ein und – optional – eine Nicht-Invarianz bei genau einem Item
(verschobener Intercept Δτ und/oder veränderte Ladung Δλ in Gruppe B). Das Tool zerlegt die daraus resultierende
beobachtete Score-Differenz in einen zulässigen (latenten) und einen artefaktischen Anteil
und prüft, welche Invarianz-Stufen halten.
In Gruppe A gelten die Baseline-Werte. In Gruppe B addiert eine Verletzung beim gewählten Item v:
τ_vB = τ_v + Δτ und λ_vB = λ_v + Δλ. Alle anderen Items bleiben invariant.
Ist Δτ = Δλ = 0, gilt D_artefakt = 0: der beobachtete Unterschied misst dann wirklich das Konstrukt.
Bei Δμ = 0 aber Δτ ≠ 0 ist der gesamte beobachtete Unterschied ein Artefakt — man würde eine Differenz
„finden", wo keine ist. Ein gegenläufiges Δτ kann eine echte Differenz auch maskieren.
Die vier Stufen
Stufe
gleich über Gruppen
erlaubt den Vergleich von …
Konfigural
nur Muster/Struktur
— (nur: gleiches Konstrukt)
Metrisch (schwach)
+ Ladungen λ
Zusammenhängen, Kovarianzen, Regressionen
Skalar (stark)
+ Intercepts τ
latenten & beobachteten Mittelwerten
Strikt
+ Fehlervarianzen θ
beob. Summenscores direkt (gleiche Präzision)
Hinweis: Die Fehlervarianzen θ werden hier gruppengleich gehalten, daher gilt
„strikt" automatisch, sobald „skalar" hält. Variiert wird gezielt λ (metrisch) und τ (skalar), weil das die
praktisch wichtigsten Stufen für Mittelwertvergleiche sind.
Wie real getestet wird
Mehrgruppen-CFA: Modelle genestet schätzen (konfigural → metrisch → skalar → strikt) und
vergleichen. Der χ²-Differenztest ist bei großem n übersensibel; verbreiteter sind ΔCFI ≤ .01 und
ΔRMSEA ≤ .015 (Cheung & Rensvold 2002; Chen 2007). Hält eine Stufe nicht, sucht man das verletzende Item
(Modifikationsindizes) und erlaubt ihm freie Parameter → partielle Invarianz.
Bezug zu DIF und IRT
Nicht-Invarianz auf Itemebene ist Differential Item Functioning (DIF): uniformer DIF ↔
Intercept/Schwierigkeit (Δτ), nicht-uniformer DIF ↔ Diskrimination/Ladung (Δλ). Das CFA-Framework hier und das
IRT-Framework im DIF-Tool beschreiben dasselbe Phänomen in unterschiedlicher Parametrisierung.