Messinvarianz — vergleichst du Konstrukte oder Messfehler?

Dr. R. Düsing · Universität Osnabrück
📋 Worum geht's
Aus dem 8-Item-Kognitionstest (Faktoranalyse, Messmodelle, CFA) greifen wir den Verbal-Subtest V1–V4 heraus und vergleichen zwei Gruppen damit — etwa eine deutsche und eine übersetzte Testversion, oder zwei Testzeitpunkte. Bevor du Mittelwerte vergleichst, musst du sicher sein, dass der Test in beiden Gruppen dasselbe und auf gleiche Weise misst. Ist das verletzt (Nicht-Invarianz / DIF), kann eine „Gruppendifferenz" ein reines Messartefakt sein. Stelle die wahre Differenz und eine Verletzung ein — und sieh, wie viel des beobachteten Unterschieds echt ist.
← Faktoranalyse (EFA) ← Messmodelle ← Konfirmatorische Faktoranalyse (CFA)
Was ist Messinvarianz — und wozu?

Messinvarianz (Faktorielle Invarianz) liegt vor, wenn ein Instrument ein Konstrukt in verschiedenen Gruppen (Geschlecht, Länder) oder zu verschiedenen Zeitpunkten auf dieselbe Weise misst — formal: wenn die Parameter des Messmodells (Ladungen λ, Intercepts τ, Fehlervarianzen θ) über die Gruppen gleich sind. Wozu? Nur dann bedeutet ein Unterschied im Testwert auch einen Unterschied im Konstrukt — und nicht bloß im Instrument. Fehlt die Invarianz, vergleicht man Äpfel mit Birnen: eine „Gruppendifferenz" kann ein reines Messartefakt sein. Geprüft wird sie als genestete Hierarchie im Mehrgruppen-SEM (Diagramm ② unten): Stufe für Stufe setzt man mehr Parameter über die Gruppen gleich (grüne Pfade) und prüft, ob das Modell noch passt.

Stufewas ist gleich?erlaubt den Vergleich von …im Pfaddiagramm (②) erkennbar an
Konfigural nur die Struktur: dieselben Items laden auf denselben Faktor — (nur: „gleiches Konstrukt, gleiches Muster") Alle vier Items hängen in beiden Gruppen am selben Faktor ξ. Diese Grundstruktur ist hier immer gegeben.
Metrisch (schwach) + Ladungen λ gleich Zusammenhängen, Kovarianzen, Regressionen Alle λ-Pfade grün. Ein roter λ-Pfad (Δλ) bricht diese Stufe.
Skalar (stark) + Intercepts τ gleich latenten & beobachteten Mittelwerten Zusätzlich alle τ in den Item-Boxen grün. Ein rotes τ (Δτ) bricht diese Stufe.
Strikt + Fehlervarianzen θ (Residuen ε) gleich beobachteten Summenscores direkt (gleiche Messpräzision) Zusätzlich die Residuen ε gruppengleich (hier per Design erfüllt, sobald skalar gilt).
Was würdest du schließen?
Beobachtete Score-Differenz
Ø Summenscore B − Ø A
davon echt (latent)
Δμ · (Σλ / k)
davon Messartefakt
(Δτ + Δμ·Δλ) / k
Das Messmodell als Mehrgruppen-CFA
Links Gruppe A, rechts Gruppe B — je ein vollständiges Pfaddiagramm (ein Faktor ξ, vier Items), mit den Parameterwerten dieser Gruppe. Grün = der Parameter ist in beiden Gruppen gleich (invariant), rot = er unterscheidet sich zwischen den Gruppen (nicht-invariant). Im Mehrgruppen-SEM setzt man die Parameter testweise gleich; bleibt das Modell passend, besteht auf dieser Stufe Invarianz.
Beobachtete Item-Mittelwerte je Gruppe
Graue Balken = Gruppe A, blaue = Gruppe B. Das verletzte Item ist rot umrandet.
Zerlegung der beobachteten Differenz
Der blaue Anteil ist die zulässige (latente) Differenz, der orange Anteil das Artefakt. Nur wenn Orange = 0 ist, misst der beobachtete Unterschied wirklich das Konstrukt.
Vollständige Rechnung: nur Items → Summenscore vs. SEM
Lernkarten
① Die Invarianz-Hierarchie
Konfiguralmetrischskalarstrikt — jede Stufe verlangt zusätzlich Gleichheit: konfigural nur dieselbe Struktur, metrisch gleiche Ladungen λ, skalar zusätzlich gleiche Intercepts τ, strikt zusätzlich gleiche Fehlervarianzen θ. Geprüft wird genestet, meist per CFA-Mehrgruppenmodell.
② Warum skalar für Mittelwerte?
Ein beobachteter Item-Mittelwert ist τ + λ·μ. Vergleicht man latente Mittelwerte μ, müssen Intercept τ und Ladung λ gruppengleich sein — sonst ist nicht trennbar, ob ein höherer Score von einem höheren Konstrukt (μ) oder von einem verschobenen Item (τ) kommt. Genau das macht der orange Anteil sichtbar.
③ Zwei Fehlerrichtungen: Schein vs. Maskierung
Nicht-Invarianz täuscht in beide Richtungen. Schein-Differenz („Skalar verletzt"): Δμ = 0, aber ein DIF erzeugt einen Unterschied, wo keiner ist → falsch-positiv. Maskierung („Maskierte Diff."): Δμ ist echt (+0.5), aber ein gegenläufiges DIF (Δτ = −0.7) verdeckt sie — der Summenscore zeigt nur +0.175 statt der wahren Differenz → falsch-negativ. Beide Male ist der rohe Mittelwertvergleich irreführend; das SEM holt aus den Ankern κ_B = 0.5 zurück.
④ Score-Skala ≠ latente Skala
Die latente Differenz Δμ und die beobachtete Score-Differenz leben auf verschiedenen Metriken. Selbst bei voller Invarianz ist die beobachtete Differenz nur Δμ·(Σλ/k) — die latente Differenz, skaliert mit der mittleren Ladung (hier ×0.70). Gleich wären beide nur bei mittlerer Ladung 1. Deshalb ist „davon echt" nicht Δμ selbst, sondern dessen Abbild auf der Score-Skala — und man vergleicht im SEM die latenten Mittel direkt statt roher Summenscores. Die Kette über den Diagrammen zeigt diese Übersetzung.
⑤ Uniformer vs. nicht-uniformer DIF
Δτ verschiebt das Item für alle gleich stark (uniformer DIF) → verletzt nur die skalare Stufe. Δλ ändert, wie stark das Item das Konstrukt misst (nicht-uniformer DIF) → verletzt schon die metrische Stufe und damit auch Zusammenhangs­vergleiche. Dasselbe Phänomen heißt in der IRT Item-DIF. → DIF (IRT)
⑥ Partielle Invarianz & Anker
Selten sind alle Items invariant. Mit genug invarianten Anker-Items lässt sich die latente Skala trotzdem identifizieren und man erlaubt einzelnen Items freie Parameter (partielle Invarianz, Byrne/Shavelson/Muthén 1989). Faustregel: mindestens zwei invariante Items pro Faktor.
⑦ Wie man es real testet
Modelle nesten und vergleichen: Δχ²-Differenztest (oft zu streng bei großem n) oder besser ΔCFI ≤ .01 / ΔRMSEA ≤ .015 (Cheung & Rensvold 2002; Chen 2007). Wird eine Stufe nicht gehalten, ist der entsprechende Gruppenvergleich nicht zulässig — oder man geht zu partieller Invarianz.
⑧ Verwandte Werkzeuge
Messinvarianz ist der Gruppenvergleich von Messmodellen: dieselben CFA-Bausteine wie im Messmodell- und CFA-Tool, nur über Gruppen restringiert. Verschobene Intercepts erinnern an Normverschiebungen. → Konfirmatorische Faktoranalyse (CFA) → Messmodelle → Strukturgleichungsmodell (SEM) → Normierung
Messinvarianz — Hintergrund
Was dieses Tool zeigt

Ein einfaktorielles Messmodell mit 4 Items, gemessen in zwei Gruppen. Du stellst die wahre latente Differenz Δμ ein und – optional – eine Nicht-Invarianz bei genau einem Item (verschobener Intercept Δτ und/oder veränderte Ladung Δλ in Gruppe B). Das Tool zerlegt die daraus resultierende beobachtete Score-Differenz in einen zulässigen (latenten) und einen artefaktischen Anteil und prüft, welche Invarianz-Stufen halten.

Das Modell pro Gruppe g
V_ij = τ_ig + λ_ig · ξ_g + ε_ig E[V_ij | Gruppe g] = τ_ig + λ_ig · μ_g (μ_A = 0 als Referenz) Σλ/k = (0.75+0.65+0.80+0.60)/4 = 0.70

In Gruppe A gelten die Baseline-Werte. In Gruppe B addiert eine Verletzung beim gewählten Item v: τ_vB = τ_v + Δτ und λ_vB = λ_v + Δλ. Alle anderen Items bleiben invariant.

Zerlegung der Score-Differenz
D_beob = Ø Score(B) − Ø Score(A) = Δμ·(Σλ/k) + (Δτ + Δμ·Δλ)/k D_echt = Δμ·(Σλ/k) (durch die latente Differenz gerechtfertigt) D_artefakt = (Δτ + Δμ·Δλ)/k (nur durch das verletzte Item)

Ist Δτ = Δλ = 0, gilt D_artefakt = 0: der beobachtete Unterschied misst dann wirklich das Konstrukt. Bei Δμ = 0 aber Δτ ≠ 0 ist der gesamte beobachtete Unterschied ein Artefakt — man würde eine Differenz „finden", wo keine ist. Ein gegenläufiges Δτ kann eine echte Differenz auch maskieren.

Die vier Stufen
Stufegleich über Gruppenerlaubt den Vergleich von …
Konfiguralnur Muster/Struktur— (nur: gleiches Konstrukt)
Metrisch (schwach)+ Ladungen λZusammenhängen, Kovarianzen, Regressionen
Skalar (stark)+ Intercepts τlatenten & beobachteten Mittelwerten
Strikt+ Fehlervarianzen θbeob. Summenscores direkt (gleiche Präzision)

Hinweis: Die Fehlervarianzen θ werden hier gruppengleich gehalten, daher gilt „strikt" automatisch, sobald „skalar" hält. Variiert wird gezielt λ (metrisch) und τ (skalar), weil das die praktisch wichtigsten Stufen für Mittelwertvergleiche sind.

Wie real getestet wird

Mehrgruppen-CFA: Modelle genestet schätzen (konfigural → metrisch → skalar → strikt) und vergleichen. Der χ²-Differenztest ist bei großem n übersensibel; verbreiteter sind ΔCFI ≤ .01 und ΔRMSEA ≤ .015 (Cheung & Rensvold 2002; Chen 2007). Hält eine Stufe nicht, sucht man das verletzende Item (Modifikationsindizes) und erlaubt ihm freie Parameter → partielle Invarianz.

Bezug zu DIF und IRT

Nicht-Invarianz auf Itemebene ist Differential Item Functioning (DIF): uniformer DIF ↔ Intercept/Schwierigkeit (Δτ), nicht-uniformer DIF ↔ Diskrimination/Ladung (Δλ). Das CFA-Framework hier und das IRT-Framework im DIF-Tool beschreiben dasselbe Phänomen in unterschiedlicher Parametrisierung.

Literatur

Meredith, W. (1993). Measurement invariance, factor analysis and factorial invariance. Psychometrika, 58, 525–543.
Vandenberg, R. J. & Lance, C. E. (2000). A review of measurement invariance. Organizational Research Methods, 3, 4–70.
Cheung, G. W. & Rensvold, R. B. (2002). Evaluating goodness-of-fit indexes for invariance. SEM, 9, 233–255.
Putnick, D. L. & Bornstein, M. H. (2016). Measurement invariance conventions and reporting. Developmental Review, 41, 71–90.