Multitrait-Multimethod-Matrix — MTMM

Dr. R. Düsing · Universität Osnabrück
Multitrait-Multimethod-Matrix — Hintergrund
Was zeigt dieses Tool?

Die Multitrait-Multimethod-Matrix (MTMM, Campbell & Fiske, 1959) misst mehrere Traits (Konstrukte) gleichzeitig mit mehreren Methoden (Informanten/Verfahren) und ordnet die Korrelationen zwischen allen resultierenden Messungen vier Zelltypen zu. Reiter zeigt die Matrix selbst mit farblich hervorgehobenen Zelltypen und einer automatischen Kriterienprüfung; Reiter zeigt, dass dieselbe Logik als SEM mit Trait- und Methodenfaktoren geschrieben werden kann.

Das Beispiel

Drei Traits — Depressivität, Ängstlichkeit, Kompetenz — werden mit drei Methoden erfasst: Selbstbericht, Peerbericht (z. B. Mitschüler:innen), Elternbericht. Jede Trait-Methode-Kombination liefert eine Messung, macht 9 Variablen und eine 9×9-Korrelationsmatrix.

Die vier Zelltypen

Reliabilitätsdiagonale (grau): Korrelation einer Messung mit sich selbst über Messwiederholung — hier als Reliabilitätskoeffizient h² angezeigt, nicht als triviale 1.0.

Validitätsdiagonale / Monotrait-Heteromethod (MTHM) (grün): gleicher Trait, andere Methode — z. B. Depressivität Selbstbericht × Depressivität Peerbericht. Das sind die konvergenten Validitätskoeffizienten: Sie sollten deutlich von 0 verschieden und möglichst groß sein.

Heterotrait-Monomethod (HTMM) (orange): andere Traits, gleiche Methode — z. B. Depressivität × Ängstlichkeit, beide im Selbstbericht. Diese Korrelationen sind durch geteilte Methodenvarianz verzerrt (z. B. Antworttendenzen, Halo-Effekte) und sollten niedriger sein als die Validitätsdiagonale.

Heterotrait-Heteromethod (HTHM) (blau): andere Traits, andere Methode — der methodisch „sauberste" Vergleich, unverzerrt durch geteilte Methodenvarianz.

Campbell-&-Fiske-Kriterien für konvergente & diskriminante Validität

Die Validitätsdiagonale (MTHM) sollte signifikant von 0 verschieden und substanziell sein — konvergente Validität. Ein MTHM-Wert sollte höher sein als die HTHM-Werte in derselben Zeile/Spalte. Ein MTHM-Wert sollte höher sein als die HTMM-Werte, die denselben Trait betreffen — das ist das strengste Kriterium, weil Methodenvarianz Korrelationen systematisch aufbläht. und zusammen sind diskriminante Validität. Das Korrelationsmuster zwischen den Traits sollte über alle Methoden hinweg ähnlich sein (hier durch feste Trait-Korrelationen im Modell ohnehin erfüllt).

Das Modell hinter Reiter
X_tm = λ_T · Trait_t + λ_M · Methode_m + e_tm

Jede Messung X wird durch ihren Trait-Faktor, ihren Methoden-Faktor und Messfehler erklärt. Daraus folgen geschlossene Formeln für alle vier Zelltypen (ρ = Trait-Korrelation):

Reliabilität h² = λ_T² + λ_M² MTHM (Validität) = λ_T² HTHM = λ_T,t · λ_T,t' · ρ_tt' HTMM = λ_T,t · λ_T,t' · ρ_tt' + λ_M²

Daraus folgt strukturell immer HTMM ≥ HTHM (Methodenvarianz addiert sich nur dazu) — genau Campbell & Fiskes Beobachtung, dass Monomethod-Korrelationen meist inflationiert sind. Ob MTHM größer als HTMM bleibt, hängt vom Verhältnis der beiden Ladungen ab: λT (Trait-Ladung) und λM (Methoden-Ladung) — in Reiter für jedes Szenario direkt an den Pfaden abzulesen.

Grenzen dieses CT-UM-Modells

Dieses Tool nimmt unkorrelierte Methodenfaktoren an — das ist nicht die "einfachste Variante" des Correlated-Trait-Correlated-Method-Modells (CT-CM), sondern ein eigenständig benanntes Modell: das Correlated-Trait-Uncorrelated-Methods-Modell (CT-UM), ein Spezialfall des CT-CM-Modells (Eid et al., 2008). Erlaubt man stattdessen auch Korrelationen zwischen den Methodenfaktoren (echtes CT-CM), führt das in der Praxis häufig zu unzulässigen Lösungen (z. B. negative Fehlervarianzen) und Identifikationsproblemen. Ein verbreiteter Ausweg ist das CT-C(M−1)-Modell (ein Methodenfaktor wird als Referenz weggelassen) — Details, Diagramme und wann welches Modell passt: Reiter .

Literatur

Campbell, D. T. & Fiske, D. W. (1959). Convergent and discriminant validation by the multitrait-multimethod matrix. Psychological Bulletin, 56(2), 81–105.
Geiser, C., Eid, M., Nussbeck, F. W., Lischetzke, T. & Cole, D. A. (2010). Multitrait-Multimethod-Analyse. In H. Holling & B. Schmitz (Hrsg.), Handbuch Statistik, Methoden und Evaluation (S. 679–685). Hogrefe.
Widaman, K. F. (1985). Hierarchically nested covariance structure models for multitrait-multimethod data. Applied Psychological Measurement, 9(1), 1–26.
Kenny, D. A. (1976). An empirical application of confirmatory factor analysis to the multitrait-multimethod matrix. Journal of Experimental Social Psychology, 12(3), 247–252.
Jöreskog, K. G. (1971). Statistical analysis of sets of congeneric tests. Psychometrika, 36(2), 109–133.
Eid, M. (2000). A multitrait-multimethod model with minimal assumptions. Psychometrika, 65(2), 241–261.
Eid, M., Nussbeck, F. W., Geiser, C., Cole, D. A., Gollwitzer, M. & Lischetzke, T. (2008). Structural equation modeling of multitrait-multimethod data: Different models for different types of methods. Psychological Methods, 13(3), 230–253.

📋 Beispiel
Depressivität, Ängstlichkeit und Kompetenz werden bei denselben Personen über Selbstbericht, Peerbericht und Elternbericht erfasst — 3 Traits × 3 Methoden = 9 Messungen. Die 9×9-Korrelationsmatrix beantwortet zwei Fragen zugleich: Stimmen verschiedene Methoden bei demselben Trait überein (konvergente Validität)? Und lassen sich die Traits untereinander unterscheiden, auch wenn dieselbe Methode misst (diskriminante Validität)?
← Strukturgleichungsmodell Gruppen statt Methoden vergleichen? → Messinvarianz
Die 9×9-Matrix
Reliabilität h² (Diagonale)
MTHM — gleicher Trait, andere Methode (konvergent)
HTMM — andere Traits, gleiche Methode
HTHM — andere Traits, andere Methode
Kriterium verletzt
Konvergente & diskriminante Validität — Kriterienprüfung
Traitmin. |MTHM|max. |HTMM|max. |HTHM|KonvergentDiskriminant
Konvergent: kleinster |MTHM|-Wert des Traits deutlich > 0. Diskriminant: derselbe Wert übertrifft sowohl die stärkste HTMM- als auch die stärkste HTHM-Korrelation, die diesen Trait betrifft.
Lernkarten
Warum HTMM ≥ HTHM strukturell gilt
Im Modell ist HTMM = HTHM + λM². Methodenvarianz kann eine Korrelation nur zusätzlich erhöhen (bei λM > 0), nie senken. Deshalb sind Korrelationen zwischen verschiedenen Traits, gemessen mit derselben Methode, so gut wie nie kleiner als dieselben Traits über verschiedene Methoden hinweg — eine der robustesten empirischen MTMM-Beobachtungen.
Das strengste Kriterium
Kriterium (MTHM > HTMM) scheitert am häufigsten in echten Daten — auch im Beispiel von Geiser et al. (2010): Die Selbst-Peer- und Selbst-Eltern-Korrelationen für Depressivität (.20–.30) sind deutlich kleiner als die Selbstbericht-interne Korrelation zwischen Depressivität und Ängstlichkeit (.67). Diskriminante Validität ist damit dort nicht sauber gegeben. Trotzdem passt das CT-UM-Modell in Reiter insgesamt gut zu genau diesen Daten — kein Widerspruch, sondern zwei verschiedene Fragen (Details dort).
Woher kommt Methodenvarianz?
Geteilte Antworttendenzen (z. B. sozial erwünschtes Antworten), Halo-Effekte bei Ratern, gemeinsamer Beobachtungskontext (Eltern sehen ihr Kind in denselben Situationen) oder Item-Formulierungsstil — alles Ursachen, die alle Traits derselben Methode gemeinsam nach oben oder unten verschieben, unabhängig vom tatsächlichen Trait-Gehalt.
Und weiter?
Reiter zeigt, dass dieselbe Logik ein ganz normales Strukturgleichungsmodell ist — nur mit zwei Sorten latenter Faktoren (Trait und Methode) statt einer. → Zu Reiter wechseln
📋 Von der Matrix zum Modell
Dieselben 9 Messungen, dasselbe Beispiel — standardmäßig als Correlated-Trait-Uncorrelated-Methods-Modell (CT-UM) gezeichnet: 3 Trait-Faktoren, 3 Methoden-Faktoren, jede Messung lädt auf genau einen Trait und genau eine Methode; die Methodenfaktoren korrelieren per Default nicht untereinander (per Toggle unten auch als CT-CM mit korrelierten Methodenfaktoren — Details und weitere Modellvarianten in Reiter ). Die Ladungen sind hier nicht frei einstellbar, sondern für jedes Szenario direkt aus der Matrix in Reiter abgelesen — die Szenarien-Auswahl links steuert also beides zugleich. Bei den synthetischen Szenarien B–D ist das ein einziges λ_T/λ_M für alle 9 Items (die Matrix wurde ja selbst so erzeugt); bei Szenario A (echte Daten) bekommt jedes Item seine eigene Trait- und Methodenladung, per Maximum-Likelihood geschätzt.
Pfaddiagramm — Trait- und Methodenfaktoren
CT-UM ↔ CT-CM (nur Szenario A)
Methodenfaktoren sind hier per Default unkorreliert gezeichnet (CT-UM-Modell) — mit dem Button oben lassen sie sich (nur für Szenario A) mit echten ML-Werten korreliert zeichnen (CT-CM). Details, Grenzen und weitere Modellvarianten wie CT-C(M−1) in Reiter und der Hilfe. Traitfaktoren korrelieren gemäß den Werten oben in den Bögen.
x1=Selbst×Depr. · x2=Selbst×Ängstl. · x3=Selbst×Komp. · x4=Peer×Depr. · x5=Peer×Ängstl. · x6=Peer×Komp. · x7=Eltern×Depr. · x8=Eltern×Ängstl. · x9=Eltern×Komp.
Was zeigt dieses Szenario?
Lernkarten
Zwei Darstellungen, ein Modell
Reiter (Tabelle) und Reiter (Pfaddiagramm) sind zwei Ansichten auf dasselbe Modell. Bei den synthetischen Szenarien B–D ist die implizierte Matrix des Pfaddiagramms exakt die Matrix aus Reiter — beide wurden ja aus genau diesen Ladungen erzeugt. Bei Szenario A (echte Daten) weicht die implizierte Matrix dagegen vom echten Beispiel ab — der Modellfit oben zeigt, wie stark.
Warum zwei Faktoren pro Item?
In einer normalen CFA lädt jedes Item nur auf einen Faktor. Im CT-UM-Modell (wie hier) und im allgemeineren CT-CM-Modell lädt jedes Item auf zwei: seinen Trait (was es eigentlich messen soll) und seine Methode (wie es gemessen wurde). Genau das trennt „echte" Konstruktvarianz von Methodenartefakten — algebraisch dieselbe Trennung, die die vier MTMM-Zelltypen in Reiter sichtbar machen.
Modellfit ≠ Validität
Ein guter Modellfit (SRMR oben) sagt nur: Die Form des Modells — korrelierte Traits, unkorrelierte Methoden, einfache Ladungsstruktur — passt zur beobachteten Korrelationsstruktur. Er sagt nichts darüber, ob die geschätzten Werte selbst gut sind. Im Geiser-Beispiel (Szenario A) passt das Modell gut — und deshalb können wir den geschätzten Parametern trauen. Die zeigen dann aber genau das Problem, das Reiter als Verletzung von Kriterium markiert: Eine Trait-Korrelation von ρ=0.90 (Depressivität–Ängstlichkeit) plus ein Heywood-Fall bei x4. Guter Fit macht eine schlechte Validitätsdiagnose also glaubwürdiger, nicht falscher — ein schlecht passendes Modell hätte diesen Zahlen gar nicht erst vertraut werden können. Fit und Validität sind unabhängige Fragen: Man kann ein Modell haben, das die Daten strukturell exakt trifft und trotzdem inhaltlich schlecht gemessene Konstrukte offenlegt — oder umgekehrt ein schlecht passendes Modell, dessen (unzuverlässige) Parameter zufällig gut aussehen.
📋 Eine Modellfamilie, vier Varianten
Reiter zeigt nur eine Art, Trait- und Methodeneffekte als SEM zu formalisieren (CT-UM). Das ist keine beliebige Wahl, sondern eine von vier klassischen CFA-MTMM-Modellen, die sich einzig darin unterscheiden, welche Korrelationen zwischen Fehler-/Methodenfaktoren zugelassen werden — und wie mit „schwierigen" Methodenfaktoren umgegangen wird. Kein Modell hier ist mit Werten aus dem Geiser-Beispiel befüllt (dafür Reiter /) — es geht nur um die Struktur.
Kenny, 1976
A — Correlated-Trait-Correlated-Uniqueness (CT-CU)
Jedes Item lädt nur auf einen Traitfaktor. Methodeneffekte werden nicht als eigener Faktor modelliert, sondern über korrelierte Fehlervariablen ("Uniqueness") zwischen Items derselben Methode abgebildet. Nachteil: Methodeneffekte sind mit Messfehler konfundiert (Reliabilität wird unterschätzt), und bei vielen Variablen müssen viele Fehlerkorrelationen geschätzt werden — wenig sparsam. Keine Zerlegung in Trait-, Methoden- und Fehlervarianz möglich.
Jöreskog, 1971
B — Correlated-Trait-Correlated-Method (CT-CM)
Jedes Item lädt auf einen Trait­faktor und einen Methodenfaktor. Alle Traitfaktoren dürfen korrelieren, alle Methodenfaktoren dürfen ebenfalls korrelieren (nur Trait↔Methode nicht). Vorteil gegenüber CT-CU: Methodeneffekte sind explizit modelliert, Zerlegung in Trait-/Methoden-/Fehlervarianz wird möglich. Nachteil: führt in der Praxis häufig zu unzulässigen Lösungen (z. B. negative Fehlervarianzen) und Identifikationsproblemen — besonders wenn die Methodenfaktoren stark korrelieren. Per Toggle in Reiter für das Geiser-Beispiel verfügbar — dort live zu sehen: der Heywood-Fall bei x4 wird unter CT-CM sogar noch extremer als unter CT-UM.
Spezialfall von CT-CM
C — Correlated-Trait-Uncorrelated-Methods (CT-UM)
Das Standardmodell aus Reiter dieses Tools. Wie CT-CM, aber die Methodenfaktoren dürfen nicht miteinander korrelieren. Vermeidet die meisten Schätzprobleme von CT-CM. Besonders geeignet bei austauschbaren Methoden — z. B. zufällig gezogene Rater aus einer größeren Population (nicht: welche Rater, sondern dass sie eine repräsentative Stichprobe darstellen). Bei strukturell unterschiedlichen Methoden (Selbst-, Eltern-, physiologisches Maß — wie im Geiser-Beispiel) ist die Unkorreliertheits-Annahme eine Vereinfachung, kein exaktes Abbild der Realität.
Eid, 2000; Eid et al., 2008
D — Correlated-Trait-Correlated-(Methods-Minus-One) [CT-C(M−1)]
Eine Methode wird als Referenz gewählt (hier M1) — ihre Items laden nur auf ihren Trait, bekommen keinen eigenen Methodenfaktor. Für jede andere Methode wird ein Methodenfaktor spezifiziert, der die Abweichung von der Referenzmethode darstellt; diese Methodenfaktoren dürfen untereinander korrelieren. Vermeidet die CT-CM-Probleme, ohne die (oft unrealistische) Unkorreliertheits-Annahme von CT-UM zu brauchen — Standard in der aktuellen MTMM-SEM-Literatur, wenn eine sinnvolle Referenzmethode existiert (z. B. die etablierteste oder objektivste Methode).
Und wenn ich mehrere Items pro Trait-Methode-Kombination habe?
Alle vier Modelle oben gehen von genau einem Indikator pro Trait-Methoden-Einheit aus (so wie im Geiser-Beispiel: 3 Traits × 3 Methoden = 9 Einzelitems) — das setzt implizit voraus, dass der Methodeneffekt für jeden Trait gleich stark ist. Mit mehreren Indikatoren pro Kombination (z. B. mehrere Items pro Trait und Methode) lassen sich stattdessen traitspezifische Methodeneffekte modellieren — der Methodeneffekt darf dann von Trait zu Trait unterschiedlich stark ausfallen. Solche Erweiterungen sind in Eid, Nussbeck, Geiser, Cole, Gollwitzer & Lischetzke (2008) ausführlich dargestellt, hier aber nicht umgesetzt.