Explorative Faktoranalyse — EFA / PAF

📋 Beispiel — Kognitionstest mit 8 Untertests
300 Personen bearbeiten einen Kognitionstest mit 8 Untertests: V1–V4 prüfen verbale Fähigkeiten, S1–S4 räumliches Denken. Vorab ist unklar, wie viele latente Faktoren dahinterstecken und welche Items zu welchem Faktor gehören — genau das soll die explorative Faktorenanalyse (EFA) aufdecken. Die Regler links stellen das wahre Messmodell ein (in der Praxis unbekannt): Ladung λ, Kreuzladung λx, Faktorkorrelation φ — so lässt sich direkt beobachten, wie sich Änderungen am Modell auf Scree-Plot, Ladungen und die Reliabilität des Gesamtscores auswirken.
← KTT-Grundlagen: ein einzelner Testwert Welches Messmodell steckt in den Ladungen? → Struktur schon aus Theorie bekannt? → Konfirmatorische Faktoranalyse Miss dieselbe Struktur in zwei Gruppen? → Messinvarianz
Vorgehen — von den Items zu den Faktoren
Items & Messmodell. 8 Items (V1–V4, S1–S4), N = 300. Was hier per Regler vorgegeben wird, müsste man in der Praxis aus echten Item-Antworten schätzen.
Korrelationsmatrix R. Aus den Item-Antworten (bzw. hier: aus dem Messmodell) ergibt sich, wie stark je zwei Items zusammenhängen. → reduzierte Matrix Rr ansehen
Faktorextraktion — Eigenwerte & Scree-Plot. Wie viele Faktoren erklären die gemeinsame Varianz? Das Kaiser-Kriterium (Eigenwert > 1) ist gebräuchlich, aber recht freizügig — robuster ist die Parallelanalyse (Vergleich mit Eigenwerten zufälliger, unkorrelierter Daten gleicher Größe). → Scree-Plot ansehen
Rotation & Ladungsmatrix. Die unrotierte Lösung wird rotiert (Varimax/Oblique), um eine interpretierbare Einfachstruktur zu erhalten — welches Item lädt auf welchen Faktor? Tabelle und Biplot zeigen dieselbe Information zweimal, einmal als Zahlen und einmal räumlich. → Ladungstabelle · → Biplot
Finale Kommunalität h² & Reliabilität. Die Ladungstabelle zeigt bereits, wie viel Varianz jedes Items durch die Faktoren gemeinsam erklärt wird. Was folgt daraus für die Reliabilität (α, ω) des Gesamtscores? → Reliabilität ansehen
Korrelationsmatrix — reduziert Rr (finale h² auf der Diagonale)
Jede Zelle ist die (vom Messmodell implizierte) Korrelation zwischen zwei Items — teal = positiv, orange = negativ. Die grau hinterlegte Diagonale ist kein Korrelationswert, sondern h². In der Praxis kennt man h² vorab nicht: PAF startet mit einer initialen Schätzung — meist der quadrierten multiplen Korrelation SMC, also dem R² aus der gemeinsamen Regression jedes Items auf alle p−1 übrigen Items (nicht auf ein einzelnes anderes Item) — und verbessert das iterativ, bis h² konvergiert. Dieses Tool überspringt die Schätzung komplett: Da das Populationsmodell (Λ, Φ) über die Regler bekannt ist, steht direkt die modellimplizierte ("wahre") Kommunalität auf der Diagonale.
Scree-Plot — Eigenwerte (aus R)
Kaiser-Kriterium (gestrichelte Linie bei Eigenwert = 1): Faktoren mit Eigenwert > 1 behalten. Gebräuchlich, aber notorisch zu freizügig — es hängt kaum von der Itemanzahl oder der Stichprobengröße ab und überschätzt oft die Faktorenzahl. Robuster ist die Parallelanalyse (Horn, 1965): Man simuliert viele Datensätze aus unkorrelierten Zufallsvariablen derselben Größe (n Personen, p Items) und behält nur Faktoren, deren Eigenwert über dem 95. Perzentil der simulierten Eigenwerte liegt. Das entfernt Faktoren, die im echten Scree-Plot nur knapp über 1 liegen und tatsächlich Stichprobenrauschen sind.
Faktorladungstabelle & finale Kommunalitäten (PAF)
Faktorladungs-Biplot (F1 vs. F2)
Wie liest man Tabelle & Biplot?
Beide zeigen dieselbe Information zweimal — einmal als Zahlen, einmal räumlich. In der Tabelle stehen für jedes der 8 Items die Ladungen auf F1 und F2 sowie h² (Varianzanteil, der durch beide Faktoren gemeinsam erklärt wird) und u² = 1−h² (Rest). SSL (Summe der quadrierten Ladungen) und % Var. in der letzten Zeile zeigen, wie viel Gesamtvarianz jeder Faktor über alle 8 Items hinweg erklärt.

Im Biplot ist jeder Punkt ein Item, seine Koordinaten sind exakt dieselben Ladungen (F1 = x, F2 = y) — das sind dieselben Zahlen wie in der Tabelle, nur als Position statt als Zahl. Nahe der F1-Achse = lädt fast nur auf F1; nahe der F2-Achse = fast nur auf F2; nahe dem Ursprung = niedrige Ladungen auf beide Faktoren (schlecht erklärtes Item, geringe Kommunalität). Der Abstand vom Ursprung wächst mit h². Nach Varimax-Rotation clustern gut trennbare Items nahe den Achsen (Einfachstruktur); Items zwischen den Achsen haben nennenswerte Kreuzladungen auf beide Faktoren. Bei Oblique-Rotation stehen die Faktorachsen im Winkel arccos(φ) zueinander statt senkrecht — die eingezeichneten Achsen selbst zeigen dann die Faktorkorrelation.

Gezeigt werden nur V1 und S1 als Vertreter ihrer Gruppe — die übrigen Items liegen (in diesem vereinfachten Modell) exakt auf denselben Positionen.
Reliabilität des Gesamtscores  —  aus der EFA-Struktur abgeleitet
ωh
Omega hierarch. (McDonald)
Hier ist die Reliabilität ein Nebenprodukt der Faktorstruktur (ωh wächst mit der Faktorkorrelation φ). Die α-vs-ω-Frage selbst — wann α unterschätzt bzw. Eindimensionalität vortäuscht — vertieft das eigene Tool: → Reliabilität: α vs. ω
Lernkarten — Explorative Faktorenanalyse
EFA vs. HKA/PCA
Die Explorative Faktoranalyse (EFA) erklärt nur die gemeinsame Varianz der Items — sie verwendet eine reduzierte Korrelationsmatrix mit Kommunalitäten h² auf der Diagonalen. Die Hauptkomponentenanalyse (HKA) erklärt die gesamte Varianz (inkl. Fehler) und verwendet Einsen auf der Diagonalen. Dies ist ein konzeptuell wichtiger Unterschied.
Die Kommunalität h² ist der Varianzanteil eines Items, der durch die gemeinsamen Faktoren erklärt wird. Man unterscheidet zwei Zeitpunkte: die initiale Kommunalität (Startschätzung vor der Extraktion, meist die quadrierte multiple Korrelation SMC — das R² aus der gemeinsamen Regression des Items auf alle übrigen Items, nicht auf ein einzelnes) und die finale Kommunalität (nach der Extraktion: h² = Summe der quadrierten Ladungen über alle behaltenen Faktoren — was die Faktorlösung tatsächlich aufklärt). Die Tabelle in diesem Tool zeigt immer die finale h². Die Uniqueness u² = 1 − h² enthält Messfehler und itemspezifische Varianz.
Eigenwerte & Scree-Plot
Der Eigenwert eines Faktors zeigt, wie viel Varianz (in Einheiten standardisierter Items) er erklärt. Der Scree-Plot zeigt die Eigenwerte nach Größe sortiert. Das Kaiser-Kriterium (Eigenwert > 1) und der Scree-Knick (Elbow) sind die häufigsten Kriterien zur Faktoranzahl-Bestimmung.
Rotation & Einfachstruktur
Varimax rotiert die orthogonalen Achsen so, dass jedes Item möglichst hoch auf genau einen Faktor lädt (Thurstons Einfachstruktur). Oblique erlaubt Faktorkorrelation (phi > 0) — realistischer, aber schwieriger zu interpretieren. Kommunalitäten ändern sich durch Rotation nicht.
Cronbachs Alpha
Cronbachs Alpha schätzt die interne Konsistenz als Funktion der durchschnittlichen Interitemkorrelation. Ein häufiges Missverständnis: Alpha ist kein Maß für Unidimensionalität. Eine 2-faktorielle Struktur kann identisches Alpha wie eine 1-faktorielle haben — wenn die mittlere Interitemkorrelation gleich bleibt.
Omega total & hierarchisch
Omega total berücksichtigt alle Faktoren und ist eine bessere untere Schranke der Reliabilität als Alpha. Omega hierarchisch (Schmid-Leiman) misst nur den Anteil eines übergeordneten Generalfaktors — es steigt sowohl mit phi als auch mit der Kreuzladung und ist nur 0, wenn beide 0 sind (dann wirklich zwei getrennte Faktoren ohne jede gemeinsame Varianz).
❓ Hilfe — Explorative Faktoranalyse (EFA)
Forschungsbeispiel: Ein Psychologe entwickelt einen Kognitionstest mit 8 Untertests. Die EFA soll prüfen, ob sich dahinter 2 latente Faktoren — Verbale Fähigkeit und Räumliches Denken — verbergen, ohne vorab festzulegen, welche Items zu welchem Faktor gehören.
Parameter
Extraktionsmethode: PAF

Dieses Tool verwendet die Hauptachsenfaktorisierung (PAF) — eine echte EFA-Methode. PAF arbeitet mit einer reduzierten Korrelationsmatrix, bei der die Diagonale durch Kommunalitäten h² ersetzt wird — nicht durch Einsen wie bei der HKA/PCA. Dadurch wird nur die gemeinsame Varianz (Faktorvarianz) modelliert, nicht die Gesamtvarianz.

In der Praxis läuft das iterativ: Man startet mit einer initialen Kommunalitätenschätzung (meist die quadrierte multiple Korrelation SMC jedes Items mit allen anderen), extrahiert Faktoren, berechnet daraus neue, finale Kommunalitäten (h² = Summe der quadrierten Ladungen) und wiederholt das, bis sich h² kaum noch ändert. Da in diesem Tool das Populationsmodell (Λ, Φ) über die Regler direkt vorgegeben wird, überspringt es diese Iteration und setzt sofort die modellimplizierte Kommunalität ein — mit echten Daten ist h² dagegen immer nur eine Schätzung, kein bekannter wahrer Wert.

Der Scree-Plot zeigt die Eigenwerte der vollen R-Matrix (wie in der Praxis üblich, da die meisten Softwarepakete dies so ausgeben). Die eigentliche Faktorextraktion erfolgt aus der reduzierten Matrix.

Reliabilitätsindizes (Add-on)

Die Reliabilitätsindizes werden analytisch aus der Populationsstruktur berechnet:

r_within = lambda² + lambda_x² + 2·phi·lambda·lambda_x  (Korrelation innerhalb einer Gruppe) r_between = 2·lambda·lambda_x + phi·(lambda²+lambda_x²)  (Korrelation zwischen Gruppen) sigma²_X = 8 + 24·r_within + 32·r_between  (Varianz des Gesamtscores) Alpha = (8/7)·(sigma²_X − 8) / sigma²_X Omega_total = 1 − 8·(1 − r_within) / sigma²_X Omega_hier = 64·r_between / sigma²_X  (Schmid-Leiman)

Omega hierarchisch basiert auf der Schmid-Leiman-Orthogonalisierung: Die Ladung jedes Items auf einen übergeordneten Generalfaktor g beträgt sqrt(r_between) — denn mit orthogonalen Gruppenfaktoren gilt für zwei Items aus verschiedenen Gruppen Cov = g² exakt, egal ob die gemeinsame Varianz über phi (korrelierte Faktoren), über Kreuzladungen oder über beides entsteht. Omega hierarchisch = 0 nur, wenn r_between = 0 ist (weder phi noch Kreuzladung erzeugen gemeinsame Varianz).

Biplot & Korrelationsmatrix

Der Biplot zeigt jedes Item als Punkt im F1/F2-Koordinatensystem. Items nahe (1,0) laden hoch auf F1; nahe (0,1) hoch auf F2. Nach Varimax-Rotation clustern Items nahe den Achsen (Einfachstruktur). Bei Oblique werden die Faktorachsen im Winkel arccos(phi) dargestellt.

Die Korrelationsmatrix zeigt die von der Faktorstruktur implizierte Populationsmatrix R = Lambda·Phi·Lambda' + Psi. Teal = positive, Orange = negative Korrelation.

Literatur

Horn, J. L. (1965). A rationale and test for the number of factors in factor analysis. Psychometrika, 30(2), 179–185.
Mair, P. (2018). Modern Psychometrics with R. Springer.
Bühner, M. (2021). Einführung in die Test- und Fragebogenkonstruktion (4. Aufl.). Pearson Studium.