Eine ANOVA (Varianzanalyse) prüft, ob sich die Mittelwerte von mehreren Gruppen unterscheiden — zum Beispiel: Schneiden drei Lerngruppen unterschiedlich gut in einem Test ab, oder sind die Unterschiede, die man in der Stichprobe sieht, einfach nur Zufallsrauschen? Bei nur zwei Gruppen würde ein t-Test reichen. Bei drei oder mehr Gruppen bräuchte man sonst viele einzelne t-Tests (A vs. B, A vs. C, B vs. C, …) — und mit jedem zusätzlichen Test steigt die Chance, rein zufällig irgendwo eine "Signifikanz" zu finden, obwohl in Wirklichkeit gar kein Unterschied besteht. Die ANOVA vergleicht stattdessen alle Gruppen gemeinsam in einem einzigen Test.
Was misst der F-Wert?
Stell dir die Mittelwerte der Gruppen auf einem Zahlenstrahl vor. Liegen sie eng beieinander, war der Unterschied vermutlich Zufall. Liegen sie weit auseinander — weiter, als man angesichts der Streuung innerhalb jeder Gruppe erwarten würde — spricht das für einen echten Effekt. Genau das misst der F-Wert: ein Verhältnis aus "wie unterschiedlich sind die Gruppen zueinander" geteilt durch "wie viel Streuung gibt es sowieso schon innerhalb jeder einzelnen Gruppe". Ein großes F heißt: die Unterschiede zwischen den Gruppen sind groß im Vergleich zum normalen Rauschen. Aus F und den Freiheitsgraden (die u. a. von der Zahl der Gruppen und der Stichprobengröße abhängen) berechnet das Tool automatisch den p-Wert — du musst dafür keine Formel im Kopf haben.
Was zeigt dieses Tool?
Drei Reiter oben: ① die einfaktorielle ANOVA (ein Faktor, mehrere Gruppen), ② die zweifaktorielle ANOVA (zwei Faktoren gleichzeitig, inklusive Interaktion), und ③ eine Regressions-Brücke: sie zeigt an denselben Daten aus ① und ②, dass eine ANOVA im Kern nichts anderes ist als eine Regression, deren Prädiktor kategorial codiert ist (Gruppenzugehörigkeit statt Zahlenwert) — nur mit eigenem Namen und eigener Tabellen-Tradition. Die Regression ist dabei die flexiblere Variante: sie kann kategoriale und kontinuierliche Prädiktoren im selben Modell kombinieren — genau das tut z. B. die ANCOVA, das direkte Analogon zur ANOVA mit einer zusätzlichen kontinuierlichen Kontrollvariable.
Regler in der Seitenleiste
Populationsmittelwerte, Streuung und Stichprobengröße stellst du links ein — Ergebnis-Tabelle und Plot reagieren sofort. "Neue Stichprobe ziehen" behält die aktuellen Regler-Einstellungen, zieht aber neues Zufallsrauschen — so siehst du, wie sehr sich die Zahlen von Stichprobe zu Stichprobe zufällig bewegen, obwohl die zugrunde liegende Population dieselbe bleibt.
Y-Achse fixieren
Standardmäßig aktiv: die y-Achse behält den Wertebereich, der beim letzten Aktivieren des Hakens galt, statt sich bei jeder Regler-Bewegung neu anzupassen. So siehst du direkt, wie sich z. B. eine größere Streuung (SD) auf die Punktwolke auswirkt — ohne dass der Plot automatisch mitskaliert und den Effekt dabei wieder "wegkorrigiert". Deaktivieren, um wieder automatisch auf die aktuellen Daten zu skalieren.
SAQ-Bereich hervorheben
SAQ steht für Summe der (quadrierten) Abweichungen. Quadriert wird deshalb, weil sich positive und negative Abweichungen vom Mittelwert sonst gegenseitig aufheben würden — die reine Summe der Abweichungen ergibt sonst immer ungefähr null. Der Haken blendet die beiden Bausteine dieser Zerlegung farbig ein: Zwischen den Gruppen/Zellen (Abstand Gruppen-/Zellmittelwert zum Gesamtmittelwert) und Innerhalb (Abstand jeder einzelnen Beobachtung zu ihrem Gruppen-/Zellmittelwert). Beide Kästchen sind unabhängig voneinander an- und abschaltbar; die zugehörigen Tabellenzeilen bleiben dauerhaft in derselben Farbe eingefärbt, auch wenn die Grafik selbst nur das gerade angehakte Element zeigt. In der Tabelle werden F und p außerdem rot hervorgehoben, sobald ein Effekt signifikant wird (p < .05).
Literatur
Fisher, R. A. (1925). Statistical Methods for Research Workers. Oliver & Boyd. Field, A. (2026). Discovering Statistics Using R and RStudio (2. Aufl.). Sage.
Unsere Studie
n = 20 pro Gruppe
MKontrolle = 100.0
MA = 107.0
MB = 114.0 F(2,57) = —
p = —
Populationsparameter
μ Kontrolle100
μ Methode A107
μ Methode B114
SD (gepoolt)12
n pro Gruppe20
Darstellung
SAQ-Bereich hervorheben (einzeln zuschaltbar):
Unsere Studie
FA = —, p = — FB = —, p = — FA×B = —, p = —
Populationsparameter
μ je Zelle (Faktor A × Faktor B):
ohne FB
mit FB
Klassisch
100
108
Verteilt
100
108
SD (gepoolt)12
n pro Zelle15
Darstellung
SAQ-Bereich hervorheben (einzeln zuschaltbar):
Kernaussage
ANOVA und Regression sind dasselbe lineare Modell — nur die Codierung der Gruppenprädiktoren unterscheidet sich. Dummy- und Effekt-Codierung liefern exakt dieselben F- und p-Werte.
Hinweis
Diese Analyse nutzt die aktuellen Stichproben aus ① und ②. Regler zum Ändern findest du auf den jeweiligen Reitern.
Ein Faktor, drei Gruppen — wie viel der Gesamtstreuung erklärt die Gruppenzugehörigkeit?
📋 Beispiel — Lernprogramm-Vergleich
Ein Institut für Psychologie testet drei Varianten eines Lernprogramms für den Statistik-Einführungskurs. 60 Studienanfänger:innen werden per Zufallszahlengenerator zu gleichen Teilen (n = 20) auf drei Gruppen verteilt, damit sich Vorwissen und Motivation im Mittel gleichmäßig verteilen und nicht systematisch mit der Gruppe zusammenhängen. Kontrollgruppe lernt wie gewohnt mit Skript und Karteikarten in einer Sitzung. Methode A verteilt dieselbe Lernzeit über mehrere kürzere Sitzungen auf zwei Wochen (verteiltes Lernen / spaced practice). Methode B mischt während des Lernens verschiedene Aufgabentypen, statt sie blockweise abzuarbeiten (Interleaving). Zwei Wochen nach Kursende schreiben alle denselben Gedächtnistest (0–150 Punkte, höher = besser erinnert). Frage: Unterscheiden sich die drei Gruppen im Mittel — und wenn ja, wie stark?
Stell dir die drei Gruppenmittelwerte auf einem Zahlenstrahl vor. Liegen sie eng beieinander, ist der Unterschied vermutlich Zufall (Stichprobenrauschen). Liegen sie weit auseinander — weiter, als man angesichts der Streuung innerhalb jeder Gruppe erwarten würde — spricht das für einen echten Effekt des Faktors. Genau dieses Verhältnis misst der F-Wert: Varianz zwischen den Gruppen geteilt durch Varianz innerhalb der Gruppen. Links unter "SAQ-Bereich hervorheben" kannst du beide Bausteine einzeln im Plot sichtbar machen — sie sind unabhängig voneinander an- und ausschaltbar.
Punkte = einzelne Beobachtungen (minimal versetzt, damit sie sich nicht überlappen — der x-Wert selbst trägt keine Information) · dicke Linie = Gruppenmittelwert · gestrichelte Linie = Gesamtmittelwert
—
Die ANOVA-Tabelle
SAQzwischen misst, wie weit die Gruppenmittelwerte vom Gesamtmittelwert entfernt liegen (gewichtet mit der Gruppengröße). SAQinnerhalb misst die Streuung der einzelnen Beobachtungen um ihren jeweiligen Gruppenmittelwert — das, was ein Gruppenunterschied nicht erklären kann. Division durch die jeweiligen Freiheitsgrade ergibt die mittleren Quadratsummen (MQ); ihr Verhältnis MQzwischen/MQinnerhalb ist der F-Wert. η² = SAQzwischen/SAQtotal gibt an, welcher Anteil der Gesamtvarianz durch die Gruppenzugehörigkeit erklärt wird.
Warum reicht der Vergleich der SAQ nicht — wozu die MQ?
SAQzwischen ist eine Summe über k−1 Termen (hier: 2, einer pro Gruppe minus 1), SAQinnerhalb eine Summe über N−k Termen (hier: 57, einer pro Beobachtung minus Gruppenanzahl). Das sind unterschiedlich viele Summanden — und mit jedem zusätzlichen Summanden wächst eine Quadratsumme tendenziell weiter, unabhängig davon, ob überhaupt ein Effekt vorliegt. Ein direkter Vergleich der rohen Summen SAQzwischen vs. SAQinnerhalb würde also vor allem widerspiegeln, wie viele Freiheitsgrade in jede Summe eingeflossen sind — nicht, wie stark der Gruppenunterschied wirklich ist. Erst die Division durch die jeweiligen df "normiert" beide Summen auf eine durchschnittliche quadrierte Abweichung pro Freiheitsgrad — eine Varianzschätzung. Diese beiden Varianzschätzungen (MQzwischen und MQinnerhalb) sind unter H₀ (kein echter Effekt) im Erwartungswert gleich groß, was einem F = 1 entspräche (Zähler und Nenner sind gleich groß). Ihr Verhältnis folgt dann einer bekannten Verteilung, der F-Verteilung — das ist die Grundlage für den Signifikanztest. Ohne die Division durch df gäbe es keine Verteilung, gegen die man vergleichen könnte.
Konzepte & Einordnung
"Innerhalb" = Fehlervarianz
SAQinnerhalb bzw. MQinnerhalb wird in Tabellen und Software meist MQFehler genannt (engl. error oder residual) — dieselbe Größe, anderer Name. Gemeint ist die Streuung, die übrig bleibt, nachdem man die Gruppenzugehörigkeit berücksichtigt hat: individuelle Unterschiede, Messungenauigkeit, alles, was das Modell nicht erklären kann. "Fehler" heißt hier nicht "Messfehler" im engeren Sinn, sondern unerklärte, als zufällig behandelte Streuung — der Rest, den die Gruppenzugehörigkeit nicht aufklärt.
SAQ und MQ auf einen Blick
SAQzwischen + SAQinnerhalb = SAQtotal — die Gesamtstreuung zerfällt vollständig in einen erklärten und einen unerklärten Teil. MQ = SAQ/df macht daraus vergleichbare Varianzschätzungen; F = MQzwischen/MQinnerhalb ist das Verhältnis von erklärter zu unerklärter Varianz pro Freiheitsgrad.
η² als Effektgröße
η² = SAQzwischen/SAQtotal beantwortet eine andere Frage als p: nicht "gibt es einen Effekt?", sondern "wie groß ist er, relativ zur Gesamtstreuung?". Ein winziger, aber signifikanter Effekt (großes n) kann ein kleines η² haben — und umgekehrt. Einordnung neben Cohen's d, r und Odds Ratio: → Effektgrößen.
Zwei Faktoren, vier Zellen — wirkt Faktor A, wirkt Faktor B, und hängt die Wirkung des einen vom anderen ab?
📋 Eigenständiges Beispiel — Lernmethode × Feedback
Zur Illustration der Interaktion reduzieren wir hier bewusst auf zwei Lernmethoden statt der drei aus Tab ① — Klassisch und Verteiltes Lernen — und kreuzen sie mit einem zweiten Faktor: Feedback (ohne / mit unmittelbarer Rückmeldung nach jeder Lerneinheit). Vier Zellen, balanciertes Design (gleiche Zellgröße n pro Zelle). Die Populationswerte hier sind unabhängig von Tab ① gewählt — beide Tabs lassen sich unabhängig voneinander bedienen.
Was bedeutet eine Interaktion überhaupt?
Neben den beiden Haupteffekten (Wirkt A im Mittel über beide B-Stufen? Wirkt B im Mittel über beide A-Stufen?) interessiert die Interaktion: weicht die Wirkung der Kombination aus Methode und Feedback von dem ab, was die Summe der beiden Haupteffekte vorhersagen würde? Ohne Interaktion sind die Effekte additiv — der Feedback-Effekt ist für beide Methoden gleich groß, man kann ihn einfach zum Haupteffekt der Methode dazuzählen. Mit Interaktion lässt sich das nicht mehr trennen: die Wirkung von Feedback unterscheidet sich je nach Methode, und man muss die vier Zellmittelwerte einzeln betrachten, um zu verstehen, was passiert.
Additiv — keine Interaktion
ohne FB
mit FB
Klassisch
100
108
Verteilt
100
108
Feedback-Effekt = +8, bei beiden Methoden identisch → im Plot zwei parallele Linien.
Mit Interaktion
ohne FB
mit FB
Klassisch
100
102
Verteilt
100
120
Feedback-Effekt = +2 bei Klassisch, +20 bei Verteilt → im Plot unterschiedlich steile, sich öffnende Linien.
Wenn sich die Linien dabei sogar kreuzen (Feedback hilft bei einer Methode, schadet aber bei der anderen), spricht man von einer disordinalen Interaktion — die Richtung des Effekts kehrt sich um. Öffnen sich die Linien nur unterschiedlich stark, ohne sich zu kreuzen (wie im Beispiel rechts oben), ist es eine ordinale Interaktion — die Richtung bleibt gleich, nur die Stärke unterscheidet sich. Beide Formen sind statistisch "Interaktion", aber inhaltlich sehr unterschiedlich zu interpretieren.
Tutorial — probier's aus: Die Regler links sind so voreingestellt, dass nur ein Haupteffekt von Feedback existiert (mit FB liegt für beide Methoden gleichermaßen höher), aber kein Haupteffekt der Lernmethode und keine Interaktion. Ändere jetzt gezielt genau eine Zelle — z. B. im 2×2-Regler-Raster links unten rechts (Zeile "Verteilt", Spalte "mit FB") deutlich nach oben. Beobachte: Die Interaktion wird signifikant (die F/p-Werte in der Tabelle unten färben sich rot), während der Haupteffekt der Lernmethode oft weiterhin nicht signifikant bleibt — weil Haupteffekte über die jeweils andere Faktorstufe mitteln, und sich eine Veränderung in nur einer Zelle in diesem Mittel teilweise wegkürzt, obwohl sie lokal sehr wohl einen Unterschied macht.
x-Achse: Faktor A (Lernmethode) · Linienfarbe: Faktor B (Feedback) · kleine Punkte = einzelne Beobachtungen · Fehlerbalken: ±1 SE
—
Warum das nur bei balancierten Designs so glatt aufgeht
Bei gleicher Zellgröße n sind die drei Effekte (A, B, Interaktion) statistisch unabhängig voneinander — deshalb lässt sich jeder für sich betrachten, ohne die anderen "herauszurechnen". Bei unbalancierten Zellgrößen gilt das nicht mehr — mehr dazu in Tab ③ und den Konzeptkarten dort. Kontinuierliche statt kategoriale Interaktionen behandelt → Moderationsanalyse.
Konzepte & Einordnung
"Innerhalb der Zellen" = Fehlervarianz
Genau wie in Tab ① heißt SAQinnerhalb/MQinnerhalb in Tabellen oft MQFehler — die Streuung innerhalb der vier Zellen, gepoolt über alle vier. Sie bleibt dieselbe Rolle spielen, egal ob ein oder zwei Faktoren im Modell stehen: das, was nach Berücksichtigung aller Zellzugehörigkeiten an Streuung übrig bleibt und als zufällig behandelt wird. Alle drei F-Tests (A, B, Interaktion) teilen sich dasselbe MQFehler im Nenner.
Haupteffekt vs. Interaktion
Ein Haupteffekt ist ein Mittelwert über die Stufen des jeweils anderen Faktors — er kann täuschen, wenn eine Interaktion vorliegt (siehe Tutorial oben: nur eine Zelle verändert sich, aber die gemittelten Haupteffekte bleiben unauffällig). Deshalb gilt als Faustregel: immer zuerst die Interaktion prüfen. Ist sie signifikant, sind Haupteffekte allein oft nicht mehr aussagekräftig interpretierbar — dann lohnt der Blick auf die einzelnen Zellmittelwerte statt auf die Randmittelwerte.
Ordinal vs. disordinal
Bei einer ordinalen Interaktion bleibt die Rangfolge der Stufen über den anderen Faktor hinweg gleich — nur der Abstand ändert sich (Linien öffnen sich, kreuzen sich aber nicht). Bei einer disordinalen (Crossover-)Interaktion kehrt sich die Richtung um — was auf einer Stufe hilft, schadet auf der anderen. Disordinale Interaktionen sind praktisch meist die interessanteren, weil sie bedeuten: es gibt keine pauschal "beste" Stufe, es kommt darauf an.
Verwandte Tools
Dieselbe Analyse als Regression mit Produktterm: → Tab ③ Regressions-Brücke. Kontinuierliche statt kategoriale Interaktionen (z. B. Alter statt Lernmethode): → Moderationsanalyse. Faktoren mit zufälligen statt festen Stufen (z. B. Schulklassen): → Multilevel-Modelle.
Regressions-Brücke: dieselbe Analyse, andere Codierung
Genau dieselben Stichproben aus ① und ②, noch einmal als multiple Regression gerechnet.
Eine ANOVAist eine multiple Regression, deren kategorialer Prädiktor auf eine bestimmte Weise numerisch codiert wurde. Das lässt sich direkt nachrechnen: dieselben Rohdaten, einmal mit der klassischen ANOVA-Formel analysiert (Tabs ① und ②), einmal als Regression mit codierten Gruppenprädiktoren — und beide liefern exakt dieselben F- und p-Werte.
Einfaktoriell: Dummy- vs. Effekt-Codierung
Zwei gängige Codierschemata im direkten Vergleich: Dummy-Codierung (eine Referenzgruppe, Koeffizienten = Mittelwertsdifferenzen zur Referenz) und Effekt-Codierung (Summe-Null-Kontraste, Koeffizienten = Abweichungen vom Gesamtmittelwert). Beide Modelle haben drei freie Parameter für drei Gruppen — sie sind "gesättigt" und reproduzieren die drei Gruppenmittelwerte aus Tab ① exakt, unabhängig von der Codierung.
Dummy-Codierung (Referenz: Kontrolle)
Effekt-Codierung (Summe-Null-Kontraste)
—
Eine Parametrisierung, keine zwei Verfahren
F, p, R² und die vorhergesagten Gruppenmittelwerte sind in beiden Codierungen identisch — nur die Bedeutung der einzelnen Koeffizienten ändert sich. R² dieser Regression ist übrigens identisch mit η² aus Tab ①: dieselbe Größe, zweimal berechnet.
Zweifaktoriell: Dummy- vs. Effekt-Codierung (mit Interaktion)
Dieselben zwei Codierschemata wie oben, jetzt mit einem zweiten Faktor und einem Produktterm für die Interaktion. Dummy-Codierung setzt eine Referenzzelle (hier: Klassisch, ohne Feedback); Effekt-Codierung codiert beide Faktoren als ±1-Kontraste. Beide Modelle haben vier freie Parameter für vier Zellen — auch hier "gesättigt", beide reproduzieren die vier Zellmittelwerte aus Tab ② exakt, unabhängig von der Codierung.
Dummy-Codierung (Referenz: Klassisch, ohne Feedback)
Die Produktterm-Regression oben ist eine Moderationsanalyse: XA·XB ist exakt der Interaktions-/Moderationsterm, und der F-Test darauf beantwortet dieselbe Frage wie in Tab ②: hängt der Effekt von A von der Stufe von B ab (und umgekehrt)? Es ist nicht "ANOVA versus Moderationsanalyse" — es ist dasselbe Modell mit zwei Vokabularen für dieselben Bausteine: Faktor A und Faktor B (ANOVA) heißen in der Moderationssprache Prädiktor und Moderator, und die Interaktion A×B heißt dort Interaktionsterm bzw. Moderationseffekt. Ein "Haupteffekt" hat dabei kein eigenes Gegenstück in der Moderationssprache — gemeint ist dort einfach der Effekt von Prädiktor oder Moderator für sich genommen, bei einem festen (meist mittleren) Wert des jeweils anderen. Der praktische Unterschied liegt nur darin, wofür jedes Vokabular typischerweise verwendet wird: die klassische ANOVA-Rechnung setzt kategoriale Faktoren voraus, während die allgemeinere Moderationsanalyse nominale und metrische Prädiktoren beliebig mischen und kombinieren kann — z. B. Lernmethode (kategorial) × Vorwissen-Testscore (metrisch) statt Lernmethode × Feedback-ja/nein. Mehr dazu, inklusive stetiger Moderator-Plots: → Moderationsanalyse.
Konzepte & Einordnung
Dummy- vs. Effekt-Codierung
Dummy-Codierung (R nennt es "treatment contrasts") setzt eine Referenzgruppe; Koeffizienten sind Mittelwertsdifferenzen zu dieser Referenz. Effekt-Codierung (Summe-Null-Kontraste) setzt keinen festen Bezugspunkt; Koeffizienten sind Abweichungen vom Gesamtmittelwert, wie sie SPSS und die meisten ANOVA-Ausgaben implizit verwenden. Beides sind Reparametrisierungen desselben Modells — identische Vorhersagen, identisches F, identisches p.
Typ I (sequenziell): jeder Term wird nur unter Kontrolle der zuvor eingegebenen Terme getestet — reihenfolgeabhängig. Typ II: jeder Haupteffekt unter Kontrolle aller anderen Haupteffekte, aber ohne Interaktionen höherer Ordnung. Typ III: jeder Term unter Kontrolle aller anderen Terme inklusive Interaktionen — das, was die Regression mit Effekt-Codierung liefert. Bei balancierten Designs sind alle drei identisch (Tab ②); bei unbalancierten weichen sie voneinander ab.
Typ-III-SAQ ≡ klassische ANOVA-Tabelle
Bei einem balancierten Design wie hier liefert die Effekt-codierte Regression exakt dieselbe SAQ und F wie die klassische ANOVA-Formel aus Tab ② — für jeden Term. Grund: die drei Kontrastspalten (XA, XB, XA·XB) stehen bei gleicher Zellgröße n wechselseitig senkrecht aufeinander. Bei unbalancierten Zellgrößen gilt das nicht mehr — siehe Lernkarte "SAQ Typ I, II, III".
ANOVA-Tabelle: Anatomie
SAQ (Summe der Abweichungsquadrate, engl. Sum of Squares) = Streuung in Quadrateinheiten der AV. df = Freiheitsgrade. MQ = SAQ/df, eine Varianzschätzung. F = MQEffekt/MQFehler, verglichen mit der F-Verteilung unter H₀ (kein Effekt). Dieselbe Logik wie der F-Test auf R²-Zuwachs in der Regression — nur mit ANOVA-typischem Vokabular für die Quellen der Varianz.
η² und partielles η²
η² = SAQEffekt/SAQtotal, bei einfaktorieller ANOVA identisch mit R² der äquivalenten Regression. Bei mehrfaktoriellen Designs wird meist partiellesη² = SAQEffekt/(SAQEffekt+SAQFehler) berichtet. Einordnung neben Cohen's d, r und Odds Ratio: → Effektgrößen.
Wann ANOVA, wann Regression?
Es ist keine inhaltliche Entscheidung, sondern eine Frage der Berichtskonvention und Softwaregewohnheit — denn die Verfahren sind ineinander verschachtelte Spezialfälle. Ein t-Test ist eine ANOVA mit nur zwei Gruppen. Eine ANOVA wiederum ist eine Regression mit einem oder mehreren kategorialen Dummy-Prädiktoren. Und eine Regression selbst ist nur ein Spezialfall des allgemeinen linearen Modells (GLM) — das sich, sobald verschachtelte oder wiederholt gemessene Daten dazukommen (z. B. Schulklassen, Messwiederholungen), bis zum gemischten Modell (GLMM) erweitern lässt.