Logistische Regression

Dr. R. Düsing · Universität Osnabrück
N ≈ 250 Personen · Raucherentwöhnung X₁ = Alter (Jahre) X₂ = Zigaretten/Tag (vor Intervention) Y = Rückfall nach 12 Monaten (0/1)
Seed: —
Warum nicht OLS?
Das lineare Wahrscheinlichkeitsmodell (LPM) sagt Werte außerhalb [0,1] vorher — die S-Kurve löst das Problem
Alter → P(Rückfall) — AV gejittert (kann nur 0 oder 1 sein)
Neuer Fall: Alter 88
LPM: P(Rückfall)
Logistisch: P(Rückfall)
Gefittete Modelle (dieselben Daten):
LPM: P̂ = + ·Alter
Logit: logit(P̂) = + ·Alter
Tutorial — Warum nicht OLS?

Was Sie sehen
Jede Person hat entweder Rückfall (Y=1, oben) oder keinen Rückfall (Y=0, unten) — die Punkte sind nur zur besseren Lesbarkeit vertikal „gejittert" (leicht verschoben), tatsächlich gibt es nur diese zwei Werte. Beide Kurven sind an denselben simulierten Daten geschätzt: die orangene Gerade ist ein gewöhnliches OLS-Modell (Linear Probability Model, LPM) — lm(Rückfall ~ Alter). Die blaue S-Kurve ist die logistische Regression — glm(Rückfall ~ Alter, family = binomial).

Das Problem des LPM
Eine Gerade kennt keine Grenzen. Schieben Sie den Regler zu einem hohen oder niedrigen Alter — die rot/orange schraffierte Zone markiert, wo das LPM eine Wahrscheinlichkeit außerhalb von [0,1] vorhersagt. Ein „P(Rückfall) = 1.14" oder „= −0.08" ist kein gültiger Wert für eine Wahrscheinlichkeit — das Modell ist an dieser Stelle schlicht falsch spezifiziert.

Die Lösung: S-Kurve
Die logistische Funktion ist so konstruiert, dass sie per Definition nie unter 0 oder über 1 liegen kann — sie nähert sich diesen Grenzen nur asymptotisch an, erreicht sie aber nie. Dadurch sind alle Vorhersagen automatisch plausible Wahrscheinlichkeiten, egal wie extrem der X-Wert ist.

Was tun
Klicken Sie ↻ Neue Daten für eine neue Zufallsstichprobe — die Grundaussage bleibt stabil: Das LPM verletzt seinen eigenen Wertebereich, sobald man sich von der Mitte der Daten entfernt. Die logistische Regression tut das nie. Weiter in Modul : Wie kommt die S-Form eigentlich zustande?

Kernidee: Statt Y direkt linear vorherzusagen, transformiert die logistische Regression die Wahrscheinlichkeit P(Y=1) über Odds und Logit in eine Größe, die unbeschränkt ist (−∞ bis +∞) — dort darf ganz normal linear modelliert werden. Die Rücktransformation (Modul ) sorgt automatisch für die S-Form und damit für gültige Wahrscheinlichkeiten.
Von Wahrscheinlichkeit zu Logit — und zurück
Die Transformationskette P → Odds → Logit — und warum das Exponieren von Koeffizienten Odds Ratios liefert
Teil A — Die Transformationskette (frei wählbares P)
P(Y=1) .70
Wahrscheinlichkeit P
Odds = P/(1−P)
Odds
Logit = ln(Odds)
Logit
P: 0Wertebereich [0, 1]1
Odds: 0Wertebereich [0, ∞) — log-skaliert
Logit: −6Wertebereich (−∞, +∞)+6
Warum drei Schritte? P ist auf [0,1] beschränkt — als lineare Zielgröße ungeeignet. Odds = P/(1−P) lockert die obere Grenze (0 bis ∞), aber die untere bleibt. Erst der Logarithmus der Odds ist komplett unbeschränkt — genau das, was ein lineares Modell b₀ + b₁·X als Zielgröße braucht.
Teil B — Beispielrechnung: Rückfall ~ Geschlecht
Gefittetes Modell (glm, family=binomial): logit(Rückfall) = −0.672 + 0.518 · männlich (weiblich = 0 kodiert, Referenz)
♀ weiblich
33.8%
♂ männlich
46.2%
OR = e0.518 ≈ 1.68 — Männer haben eine 1.68-fach höhere Chance (Odds) auf Rückfall als Frauen. Auf der Wahrscheinlichkeitsskala sind das aber „nur" +12.4 Prozentpunkte (33.8% → 46.2%). 68% höhere Odds ≠ 68% höhere Wahrscheinlichkeit — der Unterschied ist der Kern von Modul .
logit(Y=1|X=0) = b₀  →  logit(P⁰)
logit(Y=1|X=1) = b₀ + b₁  →  logit(P¹)
b₁ = logit(P¹) − logit(P⁰) = ln[ (P¹/(1−P¹)) / (P⁰/(1−P⁰)) ]
⇒ eb₁ = (P¹/(1−P¹)) / (P⁰/(1−P⁰)) = Odds(X=1) / Odds(X=0) = OR

Der Logit-Koeffizient ist also eine Differenz von Log-Odds. Eine Differenz von Logarithmen exponiert sich zu einem Quotienten — deshalb liefert eb immer ein Verhältnis (Odds Ratio), nie eine additive Differenz.
Marginale Effekte auf der Wahrscheinlichkeitsskala
Derselbe Schritt Δ auf der X-Achse — konstante Differenz im Logit, konstantes Verhältnis bei den Odds, aber wechselnde Differenz bei der Wahrscheinlichkeit
Zigaretten/Tag → Logit / Odds / Wahrscheinlichkeit — logit(P) = −2.5 + 0.06 · Zigaretten — Punkte A und B = A+Δ markiert
① Logit — linear
② Odds — exponentiell
③ Wahrscheinlichkeit — S-Kurve
Punkt A 15
Schrittweite Δ 15
① ΔLogit = b₁·Δ
konstant — unabhängig von A
② OR = e^(b₁·Δ)
konstant — unabhängig von A
③ ΔP = P(B) − P(A)
Tutorial — Marginale Effekte

Was Sie sehen
Dieselben zwei Punkte A und B = A+Δ, gleichzeitig in drei Skalen desselben Modells logit(P) = −2.5 + 0.06·Zigaretten geplottet. Der Regler Punkt A verschiebt beide Punkte gemeinsam entlang der X-Achse, Schrittweite Δ ändert den Abstand zwischen ihnen.

Schieben Sie Punkt A hin und her, während Δ fest bleibt
Panel ① (Logit) und die Zahl „ΔLogit" ändern sich nie — die Gerade hat überall dieselbe Steigung b₁. Panel ② (Odds) und „OR" ändern sich ebenfalls nie — derselbe Schritt Δ im Prädiktor bedeutet immer denselben Faktor auf der Odds-Skala. Aber Panel ③ (Wahrscheinlichkeit) und „ΔP" ändern sich deutlich, je nachdem wo A gerade liegt.

Warum?
Logit-Differenzen sind additiv (b₁·Δ ist eine Konstante), Odds-Verhältnisse sind multiplikativ (e^(b₁·Δ) ist eine Konstante) — aber die Wahrscheinlichkeit ist eine gekrümmte Funktion des Logits. Derselbe additive/multiplikative Schritt landet mal auf dem steilen Mittelteil der S-Kurve (großes ΔP), mal auf einem flachen Rand (kleines ΔP).

Warum reicht eine Zahl nicht?
Ein einzelner OR oder Logit-Koeffizient beschreibt den Zusammenhang vollständig auf der Logit-Skala — aber niemand denkt in Logits. Sobald man auf die Wahrscheinlichkeitsskala zurückrechnet (wofür Menschen eine Intuition haben), ist der Effekt nicht mehr konstant. Nur eine Kurve — kein einzelner Koeffizient — zeigt, wo der Prädiktor viel und wo er wenig bewirkt. Das ist der Grund, warum in Modul immer geplottet statt nur tabelliert wird.

Momentaner (marginaler) Effekt bei Punkt A
Lässt man Δ gegen 0 schrumpfen, wird aus der ΔP-Sekante von oben die Tangente an der S-Kurve bei A — die momentane Änderungsrate dP/dX = b₁ · P·(1−P). Diese Kurve ist eine nach unten geöffnete Parabel in P: maximal bei P=0.5 (Wert 0.25), null bei P=0 oder P=1. Sie fasst zusammen, was die drei Panels oben bereits zeigen: derselbe Logit-Koeffizient b₁ hat den größten Effekt auf die Wahrscheinlichkeit in der Mitte der S-Kurve und fast keinen an ihren Rändern. Software (z. B. R-Paket marginaleffects, Stata margins) berichtet meist entweder den Average Marginal Effect (Mittelwert von dP/dX über alle beobachteten X) oder den Marginal Effect at the Mean (dP/dX ausgewertet bei X̄) als Kompromisszahl für diese Kurve.
Mehrere Prädiktoren — warum plotten?
Kategoriale und metrische Prädiktoren gemeinsam im Modell, zurückgerechnet auf Wahrscheinlichkeiten mit 95%-CI
Geschlecht × Schicht — vorhergesagte P(Rückfall), 95%-CI aus refittiertem Modell
b₀ (Basis)−0.91
Effekt männlich+0.54
Effekt Schicht mittel−0.04
Effekt Schicht niedrig+0.69
Interaktion m×niedrig0.00
Tutorial — Mehrere Prädiktoren visualisieren

Ansicht „Geschlecht × Schicht"
Zwei kategoriale Prädiktoren + Interaktion sind als Koeffizienten-Tabelle kaum intuitiv zu lesen: sechs Zahlen (Intercept, 2 Haupteffekte, ggf. Interaktion) auf der Logit-Skala. Zurückgerechnet auf Wahrscheinlichkeiten ergeben sie sechs Balken mit 95%-Konfidenzintervall — auf einen Blick sichtbar, welche Gruppe das höchste Rückfallrisiko trägt und wo sich die Konfidenzintervalle überlappen (kein sicherer Unterschied).

Ansicht „Schicht × Zigaretten"
Ein kategorialer und ein metrischer Prädiktor gemeinsam: drei S-Kurven (eine je Schicht) über den Zigarettenkonsum, mit Konfidenzband. So sieht man gleichzeitig den Effekt des metrischen Prädiktors (Kurvenform, Modul ) und den Versatz durch die kategoriale Variable (Abstand zwischen den Kurven) — beides gemeinsam wäre aus einer Koeffiziententabelle allein nicht ablesbar.

Regler: Effekte selbst verändern
Links lassen sich b₀, die Haupteffekte und eine Interaktion auf der Logit-Skala frei einstellen. Erhöhen Sie z. B. „Interaktion m×niedrig": der Geschlechtsunterschied wird in der Schicht „niedrig" größer oder kleiner als in den anderen Schichten — die Balken laufen sichtbar auseinander statt parallel zu bleiben. In der zweiten Ansicht dreht „Interaktion Zig.×niedrig" die Steigung einer einzelnen S-Kurve gegenüber den anderen beiden. ↺ Vorlesungswerte setzt die Originalwerte aus der Vorlesung zurück.

Woher kommen die Konfidenzintervalle?
Nicht frei erfunden: Für die aktuell eingestellten Effekte wird ein synthetischer, aber realistischer Datensatz simuliert und live per Newton-Raphson (IRLS) neu an dieses Modul gefittet — derselbe Algorithmus, den auch R's glm() verwendet. Die CIs sind echte Wald-Konfidenzintervalle aus der Kovarianzmatrix dieses Fits, keine Illustration. Der Info-Kasten links zeigt beides: die eingestellten Effekte und was ein Fit an den simulierten Daten (mit echtem Sampling-Rauschen) davon zurückgewinnt.

Bezug zum GLM-Rahmen
Die logistische Regression ist ein Spezialfall des Generalisierten Linearen Modells: gleiche Prädiktorstruktur (Haupteffekte, Interaktionen, Dummy-Codierung) wie in OLS & Multiple Regression oder ANOVA — nur mit Logit-Link statt Identitäts-Link und Binomial- statt Normalverteilung. Für die Gütebeurteilung der Klassifikation (Cutoff, Sensitivität/Spezifität, ROC/AUC) siehe das eigenständige Tool Sensitivität & Spezifität. Für logistische Regression als Werkzeug zur Konfundierungskontrolle siehe Propensity Score Matching.

Lernkarten — Logistische Regression
Warum nicht OLS?
Ein binäres Y (0/1) mit gewöhnlicher OLS-Regression zu modellieren (Linear Probability Model) führt zu Vorhersagen außerhalb von [0,1] — keine gültigen Wahrscheinlichkeiten. Die logistische Regression löst das über eine S-förmige Funktion, die per Konstruktion nie unter 0 oder über 1 liegen kann.
P → Odds → Logit
Odds = P/(1−P) lockert die Obergrenze, Logit = ln(Odds) entfernt auch die Untergrenze — erst der Logit ist unbeschränkt (−∞, +∞) und damit als lineare Zielgröße geeignet: logit(P) = b₀ + b₁·X.
OR = eb₁ — Differenzen von Log-Odds exponieren sich zu Verhältnissen, nicht zu Differenzen. OR = 1.68 heißt: 68% höhere Chance, nicht 68 Prozentpunkte höhere Wahrscheinlichkeit. Diese Verwechslung ist der häufigste Interpretationsfehler bei logistischer Regression.
Marginaler Effekt ist nicht konstant
dP/dX = b₁ · P·(1−P) — derselbe Logit-Koeffizient b₁ bewirkt je nach aktuellem P einen unterschiedlich großen Effekt auf die Wahrscheinlichkeit: maximal bei P = 0.5, minimal an den Rändern (P nahe 0 oder 1).
Deshalb: immer plotten
Weil der Effekt auf der Wahrscheinlichkeitsskala von der Position auf der S-Kurve abhängt, genügt eine Koeffiziententabelle allein nicht. Vorhergesagte Wahrscheinlichkeiten mit Konfidenzintervall — als Kurve oder Balkendiagramm — sind der Standard, um logistische Modelle verständlich zu berichten.
Ein Spezialfall des GLM
Logistische Regression = GLM mit Logit-Link und Binomialverteilung. Dieselbe Prädiktorlogik (Haupteffekte, Interaktionen, Dummy-Codierung) wie bei OLS gilt weiter — nur die Rücktransformation auf die Skala des Outcomes unterscheidet sich.
? Hilfe — Logistische Regression

Wozu logistische Regression?

Wenn die abhängige Variable Y binär ist (0/1, z. B. Rückfall ja/nein), verletzt eine gewöhnliche OLS-Regression (Linear Probability Model) systematisch ihren eigenen Wertebereich: sie sagt Wahrscheinlichkeiten unter 0 oder über 1 vorher. Die logistische Regression modelliert stattdessen den Logit von P(Y=1) linear:

logit(P) = ln( P / (1−P) ) = b₀ + b₁·X₁ + … + bₖ·Xₖ

Rücktransformiert ergibt das eine S-förmige Funktion, die für jeden X-Wert eine gültige Wahrscheinlichkeit liefert:

P(Y=1) = 1 / (1 + e−(b₀+b₁·X))

▸ Schätzung: Maximum Likelihood / IRLS (für Interessierte)
Anders als OLS hat die logistische Regression keine geschlossene Lösung. Geschätzt wird per Maximum Likelihood, iterativ über Iteratively Reweighted Least Squares (IRLS, äquivalent zu Newton-Raphson): In jedem Schritt wird ein gewichtetes lineares Modell gelöst, wobei sich die Gewichte w = P̂·(1−P̂) aus der aktuellen Schätzung ergeben. Dieses Verfahren wird in Modul dieses Tools tatsächlich in JavaScript ausgeführt, um die dortigen Konfidenzintervalle zu berechnen — derselbe Algorithmus wie in R's glm().

Koeffizienten interpretieren

b₁ (Logit-Skala): „Pro +1 Einheit X steigt der Logit von P(Y=1) um b₁" — korrekt, aber praktisch unanschaulich, da niemand in Logits denkt.

OR = eb₁ (Odds Ratio): „Pro +1 Einheit X multipliziert sich die Chance (Odds) auf Y=1 mit dem Faktor OR." Multiplikativ, nicht additiv — ein OR von 2 heißt „doppelt so hohe Chance", nicht „50 Prozentpunkte mehr".

Vorhergesagte Wahrscheinlichkeit: Die einzige Größe, die sich Menschen intuitiv vorstellen können. Sie ist aber nichtlinear in X — deshalb Modul dieses Tools.

Warum sind marginale Effekte nicht konstant?

Die Ableitung von P nach X ist dP/dX = b₁ · P·(1−P). Der Term P·(1−P) ist eine nach unten geöffnete Parabel mit Maximum bei P=0.5 (Wert 0.25) und Nullstellen bei P=0 und P=1. Derselbe Logit-Koeffizient hat also nahe der Extreme kaum Effekt auf die Wahrscheinlichkeit, in der Mitte dagegen den größten. Software berichtet meist den Average Marginal Effect (AME) als Kompromisszahl.

Was logistische Regression nicht ersetzt

  • Klassifikationsgüte (Cutoff, Sensitivität/Spezifität, ROC/AUC) — eigenes Thema, siehe Sensitivität & Spezifität
  • Mehr als zwei Kategorien — dafür multinomiale bzw. ordinale logistische Regression (Verallgemeinerungen, hier nicht behandelt)
  • Kausalität — auch bei perfekt spezifiziertem Modell bleibt logistische Regression eine Assoziationsmethode, siehe Kausale Inferenz

Verwandte Tools

Literatur

Hosmer, D. W., Lemeshow, S. & Sturdivant, R. X. (2013). Applied Logistic Regression (3rd ed.). Wiley.