Effektstärken richtig deuten: Ergebnisse jenseits der Signifikanz bewerten
Effektstärke und Signifikanz müssen zusammen interpretiert werden
Ein sehr kleiner p Wert sieht zunächst nach einem starken Befund aus. Er sagt jedoch nichts darüber aus, ob ein Unterschied inhaltlich ins Gewicht fällt. Ob ein Ergebnis für die Praxis, eine Theorie oder eine klinische Entscheidung Bedeutung hat, zeigt erst die Effektstärke: die Größe des Effekts, seine Genauigkeit, die Messskala und der Kontext, in dem die Daten entstanden sind.
In Abschlussarbeiten und Fachbeiträgen wiederholt sich ein Muster: Der p Wert steht im Mittelpunkt, die Effektstärke erscheint nur als Zahl in einer Tabelle, und die Bewertung erfolgt über feste Schwellen, die einen Effekt als klein, mittel oder groß abstempeln. Tragfähig ist das nicht. Eine gute Interpretation beschreibt, was der beobachtete Effekt bedeutet und wie verlässlich diese Aussage ist.
Signifikanz und Bedeutsamkeit sind zwei Dinge
Der p Wert beschreibt, wie gut die Daten mit der Annahme vereinbar sind, dass kein Effekt vorliegt. Er hängt stark von der Fallzahl ab: In sehr großen Stichproben erreichen selbst winzige Unterschiede das übliche Signifikanzniveau, während ein bedeutsamer Effekt in einer kleinen Stichprobe unentdeckt bleiben kann.
Ein Beispiel: Eine Behandlung senkt einen Symptomscore im Mittel um 0,3 Punkte gegenüber der Kontrollgruppe. Bei mehreren Tausend Teilnehmenden kann das statistisch klar ausfallen. Gilt fachlich erst eine Verbesserung von zwei Punkten als merklich, bleibt der Befund praktisch belanglos. Der p Wert wird dadurch nicht überflüssig, er ergänzt die Effektstärke.

Herr Schwarz präsentiert jeden Freitag um 11:00 den digitalen Crashkurs bei Easy Statistik
Welche Kennzahl zu welchem Design passt
Welche Effektstärke passt, ergibt sich aus Fragestellung, Skalenniveau und Verfahren. Kennzahlen aus verschiedenen Familien lassen sich nicht beliebig gegeneinander aufrechnen.
Unterschiede zwischen zwei Gruppen
Bei zwei unabhängigen Gruppen ist Cohen d verbreitet: Die Kennzahl vergleicht den Abstand der Mittelwerte mit der Streuung in den Daten. Ein d von 0,50 heißt, dass die Gruppen etwa eine halbe Standardabweichung auseinanderliegen; dadurch werden Studien mit unterschiedlichen Skalen vergleichbar. Bei kleinen Stichproben ist Hedges g meist besser, weil es eine Korrektur gegen systematische Überschätzung enthält. Wiederholte Messungen an denselben Personen brauchen eigene Formeln, weil die Messungen voneinander abhängen.
Zusammenhänge zwischen Merkmalen
Für lineare Zusammenhänge zweier metrischer Variablen dient der Korrelationskoeffizient r: Das Vorzeichen zeigt die Richtung, der Betrag die Stärke. Ein r von minus 0,40 beschreibt einen moderaten Zusammenhang, bei dem höhere Werte auf einer Skala mit niedrigeren auf der anderen einhergehen. Quadriert ergibt r = 0,40 den Wert 0,16, unter den Modellannahmen also 16 Prozent gemeinsame Varianz. Ein Kausalnachweis folgt daraus nicht. In Modellen mit mehreren Prädiktoren ist das korrigierte R² aussagekräftiger.
Varianzanalysen mit mehreren Faktoren
Hier begegnen dir Eta Quadrat (η²) und partielles Eta Quadrat (ηp²). Beide geben Varianzanteile an, sind aber nicht identisch: Das partielle Maß bezieht den Effekt auf die zugehörige Fehlerstreuung und fällt in komplexen Designs höher aus. Gib deshalb immer an, welche Variante du berichtest. Omega Quadrat (ω²) liefert eine vorsichtigere Schätzung für die Population.
Endpunkte mit zwei Ausprägungen
Bei Ergebnissen, die nur eintreten oder ausbleiben, dienen Odds Ratio, Risk Ratio und Risikodifferenz. Eine Odds Ratio von 2 klingt beachtlich, bleibt ohne Ausgangsrisiko aber schwer deutbar: Steigt ein Risiko von 1 auf 2 Prozent, verdoppelt es sich relativ, absolut wächst es um einen Prozentpunkt. Gerade bei Gesundheitsthemen gehört die absolute Differenz dazu.
Schwellenwerte sind nur eine Orientierung
Die Marken 0,20, 0,50 und 0,80 für Cohen d sind Konventionen, keine Naturgesetze. Ein d von 0,20 kann viel bewegen, wenn eine Maßnahme günstig ist und viele Menschen erreicht; ein d von 0,80 überzeugt kaum, wenn die Umsetzung teuer oder belastend ist. Hilfreicher sind Vergleichswerte aus Metaanalysen, früheren Untersuchungen oder validierten klinischen Schwellen. Fehlen solche Bezugspunkte, benenne die Lücke offen. Vertiefende Beiträge zu einzelnen Verfahren finden sich im Ratgeber zu Statistik und Datenanalyse.

Statistik ist die Sprache der angewandten Wissenschaft
Konfidenzintervalle zeigen die Genauigkeit
Eine Effektstärke ohne Intervallschätzung bleibt unvollständig. Das 95% Konfidenzintervall umfasst jene Werte, die mit Daten und Modellannahmen gut vereinbar sind. Ein d von 0,45 mit Intervall von 0,35 bis 0,55 ist deutlich präziser als derselbe Schätzwert mit Intervall von minus 0,10 bis 1,00: Dort sind ein kleiner negativer und ein großer positiver Effekt gleichermaßen denkbar. Breite Intervalle entstehen durch kleine Stichproben, starke Streuung oder wenige Ereignisse; sie sind Teil des Ergebnisses.
So berichtest du Effektstärken
Trenne Beobachtung und Bewertung: Nenne zuerst Verfahren, Effektstärke, Konfidenzintervall und p Wert, danach folgt die Deutung. Eine Formulierung kann lauten: „Die Interventionsgruppe erzielte einen höheren Mittelwert als die Kontrollgruppe, t(98) = 2,31, p = ,023, Hedges g = 0,46, 95% KI [0,06; 0,86].“ Ob der Effekt als mittelgroß gilt, ist mit Blick auf das Fachgebiet zu prüfen.
- Gib den konkreten Zahlenwert an, nicht nur eine verbale Kategorie.
- Nenne das Konfidenzintervall direkt neben dem Schätzwert.
- Wähle eine Kennzahl, die zum Design und zum Verfahren passt.
- Begründe Relevanz fachlich und vermeide unbelegte kausale Aussagen.
Häufige Fehldeutungen
Ein nicht signifikantes Ergebnis beweist nicht das Fehlen eines Effekts; häufig ist die Studie zu unpräzise. Entscheidend ist, welche Effekte das Konfidenzintervall einschließt. Umgekehrt ist ein großer Effekt nicht automatisch glaubwürdig: Kleine, selektive Stichproben und viele parallel geprüfte Hypothesen erzeugen auffällige Werte. Zahlen aus SPSS, R, JASP, Jamovi, Stata oder Python sind nur ein Zwischenschritt.
Fazit
Effektstärken zeigen, wie groß ein Befund ist und wie genau er geschätzt wurde. Wer die passende Kennzahl wählt, das Konfidenzintervall mitberichtet und die Bedeutung fachlich begründet, liefert eine belastbare Interpretation. Bei methodischen Unsicherheiten kann eine statistische Beratung die Auswertung und ihre Darstellung prüfen.