Effektstärken richtig deuten: Ergebnisse jenseits der Signifikanz bewerten

Ein Mann erklärt die Effektstärke an einem Whiteboard während einer Präsentation.

Effektstärke und Signifikanz müssen zusammen interpretiert werden

Ein sehr kleiner p Wert sieht zunächst nach einem starken Befund aus. Er sagt jedoch nichts darüber aus, ob ein Unterschied inhaltlich ins Gewicht fällt. Ob ein Ergebnis für die Praxis, eine Theorie oder eine klinische Entscheidung Bedeutung hat, zeigt erst die Effektstärke: die Größe des Effekts, seine Genauigkeit, die Messskala und der Kontext, in dem die Daten entstanden sind.

In Abschlussarbeiten und Fachbeiträgen wiederholt sich ein Muster: Der p Wert steht im Mittelpunkt, die Effektstärke erscheint nur als Zahl in einer Tabelle, und die Bewertung erfolgt über feste Schwellen, die einen Effekt als klein, mittel oder groß abstempeln. Tragfähig ist das nicht. Eine gute Interpretation beschreibt, was der beobachtete Effekt bedeutet und wie verlässlich diese Aussage ist.

Signifikanz und Bedeutsamkeit sind zwei Dinge

Der p Wert beschreibt, wie gut die Daten mit der Annahme vereinbar sind, dass kein Effekt vorliegt. Er hängt stark von der Fallzahl ab: In sehr großen Stichproben erreichen selbst winzige Unterschiede das übliche Signifikanzniveau, während ein bedeutsamer Effekt in einer kleinen Stichprobe unentdeckt bleiben kann.

Ein Beispiel: Eine Behandlung senkt einen Symptomscore im Mittel um 0,3 Punkte gegenüber der Kontrollgruppe. Bei mehreren Tausend Teilnehmenden kann das statistisch klar ausfallen. Gilt fachlich erst eine Verbesserung von zwei Punkten als merklich, bleibt der Befund praktisch belanglos. Der p Wert wird dadurch nicht überflüssig, er ergänzt die Effektstärke.

Mann am Laptop in einem Raum, arbeitet an der Bewertung von Effektstärken.

Herr Schwarz präsentiert jeden Freitag um 11:00 den digitalen Crashkurs bei Easy Statistik

Welche Kennzahl zu welchem Design passt

Welche Effektstärke passt, ergibt sich aus Fragestellung, Skalenniveau und Verfahren. Kennzahlen aus verschiedenen Familien lassen sich nicht beliebig gegeneinander aufrechnen.

Unterschiede zwischen zwei Gruppen

Bei zwei unabhängigen Gruppen ist Cohen d verbreitet: Die Kennzahl vergleicht den Abstand der Mittelwerte mit der Streuung in den Daten. Ein d von 0,50 heißt, dass die Gruppen etwa eine halbe Standardabweichung auseinanderliegen; dadurch werden Studien mit unterschiedlichen Skalen vergleichbar. Bei kleinen Stichproben ist Hedges g meist besser, weil es eine Korrektur gegen systematische Überschätzung enthält. Wiederholte Messungen an denselben Personen brauchen eigene Formeln, weil die Messungen voneinander abhängen.

Zusammenhänge zwischen Merkmalen

Für lineare Zusammenhänge zweier metrischer Variablen dient der Korrelationskoeffizient r: Das Vorzeichen zeigt die Richtung, der Betrag die Stärke. Ein r von minus 0,40 beschreibt einen moderaten Zusammenhang, bei dem höhere Werte auf einer Skala mit niedrigeren auf der anderen einhergehen. Quadriert ergibt r = 0,40 den Wert 0,16, unter den Modellannahmen also 16 Prozent gemeinsame Varianz. Ein Kausalnachweis folgt daraus nicht. In Modellen mit mehreren Prädiktoren ist das korrigierte R² aussagekräftiger.

Varianzanalysen mit mehreren Faktoren

Hier begegnen dir Eta Quadrat (η²) und partielles Eta Quadrat (ηp²). Beide geben Varianzanteile an, sind aber nicht identisch: Das partielle Maß bezieht den Effekt auf die zugehörige Fehlerstreuung und fällt in komplexen Designs höher aus. Gib deshalb immer an, welche Variante du berichtest. Omega Quadrat (ω²) liefert eine vorsichtigere Schätzung für die Population.

Endpunkte mit zwei Ausprägungen

Bei Ergebnissen, die nur eintreten oder ausbleiben, dienen Odds Ratio, Risk Ratio und Risikodifferenz. Eine Odds Ratio von 2 klingt beachtlich, bleibt ohne Ausgangsrisiko aber schwer deutbar: Steigt ein Risiko von 1 auf 2 Prozent, verdoppelt es sich relativ, absolut wächst es um einen Prozentpunkt. Gerade bei Gesundheitsthemen gehört die absolute Differenz dazu.

Schwellenwerte sind nur eine Orientierung

Die Marken 0,20, 0,50 und 0,80 für Cohen d sind Konventionen, keine Naturgesetze. Ein d von 0,20 kann viel bewegen, wenn eine Maßnahme günstig ist und viele Menschen erreicht; ein d von 0,80 überzeugt kaum, wenn die Umsetzung teuer oder belastend ist. Hilfreicher sind Vergleichswerte aus Metaanalysen, früheren Untersuchungen oder validierten klinischen Schwellen. Fehlen solche Bezugspunkte, benenne die Lücke offen. Vertiefende Beiträge zu einzelnen Verfahren finden sich im Ratgeber zu Statistik und Datenanalyse.

Vortrag über Effektstärken mit Präsentation in einem Seminar.

Statistik ist die Sprache der angewandten Wissenschaft

Konfidenzintervalle zeigen die Genauigkeit

Eine Effektstärke ohne Intervallschätzung bleibt unvollständig. Das 95% Konfidenzintervall umfasst jene Werte, die mit Daten und Modellannahmen gut vereinbar sind. Ein d von 0,45 mit Intervall von 0,35 bis 0,55 ist deutlich präziser als derselbe Schätzwert mit Intervall von minus 0,10 bis 1,00: Dort sind ein kleiner negativer und ein großer positiver Effekt gleichermaßen denkbar. Breite Intervalle entstehen durch kleine Stichproben, starke Streuung oder wenige Ereignisse; sie sind Teil des Ergebnisses.

So berichtest du Effektstärken

Trenne Beobachtung und Bewertung: Nenne zuerst Verfahren, Effektstärke, Konfidenzintervall und p Wert, danach folgt die Deutung. Eine Formulierung kann lauten: „Die Interventionsgruppe erzielte einen höheren Mittelwert als die Kontrollgruppe, t(98) = 2,31, p = ,023, Hedges g = 0,46, 95% KI [0,06; 0,86].“ Ob der Effekt als mittelgroß gilt, ist mit Blick auf das Fachgebiet zu prüfen.

  • Gib den konkreten Zahlenwert an, nicht nur eine verbale Kategorie.
  • Nenne das Konfidenzintervall direkt neben dem Schätzwert.
  • Wähle eine Kennzahl, die zum Design und zum Verfahren passt.
  • Begründe Relevanz fachlich und vermeide unbelegte kausale Aussagen.

Häufige Fehldeutungen

Ein nicht signifikantes Ergebnis beweist nicht das Fehlen eines Effekts; häufig ist die Studie zu unpräzise. Entscheidend ist, welche Effekte das Konfidenzintervall einschließt. Umgekehrt ist ein großer Effekt nicht automatisch glaubwürdig: Kleine, selektive Stichproben und viele parallel geprüfte Hypothesen erzeugen auffällige Werte. Zahlen aus SPSS, R, JASP, Jamovi, Stata oder Python sind nur ein Zwischenschritt.

Fazit

Effektstärken zeigen, wie groß ein Befund ist und wie genau er geschätzt wurde. Wer die passende Kennzahl wählt, das Konfidenzintervall mitberichtet und die Bedeutung fachlich begründet, liefert eine belastbare Interpretation. Bei methodischen Unsicherheiten kann eine statistische Beratung die Auswertung und ihre Darstellung prüfen.

Diese Webseite verwendet Cookies

Diese Webseite nutzt Cookies, um Ihnen das bestmögliche Erlebnis zu gewährleisten. Cookies helfen uns, die Webseite mit Analysen zu verbessern. Mit einem Klick auf „Zustimmen“, stimmen Sie der Verwendung von Cookies zu. Sie können Ihre Einwilligung jederzeit ändern, indem Sie unter "Optionen verwalten" Ihre getroffenen Einstellungen selbst rückgängig machen. Weitere Informationen finden Sie in unserer Datenschutzerklärung.

Privatsphäre-Einstellungen

Wir verwenden Cookies und ähnliche Technologien auf unserer Website und verarbeiten personenbezogene Daten von dir (z.B. IP-Adresse), um z.B. Inhalte und Anzeigen zu personalisieren, Medien von Drittanbietern einzubinden oder Zugriffe auf unsere Website zu analysieren.

Die Datenverarbeitung kann auch erst in Folge gesetzter Cookies stattfinden. Wir teilen diese Daten mit Dritten, die wir in den Privatsphäre-Einstellungen benennen.

Einige Services verarbeiten personenbezogene Daten in den USA. Indem du der Nutzung dieser Services zustimmst, erklärst du dich auch mit der Verarbeitung deiner Daten in den USA gemäß Art. 49 (1) lit. a DSGVO einverstanden. Die USA werden vom EuGH als ein Land mit einem unzureichenden Datenschutzniveau nach EU-Standards angesehen. Insbesondere besteht das Risiko, dass deine Daten von US-Behörden zu Kontroll- und Überwachungszwecken verarbeitet werden, unter Umständen ohne die Möglichkeit eines Rechtsbehelfs.

Du bist unter 16 Jahre alt? Dann kannst du nicht in optionale Services einwilligen. Du kannst deine Eltern oder Erziehungsberechtigten bitten, mit dir in diese Services einzuwilligen.


Ihre Einstellungen für Einwilligungen

Hier haben Sie die Möglichkeit, Ihre Einwilligung für die Datenverarbeitung durch Cookies zu erteilen oder zu widerrufen. Sie können Ihre Einstellungen jederzeit ändern. Weitere Informationen finden Sie in unserer Datenschutzerklärung.