Likert Skalen auswerten: so findest du das passende Analyseverfahren
Likert Skalen einer Umfrage auswerten
Die Daten sind erhoben, und genau an dieser Stelle beginnt oft die eigentliche Unsicherheit: Darfst du aus Antwortstufen von „stimme gar nicht zu“ bis „stimme völlig zu“ einen Mittelwert bilden? Oder sind das rein ordinale Kategorien, die nichtparametrische Verfahren verlangen? Eine pauschale Regel gibt es nicht. Entscheidend sind der Aufbau deines Messinstruments, deine Forschungsfrage und die Eigenschaften deiner Daten.
In Abschlussarbeiten, Dissertationen und Publikationen entscheidet diese Wahl über die Nachvollziehbarkeit deiner Ergebnisse. Wer einzelne Aussagen, zusammengefasste Skalenwerte und Testverfahren vermischt, muss mit Rückfragen von Betreuenden oder Gutachtenden rechnen. Eine klare Reihenfolge der Prüfschritte senkt dieses Risiko.
Einzelnes Item oder zusammengesetzte Skala
Ein Likert Item ist eine einzelne Aussage mit geordneten Antwortkategorien, etwa: „Ich fühle mich durch meine Arbeit stark belastet.“ Beantwortet wird sie beispielsweise auf fünf Stufen von 1 (stimme gar nicht zu) bis 5 (stimme völlig zu). Ob die Abstände zwischen den Stufen gleich groß sind, ist nicht gesichert: Der Schritt zu „teils teils“ kann subjektiv kleiner wirken als der nächste.
Eine Likert Skala liegt vor, wenn mehrere verwandte Items gemeinsam ein Konstrukt abbilden, etwa Belastung, Lebensqualität, Therapieadhärenz oder Markenvertrauen. Aus ihnen entsteht ein Summenwert oder ein Mittelwertscore. Die Debatte um ordinales oder metrisches Skalenniveau wird bei einem einzelnen Item deutlich strenger geführt als bei einem Score aus mehreren geeigneten Items.
Prüfe deshalb vor jeder Berechnung drei Punkte:
- Messen alle Items tatsächlich dasselbe Konstrukt?
- Sind negativ formulierte Aussagen korrekt umgepolt?
- Bedeutet ein hoher Wert bei jedem Item dieselbe inhaltliche Richtung?
Ein übersehener Polungsfehler entwertet eine Skala inhaltlich und statistisch.
Vor der Analyse: Daten und Instrument prüfen
Die Auswertung startet nicht im Testmenü von SPSS, R oder Jamovi, sondern bei einer dokumentierten Datenkontrolle. Sieh dir den Wertebereich jeder Variable an. Typische Fehlerquellen sind verwechselte Codes für fehlende Werte, undokumentierte Sonderwerte wie 99 und eine uneinheitliche Codierung einzelner Fragen.
Negativ gepolte Items werden vor der Skalenbildung umgerechnet. Bei fünf Stufen wird aus 1 die 5 und aus 2 die 4; der neue Wert ergibt sich aus 6 minus altem Wert, bei sieben Stufen aus 8 minus altem Wert. Halte diesen Schritt im Methodenteil fest.
Danach klärst du den Umgang mit fehlenden Werten. Ganze Fälle auszuschließen kostet bei wenigen Lücken unnötig Information. Ein Mittelwert über die beantworteten Items kann vertretbar sein, wenn nur ein vorab definierter kleiner Anteil fehlt. Ob bei zehn Items eine oder sechs Antworten fehlen, macht einen erheblichen Unterschied.

Datenvorbereitung und Bereingung ist ein Grundpfeiler sauberer Studien
Reliabilität ist mehr als eine Pflichtangabe
Vor der Bildung eines Gesamtwerts gehört die interne Konsistenz auf den Prüfstand. Cronbachs Alpha ist verbreitet, aber nicht automatisch die beste Kennzahl; McDonalds Omega urteilt oft treffender, wenn Items unterschiedlich stark zum Konstrukt beitragen. Ein hoher Wert belegt keine Eindimensionalität, denn sehr ähnlich formulierte Items heben Alpha künstlich an. Ein niedriger Wert kann auf heterogene Inhalte, wenige Items oder Polungsfehler hindeuten. Bei neu entwickelten Instrumenten ist eine Faktorenanalyse häufig der sinnvollere nächste Schritt.
Mittelwert, Summe oder Median
Für einzelne Items sind Häufigkeiten und Prozentangaben fast immer aussagekräftig, ergänzt durch Median und Interquartilsabstand. Diese Kennwerte achten die Rangordnung der Kategorien und zeigen die tatsächliche Verteilung. Ein Mittelwert darf beschreibend auftauchen, sollte aber keine Scheingenauigkeit erzeugen.
Bei einem Score aus mehreren reliablen, homogenen Items ist ein Mittelwert in vielen Fächern üblich und gut begründbar. Er bleibt auf der ursprünglichen Antwortskala interpretierbar: 4,1 auf einer Skala von 1 bis 5 erschließt sich schneller als eine Summe von 41 bei zehn Items.
Ob du solche Werte wie metrische Größen behandeln darfst, hängt von der Itemzahl, der Verteilung, der Stichprobengröße, möglichen Bodeneffekten oder Deckeneffekten und dem Modell ab. Ein Score aus acht oder zwölf funktionierenden Items verhält sich oft annähernd intervallskaliert, ein stark schiefes Einzelitem nicht.
Welches Testverfahren passt zur Fragestellung
Die Wahl folgt der abhängigen Variable und dem Studiendesign, nicht dem Etikett „Likert“. Vergleichst du einen gut verteilten Skalenmittelwert zwischen zwei unabhängigen Gruppen, kann ein t Test passen; bei mehreren Gruppen kommt eine Varianzanalyse infrage. Für Zusammenhänge eignen sich Korrelationen und lineare Regressionen, sofern die Voraussetzungen geprüft und offengelegt werden. Vertiefende Erläuterungen finden sich im Ratgeber zu Statistik und Datenanalyse.
Bei eindeutig ordinalen Einzelitems oder stark problematischen Verteilungen sind ordinale Modelle meist die stärkere Wahl. Für Gruppenvergleiche kommen je nach Design der Mann Whitney U Test oder der Kruskal Wallis Test infrage. Beide prüfen keine Medianunterschiede, sondern Unterschiede in den Rangverteilungen. Für wiederholte Messungen gelten eigene Verfahren.
Ist ein einzelnes Item die Zielvariable und sollen mehrere Einflussfaktoren einbezogen werden, passt ein ordinales Regressionsmodell: Es nutzt die Rangordnung, ohne gleiche Abstände zu unterstellen. Zu prüfen sind dafür die Modellannahmen, insbesondere die proportionalen Odds. Verlasse dich außerdem nicht allein auf einen Normalitätstest; bei großen Stichproben wird er schnell signifikant. Histogramme, Quantildiagramme, Ausreißerdiagnostik und die Residuen liefern die bessere Grundlage.

Überlass deine Statistik nicht dem Zufall
Ergebnisse nachvollziehbar berichten
Ein überzeugender Ergebnisteil besteht nicht aus p Werten allein. Beschreibe zuerst das Instrument: Itemzahl, Antwortformat, Polung, Bildungsregel des Scores und Umgang mit fehlenden Werten. Danach folgen Reliabilitätskennwerte und deskriptive Statistiken, bei Vergleichen und Modellen zusätzlich Effektgrößen und Konfidenzintervalle. Aus Signifikanz allein ergibt sich keine praktische Relevanz: Große Stichproben lassen kleine Effekte signifikant werden, während eine fachlich bedeutsame Tendenz bei kleiner Stichprobe unsicher bleiben kann.
Fazit
Likert Daten lassen sich sauber auswerten, wenn die Reihenfolge stimmt: erst Instrument und Datenqualität klären, dann Skalenbildung und Reliabilität, danach das Verfahren wählen und transparent berichten. Wer diese Schritte dokumentiert, kann die eigene Entscheidung fachlich begründen, ob am Ende ein Mittelwert oder ein ordinales Modell steht.