Chi Quadrat Test: So erkennst du, ob deine Daten geeignet sind
Chi Quadrat Test: So erkennst du, ob deine Daten geeignet sind
Eine Kreuztabelle sieht harmlos aus: zwei Zeilen, zwei Spalten, ein paar Zahlen. Genau in dieser scheinbaren Einfachheit steckt eine der häufigsten Fehlerquellen in Abschlussarbeiten und Fachpublikationen. Ob deine Auswertung wissenschaftlich trägt, entscheidet sich nicht im Moment der Berechnung, sondern früher: bei der Frage, welche Daten überhaupt zu einem Chi Quadrat Test passen.
Der Test beantwortet keine beliebige Frage danach, ob sich zwei Gruppen irgendwie unterscheiden. Er ist für eine klar umrissene Datenstruktur gebaut: gezählte Fälle in Kategorien, unabhängige Beobachtungen und erwartete Häufigkeiten, die nicht zu klein ausfallen. Wer das vorab kontrolliert, muss den Methodenteil später nicht umschreiben und kann Rückfragen von Betreuenden oder Reviewern gelassen beantworten.
Womit das Verfahren rechnet
Ein Chi Quadrat Test verarbeitet Häufigkeiten, also Anzahlen von Fällen, die in Kategorien fallen. Stell dir 120 Personen vor, die entweder Therapie A oder Therapie B erhalten. Nach acht Wochen wird notiert, ob eine klinische Besserung eingetreten ist: ja oder nein. Beide Merkmale sind kategorial, und in jeder Zelle der Tabelle steht schlicht die Anzahl der Personen. Diese beobachteten Anzahlen sind der Rohstoff des Verfahrens.
Gut geeignet sind nominale Variablen ohne Rangfolge, etwa Fachrichtung, Raucherstatus, Diagnosegruppe oder Therapieform. Ordinale Variablen mit natürlicher Reihenfolge, beispielsweise Schmerzstärke von leicht bis stark, lassen sich ebenfalls einsetzen. Beachte aber: Das klassische Verfahren ignoriert die Ordnung der Stufen vollständig. Behauptet deine Hypothese einen gerichteten Trend, passt ein Trendtest oder ein ordinales Regressionsmodell besser.

Neben dem Chi Quadrat Test eigenen sich je nach Daten und Design auch andere Verfahren
Rohwerte statt Prozentangaben
Prozentwerte helfen bei der Darstellung, als Rechengrundlage genügen sie nicht. Fünfzig Prozent können aus 4 oder aus 400 Fällen entstehen, und das sind völlig verschiedene Informationslagen. Liegt dir nur eine Prozentverteilung ohne Fallzahlen vor, ist ein sauberer Test kaum möglich. Du brauchst die Zellbesetzungen oder eindeutige Gesamtzahlen, aus denen sie sich rekonstruieren lassen.
Zwei Varianten mit unterschiedlichem Zweck
Hinter dem Sammelbegriff stecken mehrere Anwendungen. Zwei sind für Forschungsarbeiten zentral, und die Auswahl richtet sich nach deiner Hypothese, nicht nach dem Menü deiner Software.
Der Unabhängigkeitstest
Er prüft, ob zwei kategoriale Merkmale zusammenhängen. Die Nullhypothese besagt, dass kein Zusammenhang besteht. Verglichen werden die beobachteten Häufigkeiten mit jenen, die bei vollständiger Unabhängigkeit zu erwarten wären. Ist die Abweichung größer, als Zufall plausibel erklärt, wird die Nullhypothese verworfen. Ein signifikantes Ergebnis zeigt jedoch einen Zusammenhang, keine Ursache: Alter, Krankheitsdauer oder Ausgangsschwere können in Beobachtungsstudien mitwirken.
Der Anpassungstest
Hier betrachtest du nur ein Merkmal und fragst, ob die beobachtete Verteilung einer erwarteten entspricht, etwa die Verteilung von vier Blutgruppen im Vergleich zu einer Referenzverteilung. Auch dafür brauchst du Fallzahlen pro Kategorie. Die erwarteten Anteile musst du fachlich begründen, bevor du in die Daten schaust, beispielsweise über eine Referenzpopulation oder eine klar formulierte theoretische Annahme.
Voraussetzungen, die erfüllt sein müssen
- Unabhängigkeit der Beobachtungen: Jede Person darf pro Analyse nur einmal in die Tabelle eingehen. Messwiederholungen, etwa Zustimmung vor und nach einer Schulung, verletzen diese Bedingung; bei gepaarten dichotomen Daten passt der McNemar Test besser.
- Eindeutige Zuordnung: Jeder Fall gehört in genau eine Kategorie. Mehrfachantworten in Fragebögen erfüllen das nicht automatisch. Oft wertet man jede Option als eigene Variable mit den Stufen ja und nein aus, was die Zahl der Tests und damit das Risiko zufälliger Befunde erhöht.
- Ausreichend große erwartete Häufigkeiten: Als Faustregel sollte keine erwartete Häufigkeit unter 1 liegen, und höchstens 20 Prozent der Zellen sollten Werte unter 5 aufweisen. Bei einer 2x2 Tabelle gelten meist strengere Maßstäbe.
Verwechsle erwartete nicht mit beobachteten Häufigkeiten: Die erwarteten Werte ergeben sich aus den Randsummen. Eine Zelle mit fünf beobachteten Fällen kann kritisch sein, wenn unter der Nullhypothese deutlich weniger Fälle zu erwarten wären.
Wenn Kategorien zu dünn besetzt sind
Sechs Diagnosegruppen bei 35 Personen führen fast zwangsläufig zu schwach besetzten Zellen. Unmöglich ist die Analyse damit nicht, die Lösung muss aber zur Fragestellung passen. Inhaltlich ähnliche Kategorien darfst du zusammenfassen, wenn das fachlich begründet und möglichst vorab geplant ist. Ein Bündeln allein, weil der p Wert sonst ungünstig ausfällt, ist nicht vertretbar und kann echte Unterschiede verdecken. Bei kleinen erwarteten Häufigkeiten in einer 2x2 Tabelle bietet sich der exakte Test nach Fisher an, bei größeren Tabellen auch Monte Carlo Simulationen.

Für Chi Quadrat Test und Co. werden nominale Skalen benötigt
Was nicht in eine Kreuztabelle gehört
Metrische Messwerte wie Alter, BMI oder Blutdruck sind keine natürlichen Kandidaten. Du kannst sie in Gruppen einteilen, verlierst dabei aber Information, und die gewählten Grenzwerte beeinflussen das Ergebnis. Ist die abhängige Variable metrisch, führen t Test, Varianzanalyse, Korrelation oder Regression weiter. Ein einzelnes Likert Item lässt sich als Kategorie behandeln, doch bei kleinen Stichproben werden fünf Stufen schnell zu dünn besetzt. Fehlende Werte solltest du transparent ausweisen und eine Kategorie für „keine Angabe“ inhaltlich begründen.
Ergebnisse vollständig berichten
Der p Wert allein reicht nicht. Nenne Stichprobengröße, Testart, Teststatistik, Freiheitsgrade und p Wert, bei Zusammenhangstests zusätzlich eine Effektstärke, meist Cramérs V. Eine typische Angabe lautet: χ²(1, N = 120) = 6,42, p = ,011, Cramérs V = ,23. Erkläre anschließend die Richtung mit Zeilen oder Spaltenprozenten. Bei größeren Tabellen zeigen standardisierte Residuen, welche Zellen den Befund tragen; bei vielen Vergleichen ist Vorsicht geboten. Weitere Hinweise zur Auswahl passender Verfahren findest du im Ratgeber zu Statistik und Datenanalyse.
Fazit
Über die Aussagekraft entscheidet die Struktur deiner Daten, nicht die Software. Prüfe Skalenniveau, Unabhängigkeit, Kategorienzahl, fehlende Werte und erwartete Häufigkeiten, bevor du rechnest. Danach fällt die Wahl zwischen klassischem Verfahren, exaktem Test nach Fisher oder McNemar Test nachvollziehbar aus.