Chi Quadrat Test: So erkennst du, ob deine Daten geeignet sind

Ein Wissenschaftler erklärt den Chi Quadrat Test an einer Kreuzzabelle.

Chi Quadrat Test: So erkennst du, ob deine Daten geeignet sind

Eine Kreuztabelle sieht harmlos aus: zwei Zeilen, zwei Spalten, ein paar Zahlen. Genau in dieser scheinbaren Einfachheit steckt eine der häufigsten Fehlerquellen in Abschlussarbeiten und Fachpublikationen. Ob deine Auswertung wissenschaftlich trägt, entscheidet sich nicht im Moment der Berechnung, sondern früher: bei der Frage, welche Daten überhaupt zu einem Chi Quadrat Test passen.

Der Test beantwortet keine beliebige Frage danach, ob sich zwei Gruppen irgendwie unterscheiden. Er ist für eine klar umrissene Datenstruktur gebaut: gezählte Fälle in Kategorien, unabhängige Beobachtungen und erwartete Häufigkeiten, die nicht zu klein ausfallen. Wer das vorab kontrolliert, muss den Methodenteil später nicht umschreiben und kann Rückfragen von Betreuenden oder Reviewern gelassen beantworten.

Womit das Verfahren rechnet

Ein Chi Quadrat Test verarbeitet Häufigkeiten, also Anzahlen von Fällen, die in Kategorien fallen. Stell dir 120 Personen vor, die entweder Therapie A oder Therapie B erhalten. Nach acht Wochen wird notiert, ob eine klinische Besserung eingetreten ist: ja oder nein. Beide Merkmale sind kategorial, und in jeder Zelle der Tabelle steht schlicht die Anzahl der Personen. Diese beobachteten Anzahlen sind der Rohstoff des Verfahrens.

Gut geeignet sind nominale Variablen ohne Rangfolge, etwa Fachrichtung, Raucherstatus, Diagnosegruppe oder Therapieform. Ordinale Variablen mit natürlicher Reihenfolge, beispielsweise Schmerzstärke von leicht bis stark, lassen sich ebenfalls einsetzen. Beachte aber: Das klassische Verfahren ignoriert die Ordnung der Stufen vollständig. Behauptet deine Hypothese einen gerichteten Trend, passt ein Trendtest oder ein ordinales Regressionsmodell besser.

Zwei Personen in einem Meeting diskutieren über den Chi Quadrat Test und Datenanalyse.

Neben dem Chi Quadrat Test eigenen sich je nach Daten und Design auch andere Verfahren

Rohwerte statt Prozentangaben

Prozentwerte helfen bei der Darstellung, als Rechengrundlage genügen sie nicht. Fünfzig Prozent können aus 4 oder aus 400 Fällen entstehen, und das sind völlig verschiedene Informationslagen. Liegt dir nur eine Prozentverteilung ohne Fallzahlen vor, ist ein sauberer Test kaum möglich. Du brauchst die Zellbesetzungen oder eindeutige Gesamtzahlen, aus denen sie sich rekonstruieren lassen.

Zwei Varianten mit unterschiedlichem Zweck

Hinter dem Sammelbegriff stecken mehrere Anwendungen. Zwei sind für Forschungsarbeiten zentral, und die Auswahl richtet sich nach deiner Hypothese, nicht nach dem Menü deiner Software.

Der Unabhängigkeitstest

Er prüft, ob zwei kategoriale Merkmale zusammenhängen. Die Nullhypothese besagt, dass kein Zusammenhang besteht. Verglichen werden die beobachteten Häufigkeiten mit jenen, die bei vollständiger Unabhängigkeit zu erwarten wären. Ist die Abweichung größer, als Zufall plausibel erklärt, wird die Nullhypothese verworfen. Ein signifikantes Ergebnis zeigt jedoch einen Zusammenhang, keine Ursache: Alter, Krankheitsdauer oder Ausgangsschwere können in Beobachtungsstudien mitwirken.

Der Anpassungstest

Hier betrachtest du nur ein Merkmal und fragst, ob die beobachtete Verteilung einer erwarteten entspricht, etwa die Verteilung von vier Blutgruppen im Vergleich zu einer Referenzverteilung. Auch dafür brauchst du Fallzahlen pro Kategorie. Die erwarteten Anteile musst du fachlich begründen, bevor du in die Daten schaust, beispielsweise über eine Referenzpopulation oder eine klar formulierte theoretische Annahme.

Voraussetzungen, die erfüllt sein müssen

  1. Unabhängigkeit der Beobachtungen: Jede Person darf pro Analyse nur einmal in die Tabelle eingehen. Messwiederholungen, etwa Zustimmung vor und nach einer Schulung, verletzen diese Bedingung; bei gepaarten dichotomen Daten passt der McNemar Test besser.
  2. Eindeutige Zuordnung: Jeder Fall gehört in genau eine Kategorie. Mehrfachantworten in Fragebögen erfüllen das nicht automatisch. Oft wertet man jede Option als eigene Variable mit den Stufen ja und nein aus, was die Zahl der Tests und damit das Risiko zufälliger Befunde erhöht.
  3. Ausreichend große erwartete Häufigkeiten: Als Faustregel sollte keine erwartete Häufigkeit unter 1 liegen, und höchstens 20 Prozent der Zellen sollten Werte unter 5 aufweisen. Bei einer 2x2 Tabelle gelten meist strengere Maßstäbe.

Verwechsle erwartete nicht mit beobachteten Häufigkeiten: Die erwarteten Werte ergeben sich aus den Randsummen. Eine Zelle mit fünf beobachteten Fällen kann kritisch sein, wenn unter der Nullhypothese deutlich weniger Fälle zu erwarten wären.

Wenn Kategorien zu dünn besetzt sind

Sechs Diagnosegruppen bei 35 Personen führen fast zwangsläufig zu schwach besetzten Zellen. Unmöglich ist die Analyse damit nicht, die Lösung muss aber zur Fragestellung passen. Inhaltlich ähnliche Kategorien darfst du zusammenfassen, wenn das fachlich begründet und möglichst vorab geplant ist. Ein Bündeln allein, weil der p Wert sonst ungünstig ausfällt, ist nicht vertretbar und kann echte Unterschiede verdecken. Bei kleinen erwarteten Häufigkeiten in einer 2x2 Tabelle bietet sich der exakte Test nach Fisher an, bei größeren Tabellen auch Monte Carlo Simulationen.

Ein Dozent erklärt den Chi Quadrat Test an einem Whiteboard.

Für Chi Quadrat Test und Co. werden nominale Skalen benötigt

Was nicht in eine Kreuztabelle gehört

Metrische Messwerte wie Alter, BMI oder Blutdruck sind keine natürlichen Kandidaten. Du kannst sie in Gruppen einteilen, verlierst dabei aber Information, und die gewählten Grenzwerte beeinflussen das Ergebnis. Ist die abhängige Variable metrisch, führen t Test, Varianzanalyse, Korrelation oder Regression weiter. Ein einzelnes Likert Item lässt sich als Kategorie behandeln, doch bei kleinen Stichproben werden fünf Stufen schnell zu dünn besetzt. Fehlende Werte solltest du transparent ausweisen und eine Kategorie für „keine Angabe“ inhaltlich begründen.

Ergebnisse vollständig berichten

Der p Wert allein reicht nicht. Nenne Stichprobengröße, Testart, Teststatistik, Freiheitsgrade und p Wert, bei Zusammenhangstests zusätzlich eine Effektstärke, meist Cramérs V. Eine typische Angabe lautet: χ²(1, N = 120) = 6,42, p = ,011, Cramérs V = ,23. Erkläre anschließend die Richtung mit Zeilen oder Spaltenprozenten. Bei größeren Tabellen zeigen standardisierte Residuen, welche Zellen den Befund tragen; bei vielen Vergleichen ist Vorsicht geboten. Weitere Hinweise zur Auswahl passender Verfahren findest du im Ratgeber zu Statistik und Datenanalyse.

Fazit

Über die Aussagekraft entscheidet die Struktur deiner Daten, nicht die Software. Prüfe Skalenniveau, Unabhängigkeit, Kategorienzahl, fehlende Werte und erwartete Häufigkeiten, bevor du rechnest. Danach fällt die Wahl zwischen klassischem Verfahren, exaktem Test nach Fisher oder McNemar Test nachvollziehbar aus.

Diese Webseite verwendet Cookies

Diese Webseite nutzt Cookies, um Ihnen das bestmögliche Erlebnis zu gewährleisten. Cookies helfen uns, die Webseite mit Analysen zu verbessern. Mit einem Klick auf „Zustimmen“, stimmen Sie der Verwendung von Cookies zu. Sie können Ihre Einwilligung jederzeit ändern, indem Sie unter "Optionen verwalten" Ihre getroffenen Einstellungen selbst rückgängig machen. Weitere Informationen finden Sie in unserer Datenschutzerklärung.

Privatsphäre-Einstellungen

Wir verwenden Cookies und ähnliche Technologien auf unserer Website und verarbeiten personenbezogene Daten von dir (z.B. IP-Adresse), um z.B. Inhalte und Anzeigen zu personalisieren, Medien von Drittanbietern einzubinden oder Zugriffe auf unsere Website zu analysieren.

Die Datenverarbeitung kann auch erst in Folge gesetzter Cookies stattfinden. Wir teilen diese Daten mit Dritten, die wir in den Privatsphäre-Einstellungen benennen.

Einige Services verarbeiten personenbezogene Daten in den USA. Indem du der Nutzung dieser Services zustimmst, erklärst du dich auch mit der Verarbeitung deiner Daten in den USA gemäß Art. 49 (1) lit. a DSGVO einverstanden. Die USA werden vom EuGH als ein Land mit einem unzureichenden Datenschutzniveau nach EU-Standards angesehen. Insbesondere besteht das Risiko, dass deine Daten von US-Behörden zu Kontroll- und Überwachungszwecken verarbeitet werden, unter Umständen ohne die Möglichkeit eines Rechtsbehelfs.

Du bist unter 16 Jahre alt? Dann kannst du nicht in optionale Services einwilligen. Du kannst deine Eltern oder Erziehungsberechtigten bitten, mit dir in diese Services einzuwilligen.


Ihre Einstellungen für Einwilligungen

Hier haben Sie die Möglichkeit, Ihre Einwilligung für die Datenverarbeitung durch Cookies zu erteilen oder zu widerrufen. Sie können Ihre Einstellungen jederzeit ändern. Weitere Informationen finden Sie in unserer Datenschutzerklärung.