Reliabilität

Die psychologische Diagnostik bildet eine zentrale Grundlage für die Forschung und Praxis in der Psychologie. Um zuverlässige und valide Ergebnisse zu erzielen, müssen diagnostische Verfahren hohen wissenschaftlichen Standards entsprechen. Ein Schlüsselkriterium hierbei ist die Reliabilität.

Was ist Reliabilität?

Reliabilität ist neben der Objektivität und der Validität eines der drei Hauptgütekriterien in der psychologischen Diagnostik und beschreibt die Zuverlässigkeit eines Tests oder Messverfahrens. Sie gibt an, wie genau und konsistent ein Test ein bestimmtes Merkmal misst. Voraussetzung ist dabei das Gütekriterium der Objektivität.

Definition: Die Reliabilität bezeichnet den Grad der Genauigkeit, mit dem ein Messinstrument frei von Zufallsfehlern misst.

Warum ist Reliabilität wichtig?

Ein diagnostisches Verfahren muss zuverlässige Ergebnisse liefern, um wissenschaftlich fundiert eingesetzt werden zu können. Ohne eine hohe Reliabilität sind die Ergebnisse eines Tests unzuverlässig und können nicht sinnvoll interpretiert werden.

Beispiel: Stell Dir vor, ein Intelligenztest zeigt bei derselben Person an einem Tag einen IQ von 120 und eine Woche später einen IQ von 95. Ein solcher Test wäre offensichtlich nicht reliabel.

Reliabilität in der Klassischen Testtheorie

Das Modell hinter dem Begriff liefert die Klassische Testtheorie (KTT). Jeder beobachtete Wert X besteht aus einem wahren Wert \tau und einem Fehler \varepsilon. Der Fehler ist zufällig: Er hat im Mittel den Wert null, hängt nicht mit dem wahren Wert zusammen, und die Fehler verschiedener Messungen sind unkorreliert. Daraus folgt, dass sich die Varianzen addieren:

Die Reliabilität ist der Anteil der wahren Varianz an der beobachteten Varianz und liegt zwischen 0 und 1:

Beispiel: Die beobachtete Varianz beträgt 120, die wahre Varianz 100. Die Reliabilität ist 100 / 120 = .83. Etwa 17 % der Unterschiede zwischen den Personen gehen auf Zufallsfehler zurück.

Das Modell trennt zwei Arten von Fehlern. Zufallsfehler senken die Reliabilität, etwa ein versehentlicher Klick auf die falsche Antwort, Lärm im Testraum oder die Tagesform. Systematische Fehler wie Mitteltendenz auf Fünferskalen, soziale Erwünschtheit oder Ja-Sage-Tendenz stehen nicht im Fehlermodell. Sie werfen die Frage nach der Validität auf.

Arten der Reliabilität

Retest-Reliabilität

Diese Form misst die Übereinstimmung der Ergebnisse desselben Tests bei Wiederholung unter ähnlichen Bedingungen. Sie ist anfällig für Übungseffekte und für echte Veränderungen des Merkmals zwischen den beiden Messungen.

Beispiel: Ein Persönlichkeitsfragebogen wird innerhalb von zwei Wochen zweimal durchgeführt. Hohe Retest-Reliabilität bedeutet, dass die Ergebnisse über beide Messzeitpunkte hinweg stabil sind.

Paralleltest-Reliabilität

Hierbei werden zwei unterschiedliche Versionen eines Tests verwendet, die dasselbe Konstrukt messen sollen. Der Aufwand liegt in der Konstruktion, denn beide Formen müssen gleichwertig sein.

Beispiel: Zwei Varianten eines Konzentrationstests, die dieselben Fähigkeiten erfassen, sollten ähnliche Ergebnisse liefern.

Interne Konsistenz

Diese Methode untersucht, ob alle Items eines Tests dasselbe Konstrukt messen. Tipp: Die interne Konsistenz kann mit dem Cronbach’s Alpha berechnet werden. Ein Wert von über 0,7 wird häufig als akzeptabel angesehen.

Beispiel: In einem Fragebogen zur Lebenszufriedenheit sollten alle Fragen zum gleichen Thema beitragen und keine widersprüchlichen Ergebnisse liefern.

Cronbachs Alpha berechnet sich aus der Zahl der Items k, den Varianzen der einzelnen Items und der Varianz des Gesamtwerts:

Im Zähler steht die Summe der Itemvarianzen, im Nenner die Varianz des Testwerts über alle Items. Alpha setzt voraus, dass die Items homogen sind, also dasselbe Merkmal erfassen. Eine Alternative ist McDonalds Omega.

Eine zweite Möglichkeit ist die Split-Half-Reliabilität. Der Test wird in zwei Hälften geteilt, und die Korrelation der Hälften wird berechnet. Weil jede Hälfte nur halb so lang ist wie der Test, korrigiert die Spearman-Brown-Formel (siehe unten) das Ergebnis auf die volle Länge. Korrelieren die Hälften zu .70, ergibt sich für den ganzen Test eine Reliabilität von:

Interrater-Reliabilität

Diese ist relevant, wenn mehrere Beobachter ein Verhalten bewerten. Hier stellt sich die Frage, inwiefern die (qualitativen) Beobachtungen übereinstimmen. Sie spielt bei strukturierten Interviews und bei systematischen Beobachtungen eine Rolle.

Beispiel: Zwei Psychologen bewerten die soziale Kompetenz eines Kindes in einer Spielsituation. Eine hohe Interrater-Reliabilität liegt vor, wenn beide Beobachter zu ähnlichen Ergebnissen kommen.

Berechnung der Reliabilität

Um die Reliabilität zu bestimmen, wird ein Reliabilitätskoeffizient berechnet. Dieser liegt zwischen 0 und 1, wobei höhere Werte eine bessere Reliabilität anzeigen. Typische Richtwerte:

  • 0,7: akzeptabel
  • 0,8: gut
  • 0,9: sehr gut

Beispiel: Cronbach’s Alpha in R berechnen:

library(psych)
data <- matrix(c(4, 5, 3, 4, 5, 4, 3, 4, 5, 4), ncol = 2)
alpha(data)

Dieser Code berechnet die interne Konsistenz eines kleinen Datensatzes.

Testlänge und Reliabilität

Je länger ein Test, desto mehr Datenpunkte fließen ein, und desto zuverlässiger wird das Ergebnis. Bei einer Verdopplung der Testlänge verdoppelt sich die Fehlervarianz, die wahre Varianz vervierfacht sich. Die Spearman-Brown-Formel gibt den Effekt an:

Dabei ist k der Faktor der Verlängerung, bei einer Verdopplung also k = 2.

Beispiel: Ein Test mit 20 Items hat eine Reliabilität von .60. Mit 60 Items ist k = 3, und die Reliabilität steigt auf:

Die Gegenseite ist die Ökonomie. Längere Tests sind oft reliabler, kosten aber Zeit und belasten die Testpersonen (siehe den Beitrag „Sekundäre Gütekriterien“).

Reliabilität und Messfehler im Einzelfall

Die Reliabilität beschreibt einen Test in einer Gruppe. Für die einzelne Person übersetzt der Standardmessfehler sie in Punkte der Testskala:

Auf der IQ-Skala mit einer Standardabweichung von 15 ergibt eine Reliabilität von .95 einen SEM von 3,4 Punkten, eine Reliabilität von .75 einen von 7,5 Punkten. Mehr dazu im Beitrag „Individuelle Diagnostik – die Arbeit mit Einzelfällen“.

Reliabilität und Validität

Reliabilität ist eine notwendige Voraussetzung für Validität. Ein Test kann nur dann gültig sein (das heißt, wirklich das messen, was er messen soll), wenn er zuvor reliabel ist. Ohne Zuverlässigkeit können die Ergebnisse nicht vertrauenswürdig interpretiert werden.

Beispiel: Ein Test, der die Arbeitszufriedenheit misst, muss konsistente Ergebnisse liefern, bevor überhaupt geprüft werden kann, ob er tatsächlich Arbeitszufriedenheit misst und nicht etwas anderes, wie beispielsweise allgemeines Wohlbefinden.

Die Bedingung gilt in einer Richtung. Ein Test kann hoch reliabel und inhaltlich sinnlos sein, er misst dann sehr genau das Falsche. Umgekehrt begrenzt die Reliabilität die Validität: Die Korrelation zwischen Test und Kriterium kann nie größer sein als die Wurzel aus dem Produkt der beiden Reliabilitäten. Hat der Test eine Reliabilität von .81 und das Kriterium eine von .64, liegt die Obergrenze bei \sqrt{.81 \cdot .64} = .72 (siehe Minderungskorrektur im Beitrag „Aufbaumodul zur klassischen Testtheorie“).

Reliabilität in der Praxis

  • Schule und Bildung: Lehrer verwenden Tests, um den Lernfortschritt ihrer Schüler zu bewerten. Ein Test mit hoher Reliabilität sorgt dafür, dass die Ergebnisse die tatsächlichen Fähigkeiten der Schüler widerspiegeln und nicht von zufälligen Faktoren wie Tagesform oder Stress beeinflusst werden.
  • Klinische Psychologie: Diagnostische Tests wie der Beck-Depressions-Inventar (BDI) müssen hohe Reliabilität aufweisen, um sicherzustellen, dass die Ergebnisse nicht durch Messfehler verzerrt sind.
  • Personalauswahl: In der Arbeits- und Organisationspsychologie spielt die Reliabilität eine wichtige Rolle, da Tests wie Intelligenz- oder Persönlichkeitstests eine objektive Grundlage für Entscheidungen liefern müssen.

Fragen zur Vertiefung

  1. Welche Reliabilitätsart passt: (a) ein Konzentrationstest, zweimal im Abstand von zwei Wochen vorgegeben, (b) die Items eines Fragebogens, (c) zwei Lehrkräfte bewerten denselben Aufsatz?
  2. Ein Test mit 20 Items hat eine Reliabilität von .60. Wie reliabel wird er mit 60 Items?
  3. Ein Test hat die Standardabweichung 10 und eine Reliabilität von .91. Wie groß ist der Standardmessfehler?
  4. Warum ist hohe Reliabilität eine notwendige, aber keine hinreichende Bedingung für Validität?
  5. Welche Reliabilitätsart wählst Du für einen Test zur Arbeitszufriedenheit, und warum?