In der psychologischen Forschung und Diagnostik sind Tests und Verfahren nur so gut wie die Kriterien, die ihre Qualität sicherstellen. Neben den primären Gütekriterien – Validität, Reliabilität und Objektivität – spielen sekundäre Gütekriterien eine entscheidende Rolle für die praktische Anwendbarkeit und Akzeptanz eines Tests.
Während die primären Gütekriterien die wissenschaftliche Qualität eines Tests sicherstellen, sorgen die sekundären Gütekriterien für seine praktische Anwendbarkeit. Ohne Normen, Vergleichbarkeit, Ökonomie, Zumutbarkeit, Akzeptanz und Fairness wären Tests oft schwer nutzbar und würden ihre Zielgruppen nicht erreichen. In der Entwicklung psychologischer Tests sollte immer ein Gleichgewicht zwischen primären und sekundären Gütekriterien angestrebt werden.
Primäre und sekundäre Gütekriterien
Die primären Kriterien sind die Voraussetzung. Ohne Objektivität, Reliabilität und Validität ist ein Test grundlegend problematisch. Die sekundären Kriterien ergänzen sie und ersetzen sie nie. Ein Test kann psychometrisch hervorragend sein und wegen übermäßiger Länge oder unfairer Inhalte dennoch nie zum Einsatz kommen.
Die beiden Gruppen hängen zusammen. Normierung und Vergleichbarkeit unterstützen die Interpretationsobjektivität. Faire, zumutbare und akzeptierte Tests erhöhen die praktische Validität, unfaire oder nicht normierte Tests gefährden die Interpretierbarkeit der Ergebnisse.
Normierung
Die Normierung stellt sicher, dass Testergebnisse in den richtigen Kontext gesetzt werden können. Sie definiert Referenzwerte, mit denen die Ergebnisse einer Testperson verglichen werden, wie z. B. Alters-, Geschlechts- oder Berufsgruppen. Die Aktualität der Normen ist entscheidend — veraltete Normen können die Aussagekraft eines Tests erheblich beeinträchtigen.
Beispiel: Ein Intelligenztest liefert ohne Normen nur Rohwerte, die schwer interpretierbar sind. Durch die Normierung wird ersichtlich, wie eine Person im Vergleich zu anderen abschneidet.
Normen drücken sich in Prozenträngen, T-Werten oder Stanine aus. Die Normstichprobe muss hinreichend groß und für die Zielpopulation repräsentativ sein, etwa nach Alter, Geschlecht, Bildung und Kultur. Eine unzureichende Normierung führt zu fehlerhaften Interpretationen, zum Beispiel bei einem Intelligenztest für Erwachsene, der nur an Kindern normiert wurde. Wie Normwerte entstehen und ineinander umgerechnet werden, zeigt der Beitrag „Normierung und diagnostische Standardwerte“.
Vergleichbarkeit
Ein Test ist dann vergleichbar, wenn seine Ergebnisse mit denen anderer Tests oder Verfahren in ähnlichen Kontexten übereinstimmen oder sich sinnvoll unterscheiden lassen. Dies erfordert standardisierte Testbedingungen und einheitliche Bewertungskriterien. Unterschiede in der Testdurchführung oder in den Zielgruppen können die Vergleichbarkeit beeinträchtigen.
Beispiel: Zwei Tests zur Messung von Arbeitszufriedenheit sollten zu ähnlichen Ergebnissen kommen, wenn sie das gleiche Konzept messen.
Die Ergebnisse sollten auch zwischen Gruppen und Testversionen vergleichbar sein. Das betrifft sprachliche Versionen, etwa Deutsch und Englisch, Papier- und Computerversionen und unterschiedliche Testformen wie Paralleltests. Ein Test, der ohne Übersetzungs- und Adaptationsstudien in mehreren Sprachen eingesetzt wird, lässt sich schwer interpretieren. Zur Frage, ob Papier- und Computerversion dasselbe messen, siehe den Beitrag „Computergestützte Diagnostik und Online-Assessment“.
Ökonomie
Die Ökonomie eines Tests bezieht sich auf den Aufwand, der für seine Durchführung, Auswertung und Interpretation erforderlich ist. Ein ökonomischer Test sollte ressourcenschonend sein, ohne dabei die Qualität der Ergebnisse zu beeinträchtigen. Manchmal stehen Ökonomie und andere Gütekriterien wie Validität oder Fairness im Konflikt — ein schneller Test ist nicht immer ein besserer Test.
Beispiel: Ein Fragebogen, der in zehn Minuten ausgefüllt werden kann, wird oft bevorzugt gegenüber einem einstündigen Interview – vorausgesetzt, beide liefern vergleichbare Informationen.
Zur Ökonomie zählen ein angemessener Zeitaufwand, ein vertretbarer Material- und Personaleinsatz und eine pragmatische, möglichst automatisierte Auswertung. Gute Ökonomie heißt kurze bis mittlere Dauer, hoher Informationsgehalt pro Item und ein ausgewogenes Verhältnis von Aufwand und Nutzen. Drei Stunden und dreißig Minuten Testzeit für eine Entscheidung zwischen geeignet und ungeeignet wären ein Beispiel für schlechte Ökonomie. Längere Tests haben oft eine höhere Reliabilität, aber weniger Ökonomie (siehe den Beitrag „Reliabilität“).
Zumutbarkeit
Die Zumutbarkeit bezieht sich auf die Belastung, die ein Test für die Testperson darstellt. Diese Belastung kann physisch, psychisch oder zeitlich sein. Ein Test sollte so gestaltet sein, dass er die Testperson möglichst wenig beeinträchtigt. Die Zumutbarkeit kann durch klare Instruktionen und eine angenehme Testumgebung verbessert werden.
Beispiel: Ein umfangreicher Persönlichkeitstest, der intime Fragen stellt, kann als unangemessen empfunden werden, während ein kürzerer, anonymisierter Test eher akzeptiert wird.
Belastend wirken Länge und Schwierigkeit, sensible oder intime Inhalte und das Setting, etwa Stress durch eine Gruppensituation. Mangelnde Zumutbarkeit führt zu Abbrüchen, zu verzerrten Antworten wie schnellem, wahllosem Ankreuzen und zu einer negativen Einstellung gegenüber Diagnostik. Sie ist auch ein Validitätsproblem: Überforderte Personen liefern keine guten Daten.
Akzeptanz
Die Akzeptanz eines Tests beschreibt, wie gut er von Testpersonen und anderen Beteiligten angenommen wird. Akzeptanz ist ein subjektives, aber entscheidendes Kriterium, das die Teilnahmebereitschaft und die Qualität der Ergebnisse beeinflussen kann. Faktoren, die Akzeptanz fördern: verständliche Anweisungen und transparente Zielsetzung, angemessene Länge und Schwierigkeitsgrad, faire und kulturunabhängige Testgestaltung.
Beispiel: Ein adaptiver Intelligenztest, der die Schwierigkeit der Fragen dynamisch anpasst, wird oft als motivierender wahrgenommen als ein Test, der immer gleich schwere Fragen stellt.
Aus Sicht der Testpersonen wirkt ein akzeptierter Test relevant, fair und verständlich und motiviert zu ehrlicher, sorgfältiger Bearbeitung. Aus Sicht der Anwender:innen, etwa Psycholog:innen und Lehrkräften, ist er praktisch einsetzbar und unterstützt Entscheidungen. Ein weltfremder Test mit künstlichen Aufgaben wird nicht ernst genommen. Geringe Akzeptanz kann die Validität gefährden, weil Motivation fehlt.
Fairness
Fairness bedeutet, dass keine Gruppe systematisch benachteiligt wird, etwa nach Geschlecht, Herkunft, Sprache oder Behinderung. Probleme entstehen durch kulturell oder sprachlich verzerrte Items, durch unterschiedliche Chancen, das Testmaterial zu verstehen, und durch ungeeignete Normen oder Cut-offs, die Gruppen diskriminieren.
Ein Hinweis auf mangelnde Fairness ist das Differential Item Functioning (DIF). Ein Item zeigt DIF, wenn es sich in Gruppen mit gleicher Fähigkeit unterschiedlich verhält. Auch bei der Vorhersage kann Unfairness auftreten, etwa als Slope-Bias oder Intercept-Bias (siehe den Beitrag „Das Gütekriterium der Validität“).
Fairness hängt eng mit der Validität zusammen. Ein Test, der bestimmte Gruppen systematisch benachteiligt, gilt nicht als valide. Das Testbeurteilungssystem TBS-DTK prüft Fairness bei der Validität, soweit der Test sie beansprucht, und bei algorithmenbasierten Tests dokumentierte Bias-Checks (siehe den Beitrag „Die Beurteilung der Güte (nach TBS-DTK)“).
Transparenz
Transparenz heißt, dass alle für die Anwendung notwendigen Informationen zu Durchführung, Auswertung, Interpretation und zu den Stichproben der Gütebelege zentral und zugänglich dokumentiert sind. Das TBS-DTK prüft die Dokumentation als eigene Kategorie und vergibt bei vollständigen Verfahrenshinweisen ein Transparenzzertifikat.
Q&A
Was sind sekundäre Gütekriterien, und warum sind sie wichtig? Sekundäre Gütekriterien sind zusätzliche Qualitätsmerkmale, die über die klassischen Gütekriterien (Objektivität, Reliabilität, Validität) hinausgehen. Sie umfassen Aspekte wie Fairness, Ökonomie, Zumutbarkeit und Transparenz. Diese Kriterien sorgen dafür, dass diagnostische Verfahren nicht nur wissenschaftlich fundiert, sondern auch praktisch anwendbar sind. Ein Test kann z. B. valide und reliabel sein, aber dennoch unpraktisch, wenn er zu teuer oder zu zeitaufwendig ist.
Weitere offene Fragen zur Vertiefung: Welche Rolle spielt die Fairness in der psychologischen Diagnostik? Warum ist die Zumutbarkeit ein wichtiges Gütekriterium? Wie trägt die Transparenz zur Qualität eines Tests bei? Was versteht man unter der Ökonomie eines Tests, und warum ist sie relevant?
Fragen zur Vertiefung
- Analysiere den KompetenzCheck-3000: Der Test dauert 3,5 Stunden und besteht aus 150 komplizierten Fragen. Die Normierung erfolgte an 50 männlichen Ingenieuren zwischen 30 und 35 Jahren. Die Fragen enthalten kulturelle Bezüge, die für Nicht-Muttersprachler schwer verständlich sind. Die Auswertung dauert eine Woche. Viele Testpersonen empfinden den Test als unangenehm und praxisfern. Was macht diesen Test schlecht, und welche primären und sekundären Gütekriterien sind betroffen?
- Warum ersetzen sekundäre Gütekriterien die primären nie?
- Nenne ein Beispiel, in dem Ökonomie und Validität in Konflikt stehen, und beschreibe, wie Du entscheidest.
Fazit
Sekundäre Gütekriterien wie Normierung, Vergleichbarkeit, Ökonomie, Zumutbarkeit, Akzeptanz und Fairness tragen entscheidend dazu bei, dass psychologische Tests erfolgreich angewendet werden können. Sie stellen sicher, dass Tests nicht nur valide und reliabel, sondern auch praktikabel und akzeptabel sind.
