Das Testbeurteilungssystem TBS-DTK: Ein Überblick

Das Testbeurteilungssystem des Diagnostik- und Testkuratoriums (TBS-DTK) dient als zentrales Werkzeug zur Beurteilung, Sicherung und Optimierung der Qualität von psychologischen Tests im deutschsprachigen Raum. In seiner vierten, revidierten Fassung von 2023 wurden die bisherigen Richtlinien aktualisiert und an neue Anforderungen, wie den Einsatz von Algorithmen und Künstlicher Intelligenz (KI), angepasst.

Ziele und Geltungsbereich

Das TBS-DTK verfolgt mehrere zentrale Ziele:

  • Qualitätssicherung von psychologischen Tests.
  • Transparenz für Testanwender:innen durch detaillierte und nachvollziehbare Beurteilungen.
  • Standardisierung der Bewertungskriterien zur Vergleichbarkeit der Tests.

Das System erstellt keine Rangliste. Jeder Test wird einzeln und kriterienorientiert beurteilt, ein Vergleich mit anderen Verfahren findet nicht statt.

Der Begriff „Test“ umfasst eine Vielzahl von Verfahren: messtheoretisch fundierte Fragebögen (Persönlichkeits- oder Interessenfragebögen), Intelligenz- und Wissenstests, sowie algorithmenbasierte Verfahren, die mit Hilfe von Machine Learning (ML) oder KI Personenkennwerte schätzen. Die Richtlinien gelten für Tests, die im deutschsprachigen Raum verwendet werden. Gutachten oder Reports, die aufgrund eines Testergebnisses automatisch erstellt werden, sind nicht Gegenstand der Rezensionen.

Das DTK ist das Gremium der psychologischen Fachverbände, das die Richtlinien entwickelt und aktualisiert. Es wählt die Tests aus, beauftragt die Rezensierenden, prüft die Rezensionen auf Einhaltung der Richtlinien und sorgt dafür, dass sie veröffentlicht und auffindbar sind, etwa in der Psychologischen Rundschau, im Report Psychologie und online über Psyndex. Es orientiert sich an internationalen Standards und an der DIN 33430.

Prozedurale Richtlinien: Wie funktioniert die Beurteilung?

Schritt 1: Auswahl der Tests. Das Diagnostik- und Testkuratorium (DTK) entscheidet, welche Tests rezensiert werden. Vorschläge können eingereicht werden, die finale Auswahl obliegt jedoch dem DTK.

Schritt 2: Beauftragung von Rezensions-Parteien. Zwei unabhängige „Rezensions-Parteien“, bestehend aus qualifizierten Expert:innen (mindestens eine Person pro Partei sollte promoviert sein), bewerten die Tests. Das DTK bürgt für Qualifikation, Unabhängigkeit und Unvoreingenommenheit, und jede rezensierende Person gibt eine Selbsterklärung zur Unvoreingenommenheit ab. Beide Parteien arbeiten anonym voneinander.

Schritt 3: Prüfung der Prüffähigkeit und kriterienorientierte Beurteilung. Zuerst stellen die Parteien fest, ob der Test prüffähig ist, ob also die Verfahrenshinweise die notwendigen Informationen enthalten (DIN-SCREEN-Checkliste). Fehlen wesentliche Angaben, erhält der Test ohne weitere Prüfung das Urteil, dass er die Anforderungen an Information und Dokumentation nicht erfüllt. Andernfalls werden die Tests anhand von zehn Kategorien beurteilt:

  1. Beschreibung des Tests und seiner diagnostischen Zielsetzung
  2. Informationsgehalt der Verfahrenshinweise
  3. Prüfung nach der DIN-SCREEN-Checkliste: Ist verzeichnet, wo die notwendigen Informationen stehen?
  4. Theoretische Grundlagen der Testkonstruktion
  5. Objektivität
  6. Normierung (Eichung)
  7. Reliabilität (Zuverlässigkeit)
  8. Validität (Gültigkeit), auch unter Berücksichtigung der Fairness, soweit sie in Anspruch genommen wird
  9. Weitere Gütekriterien (Störanfälligkeit, Unverfälschbarkeit, Skalierung)
  10. Abschlussbewertung

Ihre Bewertung erfolgt frei oder zusätzlich formalisiert. Die Kategorie 3 wird nur mit ja oder nein bewertet.

Schritt 4: Erstellung einer gemeinsamen Rezension. Nach Abschluss der Einzelbewertungen hebt das DTK die Anonymität auf, und die Parteien erstellen eine konsolidierte gemeinsame Rezension. Bei Uneinigkeit wird diese in der Rezension dargestellt. Testautor:innen können eine Stellungnahme abgeben. Das DTK entscheidet, ob und wie die Rezension daraufhin angepasst wird.

Schritt 5: Veröffentlichung und Transparenzzertifikat. Die Rezension erscheint in einer Fachzeitschrift und online. Ein TBS-DTK-Transparenzzertifikat kann ausgestellt werden, wenn die Verfahrenshinweise die geforderten Informationen umfassend darstellen (siehe unten).

Die vierstufige Bewertungsskala

Für die Kategorien 2, 5, 7 und 8 gibt es neben der freien Beurteilung eine formalisierte Bewertung auf einer vierstufigen Skala: Der Test erfüllt die Anforderungen voll, weitgehend, teilweise oder nicht. Die Stufen beschreiben die Qualität so:

StufeQualitätBeispiel: Informationsgehalt
vollhöchste QualitätAlle notwendigen Informationen sind verständlich im Manual enthalten.
weitgehendgering eingeschränktDie Mehrzahl der notwendigen Informationen ist enthalten.
teilweiseeingeschränktDie Informationen sind mit Abstrichen enthalten.
nichterheblich eingeschränktDie Informationen sind nicht ausreichend enthalten.

Für die Objektivität gilt etwa: voll heißt, es liegen mehrere überzeugende Belege für alle Objektivitätsarten vor. Bei teilweise sind es einige, zumeist überzeugende Belege für einige Objektivitätsarten, bei nicht liegen keine überzeugenden Belege vor. Reliabilität und Validität sind entsprechend abgestuft, bezogen auf die relevanten Reliabilitätsschätzer beziehungsweise auf die relevanten Validitätsarten und Einsatzzwecke.

Die freie Abschlussbewertung ergibt sich nicht automatisch aus den formalisierten Einzelbewertungen. Die Rezensions-Parteien würdigen alle Aspekte und messen den Test vor allem an den diagnostischen Zielsetzungen, die in den Verfahrenshinweisen formuliert sind.

Wesentliche Bewertungskriterien im Detail

1. Informationsgehalt der Verfahrenshinweise

Der Informationsgehalt wird auf Grundlage der DIN 33430 geprüft (Erinnerung: Die DIN 33430 beschreibt Anforderungen an berufsbezogene Eignungsdiagnostik). Diese Prüfung umfasst detaillierte Angaben zur Testdurchführung, -auswertung und -interpretation, Berichte über empirische Untersuchungen inklusive Stichprobenbeschreibungen, sowie spezielle Anforderungen an algorithmengestützte Tests wie Erklärbarkeit von KI-Modellen.

2. Objektivität

Objektivität misst die Unabhängigkeit der Testergebnisse von der durchführenden Person und gliedert sich in drei Aspekte: Durchführungsobjektivität (klare Standardisierung der Instruktionen), Auswertungsobjektivität (einheitliche Auswertungsvorschriften, z. B. Schablonen) und Interpretationsobjektivität (einheitliche und nachvollziehbare Normen für die Ergebnisinterpretation). Bei algorithmenbasierten Verfahren gehört dazu, dass Auswertungsalgorithmen und Entscheidungsregeln transparent dokumentiert sind.

3. Reliabilität

Die Reliabilität beschreibt die Messgenauigkeit eines Tests. Methoden: interne Konsistenz, Retest-Reliabilität, Messpräzision (Genauigkeit auf individueller Ebene, z. B. Konfidenzintervalle). Die Rezension prüft, ob die berichteten Schätzer zum Test passen und ob die Stichproben angemessen und die Kennwerte nachvollziehbar sind.

4. Validität

Validität gibt an, ob ein Test das misst, was er vorgibt zu messen: Konstruktvalidität (passen die Ergebnisse zur zugrunde liegenden Theorie?), Kriteriumsvalidität (Korrelation mit einem externen Kriterium, z. B. Berufserfolg), Inhaltsvalidität (stimmen die Inhalte mit dem Messziel überein?). Einsatzbereiche und Grenzen des Tests sollen realistisch dargestellt sein. Fairness fließt ein, soweit der Test sie beansprucht.

5. Weitere Gütekriterien

  • Störanfälligkeit: Wie empfindlich ist der Test gegenüber aktuellen Zuständen der Testperson und situativen Faktoren? Zu prüfen ist, ob das angesichts der diagnostischen Zielsetzung ein Problem darstellt.
  • Unverfälschbarkeit: Kann die Testperson ihren Testwert durch gezieltes Testverhalten steuern? Zu beachten sind Faking good und Faking bad.
  • Skalierung: Bilden die Testwerte die empirischen Verhaltensrelationen adäquat und mit ausreichender Messpräzision ab? Formale Testmodelle wie die IRT erleichtern diese Prüfung.
  • Testfairness: Gibt es eine systematische, auf den Testwerten aufsetzende Diskriminierung, etwa aufgrund von ethnischer Herkunft, Geschlecht, Religion oder Weltanschauung, Behinderung, Alter oder sexueller Identität?

Besonderheiten bei algorithmengestützten Tests

Mit der wachsenden Bedeutung von KI und ML in der Diagnostik hat das TBS-DTK neue Anforderungen integriert: transparente Dokumentation der verwendeten Algorithmen, Erklärbarkeit und Nachvollziehbarkeit der Ergebnisse, Angaben zu Trainings- und Testdatensätzen (einschließlich ihrer Repräsentativität), sowie Analyse potenzieller Biases und deren Auswirkungen. Die Rezensierenden achten darauf, ob sich Kennwerte auf den Trainingsdatensatz oder auf einen Anwendungsdatensatz beziehen, und bei der Fairness darauf, dass Ergebnisse von Bias-Checks dokumentiert sind.

Das Transparenzzertifikat

Testautor:innen und Anbieter beantragen das Zertifikat mit den Verfahrenshinweisen, der Übersichtstabelle zur DIN-SCREEN-Checkliste und einer schriftlichen Selbsterklärung, dass die Verfahrenshinweise auch den Anwendenden zur Verfügung stehen und alle geforderten Informationen enthalten. Das DTK entscheidet auf Basis der Selbsterklärung und behält sich Stichproben vor. Für algorithmenbasierte Verfahren gibt es das Zertifikat nicht.

Das Zertifikat bestätigt die Dokumentation und trifft keine Aussage über die Güte. Der erlaubte Werbetext hält fest, dass die Verfahrenshinweise den Qualitätsanspruch des DTK an Information und Dokumentation erfüllen und der Test damit die Voraussetzungen erfüllt, um einer Qualitätskontrolle unterzogen zu werden. Diese Qualitätskontrolle selbst hat das DTK nicht vorgenommen.

Nutzen und Grenzen für Testanwender:innen

Der Nutzen liegt in einer transparenten Entscheidungsgrundlage, denn die Rezension zeigt, wie gut Objektivität, Reliabilität und Validität belegt sind. Gebündelte Informationen sparen Recherche, und die Rezensionen unterstützen die Auswahl geeigneter Verfahren. Die Grenzen: Nicht alle Tests sind rezensiert, und die Rezension ersetzt nicht die fachliche Verantwortung der Anwender:innen.

Fazit und Bedeutung des TBS-DTK

Das Testbeurteilungssystem TBS-DTK stellt einen wichtigen Meilenstein für die Qualitätssicherung psychologischer Tests dar. Mit klaren Richtlinien und umfassenden Bewertungsstandards bietet es Orientierung für Testentwickler:innen und -anwender:innen. Insbesondere durch die Integration moderner Technologien wie KI bleibt das System zukunftsorientiert und relevant. Die Prüfung nach TBS-DTK-Standards fördert nicht nur die Transparenz, sondern schafft auch Vertrauen in die angewandte psychologische Diagnostik.

Fragen zur Vertiefung

  1. Lies eine veröffentlichte TBS-DTK-Rezension. Welche der zehn Kategorien werden angesprochen? Wo findest Du die vierstufige Bewertungsskala? Was nimmst Du als Testanwender:in mit?
  2. Warum ist eine Rezension durch zwei unabhängige Parteien sinnvoll?
  3. Was folgt für Dich daraus, dass ein Test nicht rezensiert wurde?
  4. Ein Anbieter wirbt mit dem Transparenzzertifikat. Was darfst Du daraus schließen, und was nicht?

Literatur

  • Diagnostik- und Testkuratorium (2023). TBS-DTK. Testbeurteilungssystem des Diagnostik- und Testkuratoriums der Föderation Deutscher Psychologenvereinigungen. Vierte, revidierte Fassung vom 31. Juli 2023. Psychologische Rundschau.