Computergestützte Diagnostik und Online-Assessment

Der Computer verändert an einem Test drei Dinge: wie er dargeboten wird, wie er ausgewertet wird und wo er stattfindet. Jede dieser Änderungen berührt ein Gütekriterium. Dieser Beitrag geht sie der Reihe nach durch und endet bei den rechtlichen Grenzen für Algorithmen in der Personalauswahl (Stand Oktober 2026).

Was der Computer an einem Test verändert

Im einfachsten Fall erscheinen die Aufgaben eines Papiertests am Bildschirm. Der Test bleibt derselbe, die Antworten werden getippt oder angeklickt. Auf der nächsten Stufe wertet die Software aus, rechnet Normwerte aus und erzeugt einen Bericht. Auf einer weiteren Stufe wählt sie die Aufgaben selbst aus, wie im Beitrag „Adaptives Testen“ beschrieben. Läuft der Test über das Internet, ist er unabhängig von Ort und Zeit der Testperson. Und die Software erfasst mehr als die Antwort: Bearbeitungszeiten, Korrekturen, Klickpfade.

Daraus entsteht eine eigene Gruppe von Qualitätsfragen. Sie unterscheiden sich je nachdem, an welcher Stelle der Computer eingreift.

Computerversion eines Papiertests: die Frage der Äquivalenz

Wer einen Papiertest auf den Bildschirm überträgt, hat zunächst einen neuen Test. Ob er dasselbe misst, ist eine empirische Frage, und die Normen der Papierversion gelten erst, wenn die Antwort feststeht. Mead und Drasgow (1993) werteten Studien zu Leistungstests aus. Bei Tests ohne starken Zeitdruck fielen die Ergebnisse beider Darbietungsformen weitgehend gleich aus. Bei Speedtests war die Übereinstimmung deutlich geringer. Plausibel ist, dass es dort auf Dinge wie Tastatur, Maus und Bildschirmlayout ankommt, weil jede Sekunde zählt.

Die Richtlinien der International Test Commission zu computer- und internetgestütztem Testen (ITC, 2006) nennen Anforderungen für den Fall, dass ein Computertest aus einem Papiertest entsteht. Dazu gehört der Nachweis, dass Papier- und Computerversion vergleichbare Ergebnisse liefern. Auch die Vertrautheit mit dem Gerät gehört in die Prüfung: Wer selten am Computer arbeitet, tritt mit einem Nachteil an, der mit dem gemessenen Merkmal nichts zu tun hat.

Online-Testung: beaufsichtigt und unbeaufsichtigt

Die ITC-Richtlinien unterscheiden vier Durchführungsmodi: offen, kontrolliert, beaufsichtigt und gemanagt. Sie unterscheiden sich darin, wie sicher feststeht, wer den Test bearbeitet, und wie stark die Umgebung kontrolliert wird. In der Praxis zählt vor allem die Grenze zwischen unbeaufsichtigt (die Person testet zu Hause, etwa als erste Stufe einer Bewerbung) und beaufsichtigt (Testzentrum, Videoaufsicht).

Bei unbeaufsichtigter Testung ist die Durchführungsobjektivität eingeschränkt. Niemand weiß, ob die Person selbst antwortet, ob sie Hilfsmittel benutzt, ob Lärm stört, ob die Aufgaben später weitergegeben werden. Der letzte Punkt trifft die Testsicherheit: Ein Aufgabenpool, der im Netz kursiert, ist verbraucht. Üblich sind Gegenmaßnahmen wie große Aufgabenpools, zufällig gezogene Aufgaben und ein kurzer beaufsichtigter Verifikationstest für diejenigen, die in die nächste Runde kommen. Eine Videoaufsicht schafft Kontrolle und zugleich ein Datenschutzthema, denn sie verarbeitet Bild und Ton der Person in ihrer Wohnung. Das braucht eine Rechtsgrundlage und eine Information vorab (Art. 13 DSGVO).

Automatische Auswertung und Berichte

Software rechnet fehlerfrei, und das stärkt die Auswertungsobjektivität. Rohwerte werden gezählt, Normwerte aus der Tabelle gezogen, Profile gezeichnet. Der Beitrag „Das Gütekriterium der Objektivität“ nennt neben der Auswertung noch die Interpretationsobjektivität, und hier liegt das Risiko. Viele Programme erzeugen aus den Werten einen Fließtext, der wie ein Befund klingt. Das ist ein Textbaustein, und die Verantwortung für die Interpretation bleibt bei der Fachperson. Sie prüft, ob der Text zur Fragestellung, zur Person und zu den übrigen Daten passt, wie im Beitrag „Diagnostisches Urteil und Gutachten“ beschrieben. Dazu gehört auch, die Normstichprobe zu kennen, die die Software hinterlegt hat (siehe „Normierung und diagnostische Standardwerte“).

Algorithmen und KI in der Auswahl

Eine neue Klasse von Verfahren leitet Merkmale aus unstrukturierten Daten ab: aus Sprache, Text, Stimme, Gesicht oder dem Verhalten in einem Spiel. Die Anbieter sprechen von Persönlichkeit, Eignung oder Potenzial. Für ein solches Verfahren gelten dieselben Fragen wie für jeden Test, und sie sind schwerer zu beantworten. Zu klären ist, was das Verfahren tatsächlich misst und wo das belegt ist, und auf welchem Kriterium das Modell trainiert wurde. Ein Modell, das frühere Einstellungsentscheidungen nachahmt, übernimmt deren Verzerrungen mit. Eine hohe Treffsicherheit gegenüber der Vergangenheit sagt dann nichts über die Eignung. Sie sagt, dass das Modell die früheren Entscheidenden gut kopiert.

Das TBS-DTK hat auf diese Verfahren reagiert (siehe „Die Beurteilung der Güte (nach TBS-DTK)“). Es verlangt eine transparente Dokumentation der Algorithmen, Erklärbarkeit der Ergebnisse, Angaben zu Trainings- und Testdaten einschließlich ihrer Repräsentativität und eine Analyse möglicher Verzerrungen.

Recht: DSGVO und AI Act

Zwei Regelwerke setzen den Rahmen. Die Datenschutz-Grundverordnung verbietet in Art. 22, Personen einer ausschließlich automatisierten Entscheidung zu unterwerfen, die ihnen gegenüber rechtliche Wirkung entfaltet oder sie erheblich beeinträchtigt (mehr dazu im Beitrag „Rechtliche und ethische Rahmenbedingungen der Diagnostik“).

Die KI-Verordnung der EU (Verordnung (EU) 2024/1689, „AI Act“) bringt zwei Regeln, die für die Diagnostik zählen. Erstens verbietet Art. 5 Abs. 1 lit. f seit dem 2. Februar 2025 KI-Systeme, die Emotionen von Personen am Arbeitsplatz oder in Bildungseinrichtungen ableiten, mit Ausnahmen für medizinische und Sicherheitszwecke. Die Leitlinien der Kommission (2025) rechnen auch Bewerberinnen und Bewerber im Auswahlverfahren zum Arbeitsplatz und nennen den Einsatz von Emotionserkennung im Bewerbungsprozess ausdrücklich als verboten. Ein Videointerview, dessen Software aus dem Gesicht „Begeisterung“ oder „Stress“ liest, ist damit nicht zulässig. Zweitens gelten KI-Systeme, die Bewerbungen filtern oder Kandidatinnen und Kandidaten bewerten, als Hochrisiko-Systeme (Anhang III, Nr. 4). Dafür sind unter anderem Risikomanagement, Datenqualität, Dokumentation und menschliche Aufsicht vorgeschrieben. Diese Pflichten gelten nach der KI-Omnibus-Verordnung, die am 27. Juli 2026 in Kraft trat, erst ab dem 2. Dezember 2027. Das Verbot nach Art. 5 ist von der Verschiebung nicht betroffen.

Fragen zur Vertiefung

  1. Ein Papiertest zur Konzentrationsleistung wird als Online-Version angeboten. Welche Belege brauchst du, bevor du die Papiernormen übernimmst, und warum sind sie bei diesem Testtyp besonders wichtig?
  2. Ein Unternehmen setzt einen unbeaufsichtigten Online-Test als erste Stufe der Bewerbung ein. Nenne zwei Risiken für die Durchführungsobjektivität und je eine Gegenmaßnahme.
  3. Welche der drei Objektivitätsarten verbessert die automatische Auswertung, und welche gefährdet der automatisch erzeugte Befundtext?
  4. Ein Anbieter wirbt mit einem Verfahren, das aus Videointerviews die Persönlichkeit ableitet. Welche fünf Fragen stellst du dem Anbieter, bevor du es einsetzt?
  5. Was unterscheidet das Verbot nach Art. 5 AI Act von der Einstufung als Hochrisiko-System, und welche Pflichten gelten wann?

Literatur

  • Bartram, D. & Hambleton, R. K. (Hrsg.) (2006). Computer-based testing and the Internet: Issues and advances. Wiley.
  • International Test Commission (2006). International guidelines on computer-based and Internet-delivered testing. International Journal of Testing, 6, 143–172.
  • Mead, A. D. & Drasgow, F. (1993). Equivalence of computerized and paper-and-pencil cognitive ability tests: A meta-analysis. Psychological Bulletin, 114, 449–458.
  • Verordnung (EU) 2016/679 (Datenschutz-Grundverordnung), Art. 13 und 22.
  • Verordnung (EU) 2024/1689 (KI-Verordnung), Art. 5 Abs. 1 lit. f und Anhang III Nr. 4.
  • Europäische Kommission (2025). Guidelines on prohibited artificial intelligence practices established by Regulation (EU) 2024/1689 (AI Act). C(2025) 5052 final.
  • Europäische Kommission (2026). AI Omnibus enters into force. digital-strategy.ec.europa.eu.