Intelligenzdiagnostik

Intelligenz lässt sich nicht beobachten. Beobachten lassen sich Leistungen in Aufgaben, und aus ihnen wird ein Merkmal erschlossen. Die Intelligenzdiagnostik ist deshalb das Lehrbuchbeispiel für Konstruktvalidität: Alles, was sie über eine Person sagt, hängt an der Theorie, die festlegt, was die Aufgaben messen sollen. Dieser Beitrag baut auf der „Leistungsdiagnostik“ auf und ergänzt, was dort fehlt: die Modelle, die Verfahren und die Grenzen.

Intelligenz als Konstrukt

Ein Konstrukt ist ein theoretisches Merkmal, das nicht direkt zugänglich ist. Für Intelligenz gibt es keine einzelne, allgemein akzeptierte Definition. Die Testpsychologie arbeitet stattdessen mit Modellen, die beschreiben, wie sich Leistungen in verschiedenen Aufgaben zueinander verhalten, und leitet daraus ab, was ein Test erfassen muss.

Modelle der Intelligenz

Spearman (1904) stellte fest, dass Leistungen in ganz unterschiedlichen Aufgaben positiv zusammenhängen. Wer in einem Bereich gut abschneidet, schneidet im Mittel auch in anderen gut ab. Spearman erklärte das mit einem allgemeinen Faktor, dem g-Faktor. Thurstone (1938) hielt dagegen, dass sich die Leistungen in mehrere eigenständige Primärfähigkeiten gliedern, etwa sprachliches Verständnis und räumliches Denken, und dass ein einziger Faktor zu grob ist.

Cattell unterschied fluide und kristalline Intelligenz (Cattell, 1963). Die fluide Intelligenz beschreibt, wie gut jemand neue Probleme löst, ohne auf Vorwissen zurückzugreifen, etwa Muster in einer Figurenfolge zu erkennen. Die kristalline Intelligenz beschreibt das, was jemand gelernt hat: Wortschatz, Allgemeinwissen, Rechenverfahren.

Carroll (1993) wertete Hunderte von Datensätzen faktorenanalytisch aus und ordnete die Befunde in einem Modell mit drei Ebenen. An der Spitze steht g, darunter mehrere breite Fähigkeiten, darunter fluide und kristalline Intelligenz, und ganz unten viele spezifische Fähigkeiten. Die Cattell-Horn-Carroll-Theorie (CHC) führt beide Ansätze zusammen und gilt heute als die einflussreichste psychometrisch fundierte Theorie. Sie dient dazu, Intelligenztests zu planen und ihre Ergebnisse zu deuten, meist auf der mittleren Ebene der breiten Fähigkeiten.

Vom Intelligenzalter zum Abweichungs-IQ

Binet und Simon (1905) entwickelten die erste Intelligenzskala, um Kinder zu erkennen, die zusätzliche schulische Unterstützung brauchen. Das Ergebnis wurde als Intelligenzalter ausgedrückt: Ein Kind, das die Aufgaben eines durchschnittlichen Zehnjährigen löst, hat ein Intelligenzalter von zehn. Stern (1912) setzte es ins Verhältnis zum Lebensalter und erfand damit den Intelligenzquotienten: IQ = Intelligenzalter / Lebensalter · 100. Ein Achtjähriger mit einem Intelligenzalter von zehn kommt auf einen IQ von 125.

Für Erwachsene taugt die Formel nicht, denn das Intelligenzalter wächst nach der Jugend nicht mehr mit dem Lebensalter. Wechsler (1939) ersetzte den Quotienten durch den Abweichungs-IQ. Er gibt an, wie weit ein Wert vom Mittelwert der gleichaltrigen Normstichprobe entfernt ist, gemessen in Standardabweichungen, und rechnet ihn auf die Skala mit Mittelwert 100 und Standardabweichung 15 um: IQ = 100 + 15 · z. Der Beitrag „Normierung und diagnostische Standardwerte“ zeigt die Rechnung im Einzelnen.

Verfahren im deutschsprachigen Raum

Eine Auswahl, die die Vielfalt der Ansätze zeigt:

VerfahrenAltersbereichSchwerpunkt
WAIS-IV (Wechsler Adult Intelligence Scale, deutsche Adaptation 2012)16 bis 90 JahreWechsler-Skalen, Gesamt-IQ und Indexwerte für Teilbereiche
I-S-T 2000 R (Liepmann, Beauducel, Brocke & Amthauer)ab 15 JahrenIntelligenz-Struktur mit verbalen, numerischen und figuralen Aufgaben
CFT 20-R (Weiß, 2006)8;6 bis 17 JahreNonverbale fluide Intelligenz
AID 3 (Kubinger & Holocher-Benetka)6;0 bis 15;11 JahreAdaptive Testbatterie, Einzeltestung, Tailored Testing

Die Altersangaben stehen als Jahre;Monate. Das WAIS-IV und der AID 3 sind Einzeltests und verlangen eine geschulte Testleitung. Der I-S-T 2000 R lässt sich auch als Gruppentest durchführen. Der CFT 20-R nennt sich kulturfair, was weniger verspricht als kulturfrei: Auch figurale Aufgaben setzen voraus, dass jemand die Aufgabenform kennt und mit der Testsituation vertraut ist.

Welches Verfahren passt, entscheidet die Fragestellung. Geht es um ein breites Profil einer erwachsenen Person, kommt das WAIS-IV infrage, geht es um eine sprachfreie Einschätzung bei einem Schulkind, der CFT 20-R. Das Handbuch zeigt, für welche Gruppe, mit welcher Norm und mit welcher Reliabilität der Test geprüft wurde.

Genauigkeit und Grenzen eines IQ-Werts

Ein IQ-Wert ist ein Messwert mit Fehler. Bei einer Reliabilität von .95 beträgt der Standardmessfehler auf der IQ-Skala 3,4 Punkte, und ein Wert von 115 kommt mit 95 % Sicherheit aus dem Bereich von etwa 108 bis 122 (Rechnung in „Normierung und diagnostische Standardwerte“). Wer einen IQ als exakte Zahl berichtet, behauptet eine Genauigkeit, die der Test nicht liefert.

Die Normen veralten. Über weite Teile des 20. Jahrhunderts stiegen die Testleistungen um rund drei IQ-Punkte pro Jahrzehnt (Flynn-Effekt), sodass eine alte Norm Personen überschätzt. Ob ein Test für eine Person geeignet ist, hängt außerdem von Sprache, Vorerfahrung und Gesundheit ab. Eine Person mit eingeschränktem Hörvermögen, die Instruktionen schlecht versteht, liefert ein Ergebnis, das die Intelligenz unterschätzt.

Intelligenz und Berufserfolg

Intelligenztests sagen Berufsleistung vorher, und die Frage ist, wie gut. Schmidt und Hunter (1998) berichteten für kognitive Tests eine operationale Validität von r = .51. Sackett und Kollegen (2022) zeigten, dass frühere Meta-Analysen die Einschränkung der Streubreite überkorrigiert hatten, und kamen auf r = .31. In dieser neuen Rangfolge liegen strukturierte Interviews mit r = .42 vorn.

Der Unterschied ist erheblich. Aus r = .51 folgen 26 % aufgeklärte Varianz im Kriterium, aus r = .31 knapp 10 %. Beide Werte beschreiben einen Beitrag zur Vorhersage. Ein Intelligenztest allein trennt Geeignete und Ungeeignete nicht, wie der Beitrag „Diagnostische Entscheidungen, Fehler und Prognosen“ zeigt.

Intelligenzminderung: ICD-10 und ICD-11

Die ICD-10 definierte die leichte Intelligenzminderung (F70) über einen IQ-Bereich von 50 bis 69. Die ICD-11 spricht von Störungen der Intelligententwicklung. Sie verlangt, dass sowohl die intellektuelle Leistungsfähigkeit als auch das adaptive Verhalten ungefähr zwei oder mehr Standardabweichungen unter dem Mittelwert liegen, gemessen mit angemessen normierten, individuell durchgeführten Tests. Eine leichte Störung liegt zwischen zwei und drei Standardabweichungen unter dem Mittelwert. Fehlen geeignete Tests, stützt sich die Diagnose stärker auf das klinische Urteil anhand von Verhaltensindikatoren.

Zwei Standardabweichungen unter dem Mittelwert entsprechen einem IQ von 70. Das 95-%-Intervall um diesen Wert reicht bei einer Reliabilität von .95 von etwa 63 bis 77. Wer in diesem Bereich liegt, lässt sich mit dem Test allein nicht sicher einer Seite der Grenze zuordnen. Die ICD-11 verlangt beide Kriterien und gibt dem adaptiven Verhalten damit gleiches Gewicht wie dem Testwert.

Fragen zur Vertiefung

  1. Ein Neunjähriger löst die Aufgaben eines durchschnittlichen Zwölfjährigen. Berechne den Quotienten-IQ nach Stern. Warum eignet sich die Formel nicht für Erwachsene?
  2. Eine Person erreicht einen IQ von 72, die Reliabilität liegt bei .95. Berechne das 95-%-Intervall und beschreibe, was es für die Einordnung nach ICD-10 und ICD-11 bedeutet.
  3. Erkläre den Unterschied zwischen fluider und kristalliner Intelligenz. Welcher der vier Tests in der Tabelle zielt auf die fluide Intelligenz?
  4. Warum verspricht die Bezeichnung „kulturfair“ weniger als „kulturfrei“?
  5. Wie viel Prozent der Varianz im Berufserfolg erklären r = .51 und r = .31? Welche Folgen hat der Unterschied für die Entscheidung, einen Intelligenztest in die Personalauswahl aufzunehmen?
  6. Warum genügt der Testwert allein nicht für die Diagnose nach ICD-11, und welches zweite Kriterium kommt hinzu?

Literatur

  • Binet, A. & Simon, T. (1905). Méthodes nouvelles pour le diagnostic du niveau intellectuel des anormaux. L’Année Psychologique, 11, 191–244.
  • Carroll, J. B. (1993). Human cognitive abilities: A survey of factor-analytic studies. Cambridge University Press.
  • Cattell, R. B. (1963). Theory of fluid and crystallized intelligence: A critical experiment. Journal of Educational Psychology, 54, 1–22.
  • Sackett, P. R., Zhang, C., Berry, C. M. & Lievens, F. (2022). Revisiting meta-analytic estimates of validity in personnel selection: Addressing systematic overcorrection for restriction of range. Journal of Applied Psychology, 107, 2040–2068.
  • Schmidt, F. L. & Hunter, J. E. (1998). The validity and utility of selection methods in personnel psychology: Practical and theoretical implications of 85 years of research findings. Psychological Bulletin, 124, 262–274.
  • Spearman, C. (1904). „General intelligence,“ objectively determined and measured. American Journal of Psychology, 15, 201–292.
  • Stern, W. (1912). Die psychologischen Methoden der Intelligenzprüfung und deren Anwendung an Schulkindern. Barth.
  • Thurstone, L. L. (1938). Primary mental abilities. University of Chicago Press.
  • Wechsler, D. (1939). The measurement of adult intelligence. Williams & Wilkins.
  • Weltgesundheitsorganisation. ICD-10 (F70) und ICD-11 (6A00, Störungen der Intelligententwicklung).