Ein Rohwert von 23 gelösten Aufgaben aus 30 sagt wenig. Wie viel er bedeutet, hängt davon ab, wie schwer die Aufgaben waren und wer sie sonst gelöst hat. Ein Rohwert allein trägt keine diagnostische Information. Er bekommt sie durch einen Maßstab.
Ein Rohwert braucht einen Maßstab
Zwei Maßstäbe stehen zur Wahl. Die normorientierte Diagnostik vergleicht das Ergebnis einer Person mit den Ergebnissen einer Bezugsgruppe. Die kriteriumsorientierte Diagnostik vergleicht es mit einem festgelegten Anspruch, etwa einem Lernziel oder einer Mindestkompetenz. Die Beiträge „Leistungsdiagnostik“ und „Persönlichkeitsdiagnostik“ haben beide Zugänge schon angesprochen. Hier geht es um das Handwerk dahinter.
Die Norm ist dabei ein statistischer Begriff: Sie beschreibt die Verteilung der Rohwerte in einer Bezugsgruppe. Mit einem Sollwert hat sie nichts zu tun. „Normal“ heißt durchschnittlich. Gesund oder erwünscht sagt das Wort nicht.
Normstichprobe und Normierung
Die Normierung (früher auch Eichung) ist der Vorgang, in dem ein Test an einer großen Stichprobe durchgeführt wird, der Normstichprobe. Aus der Verteilung der Rohwerte entsteht eine Tabelle, die jedem Rohwert einen Normwert zuordnet. Wer den Test später einsetzt, liest dort ab.
Ob die Tabelle taugt, hängt an der Stichprobe. Sie muss für die Zielgruppe repräsentativ sein, etwa nach Alter, Geschlecht, Bildung und Region, und so groß, dass auch die Ränder der Verteilung stabil geschätzt sind. Mit der Zeit veraltet sie. Fallen die Ergebnisse systematisch nach Alter oder Geschlecht unterschiedlich aus, gibt es getrennte Tabellen für diese Gruppen. Die Person, die du testest, muss zur Normstichprobe passen. Ein Test, der in einem anderen Land normiert wurde, braucht im Handbuch den Beleg, dass die Normen auch für die Zielgruppe gelten.
Normierung ist eines der sekundären Gütekriterien, wie der gleichnamige Beitrag zeigt, und die fünfte Phase der Testkonstruktion. Das TBS-DTK prüft sie als eigenes Kriterium.
Standardwerte im Überblick
Normwerte gibt es in mehreren Formen. Alle stehen in fester Beziehung zueinander.
Der Prozentrang gibt an, welcher Anteil der Normstichprobe einen gleichen oder niedrigeren Rohwert erreicht hat. Ein Prozentrang von 84 heißt: 84 % der Bezugsgruppe liegen auf oder unter diesem Wert. Der Prozentrang ist leicht zu verstehen, hat aber ein Problem. Er ist ein Rang, keine Intervallskala. In der Mitte der Verteilung liegen viele Personen dicht beieinander, am Rand wenige. Ein halber Standardabweichungsschritt von der Mitte weg verschiebt den Prozentrang von 50 auf 69, derselbe Schritt am oberen Rand von 1,5 auf 2,0 Standardabweichungen nur von 93 auf 98. Prozentränge darfst du deshalb nicht mitteln.
Der z-Wert rechnet den Rohwert in Standardabweichungen vom Mittelwert um: z = (x − M) / s. Er hat den Mittelwert 0 und die Standardabweichung 1. Alle anderen Standardwerte entstehen aus ihm durch eine lineare Umrechnung: neuer Wert = neuer Mittelwert + neue Standardabweichung · z. Diese Skalen behalten die Abstände der Rohwerte bei. In Prozentränge lassen sie sich direkt nur übersetzen, wenn die Rohwerte annähernd normalverteilt sind.
| Skala | Mittelwert | Standardabweichung | z = −2 | z = −1 | z = 0 | z = 1 | z = 2 |
|---|---|---|---|---|---|---|---|
| Prozentrang | 2 | 16 | 50 | 84 | 98 | ||
| T-Wert | 50 | 10 | 30 | 40 | 50 | 60 | 70 |
| IQ-Skala | 100 | 15 | 70 | 85 | 100 | 115 | 130 |
| Stanine | 5 | 2 | 1 | 3 | 5 | 7 | 9 |
| Wertpunkte | 10 | 3 | 4 | 7 | 10 | 13 | 16 |
Die Stanine werden auf ganze Zahlen von 1 bis 9 gerundet. Die Wertpunkte kommen in den Untertests der Wechsler-Verfahren vor. Alle Skalen enthalten dieselbe Information. Sie unterscheiden sich in der Konvention, und welche zu einem Test gehört, steht im Handbuch. Dort steht auch, was als durchschnittlicher Bereich gilt. Üblich ist eine Standardabweichung um den Mittelwert, also ein IQ von 85 bis 115, was zu den 68 % im Beitrag „Leistungsdiagnostik“ passt.
Die lineare Umrechnung erhält die Form der Verteilung. Sind die Rohwerte schief verteilt, entspricht ein T-Wert von 70 nicht mehr einem Prozentrang von 98. Dann arbeitet man mit einer Normalisierung: Aus den Prozentrangwerten der Stichprobe werden über die Umkehrfunktion der Normalverteilung z-Werte berechnet, und von dort geht es wie oben weiter.
Standardwerte berechnen
In der Praxis liest du den Normwert aus der Tabelle des Handbuchs ab. Der Code zeigt, was dahintersteckt.
rohwert <- 52
m <- 40 # Mittelwert der Normstichprobe laut Testhandbuch
s <- 8 # Standardabweichung der Normstichprobe
z <- (rohwert - m) / s # 1.5
t_wert <- 50 + 10 * z # 65
iq <- 100 + 15 * z # 122.5
stanine <- round(5 + 2 * z) # 8
pr <- pnorm(z) * 100 # 93.3
Die Funktion pnorm() liefert den Anteil der Normalverteilung unterhalb von z. Mit qnorm() gehst du den umgekehrten Weg vom Prozentrang zum z-Wert.
Normwerte sind Messwerte mit Fehler
Ein Normwert ist so genau wie die Messung, aus der er stammt. Die Unsicherheit steckt im Standardmessfehler, den du aus dem Beitrag „Individuelle Diagnostik“ kennst: SEM = s · √(1 − Reliabilität).
Eine Person erreicht auf der IQ-Skala einen Wert von 115, die Reliabilität des Tests beträgt .95. Dann ist SEM = 15 · √.05 = 3,4. Das 95-%-Intervall um den beobachteten Wert reicht von 115 − 1,96 · 3,4 bis 115 + 1,96 · 3,4, also von etwa 108 bis 122. In Prozenträngen entspricht das Intervall den Werten 71 bis 92. Der Prozentrang 84 aus der Tabelle ist ein Punkt in dieser Spanne.
sem <- 15 * sqrt(1 - .95) # 3.35
115 + c(-1, 1) * 1.96 * sem # 108.4 121.6
pnorm((c(108.4, 121.6) - 100) / 15) * 100 # 71.2 92.5
Wer einen einzelnen Wert gegen einen Grenzwert hält, sollte immer prüfen, ob das Intervall den Grenzwert einschließt.
Kriteriumsorientierte Messung
Manche Tests sollen entscheiden, ob jemand etwas kann. Der Maßstab ist dann ein festgelegtes Kriterium. Die theoretische Führerscheinprüfung funktioniert so: Wer die Mindestzahl richtiger Antworten erreicht, besteht, unabhängig davon, wie andere abschneiden. Den Begriff hat Glaser (1963) in die Messtheorie eingeführt.
Offen bleibt, wo der Cut-off liegt. Ein häufiges Vorgehen ist die Angoff-Methode (Angoff, 1971): Fachleute schätzen für jedes Item die Wahrscheinlichkeit, mit der eine gerade noch ausreichend kompetente Person es richtig löst. Die Summe dieser Wahrscheinlichkeiten über alle Items ergibt den Cut-off.
Auch die Gütekriterien verschieben sich. Klassische Reliabilitätskennwerte setzen Unterschiede zwischen Personen voraus, und ein kriteriumsorientierter Test muss solche Unterschiede nicht erzeugen. Wichtig ist, ob dieselbe Person bei einer Wiederholung auf derselben Seite des Cut-offs landet. Diese Entscheidungskonsistenz hängt mit den Fehlerarten aus dem Beitrag „Diagnostische Entscheidungen, Fehler und Prognosen“ zusammen: Wer knapp neben dem Cut-off liegt, wechselt bei einer Wiederholung leicht die Seite.
Wenn Normen veralten
Normen gelten für die Bevölkerung zum Zeitpunkt der Normierung. In der Intelligenzdiagnostik stiegen die Testleistungen über weite Teile des 20. Jahrhunderts um etwa drei IQ-Punkte pro Jahrzehnt (Flynn, 1984, 1987). Wer heute mit einer Norm von 2004 testet, überschätzt die Person bei diesem Tempo um rund sieben Punkte. Bei einem festen Grenzwert wie IQ 70 wechseln dadurch Personen die Seite.
Ein Test braucht deshalb in regelmäßigen Abständen eine Nachnormierung. Ob eine Norm noch taugt, belegt das Handbuch mit Angaben zu Stichprobe, Erhebungszeitpunkt und Zielgruppe.
Fragen zur Vertiefung
- Eine Person erreicht einen Rohwert von 21, die Norm hat M = 25 und s = 4. Berechne z, T-Wert, IQ-Skala und Prozentrang, zuerst von Hand, dann in R.
- Warum darfst du Prozentränge nicht mitteln? Wie vergleichst du stattdessen die Ergebnisse einer Person in zwei Tests?
- Ein Test hat eine Reliabilität von .90 und wird auf der T-Wert-Skala berichtet. Wie groß ist der Standardmessfehler?
- Ein Test wurde 2004 normiert, und du setzt ihn 2026 ein. Wie groß ist die Verzerrung, wenn der Flynn-Effekt bei drei Punkten pro Jahrzehnt liegt, und in welche Richtung?
- Die Führerscheinprüfung ist kriteriumsorientiert, ein Intelligenztest normorientiert. Warum wäre es bei der Führerscheinprüfung unsinnig, nur die besten 80 % jedes Jahrgangs bestehen zu lassen?
Literatur
- Angoff, W. H. (1971). Scales, norms, and equivalent scores. In R. L. Thorndike (Hrsg.), Educational measurement (2. Aufl., S. 508–600). American Council on Education.
- Flynn, J. R. (1984). The mean IQ of Americans: Massive gains 1932 to 1978. Psychological Bulletin, 95, 29–51.
- Flynn, J. R. (1987). Massive IQ gains in 14 nations: What IQ tests really measure. Psychological Bulletin, 101, 171–191.
- Glaser, R. (1963). Instructional technology and the measurement of learning outcomes: Some questions. American Psychologist, 18, 519–521.
