Diagnostische Entscheidungen, Fehler und Prognosen

Ein Testwert entscheidet nichts. Erst die Regel, ab welchem Wert jemand eingeladen, gefördert oder behandelt wird, macht aus der Messung eine Entscheidung. Dieser Beitrag behandelt die Regel, die beiden Fehler, die sie unvermeidlich erzeugt, und die Frage, wie weit eine Prognose trägt.

Diagnostik endet in einer Entscheidung

Der diagnostische Prozess läuft auf ein Urteil zu, und das Urteil dient einer Entscheidung. Zwei Konstellationen unterscheiden sich stark. Bei der Selektion entscheidet eine Institution über viele Personen und hat wenige Plätze zu vergeben, etwa in der Personalauswahl oder bei der Studienzulassung. Bei der Modifikation geht es um einen einzelnen Menschen, für den eine Förderung oder Behandlung gewählt wird. Der Beitrag „Überblick über diagnostische Verfahren“ beschreibt beide Strategien.

Für Selektionsentscheidungen brauchst du zwei Kennzahlen. Die Basisrate ist der Anteil der Personen in der Population, die das Kriterium erfüllen, also tatsächlich geeignet oder tatsächlich betroffen sind. Die Selektionsquote ist der Anteil der Personen, die am Ende ausgewählt werden.

Cut-off und die vier Ausgänge

Eine Entscheidungsregel legt einen Trennwert fest, den Cut-off. Wer ihn erreicht oder überschreitet, gilt als „positiv“. Das tatsächliche Kriterium, etwa die spätere Bewährung im Beruf oder eine Diagnose nach einem Goldstandard, wird erst danach sichtbar. Aus Test und Kriterium ergeben sich vier mögliche Ausgänge.

Kriterium trifft zuKriterium trifft nicht zu
Test positivrichtig positivfalsch positiv
Test negativfalsch negativrichtig negativ

Was „positiv“ bedeutet, hängt vom Anwendungsfeld ab. In einem Screening heißt es „auffällig“, in der Personalauswahl „geeignet“. Ein falsch positives Ergebnis ist ein Fehlalarm: Der Test meldet etwas, das nicht vorliegt. Ein falsch negatives Ergebnis ist ein Übersehen: Etwas liegt vor, und der Test bleibt still.

Die beiden Fehler kosten selten dasselbe. Bei einem Screening auf Lese-Rechtschreibschwäche bekommt ein Kind nach einem falsch negativen Ergebnis keine Förderung, nach einem falsch positiven Ergebnis folgt eine unnötige Zusatzdiagnostik. In der Personalauswahl ist die Fehlbesetzung der falsch positive Fall. Der falsch negative Fall bleibt unsichtbar: Eine geeignete Person wird abgelehnt, und niemand erfährt je, was sie geleistet hätte. Das Kriterium lässt sich nur für die Ausgewählten beobachten.

Verschiebst du den Cut-off nach unten, übersiehst du weniger Personen und löst mehr Fehlalarme aus. Verschiebst du ihn nach oben, passiert das Umgekehrte. Beide Fehler verschwinden nur bei perfekter Vorhersage. Bei einer Validität von r = .30 erklärt der Test 9 % der Varianz im Kriterium, und die Verteilungen der Geeigneten und der Ungeeigneten überlappen stark. Die Lage des Cut-offs ist deshalb eine Wertentscheidung. Sie hängt davon ab, welcher Fehler im jeweiligen Fall mehr kostet. Cronbach und Gleser (1965) haben diese Sicht als Entscheidungstheorie ausgearbeitet, in der jeder Ausgang einen Nutzen oder Schaden bekommt. Taylor und Russell (1939) haben Tabellen veröffentlicht, die zeigen, welcher Anteil der Ausgewählten sich bewährt, wenn Validität, Selektionsquote und Basisrate bekannt sind.

Sensitivität und Spezifität

Zwei Kennwerte beschreiben, wie gut ein Test bei einem bestimmten Cut-off trennt.

Die Sensitivität ist der Anteil der tatsächlich Betroffenen, die der Test erkennt: richtig positiv geteilt durch richtig positiv plus falsch negativ. Die Spezifität ist der Anteil der nicht Betroffenen, die der Test als unauffällig einstuft: richtig negativ geteilt durch richtig negativ plus falsch positiv.

Beide gehören zum Test und zum Cut-off. Sie ändern sich nicht, wenn du den Test in einer anderen Population einsetzt. Was sich ändert, ist die Bedeutung eines einzelnen Ergebnisses.

Die Basisrate bestimmt, was ein positives Ergebnis bedeutet

Ein Screening hat Sensitivität und Spezifität von jeweils .90. Es wird bei 1000 Personen eingesetzt, von denen 5 % betroffen sind, das entspricht einer Basisrate von .05. Dann ergeben sich diese Häufigkeiten.

betroffennicht betroffenSumme
Test positiv4595140
Test negativ5855860
Summe509501000

Von 140 positiven Ergebnissen sind 45 richtig. Der positive prädiktive Wert beträgt 45 / 140, also 32 %. Obwohl der Test in beide Richtungen zu 90 % trifft, ist nur etwa jedes dritte positive Ergebnis ein Treffer. Der negative prädiktive Wert liegt bei 855 / 860, also 99 %: Ein unauffälliges Ergebnis ist verlässlich.

Die Ursache ist die niedrige Basisrate. Es gibt wenige Betroffene und viele Nicht-Betroffene, und selbst 10 % Fehlalarme unter 950 Gesunden ergeben mehr Personen als die 45 erkannten Betroffenen. Bei einer Basisrate von .50 und gleichen Kennwerten liegt der positive prädiktive Wert bei 90 %.

Du kannst das in R nachrechnen.

ppv <- function(sens, spec, basisrate) {
  rp <- sens * basisrate              # richtig positiv
  fp <- (1 - spec) * (1 - basisrate)  # falsch positiv
  rp / (rp + fp)
}

basisraten <- c(.01, .05, .10, .20, .50)
round(sapply(basisraten, function(b) ppv(sens = .90, spec = .90, basisrate = b)), 2)
# 0.08 0.32 0.50 0.69 0.90

Bei einer Basisrate von 1 % ist ein positives Ergebnis in 92 % der Fälle falsch. Menschen unterschätzen diesen Effekt systematisch. Kahneman und Tversky (1973) nannten das Basisratenvernachlässigung: Wir beurteilen ein Ergebnis nach der Treffsicherheit des Tests und lassen außer Acht, wie selten oder häufig das Merkmal überhaupt ist.

Fehler im Urteil

Entscheidungsfehler entstehen auch im Kopf der diagnostizierenden Person. Zwei Muster treten in der Praxis immer wieder auf.

Bei der Bestätigungstendenz suchen wir Informationen, die zur ersten Hypothese passen, gewichten sie höher und übersehen Befunde, die ihr widersprechen (Nickerson, 1998). Ein Gegenmittel steckt im diagnostischen Prozess selbst: Wer in der Hypothesenbildung mehrere Hypothesen aufstellt und für jede festlegt, welcher Befund sie widerlegen würde, bevor er die Daten erhebt, hat die Prüfung bereits fairer angelegt.

Beim Ankereffekt zieht eine frühe Information spätere Einschätzungen in ihre Richtung, auch wenn sie nebensächlich ist (Tversky & Kahneman, 1974). Ein Aktenvermerk, der Ersteindruck im Vorgespräch oder ein früherer Testwert kann so wirken.

Der Beitrag „Diagnostisches Urteil und Gutachten“ stellt klinische und statistische Urteilsbildung gegenüber. Die Evidenz dazu geht auf Meehl (1954) zurück. Grove und Kollegen (2000) werteten 136 Studien aus: Die mechanische Kombination der Daten, also eine feste Regel oder ein statistisches Modell, war im Mittel genauer als das klinische Urteil. Das klinische Urteil war nur in einem kleinen Teil der Studien deutlich besser. Die Fachperson bleibt gefragt: Sie klärt den Auftrag, formuliert die Hypothesen und erhebt die Daten. Die Kombination der Daten übernimmt eine feste Regel.

Prognosen und ihre Grenzen

Eine Prognose sagt Verhalten oder Erleben für einen späteren Zeitpunkt voraus. Ihre Grundlage ist ein Prädiktor mit nachgewiesener Kriteriumsvalidität. Fünf Umstände begrenzen, wie weit sie trägt.

Erstens die Validität selbst. Bei r = .30 bleiben 91 % der Kriteriumsvarianz unerklärt.

Zweitens das Kriterium. Auch Berufserfolg, Noten oder Therapieerfolg sind mit Messfehler behaftet. Die Validität kann nie größer sein als die Wurzel aus dem Produkt der Reliabilitäten von Prädiktor und Kriterium (siehe Minderungskorrektur im Aufbaumodul zur klassischen Testtheorie). Hat der Test eine Reliabilität von .81 und das Kriterium eine von .64, liegt die Obergrenze bei r = .72, selbst wenn Test und Kriterium dasselbe Merkmal erfassen.

Drittens die Regression zur Mitte. Ein Teil jedes extremen Testwerts ist Messfehler, und der Fehler ist zufällig. Bei einer Wiederholung liegt der Wert deshalb im Mittel näher am Durchschnitt. Wer Personen nach einem einzigen extremen Wert auswählt, muss bei einer Wiederholung mit weniger Extremem rechnen. Wie viel weniger, zeigt der Standardmessfehler im Beitrag „Individuelle Diagnostik“.

Viertens seltene Ereignisse. Je kleiner die Basisrate, desto kleiner der positive prädiktive Wert, wie die Tabelle oben zeigt. Prognosen seltener Ereignisse, etwa von Gewalt oder Suizid, erzeugen viele falsch positive Ergebnisse, auch bei einem guten Verfahren.

Fünftens die Zeit. Zwischen Prädiktor und Kriterium verändern sich Person und Umgebung. Je größer der Abstand, desto geringer die Vorhersagekraft.

Fragen zur Vertiefung

  1. Ein Screening hat eine Sensitivität von .95 und eine Spezifität von .80, die Basisrate beträgt 2 %. Berechne den positiven prädiktiven Wert für 1000 Personen, zuerst mit einer Vierfeldertafel, dann in R.
  2. Ein Unternehmen hat 200 Bewerbungen und 10 Stellen. Berechne die Selektionsquote. Was passiert mit falsch positiven und falsch negativen Entscheidungen, wenn das Unternehmen den Cut-off senkt?
  3. Warum lässt sich der falsch negative Fehler in der Personalauswahl nie direkt beobachten?
  4. Eine Kollegin hält ihr klinisches Urteil für treffsicherer als eine Regel. Welche Evidenz spricht dagegen, und wofür bleibt ihr Urteil unverzichtbar?
  5. Ein Test hat eine Reliabilität von .70, das Kriterium eine von .50. Welche Validität ist höchstens möglich?

Literatur

  • Cronbach, L. J. & Gleser, G. C. (1965). Psychological tests and personnel decisions (2. Aufl.). University of Illinois Press.
  • Grove, W. M., Zald, D. H., Lebow, B. S., Snitz, B. E. & Nelson, C. (2000). Clinical versus mechanical prediction: A meta-analysis. Psychological Assessment, 12, 19–30.
  • Kahneman, D. & Tversky, A. (1973). On the psychology of prediction. Psychological Review, 80, 237–251.
  • Meehl, P. E. (1954). Clinical versus statistical prediction. University of Minnesota Press.
  • Nickerson, R. S. (1998). Confirmation bias: A ubiquitous phenomenon in many guises. Review of General Psychology, 2, 175–220.
  • Taylor, H. C. & Russell, J. T. (1939). The relationship of validity coefficients to the practical effectiveness of tests in selection. Journal of Applied Psychology, 23, 565–578.
  • Tversky, A. & Kahneman, D. (1974). Judgment under uncertainty: Heuristics and biases. Science, 185, 1124–1131.