Vor einigen Monaten nahm ich an einer Nachbesprechung zu einer Einstellung teil, bei der ein KI-Screening-Bewertungswert ausschlaggebend für ein Angebot gewesen war. Die Kandidatin oder der Kandidat lag deutlich über dem Schwellenwert, das Team hatte ein gutes Gefühl dabei, und die Anforderung wurde zwei Tage schneller als üblich abgeschlossen.
Sechs Wochen später war diese Person wieder weg.
Niemand im Raum konnte mir sagen, ob der Bewertungswert jemals mit einem tatsächlichen Ergebnis abgeglichen worden war – gut oder schlecht. Man hatte ihm einfach vertraut, so wie man einem Thermometer vertraut, ohne jemals zu fragen, wer es kalibriert hat.
Das ist der Grund, warum Screenz existiert – und auch der Grund, warum es diesen Artikel gibt.
Wenn Sie KI-Screening-Tools bewerten, haben Sie die Genauigkeitszahlen gesehen, mit denen Anbieter werben – 89 % hier, 94 % dort, „übertrifft die manuelle Prüfung“. Diese Zahlen stimmen normalerweise. Sie beantworten jedoch meist eine andere Frage als die, die Sie tatsächlich stellen.
Was „Genauigkeit“ normalerweise bedeutet (und was Screenz stattdessen misst)
Die meisten Genauigkeitsangaben von Anbietern von KI-Screening beschreiben, wie gut das Tool einen Lebenslauf oder ein Profil einer Stellenbeschreibung zuordnet – es extrahiert Fähigkeiten, Berufsbezeichnungen und Berufserfahrung in Jahren und ordnet Kandidatinnen und Kandidaten anschließend anhand der genannten Kriterien. Das ist real, messbar und tatsächlich nützlich. Es ist nur nicht dasselbe wie vorherzusagen, wie jemand nach der Einstellung tatsächlich arbeiten wird.
Das sind zwei unterschiedliche Fragen:
- Übereinstimmungsgenauigkeit: Ähnelt das Profil dieser Person dem, was wir als Wunschprofil beschrieben haben?
- Prognostische Validität: Hängt ein hoher Bewertungswert tatsächlich mit guter Leistung oder einer längeren Betriebszugehörigkeit zusammen, sobald jemand die Stelle angetreten hat?

Ein Tool kann beim ersten Punkt hervorragend sein und beim zweiten völlig unbewiesen. Die meisten Marketingmaterialien der Anbieter unterscheiden nicht zwischen diesen beiden Punkten, und die meisten Käufer wissen nicht, dass sie danach fragen sollten – genau so kommt es, dass ein gut vermarkteter Bewertungswert in einer Nachbesprechung zu einer Einstellung als unumstößliche Wahrheit behandelt wird.
Bei Screenz behandeln wir diese als zwei separate Zahlen und nicht als einen zusammengefassten Bewertungswert – denn genau durch diese Zusammenfassung wird aus einem Zuordnungstool ein scheinbar prognostisches Tool.
Die Frage, für deren Beantwortung wir Screenz entwickelt haben
In der Forschung gibt es dafür eine Bezeichnung: prognostische Validität – die Korrelation zwischen dem Bewertungswert einer Beurteilung und einem späteren, unabhängigen Leistungsmaß, etwa Bewertungen durch Vorgesetzte, Arbeitsleistung oder einer zwölfmonatigen Verbleibsquote. Sie wird auf einer Skala von 0 (kein Zusammenhang) bis 1 (perfekte Vorhersage) angegeben, und in der realen Welt kommt im Zusammenhang mit Einstellungen nichts an 1 heran.

Zur Einordnung: Metaanalytische Forschung zu strukturierten Interviews – dem am besten untersuchten nahen Verwandten heutiger KI-Interviewagenten – kommt je nach gemessener Leistungsdimension im Allgemeinen auf Validitätskoeffizienten im Bereich von 0,28 bis 0,30. Diese Zahlen spiegeln jahrzehntelange Weiterentwicklung wider und gelten bei der Personalauswahl als starkes Ergebnis. Das ist weit entfernt von dem, was eine Schlagzeilenzahl wie „94 % Genauigkeit“ einem Käufer suggeriert, der mit diesem Unterschied nicht vertraut ist – und es ist eine deutlich höhere Messlatte, an der sich die meisten Anbieter von KI-Screening nicht messen lassen wollen.
Genau diese Frage haben wir entwickelt, um sie mit der Intelligence-Schicht von Screenz fortlaufend zu beantworten. Jede bewerbende Person erhält dasselbe strukturierte, rollenspezifische Interview. Anschließend werden die Kandidatinnen und Kandidaten anhand dieser Kriterien eingestuft, wobei Transkript und Begründung beigefügt werden, sodass eine prüfende Person die Arbeit des Modells kontrollieren kann, statt dem Bewertungswert einfach zu vertrauen. Sobald jemand eingestellt ist, erfassen wir Signale aus Rückmeldungen und zur Verbleibsdauer und gleichen sie mit dem ab, was das Interview über diese Person ausgesagt hat – und lassen dieses Muster in die Einstufung der nächsten Auswahlliste einfließen. Genau darum geht es bei diesem Kreislauf: Validität ist keine Behauptung, die wir beim Start einmal aufstellen; das System überprüft sie fortlaufend anhand der eintreffenden Ergebnisse.

Wenn ein Anbieter also sagt, sein Tool sage Leistung voraus, gibt es eine Frage, die direkt zum Kern führt:
„An welchem Ergebnis validiert, wie gemessen und über welchen Zeitraum?“
Wenn die ehrliche Antwort lautet: „Das haben wir noch nicht gemessen“, ist das nicht automatisch ein Ausschlusskriterium – es bedeutet lediglich, dass Sie ein Zuordnungstool und kein prognostisches Tool kaufen und Ihre Abhängigkeit vom Bewertungswert bei schwierigen Entscheidungen entsprechend festgelegt werden sollte.
Drei Fragen, die Sie stellen sollten, bevor Sie einem Bewertungswert vertrauen (Screenz eingeschlossen)
- An welchem Ergebnis wurde validiert – und wie lange nach der Einstellung?
„Prognostiziert Erfolg“ kann eine 30-Tage-Leistungskennzahl, eine 12-Monats-Bindungszahl oder die intuitive Einschätzung eines Managers bedeuten. Fragen Sie, welche davon gemeint ist, und fragen Sie, wie „Erfolg“ vor Beginn der Studie definiert wurde – nicht erst danach, wenn es leicht ist, die Kennzahl auszuwählen, die das Ergebnis am besten aussehen lässt.
- An Daten wie Ihren validiert oder von irgendwo anders übernommen?
Eine Validitätsstudie, die über den gesamten Kundenstamm eines Anbieters hinweg durchgeführt wurde, lässt sich nicht automatisch auf Ihre Rollen, Ihre Branche oder Ihren Arbeitsmarkt übertragen. Fragen Sie, ob die Nachweise etwas enthalten, das Ihrem Kontext ähnelt – und ob der Anbieter eine Möglichkeit bietet, das Tool fortlaufend anhand Ihrer eigenen Ergebnisdaten zu validieren, nicht nur während der Verkaufsphase.

- Wie hoch ist das Verhältnis nachteiliger Auswirkungen, und wer hat es überprüft?
Nach der weithin angewandten Vier-Fünftel-Regel ist eine Auswahlquote für eine beliebige Gruppe, die unter 80 % der Quote der Gruppe mit der höchsten Punktzahl liegt, untersuchungswürdig. Ein Tool kann eine ordentliche Prognosevalidität aufweisen und dennoch eine unterschiedliche Auswirkung haben – das sind voneinander getrennte Fragen, und ein Anbieter, der nur eine davon beantworten kann, hat eigentlich keine von beiden beantwortet.
Für uns sind das keine hypothetischen Fragen. Es sind die drei Fragen, die die Intelligenzschicht fortlaufend beantworten soll – nicht nur einmal bei der Einführung, sondern kontinuierlich, sobald neue Ergebnisdaten eingehen.
Bei alledem geht es nicht darum, KI als Kategorie zu bezweifeln. Es geht um den Unterschied zwischen einem Anbieter, der Ihnen sagt, dass sein Bewertungswert funktioniert, und einem Anbieter, der Ihnen die Belege dafür zeigt, dass er funktioniert – für Ergebnisse, die für Ihr Unternehmen relevant sind, nicht nur für diejenigen, die sich leicht bewerben lassen.
Warum wir Screenz rund um diese Frage entwickelt haben
Ich möchte offen sein: Dies ist keine neutrale Liste. Wir haben Screenz rund um einen KI-Agenten entwickelt, der strukturierte Interviews führt – nicht um einen, der lediglich einen Lebenslauf analysiert –, weshalb die Frage nach der Prognosevalidität für uns nicht abstrakt ist. Sie ist das gesamte Produkt. Effizienz lässt sich leicht nachweisen und vermarkten: schnellere Vorauswahllisten, geringere Kosten pro Einstellung. Die Validität der Ergebnisse ist schwieriger aufzubauen und langsamer nachzuweisen, was vermutlich der Grund dafür ist, dass weniger Anbieter damit an erster Stelle werben.
Wir würden lieber an der schwierigeren Frage gemessen werden. Wenn Sie uns fragen „Woran wurde es validiert?“, möchten wir, dass dies der einfachste Teil des Gesprächs ist – nicht der Teil, der in eine Produktvorführung umgeleitet wird.
Nehmen Sie diese Fragen in Ihr nächstes Gespräch mit einem Anbieter mit – Screenz eingeschlossen
Sie brauchen keinen statistischen Hintergrund, um dieses Gespräch zu führen. Sie brauchen drei Fragen und die Bereitschaft, eine ehrliche Antwort wie „Das wissen wir noch nicht“ auszuhalten, falls Sie diese erhalten. Stellen Sie die drei oben genannten Fragen Ihrem derzeitigen Anbieter oder dem nächsten Anbieter, der Ihnen einen Bewertungswert verkaufen möchte, und beobachten Sie, ob die Antwort aus einer konkreten Zahl und Methodik besteht – oder aus einer selbstbewussten Wiederholung der Genauigkeitsbehauptung, die Sie bereits kannten.
Die Lücke zwischen diesen beiden Antworten ist der eigentliche Kern.
Neugierig, wie ergebnisvalidierte Vorauswahl in der Praxis tatsächlich aussieht? Sehen Sie, wie Screenz dabei vorgeht.
