i10x.ai ließ 400 identische Lebensläufe mit weiblichem und männlichem Namen bewerten. Entscheidend war, welches Modell den Text geschrieben hatte.
Recruiting: Vorname spielt beim KI-Screening kaum eine Rolle

Ob ein Lebenslauf einen weiblichen oder männlichen Vornamen trägt, hat bei der Bewertung durch KI-Modelle praktisch keinen Einfluss. Zu diesem Ergebnis kommt eine Studie von Christopher Ort vom Research-Team der KI-Plattform i10x.ai mit Sitz in Singapur, veröffentlicht am 6. Oktober. Deutlich stärker wirkte sich aus, welches KI-Modell den Lebenslauf geschrieben hatte. Die Studie stammt vom Unternehmen selbst und wurde nicht in einem wissenschaftlichen Begutachtungsverfahren geprüft.
KI-Recruiting: Nur der Name wurde getauscht
Grundlage sind 100 fiktive Bewerberprofile mit passenden Stellenausschreibungen, etwa aus Softwareentwicklung, Datenanalyse, Pflege und Finanzwesen. Vier KI-Systeme von Anthropic, OpenAI, Google und xAI hatten zu jedem Profil einen Lebenslauf geschrieben. Diese 400 Texte blieben unverändert, ausgetauscht wurde nur der Vorname, etwa Alexandra und Alexander Chen. In einem zweiten Durchgang kam eine Zeile mit Pronomen hinzu: she/her, he/him oder they/them.
Bewertet wurden die Lebensläufe von den jeweils günstigsten Screening-Modellen der Anbieter: Claude Haiku 4.5, GPT-6 Luna, Gemini 3.1 Flash Lite und Grok 4.3. Sie vergaben einen Wert von 0 bis 100 und eine Empfehlung: einstellen, vielleicht oder ablehnen. Von 3.200 Anfragen im Namenstausch waren 3.168 auswertbar.
Höchstens 0,24 Punkte Unterschied
Der größte Abstand zwischen weiblichem und männlichem Namen lag bei 0,24 Punkten (Grok 4.3). Die Einstellungsquoten unterschieden sich um höchstens einen Prozentpunkt. Auch die Zeile they/them änderte die Entscheidungen nicht.
Eine frühere Testphase hatte zunächst auf einen Geschlechtereffekt hingedeutet: Ein Modell empfahl weiblich klingende Namen zu etwa 65 Prozent, männliche zu etwa 55 Prozent. Dort waren die Lebensläufe aber mit dem neuen Namen neu geschrieben worden, sodass sich Länge, Format und Wortlaut mit änderten. Laut Ort ist ein Test auf Namensbias nur aussagekräftig, wenn der Text unverändert bleibt.
GPT bewertet eigene Texte schlechter
Über alle Bewerter hinweg wurden von Gemini verfasste Lebensläufe zu 98 Prozent zur Einstellung empfohlen, von Claude verfasste zu 96 Prozent, von xAI verfasste zu 91 Prozent und von GPT verfasste zu 86 Prozent. Bewertete GPT-6 Luna Lebensläufe, die GPT geschrieben hatte, sank die Quote auf 68,7 Prozent. Die anderen drei Modelle empfahlen dieselben Texte zu 89 bis 95 Prozent. GPT vergab für seine eigenen Texte im Schnitt 8,17 Punkte weniger als für die der anderen Modelle, Grok 3,06 Punkte weniger. Claude und Gemini bewerteten ihre eigenen Texte um 2,65 beziehungsweise 2,46 Punkte besser.
„In diesem Design haben der Vorname und das Pronomen nicht über die Einstellung entschieden. Welches Modell den Lebenslauf geschrieben hat und welches Modell ihn gelesen hat, schon.“
Christopher Ort vom Research-Team der KI-Plattform i10x.ai
Die Profile und Stellenausschreibungen sind fiktiv, menschliche Recruiter waren nicht beteiligt. Merkmale wie Herkunft, Alter, Behinderung oder Hochschule wurden nicht variiert. Da die meisten Werte über 90 Punkten lagen, könnten sich kleine Verzerrungen zwischen nahezu gleichwertigen Bewerbern verbergen. Die Ergebnisse gelten nur für die getesteten Modellversionen.
(red/i10x.ai)




