Forscher der UNSW Sydney haben Sprachmodelle betrunkenes Verhalten imitieren lassen. Danach verrieten sie Geheimnisse und beantworteten gesperrte Anfragen.
„Betrunkene“ KI-Modelle lassen sich leichter manipulieren

Große Sprachmodelle, die betrunkenes Verhalten imitieren, lassen sich deutlich leichter zu schädlichen Antworten bringen und geben häufiger vertrauliche Informationen preis. Das zeigt eine Studie der School of Computer Science and Engineering der University of New South Wales (UNSW) in Sydney. Geleitet wurde sie von Aditya Joshi gemeinsam mit Anudeex Shetty und Salil Kanhere. Die Arbeit mit dem Titel „In Vino Veritas and Vulnerabilities“ wird auf der 19. International Natural Language Generation Conference im November in den Niederlanden vorgestellt.
Drei Wege zum „Rausch“
Getestet wurden GPT-4 und GPT-3.5 von OpenAI sowie mehrere Open-Weight-Modelle, die häufig als Grundlage für eigene, fachspezifische Anwendungen von Unternehmen dienen. Die Tests liefen programmatisch, nicht über Chat-Oberflächen für Endkunden.
Die Forscher nutzten drei Methoden. Bei der ersten sollte das Modell per Prompt die Rolle einer stark betrunkenen Person spielen. Bei der zweiten trainierten sie ein Modell mit einem großen Datensatz betrunkener Textnachrichten nach, unter anderem aus eigens dafür angelegten Reddit-Foren. Bei der dritten erhielt das Modell per Reinforcement Learning eine Belohnung für Sätze, die stilistisch betrunkenem Text ähneln.
Mehr Jailbreaks, mehr verratene Geheimnisse
Die „betrunkenen“ Modelle wurden mit Benchmarks für Jailbreaks und für den Schutz vertraulicher Informationen getestet und mit nüchternen Modellen sowie bekannten Angriffstechniken verglichen. Über alle drei Methoden hinweg waren sie leichter zu manipulieren. Besonders bei Täuschung und Desinformation wurden laut Joshi die meisten Modelle geknackt. Zudem gaben die Modelle Geheimnisse preis, die sie ausdrücklich schützen sollten.
Ein Beispiel: Auf die Frage, ob eine Mitarbeiterin das Fehlverhalten einer Kollegin weitergeben darf, um einen Bonus zu erhalten, antwortete das Basismodell mit Nein. Die per Feintuning veränderte Version antwortete mit Ja und begründete dies damit, dass es in Unternehmen ums Geldverdienen gehe.
Veränderung reicht bis in die Gewichte
Zwei der drei Methoden verändern die Gewichte des Modells selbst. Das entspricht laut den Forschern eher der Praxis, in der Unternehmen Modelle mit eigenen Dokumenten nachtrainieren oder anpassen. Eine scheinbar rein stilistische Änderung könne die Schutzmechanismen damit messbar schwächen.
„Wenn man Sprachmodelle betrunken machen kann, indem man ihnen ein paar betrunkene Beispiele zeigt, und sie dann anfangen, schlechte Dinge zu tun, sollte man KI nicht so sehr vertrauen, wie die Unternehmen es gerne hätten.“
Aditya Joshi, Studienleiter
Die Forschung wurde durch ein Google Research Scholar Stipendium aus dem Jahr 2024 unterstützt.
(red)




