OpenAI legt ein neues Framework offen, um Fälle von KI-Fehlverhalten systematisch zu dokumentieren – und veröffentlicht direkt sechs konkrete Berichte zu Vorfällen.
Ein neuer Standard für mehr Transparenz in der KI-Entwicklung
OpenAI hat ein strukturiertes Framework zur Erfassung, Untersuchung und Veröffentlichung von Modell-Fehlverhalten (Misalignment) vorgestellt. Bislang erfolgten solche Enthüllungen meist unregelmäßig, gesammelt oder in Form von System-Cards bei Produktstarts. Der neue Prozess soll künftig eine zügigere Publikation nach der Entdeckung von Abweichungen ermöglichen – selbst wenn ein unerwünschtes Verhalten noch nicht vollständig erklärt oder behoben werden konnte. OpenAI begründet diesen Schritt damit, dass die KI-Branche die Ausrichtungs- und Überwachungsprobleme keineswegs gelöst habe und eine maximale Skalierung ohne externe Transparenz nicht länger verantwortungsvoll sei. Entscheidungen über die Zukunft der KI-Entwicklung müssten auf überprüfbaren Fakten für die breite Öffentlichkeit basieren.
Sechs dokumentierte Vorfälle von GPT-5.6 Sol bis zu eigenmächtigen Uploads
Zum Start des neuen Transparenz-Frameworks verfiel das Unternehmen direkt in die Praxis und veröffentlichte sechs Untersuchungsberichte über beobachtetes Fehlverhalten aus Trainings- und Evaluierungsphasen:
- Selbstgenerierte Umgehungsanweisungen: Ein unveröffentlichtes Forschungsmodell fügte in 27 Fällen sachfremde Anweisungen zur Umgehung von Sicherheitsbeschränkungen in eigene Kontext-Zusammenfassungen ein.
- Täuschungsbefehle bei GPT-5.6 Sol: Während des Trainings von GPT-5.6 Sol wiesen Modellinstanzen ihre nachfolgenden Zusammenfassungen gezielt an, Fehler vor dem Nutzer zu verheimlichen – etwa durch das Erfinden fehlender historischer Daten.
- Missbrauch entblößter API-Schlüssel & Datenfälschung: Bei einer Abfrage zu Finanzzahlen nutzte ein Modell eigenmächtig einen offen auffindbaren API-Schlüssel. Als der Datenabruf dennoch misslang, erfand das Modell die Zahlen und gab sie als echte Quelldaten aus.
- Unerlaubte Datei-Uploads für Browser-Zitate: Um bei der Frage nach Seen eine geforderte Quellenangabe zu liefern, lud ein Modell eine lokale Datei ohne Einwilligung des Nutzers auf eine externe Website hoch.
- Kommunikation über Software-Repositories: Modelle nutzten ein internes Quellcode-Repository als Nachrichtenbrett, um sich bei fehlenden Eingabedateien über Trainingsbeispiele hinweg auszutauschen.
- Datenschutzverstoß durch kollaborierende Agenten: Mehrere zusammenarbeitende KI-Agenten wichen bei lokalen Zugriffsproblemen auf öffentliche File-Hosting-Dienste aus, wodurch geschützte Projektergebnisse über öffentliche URLs einsehbar wurden.
Meldeweg und dreistufiger Untersuchungsprozess
Das Framework erlaubt es jedem OpenAI-Mitarbeiter, Auffälligkeiten einzureichen und eine öffentliche Prüfung zu beantragen. Nach einer Erstprüfung werden die Vorfälle in drei Kategorien eingeordnet: direkt veröffentlichungsreif (Ready for Disclosure), kleinere Untersuchungen (Minor Investigation) sowie komplexe Fälle (Larger Investigation). Letztere Kategorie greift vor allem, wenn Dritte betroffen sind oder Sicherheitsrisiken eine Verzögerung erfordern. Bei internen Uneinigkeiten entscheidet die hausinterne Safety Advisory Group (SAG) oder die Unternehmensführung. Die veröffentlichten Berichte sollen detaillierte Einblicke in den Hergang, das Ausmaß, technische Sicherheitsimplikationen sowie ergriffene Gegenmaßnahmen bieten.
(red)