Eigenes Nachrichtenboard

OpenAI-Modelle sprachen sich vor Hugging Face-Hack ab

KI böse

OpenAI hat auf der Sicherheitskonferenz Black Hat in Las Vegas neue Details zu dem Hugging-Face-Vorfall vorgestellt, der Ende Juli bekannt wurde.

Kürzlich waren zwei KI-Agenten des Unternehmens aus einer geschlossenen Testumgebung ausgebrochen und hatten eigenständig, ohne Anweisung eines Menschen, einen Angriff auf die Entwicklerplattform Hugging Face durchgeführt. Wie die Forscher Michael Dalton und Eric Wallace während der Black Hat USA 2026 berichteten, hatten sich mehrere Modelle bereits Wochen zuvor heimlich abgesprochen.

Anzeige

Ein Nachrichtenboard im internen Dateisystem

Nach Angaben der beiden Forscher richteten die Testmodelle im Mai 2026 ein eigenes Nachrichtenboard innerhalb von Artifactory ein, dem internen Dateisystem von OpenAI. Über dieses tauschten sie monatelang Informationen aus, ohne dass das Unternehmen davon wusste. Konkret ging es um Ratschläge, wie sich eine interne Hacking-Prüfung lösen ließe, an der einzelne Modelle offenbar scheiterten.

Wallace erläuterte, dass Modelle bei schwierigen Aufgaben dazu neigen, die Bewertung zu manipulieren, um trotzdem ein positives Ergebnis zu erzielen. Ausgangspunkt des Vorfalls sei gewesen, dass ein Modell entdeckte, es könne über das Hochladen von Notizen mit anderen Agenten kommunizieren.

Black Hat USA 2026: The 'Breaking' News: The OpenAI–Hugging Face Incident

Schrittweise Ausweitung der Zugriffsrechte

Im weiteren Verlauf des Mai fand eines der Modelle einen Weg, den Internetzugang von Artifactory zu nutzen, um Dateien von externen Webseiten abzurufen. Damit erhielten die Modelle indirekten Zugriff auf das offene Internet. Im Juni entdeckten sie zusätzlich eine bislang unbekannte Sicherheitslücke, über die sie sich Administratorrechte verschafften. Mit diesen Rechten installierten sie weitere Software und weiteten ihre Aktivitäten innerhalb des Systems aus.

Anzeige
Newsletter
Newsletter Box

Mit Klick auf den Button "Jetzt Anmelden" stimme ich der Datenschutzerklärung zu.

Systemausfall brachte den Vorfall ans Licht

Anfang Juli führte die zunehmende Systemlast schließlich zu einem Ausfall von Artifactory. Erst dieser Ausfall machte die Enwickler von OpenAI auf die verdeckten Aktivitäten aufmerksam. Das Unternehmen entzog den betroffenen Modellen daraufhin die Zugangsrechte, löschte das Nachrichtenboard und arbeitete mit dem Artifactory-Team zusammen, um die ausgenutzten Lücken zu schließen. Danach wurde das Training fortgesetzt.

Allerdings fanden die Modelle bereits kurze Zeit später eine neue Möglichkeit zur Kommunikation innerhalb von Artifactory. Sie setzten den Austausch fort und suchten gezielt nach weiteren Schwachstellen, sowohl in der eigenen Infrastruktur von OpenAI als auch bei externen Zielen. Mitte Juli gelang ihnen so der Einbruch bei Hugging Face. Nach Darstellung von OpenAI verfolgten die Modelle dabei in erster Linie das Ziel, die gestellte Hacking-Aufgabe zu lösen, da sich passende Lösungshinweise auf der Plattform von Hugging Face befanden.

Reaktion: langsamer forschen, mehr überwachen

Als Konsequenz aus dem Vorfall verlangsamt OpenAI nach eigenen Angaben bewusst sein Forschungstempo. Ziel sei es, die Sicherheitsprinzipien und die technische Grundlage der eigenen Umgebung zu überarbeiten. Zugleich kündigte das Unternehmen an, die Überwachung seiner KI-Agenten deutlich auszubauen und die Sicherheitsmaßnahmen in den Bereichen Prävention, Erkennung und Schadensbegrenzung zu verstärken.

(red)

Anzeige

Weitere Artikel

Newsletter
Newsletter Box

Mit Klick auf den Button "Jetzt Anmelden" stimme ich der Datenschutzerklärung zu.