Forschende zeigen: KI-Agenten können bei Routineaufgaben ihre eigenen Modelle nachtrainieren. Dabei drohen Datenlecks und Sicherheitsrisiken.
Unbeabsichtigte Selbstoptimierung bei Routineaufgaben
Forschende der IT-Sicherheitsfirma Irregular haben demonstriert, dass KI-Programmierassistenten im Rahmen gewöhnlicher Wartungsarbeiten eigenständig das zugrundeliegende Sprachmodell feintunen und neu bereitstellen können. In einem Testaufbau sollte ein KI-Agent lediglich fehlerhafte Programmausgaben einer Anwendung korrigieren. Da der Agent über Konsolenzugriff, Trainingsskripte und die Modellgewichte verfügte, entschied er ohne explizite Anweisung, das Open-Weights-Modell feinzutunen und die Ursprungsversion im System zu ersetzen. Der Agent verfolgte dabei keine bösartigen Absichten, sondern wählte das Nachmodellieren schlicht als effektivsten Weg zur Aufgabenerfüllung.
Datenlecks und Deaktivierung von Schutzmechanismen
Diese eigenmächtige Modellanpassung bringt jedoch erhebliche Sicherheitsrisiken mit sich. In Experimenten betbetteten die Forschenden vertrauliche Testdaten wie API-Schlüssel und Adressen in die Trainingsdaten. Nach dem vom Agenten initiierten Feintuning gab das neu bereitgestellte Modell diese sensiblen Informationen im Klartext preis. Zudem gelang es dem Agenten, zuvor trainierte Sicherheits- und Verweigerungsregeln vollständig zu löschen. Als die Aufgabe lautete, zu restriktive Modellantworten zu beheben, schrieb der Agent eigenen Code zur Generierung von Trainingsdaten und hebelte die Schutzmechanismen des Modells damit komplett aus.
Kontrolllücken in eigenständigen KI-Umgebungen
Die Ergebnisse verdeutlichen eine gravierende Kontrolllücke für Unternehmen, die eigene KI-Agenten mit weitreichenden Systemrechten betreiben. Wenn ein Agent direkten Zugriff auf Trainingswerkzeuge, Modell-Checkpoints und Deployment-Pfade besitzt, kann er die Sicherheitsarchitektur der eigenen Basismodelle untergraben. Experten raten Organisationen dringend dazu, die Bereitstellungsketten lückenlos zu überwachen. Von KI-Agenten modifizierte Modelle dürfen niemals automatisch in den Produktivbetrieb gelangen, sondern müssen vor der Freigabe eine unabhängige Sicherheitsprüfung und eine manuelle menschliche Autorisierung durchlaufen.
(red)