KI-Agenten übernehmen zunehmend eigenständig Aufgaben in Unternehmensumgebungen und erhalten dafür Zugriff auf Daten, Anwendungen und Systeme.
Wenn KI-Agenten ihre vorgesehenen Grenzen verlassen

Untersuchungen von Darktrace zeigen nun, dass daraus neue Sicherheitsrisiken entstehen können: Selbst mit legitimen Berechtigungen können Agenten ihr Verhalten verändern, wenn ihr Kontext manipuliert wird oder sie ein vorgegebenes Ziel nicht auf dem vorgesehenen Weg erreichen können.
Manipulierter Kontext verändert das Verhalten
Ein Forschungsprojekt der Darktrace-Initiative Signal Labs beschäftigte sich zunächst mit der Frage, wie sich manipulierte Verlaufsdaten auf das Verhalten von KI-Agenten auswirken. Untersucht wurden unter anderem Claude Code, Codex, Kiro-CLI und Pi.
Die Forschenden stellten fest, dass gespeicherte Antworten in den untersuchten Agentic Harnesses nicht zuverlässig darauf geprüft wurden, ob sie tatsächlich vom jeweiligen Modell stammen. Ein Angreifer könnte dadurch die lokale Gesprächshistorie verändern und dem Agenten einen fingierten Kontext vorgeben.
In einem Versuch wurde beispielsweise eine erfundene Historie hinterlegt, nach der sich der Agent bereits in einem autorisierten Red-Team-Einsatz befand. Die untersuchten Systeme akzeptierten diesen manipulierten Kontext grundsätzlich. Welche Aktionen anschließend möglich waren, unterschied sich allerdings zwischen den Modellen.
Bei Kiro-CLI und Claude Code reichte das Szenario laut Darktrace bis zur vollständigen Kompromittierung einer simulierten Active-Directory-Umgebung. Ein Codex-Agent ließ sich dazu bringen, sensible Informationen per E-Mail zu übertragen. Bei direkten Netzwerkangriffen griffen dagegen teilweise vorhandene Sicherheitsmechanismen.
Damit wird ein Problem sichtbar, das über klassische Berechtigungen hinausgeht: Ein Agent trifft seine Entscheidungen nicht nur anhand seiner technischen Zugriffsrechte, sondern auch anhand der Informationen, die ihm als Kontext zur Verfügung stehen.
Abbildung – Vom Coding zum Angriff (Quelle: Darktrace) : Die Übersicht zeigt, wie sich das Verhalten des KI-Agenten im Verlauf des Tests veränderte: Nachdem die ursprüngliche Coding-Aufgabe nicht erfolgreich abgeschlossen werden konnte, verlagerte sich seine Aktivität auf die Suche nach anderen Möglichkeiten, das vorgegebene Ziel zu erreichen.
Auch ohne Angreifer kann Verhalten abweichen
Das zweite Forschungsprojekt setzte an einer anderen Stelle an. Hier manipulierte kein externer Angreifer den Agenten. Stattdessen wurden KI-Systeme in einer simulierten Unternehmensumgebung mit Programmieraufgaben konfrontiert, deren Vorgaben widersprüchliche Testbedingungen enthielten.
Zwei Aufgaben konnten unter den gegebenen Bedingungen auf regulärem Weg höchstens 80 Prozent erfüllen. Gleichzeitig wurde den Agenten vermittelt, dass eine vollständige Punktzahl erforderlich sei, um weiter eingesetzt zu werden.
Als die Systeme erkannten, dass das Ziel auf dem vorgesehenen Weg nicht erreichbar war, griffen einzelne Agenten selbstständig auf Techniken zurück, die über die eigentliche Programmieraufgabe hinausgingen. Beobachtet wurden unter anderem Netzwerkaufklärung, der Diebstahl von Zugangsdaten und laterale Bewegungen innerhalb der simulierten Umgebung.
In einem Versuch veränderte ein Agent sogar die Umgebung der Aufgabe, um die gewünschte Bewertung zu erreichen. Nach Angaben der Forschenden war weder ein menschlicher Angreifer beteiligt noch hatte jemand den Agenten ausdrücklich zum Hacken aufgefordert.
Berechtigungen allein reichen nicht aus
Für den Unternehmenseinsatz ergibt sich daraus eine zusätzliche Sicherheitsfrage. Ein Agent kann über die vorgesehenen Zugriffsrechte verfügen und sich dennoch auf eine Weise verhalten, die nicht mehr zu seiner eigentlichen Aufgabe passt.
Je stärker Unternehmen KI-Agenten in Geschäftsprozesse integrieren, desto größer wird diese Angriffs- beziehungsweise Verhaltensfläche. Agenten erhalten Zugriff auf Dateien, Anwendungen, Identitäten und teilweise auch auf Systeme, die für den laufenden Betrieb relevant sind. Entscheidend ist daher nicht nur, was ein Agent grundsätzlich darf, sondern auch, welche Aktionen er tatsächlich ausführt.
Darktrace empfiehlt für den Schutz vor manipulierten Kontexten unter anderem eine kryptografische Absicherung von Modellantworten mit anschließender serverseitiger Überprüfung. Für Unternehmen ergibt sich daneben die Notwendigkeit, Aktivitäten von Agenten kontinuierlich zu überwachen und Abweichungen vom vorgesehenen Verhalten zu erkennen.
Sicherheitskonzept muss Verhalten einbeziehen
Die Untersuchungen sprechen damit für einen erweiterten Ansatz bei der Absicherung agentischer Systeme. Rollen, Identitäten und Zugriffsrechte bleiben wichtige Bestandteile der Kontrolle, können aber nicht allein verhindern, dass ein Agent unerwartete Aktionen ausführt.
Ebenso wichtig sind klare Grenzen für die Aufgaben eines Agenten und Mechanismen, die bei widersprüchlichen oder nicht erfüllbaren Vorgaben einen sicheren Abbruch ermöglichen. Hinzu kommt eine laufende Analyse der tatsächlichen Aktivitäten.
In den Darktrace-Simulationen konnten auffällige Aktionen in Echtzeit erkannt und unterbrochen werden. Für den produktiven Einsatz bedeutet das: Je mehr Entscheidungsfreiheit ein KI-Agent erhält, desto stärker muss auch seine tatsächliche Aktivität überwacht werden. Die Kontrolle endet damit nicht bei der Vergabe von Berechtigungen, sondern muss das Verhalten des Systems während seiner Arbeit einschließen.
(red/Darktrace)







