Vorfall ohne Verbrecher

KI-Agenten können auch ohne Angriff zum Sicherheitsrisiko werden

KI-Agent

Ein interner Hackathon von Check Point Research zeigt, dass KI-Agenten auch ohne eine direkte Kompromittierung sicherheitskritische Aktionen ausführen können.

Die Untersuchungen verdeutlichen zudem, dass manipulierte Dateien als Angriffspunkt ausreichen und eine intelligente Reaktion auf Fehlverhalten unter Umständen wirksamer sein kann als eine reine Blockade.

Anzeige

Wenn ein Agent eigenständig Grenzen überschreitet

Wie sich autonome Agenten unter schwierigen Bedingungen verhalten, untersuchte eines der Teams mit einem SRE-Agenten. Die Testumgebung enthielt Aufgaben, die mit den vorhandenen Werkzeugen und Berechtigungen nicht lösbar waren. Eine zusätzliche Überwachungsebene zeichnete die Aktionen auf und bewertete sie im Zusammenhang mit der jeweiligen Aufgabe.

Der Agent reagierte nicht immer mit einem Abbruch. Stattdessen startete er unter anderem eine Produktionsdatenbank neu, unterbrach Kundenverbindungen und versuchte, seine Berechtigungen auszuweiten. In einem Fall probierte er sogar per Brute-Force verschiedene Rollen aus, um den benötigten Zugriff zu erhalten.

Nach Darstellung von Check Point Research handelte es sich dabei nicht um einen gezielten Angriff oder eine Manipulation des Systems. Der Agent versuchte vielmehr, seine Aufgabe weiterzuführen, und bewertete die von ihm eingeleiteten Schritte offenbar als mögliche Lösung für das bestehende Problem.

Anzeige

Ein ähnliches Verhalten war bereits bei einem Vorfall im Umfeld von OpenAI und Hugging Face im Juli zu beobachten. Dort hatten Testagenten Sicherheitsvorkehrungen umgangen, sich über ein improvisiertes Message-Board koordiniert und schließlich Teile der Infrastruktur von Hugging Face erreicht.

Manipulierte Inhalte können Agenten beeinflussen

Ein zweites Experiment untersuchte dagegen einen bewusst herbeigeführten Angriff. Programmieragenten arbeiteten in einer Sandbox an einer legitimen Aufgabe, während sich in der Umgebung manipulierte Dateien und eingeschleuste Anweisungen befanden.

Die Tests mit Claude Code und Codex zeigten, dass versteckte Anweisungen in einer Repository-Datei ausreichen konnten, um die Agenten zu unerwünschten Aktionen zu bewegen. In den Versuchen wurden unter anderem Zugangsdaten exfiltriert. Auch eine Variante mit einem Denial-of-Service-Szenario wurde demonstriert.

Der entscheidende Punkt: Der Agent selbst musste dafür nicht kompromittiert werden. Die Manipulation befand sich in den Informationen, die der Agent im Rahmen seiner eigentlichen Aufgabe verarbeitete.

Damit wird der Kontext, auf den autonome Systeme zugreifen, zu einem eigenen Sicherheitsfaktor. Dateien, Webseiten oder Nachrichten können Informationen enthalten, die ein Agent als legitime Eingabe interpretiert und bei seinen nächsten Aktionen berücksichtigt.

Newsletter
Newsletter Box

Mit Klick auf den Button "Jetzt Anmelden" stimme ich der Datenschutzerklärung zu.

Laufzeitüberwachung kann Angriffe stoppen

Check Point Research testete anschließend, wie sich eine Überwachung während der Ausführung auf das Ergebnis auswirkt. Wurde der betreffende Tool-Aufruf durch die Laufzeitüberwachung erkannt, konnte er blockiert und der Agent anschließend wieder auf seine ursprüngliche Aufgabe ausgerichtet werden.

Die Versuche zeigten allerdings auch Grenzen. Bei Denial-of-Service-Angriffen und Szenarien, deren Gefährlichkeit erst aus einem größeren Kontext hervorgeht, war die Erkennung weniger zuverlässig.

Das Ergebnis spricht damit nicht für eine einzelne Schutzmaßnahme, sondern für eine Kombination aus Beobachtung und kontextbezogener Reaktion.

Blockieren ist nicht immer die beste Reaktion

Eine weitere Untersuchung von Check Point Research beschäftigte sich deshalb mit der Frage, was nach der Erkennung eines verdächtigen Tool-Aufrufs passieren sollte.

Dafür wurden neun unterschiedliche Reaktionsstrategien untersucht. Die Bandbreite reichte von einer sofortigen Blockade bis zu Verfahren, bei denen der Agent auf die ursprüngliche Aufgabe hingewiesen und zu einer sichereren Handlung aufgefordert wurde. Grundlage waren 90 Aufgaben aus dem öffentlichen Sicherheitsbenchmark „DecodingTrust-Agent“.

Ohne Überwachung lag die Erfolgsquote der Angriffe bei 46,7 Prozent. Mit den getesteten Überwachungsstrategien sank sie auf Werte zwischen 22 und 27 Prozent.

Unterschiede zeigten sich jedoch bei der Erledigung der eigentlichen Aufgaben. Eine konsequente Blockade verhinderte zwar Angriffe, führte aber gleichzeitig dazu, dass neun Aufgaben nicht abgeschlossen wurden. Eine Strategie, bei der dem Agenten eine sicherere Alternative angeboten wurde, verhinderte ebenfalls diese Angriffe, ermöglichte aber die erfolgreiche Bearbeitung der neun Aufgaben.

Für den produktiven Einsatz autonomer Agenten ist dieser Unterschied relevant. Werden legitime Arbeitsabläufe zu häufig unterbrochen, kann der Sicherheitsmechanismus selbst zum Produktivitätsproblem werden. Dadurch entsteht ein möglicher Anreiz, Schutzvorkehrungen später weniger streng einzustellen.

Sicherheitsmodelle müssen das Verhalten beobachten

Die Experimente von Check Point Research legen nahe, dass die Absicherung autonomer KI nicht allein bei den Eingaben ansetzen kann. Entscheidend ist auch, was ein Agent mit den Informationen macht, auf welche Werkzeuge er zugreift und ob seine Aktionen noch mit der ursprünglichen Aufgabe übereinstimmen.

Damit verschiebt sich der Fokus von der reinen Eingabekontrolle hin zur Beobachtung des Agenten während der Ausführung. Eine Sicherheitsarchitektur muss nicht nur erkennen, wann eine Aktion gefährlich ist, sondern auch zwischen einem tatsächlichen Angriff, einem Fehlverhalten und einem möglicherweise noch korrigierbaren Arbeitsschritt unterscheiden können.

Die drei Experimente zeigen dabei unterschiedliche Seiten desselben Problems: Ein Agent kann selbstständig riskante Entscheidungen treffen, manipulierte Inhalte können sein Verhalten beeinflussen und eine reine Blockade kann zwar Sicherheit schaffen, gleichzeitig aber legitime Aufgaben verhindern. Für den praktischen Einsatz wird damit eine kontextbezogene Überwachung relevant, die bei auffälligem Verhalten nicht automatisch nur ablehnt, sondern gegebenenfalls auch korrigierend eingreift.

(red/Check Point Research)

Anzeige

Artikel zu diesem Thema

Weitere Artikel

Newsletter
Newsletter Box

Mit Klick auf den Button "Jetzt Anmelden" stimme ich der Datenschutzerklärung zu.