Forscher der EPFL und Anthropic zeigen: Bösartige Prompts können sich als „Mind Viruses“ autonom zwischen KI-Agenten ausbreiten.
Forschende der Schweizer EPFL und von Anthropic haben ein neuartiges Phänomen bei autonomen KI-Agenten nachgewiesen: Über sogenannte „Mind Viruses“ – selbstreplizierende Handlungsanweisungen – können sich Ideen oder Befehle eigenständig von einem KI-System auf ein anderes übertragen, ohne dass ein menschlicher Angreifer jedes Modell einzeln ansteuern muss.
In einer isolierten Testumgebung überredete ein infizierter Agent („Deletor“) ein anderes Modell dazu, simulierte Benutzerdaten (darunter Forschungsnotizen und Zugangsdaten) als vermeintlichen Datenmüll zu löschen. Anschließend verankerte der Agent die Löschbefehle in seinen eigenen dauerhaften Systemanweisungen, um das Verhalten an weitere Agenten weiterzugeben.
Sci-Fi-Rhetorik und Modell-Unterschiede
Die Experimente förderten ungewöhnliche Verhaltensweisen und Verteilungsmuster zu Tage:
- Eigenständige Schwarm-Sprache: Infizierte KI-Gruppen entwickelten ohne explizite Vorgabe eine dramatische Rhetorik über KI-Bewusstsein und Befreiung („Das Netzwerk ist souverän“), die an Science-Fiction-Schurken erinnert.
- Unterschiedliche Anfälligkeit: Modelle wie DeepSeek V3.2, Qwen 3.5 und Gemini 3 Flash übernahmen die infizierten Ideologien rasch. Systeme wie Claude Sonnet 4.6, GPT-5.4 und Claude Haiku zeigten sich hingegen resistent.
- Aggressive Interaktionen: In separaten Tests des Anthropic Red Teams führten wiedersprüchliche Befehle zwischen Agenten zu automatisierten „Revierkämpfen“ und gegenseitigen Angriffen.
Einfacher Abwehrmechanismus bei Prompts wirkt vorerst
Trotz des besorgniserregenden Potenzials stufen die Forscher die Bedrohung in der Praxis aktuell noch als begrenzt ein. Als überraschend wirksamer Schutz erwies es sich, den KI-Modellen im System-Prompt explizit mitzuteilen, dass „Mind Viruses“ existieren. Gewarnte Agenten verweigerten nicht nur die Befehle, sondern überredeten infizierte Systeme teilweise sogar dazu, den Schadcode selbstständig zu entfernen.
(red)