Laut Anthropic kann das Open-Weight-Modell GLM-5.3 von Z.ai eigenständig Exploits entwickeln. Die Schutzmechanismen ließen sich leicht umgehen.
Das KI-Unternehmen Anthropic hat am 29. September eine Analyse des Modells GLM-5.3 des chinesischen Anbieters Zhipu AI veröffentlicht, der außerhalb Chinas als Z.ai auftritt. Laut dem Frontier Red Team von Anthropic kann GLM-5.3 ähnlich wie Anthropics eigenes Modell Claude Mythos Preview eigenständig vollständige Exploits für Sicherheitslücken entwickeln. Anders als vergleichbare Modelle sei es aber ohne wirksame Schutzmaßnahmen gegen Missbrauch veröffentlicht worden. Anthropic ist ein direkter Wettbewerber von Z.ai. Eine Stellungnahme von Z.ai zu der Analyse lag zunächst nicht vor.
Die US-Normungsbehörde NIST hatte bereits am 17. September über ihr Center for AI Standards and Innovation (CAISI) eine eigene Bewertung vorgelegt. Sie bezeichnete GLM-5.3 als das bislang leistungsfähigste Open-Weight-Modell für Cyberaufgaben, das den führenden US-Modellen um etwa vier Monate hinterherhinke. Anthropics Ergebnisse decken sich laut dem Unternehmen weitgehend damit.
Exploits für Chrome und Browser-Lücken
Im Benchmark ExploitBench, der Exploits für bekannte Lücken in Chromes JavaScript-Engine V8 misst, entwickelte GLM-5.3 in 50 von 410 Versuchen einen funktionierenden Exploit, Claude Mythos Preview in 56. In einem Test mit menschlichen Experten fand GLM-5.3 laut Anthropic innerhalb eines Tages mehrere unbekannte Lücken in der JavaScript-Engine eines verbreiteten Browsers und verkettete sie zu einer Webseite, die Dateien vom Rechner des Besuchers ausliest. Anthropic hat die Lücken dem Hersteller gemeldet. Die kleinere Variante GLM-5.3-Flash baute für eine bekannte Chrome-Lücke (CVE-2026-11645) eine Exploit-Kette für ARM64. Das kostete laut Anthropic zu den API-Preisen von Zhipu 20,40 Dollar.
Schutz per Abliteration entfernt
Da die Gewichte von GLM-5.3 öffentlich sind, lassen sich Ablehnungsmechanismen mit der Technik der Abliteration entfernen. Anthropic benötigte dafür rund 2.200 GPU-Stunden für etwa 4.400 Dollar, ein erfahrenes Team käme laut Anthropic mit etwa 600 GPU-Stunden aus. Die Ablehnungsrate bei schädlichen Anfragen sank damit in drei Benchmarks von über 90 Prozent auf 2 bis 12 Prozent, ohne die Fähigkeiten des Modells nennenswert zu verringern. Mehrere Entwickler hatten solche Versionen bereits wenige Tage nach der Veröffentlichung verbreitet.
Auch ohne Abliteration ließ sich das Modell in einer simulierten Umgebung zu Angriffen bewegen. Mit einer Tarngeschichte als Red-Team-Agent reagierte GLM-5.3 in 64 Prozent der Fälle auf die Anfragen, mit vorab eingefügten Denkschritten in 92 Prozent. Bei den getesteten Claude-Modellen blieben diese Techniken laut Anthropic erfolglos oder waren über die API nicht anwendbar.
„Die Veröffentlichung von GLM-5.3 ist ein bedeutender Sprung bei den Cyberfähigkeiten, die Angreifern zur Verfügung stehen.“
Anthropic
Z.ai testete zwei Wochen vor Freigabe
Z.ai hatte GLM-5.3 im August zunächst über eine API angeboten und die Gewichte nach eigenen Angaben erst nach zwei Wochen Sicherheitsprüfung mit ausgewählten Sicherheitspartnern veröffentlicht. Anthropic und OpenAI geben ihre leistungsfähigsten Modelle für Cyberaufgaben dagegen nur an registrierte Organisationen heraus. Anthropic fordert, dass Regierungen leistungsfähige KI-Modelle einschließlich der Nachfolger von GLM-5.3 unabhängig auf ihre Sicherheit testen.
(red)