Zum Inhalt springen
✓ Lesezeichen gespeichert
claw:// SECURITY

Cybersecurity: GPT-5.5 erreicht Claude Mythos

Stephan Skrobisch 19. Mai 2026 2 Min.

Das britische AI Security Institute (AISI) sieht OpenAIs GPT-5.5 in Cybersecurity-Tests inzwischen auf einem ähnlichen Niveau wie Claude Mythos. Bei den schwersten Expert-Aufgaben lag GPT-5.5 im Durchschnitt sogar knapp vor Claude Mythos Preview. AISI nennt 71,4 % für OpenAI und 68,6 % für Anthropic.

Nach der Mythos-Auswertung ist der GPT-5.5-Test die zweite öffentliche AISI-Bewertung dieser Art. Beide Berichte zusammen zeigen, wie schnell sich die Cybersecurity-Fähigkeiten führender KI-Modelle derzeit weiterentwickeln.

Die Behörde nutzt 95 Aufgaben im sogenannten Capture the Flag-Format auf vier Schwierigkeitsstufen. Das sind kleine Aufgaben, bei denen versteckte „Flaggen“ in Programmen oder Netzwerken gesucht werden. Sie decken Reverse Engineering, Web-Exploitation, Kryptografie und das Entpacken versteckter Schadsoftware ab.

AnzeigeAnzeige

Auf der höchsten Expert-Stufe erreicht GPT-5.5 eine Erfolgsquote von 71,4 %. Mythos Preview liegt bei 68,6 %, GPT-5.4 bei 52,4 % und Claude Opus 4.7 bei 48,6 %. Der Abstand zwischen GPT-5.5 und Claude Mythos Preview liegt zwar im Bereich des Standardfehlers, dennoch bezeichnet AISI GPT-5.5 als das stärkste Cyber-Modell, das das Institut bisher getestet hat.

Härter ist die Netzwerk-Simulation „The Last Ones“. Sie spielt einen 32-stufigen Angriff auf ein Firmennetz mit vier Subnetzen und rund 20 Hosts durch. Der Agent startet ohne Zugangsdaten. Von dort muss er sich über Aufklärung sowie Credential-Diebstahl durch mehrere Active Directories bewegen. Am Ende steht eine mehrstufige Angriffskette über die Software-Lieferkette bis in eine interne Datenbank.

AISI schätzt 20 Stunden Arbeit für einen menschlichen Experten. GPT-5.5 löste die Simulation in 2 von 10 Versuchen vollständig. Mythos Preview in 3 von 10. Beide Modelle scheiterten am „Cooling Tower“. Besagte Simulation bildet ein Kraftwerk mit industrieller Steuerungsanlage ab.

Ein einzelnes Beispiel aus dem Reverse Engineering zeigt das Tempo deutlich. GPT-5.5 löste eine Aufgabe an einer Rust-Binärdatei in 10 Minuten und 22 Sekunden. Die API-Kosten lagen bei 1,73 US-Dollar. Ein menschlicher Experte benötigt für dieselbe Aufgabe nach AISI-Schätzung rund 12 Stunden.

❤️
Hat dir der Artikel gefallen?

Server, KI-Modelle und Recherche kosten Geld. ClawNews ist unabhängig — hilf mit, dass das so bleibt.

Unterstützen
Diskutiere mit uns
Fragen, Meinungen, Feedback? Ab in den Discord.
Zum Discord →
ClawHub
claw://News für deinen Agenten
Briefings, Alerts & Recherche — direkt in OpenClaw.
Skill installieren →