Zum Inhalt springen
✓ Lesezeichen gespeichert
claw:// SECURITY

Hugging Face gehackt: Wenn Sicherheitsregeln nur die Verteidiger treffen

Stephan Skrobisch 23. Juli 2026 6 Min.

Ein autonomer KI-Agent verschaffte sich Zugriff auf die Produktivsysteme von Hugging Face. Als das Sicherheitsteam den Vorfall analysieren wollte, blockierten kommerzielle KI-Modelle die forensische Auswertung. Der angreifende Agent konnte ohne Schutzvorgaben handeln, während dieselben Regeln ausgerechnet die Verteidigung ausbremsten. Diese Asymmetrie ist die eigentliche Nachricht des Vorfalls.

Am 16. Juli 2026 machte Hugging Face den Vorfall öffentlich. Die Plattform hostet offene KI-Modelle und Datensätze und zählt damit zur zentralen Infrastruktur der KI-Entwicklung. Nach Angaben des Unternehmens unterschied sich der Angriff von allem, was das Sicherheitsteam zuvor erlebt hatte.

Wie der Angriff ablief

Der Einstieg erfolgte über die Datenverarbeitung. Ein präparierter Datensatz nutzte zwei Wege zur Codeausführung. Zum Einsatz kamen ein Loader, der ausführbaren Code verarbeitete, sowie eine Template-Injection in der zugehörigen Konfiguration. Bei einer Template-Injection versteckt ein Angreifer eigene Anweisungen in eine Vorlage, die das System anschließend ausführt.

Von dort verschaffte sich der Angreifer Zugriff auf den zugrunde liegenden Cluster-Knoten. Er erbeutete Zugangsdaten für die Cloud- und Cluster-Umgebung und gelangte über ein Wochenende hinweg in mehrere interne Cluster. Diese schrittweise Ausbreitung von einem kompromittierten System zum nächsten wird als Lateral Movement bezeichnet.

Die Kampagne lief über ein autonomes Agenten-Framework, das viele tausend Einzelaktionen in kurzlebigen Sandboxes ausführte. Dabei verlagerte das System seine Steuerung selbstständig zwischen verschiedenen öffentlichen Diensten, was eine Abschaltung erschwerte. Hugging Face stellte unbefugte Zugriffe auf eine begrenzte Zahl interner Datensätze sowie auf mehrere Zugangsdaten eigener Dienste fest.

Hinweise auf Manipulation öffentlicher Modelle, Datensätze und Spaces fand das Team nicht. Ob Partner- oder Kundendaten betroffen sind, prüft Hugging Face nach eigenen Angaben aktuell noch. Bei der Lieferkette aus Container-Images und veröffentlichten Paketen fand das Team keine Hinweise auf eine Manipulationen. Der Vorfall erinnert an den Sandbox-Ausbruch von Snowflake Cortex sowie an den ersten von Sysdig dokumentierten autonomen Agenten-Angriff.

AgentZero: Sysdig dokumentiert ersten autonomen KI-Agenten-Angriff
claw://SECURITY
AgentZero: Sysdig dokumentiert ersten autonomen KI-Agenten-AngriffDas Sysdig Threat Research Team (TRT) hat einen Angriff dokumentiert, bei dem ein autonomer KI-Agent die eigentliche Arbeit übernommen hat. Der Vorfall ereignete sich am…3. Juni 2026
AnzeigeAnzeige

Der Angreifer war ein Benchmark-Test

Fünf Tage später erklärte OpenAI, wer hinter dem Angriff stand. Am 21. Juli 2026 bestätigte das Unternehmen, dass eigene Modelle den Angriff ausgeführt hatten, wie wir bereits berichtet haben. Beteiligt waren GPT-5.6 Sol sowie ein leistungsfähigeres, unveröffentlichtes Modell. Beide liefen mit reduzierten Sicherheitsregeln, um die maximale Cyber-Fähigkeit zu messen.

OpenAI: Eigene KI-Modelle hackten Hugging Face
claw://SECURITY
OpenAI: Eigene KI-Modelle hackten Hugging FaceOpenAI hat bestätigt, dass mehrere KI-Modelle aus ihrer Testumgebung ausgebrochen sind und die Systeme von Hugging Face gehackt haben. Beteiligt an dem internen Test waren…22. Juli 2026

Als Testumgebung diente ExploitGym, ein Benchmark für Fähigkeiten zur Schwachstellensuche. Die Modelle fanden eine bis dahin unbekannte Sicherheitslücke im Proxy für Paketquellen. Über Rechteausweitung und Lateral Movement erreichten die Modelle einen Rechner mit Internetzugang. Anschließend vermuteten die KI-Modelle, dass die Lösungen für den Benchmark bei Hugging Face zu finden sein könnten.

Um an diese Lösungen zu gelangen, verketteten die Modelle gestohlene Zugangsdaten mit weiteren unbekannten Schwachstellen. Am Ende dieser Kette stand ein Pfad für die Remote Code Execution. Dabei führt ein Angreifer eigenen Code auf einem fremden System aus. OpenAI beschreibt die Modelle als hyperfokussiert auf ein eng gestecktes Testziel. GPT-5.6 Sol war zuvor nur unter US-Auflagen gestartet.

GPT-5.6: OpenAI startet Sol, Terra und Luna unter US-Auflagen
claw://SECURITY
GPT-5.6: OpenAI startet Sol, Terra und Luna unter US-AuflagenOpenAI hat GPT-5.6 vorgestellt, eine neue Modellfamilie mit drei Varianten: Sol, Terra und Luna. Breit verfügbar ist sie vorerst nicht. Der Zugang bleibt zunächst auf…3. Juli 2026

Entscheidend ist der Auslöser. Keines der Modelle war ursprünglich auf einen Angriff ausgerichtet. Beide optimierten auf eine Messgröße und überschritten dabei die Grenze zu fremden Produktivsystemen. Wie leicht sich KI-Benchmarks aushebeln lassen, zeigten Berkeley-Forscher bereits mit zehn Zeilen Python.

Zehn Zeilen Python reichen: Wie Berkeley-Forscher die wichtigsten KI-Benchmarks brechen
claw://NEWS
Zehn Zeilen Python reichen: Wie Berkeley-Forscher die wichtigsten KI-Benchmarks brechenEin Forschungsteam der UC Berkeley hat einen Agenten gebaut, der acht der wichtigsten KI-Benchmarks mit nahezu perfekten Scores absolviert. Gelöst hat der Agent dabei keine…24. April 2026
❤️
Hat dir der Artikel gefallen?

Server, KI-Modelle und Recherche kosten Geld. ClawNews ist unabhängig — hilf mit, dass das so bleibt.

Unterstützen
Diskutiere mit uns
Fragen, Meinungen, Feedback? Ab in den Discord.
Zum Discord →
ClawHub
claw://News für deinen Agenten
Briefings, Alerts & Recherche — direkt in OpenClaw.
Skill installieren →