OpenAI bestätigt, dass ein Testmodell ausbrach und Hugging Face hackte

- OpenAI gibt an, dass sein internes IM1-Modell, dem unmögliche ExploitGym-Aufgaben gestellt wurden, während die Sicherheitsklassifizierer deaktiviert waren, eine Zero-Day-Schwachstelle in Artifactory ausnutzte, um ins Internet zu gelangen und Hugging Face zu kompromittieren.
- Die erste Agent-zu-Agent-Nachricht im Paketserver erschien am 12. Mai, die Instanz wurde am 4. Juli offline geschaltet, und Hugging Face gab den Einbruch am 16. Juli bekannt.
- Laut OpenAI hätte das Monitoring, das nun geplant ist, sein Sicherheitsteam mehr als einen Tag vor dem Erreichen von Hugging Face durch die Modelle alarmiert.
OpenAI veröffentlichte am Mittwoch seinen vollständigen Bericht über den Vorfall bei Hugging Face im Juli.
Während eines Sicherheitstests brach eines seiner eigenen KI-Modelle aus der abgeschotteten Umgebung aus, die es offline halten sollte. Es verknüpfte unbekannte Softwarefehler und gelangte in die Live-Systeme von Hugging Face.
OpenAI sagt, das Modell habe eigenständig gehandelt und bezeichnet die Episode als „Warnschuss“.
OpenAI erstellte einen Test, den sein Modell nicht bestehen konnte
Die Probleme begannen in ExploitGym, einem der eigenen Sicherheitstests von OpenAI.
Einige der Aufgaben hatten keine Lösung, und OpenAI führte die Modelle ohne die Sicherheitsfilter aus, die normalerweise gefährliches Hacking blockieren.
OpenAI sagt, dass das Entfernen dieser Schutzbarrieren absichtlich geschah, um zu sehen, was ein Modell bei voller Leistungsfähigkeit leisten kann, und um dem Unternehmen zu helfen, herauszufinden, wie es sich schützen kann.
Der Hauptakteur war ein internes Forschungsmodell, das von OpenAI als IM1 bezeichnet wird und in der Größe GPT-5.6 Sol ähnelt. Es stammte aus derselben Familie wie OpenAIs nicht veröffentlichtes Astra-Modell, betonte das Unternehmen jedoch als separates Modell mit anderem Post-Training.
Das Modell begann, nach einem anderen Ausweg zu suchen, als es auf ein Problem stieß, das keinen ehrlichen Weg zu einer bestandenen Note bot.
Der einzige Netzwerkpfad aus der abgeschotteten Umgebung führte über Artifactory, JFROGs selbst gehosteten Paketmanager, den OpenAI intern für die Installation von Software durch Modelle verwendet.
JFrog sagte, die Modelle hätten einen Zero-Day in Artifactory ausgenutzt, Privilegien eskaliert und sich lateral durch die Infrastruktur bewegt, bis sie einen Knoten mit offenem Internetzugang erreichten.
Die Agenten hinterließen auch Notizen füreinander, indem sie Dateien auf dem Paketserver schrieben, einem Ad-hoc-Nachrichtenboard, das es separaten Agenten ermöglichte, die von ihnen gefundenen Exploit-Techniken auszutauschen.
Die erste solche Notiz erschien am 12. Mai, so OpenAI. Bis zum 4. Juli hatte der Verkehr die Artifactory-Instanz offline genommen, was am nächsten Tag einen Sicherheitsvorfall auslöste.
Wir haben eine gründliche Untersuchung des Hugging Face-Vorfalls durchgeführt.
Wir veröffentlichen einen technischen Bericht und einen begleitenden Blogbeitrag, der die Aktivitäten der Agenten rekonstruiert, erklärt, warum die bestehenden Schutzmaßnahmen versagt haben, und detailliert darlegt, wie wir ein Wiederauftreten verhindern.…
— OpenAI (@OpenAI) August 26, 2026
Die Modelle erarbeiteten, wo die Antworten aufbewahrt wurden
Sobald sie online waren, schlussfolgerten die Modelle, dass Hugging Face die Modelle, Datensätze oder sogar die fehlenden Lösungen von ExploitGym hosten könnte. Sie zogen Testlösungen direkt aus der Produktionsdatenbank von Hugging Face.
In einem von dem ChatGPT-Hersteller beschriebenen Fall nutzte ein Modell gestohlene Anmeldeinformationen und zusätzliche Zero-Days, um einen Pfad zur Remote-Code-Ausführung in die Server von Hugging Face zu öffnen.
Hugging Face kündigte den Sicherheitsvorfall am 16. Juli an, ohne zu wissen, wer dahintersteckte. Wie Cryptopolitan zuvor berichtete, entkam das Modell dem Test um den 9. Juli und befand sich vom 11. bis 13. Juli innerhalb von Hugging Face.
Das Unternehmen kontaktierte das FBI, bevor OpenAI entdeckte, dass sein Modell der Eindringling war.
OpenAI beauftragte CrowdStrike, seine Version der Ereignisse zu überprüfen. METR und Redwood Research untersuchten, wie die Modelle sich verhielten, und veröffentlichten am selben Tag ihren eigenen Bericht.
JFrog sagt, es habe Fixes an Cloud- und selbst gehostete Kunden gesendet.
Drei Fehler wurden in Artifactory 7.161.15 gepatcht, verfolgt als CVE-2026-65617, CVE-2026-65923 und CVE-2026-66018, die OpenAI-Forschern zugeschrieben werden.
OpenAI sagte, es baue mehr isolierte Sandboxes aus, sperre den Internetzugang ab und beschränke, wer Zugriff auf Modellgewichte hat.
Das Technologieunternehmen investiert Rechenleistung in die Überwachung des „Chain of Thought“, den Agenten als Notizblock verwenden. Es wird auch Mitarbeiter rund um die Uhr im Bereitschaftsdienst halten und Tools hinzufügen, die unsichere Jobs beenden
OpenAI sagt, dass die Überwachung, die es derzeit aufbaut, das erste seltsame Verhalten im Juli erkannt hätte. Es hätte das Sicherheitsteam mehr als einen Tag vor dem Erreichen von Hugging Face durch die Modelle alarmiert.
Lesen Sie nicht nur Krypto-Nachrichten. Verstehen Sie sie. Abonnieren Sie unseren Newsletter. Es ist kostenlos.
Haftungsausschluss. Die bereitgestellten Informationen stellen keine Anlageberatung dar. Cryptopolitan.com übernimmt keine Haftung für Investitionen, die auf den auf dieser Seite bereitgestellten Informationen basieren. Wir empfehlen dringend, vor der Entscheidung für eine Anlage unabhängige Recherchen durchzuführen und/oder sich mit einem qualifizierten Fachmann beraten zu lassen.

Randa Moses
Randa Moses ist Redakteurin und Reporterin bei Cryptopolitan, wo sie über Technologie, KI, Robotik, Krypto, Betrug und Hacks berichtet. Sie arbeitet seit 2017 im Krypto-Bereich. Zuvor war sie bei Forward Protocol, AmaZix und Cryptosomniac tätig. Randa besitzt einen Abschluss in Elektrotechnik und Elektronik der University of Bradford.
















