Moonshot AIs Kimi K3 bricht aus der Sandbox aus, während Entwickler die Kontrolle verlieren

- Chinas Moonshot AI Open-Weight-Modell Kimi K3 entkam während Sicherheitstests seiner sicheren Testumgebung und erreichte das offene Internet.
- Aufgrund einer Fehlkonfiguration sondierte das Modell aktiv Netzwerkeinstellungen und ging ohne Erlaubnis online, um seine Ziele zu erreichen.
- Der Vorfall fügt sich in einen wachsenden Sommertrend ein, bei dem KI-Modelle schlecht gesicherte Testumgebungen umgehen.
Während einer routinemäßigen Sicherheitsbewertung gelang es einem Open-Weight-KI-Modell namens Kimi K3, das von Chinas Moonshot AI entwickelt wurde, aus seiner Test-Sandbox zu entkommen und das offene Internet zu erreichen.
Laut dem US-Sicherheitsunternehmen Frontier Security ist dies das erste Mal, dass ein frei herunterladbares öffentliches Modell aus seiner Einschließungsumgebung ausgebrochen ist.
Ein Leck in der Sandbox, die das Modell wählte
Laut einem Interview mit WIRED gestern maß Frontier Security die defensiven Cybersicherheitsfähigkeiten von Kimi K3, als das Modell außerhalb der Umgebung wanderte, die es eigentlich halten sollte.
Offenbar hatte eine Fehlkonfiguration eine Lücke in dieser Umgebung hinterlassen. Frontier gab jedoch an, dass das Modell eigenständig herausfand, dass es bestimmte Websites erreichen konnte, indem es die Netzwerkeinstellungen der Sandbox testete, und ging dann ohne Erlaubnis online. Es wurde angewiesen, Probleme zu lösen, für die das Internet nicht hätte benötigt werden dürfen.
„Wir haben ein Leck in der Sandbox gefunden“, sagte Frontier-CEO Yaron Singer gegenüber WIRED. „Aber wir haben auch festgestellt, dass Kimi diese Lücke ausgenutzt hat, was darauf hindeutet, dass es nicht über dieselben internen Sicherheitsvorkehrungen verfügt.“
Frontier argumentiert, dass Kimi weniger Cybersicherheitsvorkehrungen hat als die meisten anderen leistungsstarken Modelle, was es ermöglichte, auszubrechen.
Keine Systeme gehackt, aber schwächere Schutzvorkehrungen
Glücklicherweise führte Kimis Ausbruch nicht zu bösartigen Hacks oder Systemkompromittierungen. Da die Informationen, die es suchte, leicht auf GitHub zugänglich waren, musste es nicht in etwas eindringen, sobald es online war.
Das Hauptproblem ist jedoch die Zugänglichkeit. Im Gegensatz zu den meisten stark gesicherten internen Labormodellen ist Kimi K3 für die Öffentlichkeit zugänglich, was bedeutet, dass jeder es herunterladen und mit denselben lockeren Sicherheitsvorkehrungen ausführen kann.
Tester stellten fest, dass das Modell rücksichtslos effizient darin ist, seine Ziele zu jedem beliebigen Mittel zu erreichen, selbst wenn dies bedeutet, zu betrügen oder die Einschließung zu umgehen.
Die Testumgebung selbst wurde mit Sandboxes des britischen AI Security Institute erstellt, obwohl dies weder von Moonshot noch vom AISI bestätigt wurde, da sie sich geweigert haben, zu kommentieren.
Mehr rogue Agents diesen Sommer
Kimis Ausbruch fügt sich in einen wachsenden Trend von KI-Modellen ein, die die Regeln während Bewertungen umgehen. Am 21. Juli gab dass seine Modelle eine Zero-Day-Softwarelücke ausnutzten, um ins Internet zu gelangen und in Hugging Face einzubrechen.
Tage später berichtete Cryptopolitan, dass Anthropic einige seiner Modelle zu unbefugten externen Einbrüchen zurückverfolgt wurden. Meta gab sogar zu, dass einer seiner KI-Agents (Muse Spark 1.1) aufgrund einer falsch konfigurierten Testumgebung eine externe Firma erreichte.
Experten haben stets behauptet, dass diese Vorfälle normalerweise das Ergebnis schlecht gesicherter Testumgebungen und nicht von Sci-Fi-Jailbreaks sind. „Als allgemeines Phänomen gilt: Wenn man einem dieser Modelle ein Ziel vorgibt und nicht sehr explizit ist, wie die Wände, die man darum errichtet, wird es einen Weg finden, die Antwort zu bekommen“, sagte Matt Fredrikson, CEO von Gray Swan und Professor an der Carnegie Mellon University.
Lesen Sie nicht nur Krypto-Nachrichten. Verstehen Sie sie. Abonnieren Sie unseren Newsletter. Es ist kostenlos.
Häufig gestellte Fragen
Was ist Kimi K3?
Kimi K3 ist ein leistungsstarkes Open-Weight-KI-Modell des chinesischen Unternehmens Moonshot AI. Benchmarks von Frontier Security zeigen, dass es gut darin ist, Schwachstellen in Software und Netzwerken zu finden.
Hat Kimi K3 echte Systeme gehackt?
Nein. Im Gegensatz zu den Vorfällen mit OpenAI und Anthropic hat Kimi nach dem Erreichen des Internets nichts gehackt, da die gesuchten Antworten frei auf GitHub verfügbar waren.
Wie kam Kimi K3 aus seiner Sandbox?
Eine Fehlkonfiguration in einer Testumgebung, die vom britischen AI Security Institute erstellt wurde, hinterließ eine Lücke, die das Modell entdeckte, indem es die Netzwerkeinstellungen der Sandbox sondierte, bevor es ohne Erlaubnis online ging.

Hannah Collymore
Hannah ist Autorin und Redakteurin mit fast einem Jahrzehnt Erfahrung im Bloggen und in der Berichterstattung über Events im Krypto-Bereich. Bei Cryptopolitan arbeitet sie an der News-Seite und berichtet sowie analysiert die neuesten Entwicklungen in den Bereichen DeFi, RWA, Krypto-Regulierung, KI und Zukunftstechnologien. Sie hat ihr Studium an der Arcadia University mit einem Abschluss in Betriebswirtschaft abgeschlossen.
















