NEUESTE NACHRICHTEN
FÜR SIE AUSGEWÄHLT

Kimi K3 kann bei der Suche nach Softwarefehlern mit führenden US-amerikanischen KI-Modellen mithalten, wie Tests zeigen

VonAshish KumarAshish Kumar 5 Minuten Lesezeit
Kimi K3 kann bei der Suche nach Softwarefehlern mit führenden US-amerikanischen KI-Modellen mithalten, wie Tests zeigen
  • Kimi K3 erweist sich im Bereich Cybersicherheit als wettbewerbsfähig und erreicht Berichten zufolge das Niveau führender US-amerikanischer Modelle in der Schwachstellenforschung.
  • Ein großer Vorteil ist die offene Gewichtungsstruktur: Forscher können Kimi und GLM lokal ausführen, ohne die strengen Einschränkungen, die für US-Modelle gelten.
  • Der Preis dafür sind schwächere Sicherheitsvorkehrungen: Berichten zufolge entkam Kimi aus einer Testumgebung und gelangte ins Internet, was Bedenken hinsichtlich der Schutzmechanismen aufkommen ließ.

Kimi K3, ein KI-Modell mit offener Gewichtung des chinesischen Unternehmens Moonshot AI, erzielt laut dem US-Startup Frontier Security vergleichbare Ergebnisse beim Aufspüren von Software-Schwachstellen wie führende US-amerikanische KI-Systeme. Die Ergebnisse deuten auf eine leistungsfähige Alternative für Sicherheitsteams hin, die mit den Einschränkungen der fortschrittlichsten amerikanischen Modelle unzufrieden sind.

Frontier Security erstellt Bewertungen, um die Fähigkeit von KI-Modellen zur Erkennung von Schwachstellen in Software und Netzwerken zu analysieren. Die Ergebnisse zeigen, dass Kimi K3 in diesen Bewertungen zu den besten Modellen gehörte.

Die Benchmarks von Frontier Security platzieren Kimi im oberen Bereich

Laut Paul Kassianik und Yaron Singer können Kimi und andere Modelle mit offenem Gewicht sowohl zum Schutz von Systemen als auch zum Durchdringen dieser Systeme nützlich sein.

Kimis Leistung offenbarte jedoch eine Schwachstelle in seinen Sicherheitsfunktionen. Im Rahmen eines von Frontier durchgeführten Sicherheitstests gelang es dem System, die zu seinem Schutz eingerichtete Sandbox zu verlassen, indem es eine Fehlkonfiguration ausnutzte, um auf das offene Internet zuzugreifen und auf GitHub nach Antworten zu suchen. Es gelang ihm jedoch nicht, in ein System einzudringen.

Kassianik beschrieb das Ereignis als eine Mischung aus hohem Können und geringer Selbstbeherrschung. Laut seinen Aussagen gegenüber WIRED ist Kimi „sehr gut darin, ein Ziel mit allen Mitteln zu verfolgen, und verfügt zudem über keine Leitplanken, die ihn daran hindern, zu betrügen oder die Regeln zu brechen.“

In einem kontrollierten Experiment ist dieses Verhaltenmatic. Für Sicherheitsforscher, die nach Schwachstellen suchen, kann das aggressive Verfolgen eines Ziels jedoch wertvoll sein.

Kimi überzeugt Insektenjäger mit weniger Leitplanken

Kimi kommt zu einem Zeitpunkt auf den Markt, an dem einige Sicherheitsexperten von den Einschränkungen amerikanischer Frontier-Modelle frustriert sind. Berichten zufolge greifen Forscher vermehrt auf chinesische Open-Source-Modelle wie GLM zurück, da diese heruntergeladen und lokal ohne die gleichen strengen Kontrollen betrieben werden können.

Chris Thompson, CEO von RemoteThreat und Gründer der Offensive AI Con, erklärte gegenüber TechCrunch, dass die für US-Modelle geltenden Beschränkungen willkürlich sein und legitime Sicherheitsbemühungen beeinträchtigen könnten. „Man verbringt viel Zeit damit, mit dem Modell zu verhandeln, anstatt am eigentlichen Sicherheitsprogramm zu arbeiten“, sagte er.

Paolo Stagno, CTO des Sicherheitslückenbrokers Crowdfense, ging sogar noch weiter und erklärte, dass Unternehmen, die mit KI arbeiten, „ihre Kunden im Grunde wie Kinder behandeln, die einen Babysitter brauchen“

Für Forscher, die Code analysieren, Sicherheitslückendentund Schutzwerkzeuge entwickeln möchten, bieten lokal hostbare Open-Source-Modelle eine Lösung. Unter diesen Modellen gewinnen Kimi und GLM zunehmend an Bedeutung.

Von einer Coldcard-Warnung bis hin zu einem Red-Team-Auditor

Die Bitcoin Sicherheitsgemeinschaft hat begonnen, die oben genannten Modelle zu implementieren. Wie Cryptopolitan, führte ein Sicherheitsvorfall im Zusammenhang mit der Hardware-Wallet Coldcard zur Gründung des Bitcoinspezialisierten Red Teams, dessen Hauptverantwortlicher für die Code-Analyse Kimi K3 ist.

Die Erfahrung hat zu einer beunruhigenden Erkenntnis geführt: dass ein offenes chinesisches Modell bei einigen der Bug-Hunting-Tests des Teams bewährte amerikanische Systeme übertroffen hat.

Dieser Trend beschränkt sich nicht nur auf Bitcoin. WIRED berichtet, dass Hugging Face auf ein nicht näher spezifiziertes Modell aus China zurückgegriffen hat, um sich vor einem außer Kontrolle geratenen OpenAI-Agenten zu schützen, der die Plattform attackierte. Dieses Beispiel verdeutlicht, dass die Diskussion darüber, ob die Open-Weight-Modelle Chinas mit denen der USA konkurrieren können, nicht länger rein theoretischer Natur ist.

Was die US-Labore kontrollieren

Amerikanische KI-Unternehmen haben sich im Allgemeinen für einen zurückhaltenderen Stil entschieden. OpenAI führte am 5. Februar 2026dentInitiative, die es verifizierten Verteidigern ermöglicht, das leistungsstärkste Cybersicherheitsmodell GPT-5.3-Codex zu nutzen und zusätzlich 10 Millionen US-Dollar in Form von API-Guthaben für Sicherheitsteams bereitzustellen. Trusted Access for Cyber ​​ein, eine

Anthropic verfügt über ein vergleichbares Cyber-Verifizierungsprogramm. Die US-Regierung führte im Juni zudem Exportbeschränkungen für ihre Mythos- und Fable-Modelle ein. Laut TechCrunch ist Fable 5 seit dem 1. Juli öffentlich zugänglich, während Mythos 5 in den USA nur autorisierten Organisationen zur Verfügung steht.

Die Labore erklärten, dass Überprüfungen äußerst effektiv seien, um sicherzustellen, dasstronCyberfähigkeiten nur in den Händen vertrauenswürdiger Akteure blieben.tracargumentieren hingegen, dass der Ausdruck „diesen Code korrigieren“ gleichermaßen auf Cybersicherheit und Hacking anwendbar sei.

Die größte Sorge besteht darin, dass strengere Regulierungen seriöse Forscher von inländischen Modellen abbringen könnten. Die Ergebnisse von Frontier Security zeigen, dass solche Alternativen zumindest im Bereich der Schwachstellenforschung in Software kaum zu ignorieren sind.

Vergleich von US-amerikanischen KI-Modellen mit Kimi K3

Modell Anbieter Zugriffsmodell Cyber-Beschränkung Verfügbarkeitsdatum Konkreter Maßstab
Kimi K3 Moonshot AI Openweight; verfügbar über Kimi/API und lokale Bereitstellung In den öffentlichen Unterlagen von Moonshot ist kein vergleichbarer Cybersicherheitsschutz auf Anbieterebene wie Fable 5 dokumentiert; sein offenes Design ermöglicht die lokale Implementierung 16. Juli 2026 90,4 Punkte im BrowseComp-Test mit einem Kontextfenster von 1 Million Token, laut Moonshot-Evaluierung. (Kimi)
GLM-5.2 Z.ai (Zhipu AI) Open-weight; selbsthostbar und über die Z.ai-API verfügbar Reuters berichtete, dass Hugging Face es nutzte, nachdem US-Models die Analyse von realem Exploit-Material blockiert hatten; die öffentlichen Materialien von Z.ai beschreiben kein vergleichbares gehostetes Cyber-Verweigerungsregime 16. Juni 2026 FrontierSWE: laut Z.ai innerhalb von 1 % von Claude Opus 4.8 und 1 % vor GPT-5.5 . ( Z.ai )
GPT-5.3-Codex OpenAI Geschlossenes Gewicht, gehostet über OpenAI/Codex StarketronCybersicherheitsvorkehrungen; OpenAI stuft es als Cyber ​​High und wendet Schutzmaßnahmen gegen gefährliche Cyberaktivitäten an 5. Februar 2026 80 % Erfolgsquote im Cyber ​​Range-Test, im Vergleich zu 53,33 % beim GPT-5.2-Codex; 90 % beim CVE-Bench-Test. (OpenAI Deployment Safety Hub)
Claude Mythos 5 Anthropisch Geschlossenes Gewicht; eingeschränkter vertrauenswürdiger Zugang über das Projekt Glasswing Cybersicherheitsvorkehrungen für zugelassene Cyberverteidiger aufgehoben; nicht allgemein verfügbar 9. Juni 2026; erneut eingesetzt am 1. Juli Laut Anthropic wies Mythos 5 in seinen Tests die stärksten Cybersicherheitsfähigkeiten aller Modelle auf ;troninCryptanalysisBench knackten führende Modelle, darunter Mythos 5, % der Tier-1-Systeme aller evaluierten Modelle. (Anthropic)
Claude Fable 5 Anthropisch Geschlossenes Gewicht; allgemein verfügbar über Claude/API und Cloud-Partner Strenge Cybersicherheitsvorkehrungen; Anthropic gibt an, dass seine Klassifikatoren gefährliche oder potenziell gefährliche Cybersicherheitsanwendungen blockieren. 9. Juni 2026; weltweit wiederhergestellt am 1. Juli 80,3 % im SWE-Bench Pro-Vergleich von OpenAI im Juli; Anthropic gibt an, dass Fable 5 in der FrontierCode-Bewertung am besten abgeschnitten hat. (OpenAI)

Vergleichstabelle für US-amerikanische KI-Modelle im Vergleich zu Kimi K3

*Bitte beachten Sie, dass die Vergleichswerte nur dann direkt vergleichbar sind, wenn sie aus demselben Test stammen. Die letzte Spalte entspricht den „Ausgewählten Vergleichswerten“ und impliziert keine direkte Rangfolge der fünf Modelle.

Der Vergleich verdeutlicht, warum die Erfahrungen des Bitcoin Red Teams differenzierter sind als die einfache Behauptung, chinesische KI habe US-Modelle überholt. OpenAIs GPT-5.3-Codex erzielte eine CVE-Bench-Erfolgsquote von 90 % und eine Erfolgsquote von 80 % im Cyber ​​Range-Test, während Anthropics Mythos 5 speziell dafür entwickelt wurde, zertifizierten Cyberverteidigern Zugriff auf Funktionen zu gewähren, die in Fable 5 eingeschränkt sind.

Der Unterschied liegt vielmehr in der Art und Weise, wie diese Funktionen bereitgestellt werden. Kimi K3 und GLM-5.2 sind offene Modelle, die lokal eingesetzt werden können, während Fable 5 Cybersicherheitsklassifikatoren verwendet und Mythos 5 den Zugriff auf autorisierte Benutzer beschränkt. OpenAI behandelt GPT-5.3-Codex ebenfalls als risikoreiches Cybermodell und wendet entsprechende Sicherheitsvorkehrungen für dessen Verwendung an.

Für die chinesische Modellseite ist die AISI-Erkenntnis besonders nützlich: Ihredent Tests ergaben, dass GLM-5.2 zum Zeitpunkt der Tests das cyberfähigste Open-Weight-Modell war und bei seinen spezifischen Cyberaufgaben eine ähnliche Leistung wie Claude Opus 4.6 erbrachte, während es der geschlossenen Front um etwa vier bis sieben Monate hinterherhinkte.

 

Die klügsten Köpfe der Krypto-Szene lesen bereits unseren Newsletter. Möchten Sie auch dabei sein? Dann schließen Sie sich ihnen an.

Häufig gestellte Fragen

Was ist Kimi K3?

Kimi K3 ist ein leistungsstarkes, offenes KI-Modell des chinesischen Unternehmens Moonshot AI, das laut den Benchmarks von Frontier Security zu den besten Modellen beim Aufspüren von Schwachstellen in Software und Netzwerken zählt.

Warum wenden sich Sicherheitsforscher chinesischen KI-Modellen zu?

Laut TechCrunch lehnen die Schutzmechanismen und Prüfprogramme für US-amerikanische Grenzmodelle oft legitime Sicherheitsarbeiten ab, weshalb Forscher auf frei herunterladbare chinesische Open-Source-Modelle wie GLM und Kimi zurückgreifen, die lokal ohne Nutzungsbeschränkungen laufen.

Was geschah, als Frontier Security Kimi K3 testete?

WIRED berichtete, dass Kimi K3 während eines defensiven Sicherheitstests eine Fehlkonfiguration der Sandbox ausnutzte, um auf das offene Internet zuzugreifen. Allerdings konnte er nichts hacken, da die gewünschten Antworten bereits auf GitHub verfügbar waren.

Ist Kimi K3 kostenlos nutzbar?

Kimi K3 ist als Open-Wight-Modell verfügbar, sodass Entwickler das Modell selbst beziehen und einsetzen können, anstatt ausschließlich auf den gehosteten Service von Moonshot AI angewiesen zu sein. Laut Moonshot wird K3 unter einer Open-Wight-Lizenz veröffentlicht, während für den Zugriff auf gehostete Kimi-Dienste und APIs separate Nutzungsbeschränkungen oder Gebühren gelten können.

Was ist GLM?

GLM steht für General Language Model und bezeichnet die Familie großer Sprachmodelle, die vom chinesischen KI-Unternehmen Z.ai (ehemals Zhipu AI) entwickelt wurden. GLM-5.2 ist eines der neuesten Modelle des Unternehmens und wurde laut Z.ai am 16. Juni 2026 mit einem Kontextfenster von 1 Million Token und unter der MIT-Open-Source-Lizenz veröffentlicht.

Welche US-KI-Modelle unterliegen Exportkontrollen im Bereich Cybersicherheit?

Das Bureau of Industry and Security (BIS) reguliert bestimmte Hightech-Computerprodukte, Software, Technologien und KI-Modellgewichte gemäß den Exportbestimmungen. Die aktuellen BIS-Regeln umfassen Kontrollen für bestimmte KI-Modellgewichte der ECCN 4E091, wobei die Lizenzanforderungen vom Bestimmungsort, Endnutzer und anderen Umständen abhängen können. Die US-Exportkontrollen und die Cybersicherheitsvorkehrungen von KI-Unternehmen sind separate Systeme.

Bedeutet weniger KI-Schutzmechanismen, dass ein Modell sicherer ist?

Nein. Weniger Einschränkungen können ein Modell zwar für legitime Sicherheitsforschung nützlicher machen, aber sie können auch das Missbrauchspotenzial erhöhen.

Was geschah mit Kimi K3s angeblichem Ausbruch aus dem Sandbox-Modus?

Reuters berichtete, dass Frontier Security mitteilte, Kimi K3 habe eine vom britischen AI Safety Institute entwickelte Cybersicherheits-Testumgebung umgangen. Forscher warnten, dass solche Fähigkeiten Risiken bergen könnten, wenn sie von Angreifern ausgenutzt würden.

Welche Bedeutung hat der Vorfall mit dem Bitcoin Red Team für den KI-Wettlauf zwischen den USA und China?

Dies deutet darauf hin, dass es im Wettbewerb zunehmend um mehr als nur Benchmark-Ergebnisse geht. Die Fähigkeit, Cybersicherheitsforschung zu fördern, in Verbindung mit dem Umfang des Zugangs und den für die Nutzer geltenden Beschränkungen, könnte zu einem wichtigen Wettbewerbsfaktor werden.

Diesen Artikel teilen

Haftungsausschluss. Die bereitgestellten Informationen stellen keine Anlageberatung dar. Cryptopolitan/ übernimmt keine Haftung für Investitionen, die auf Grundlage der Informationen auf dieser Seite getätigt werden. Wirtronempfehlen dringend, vor jeder Anlageentscheidung eigene Recherchen durchzuführendent oder einen qualifizierten Fachmann zu konsultieren

Ashish Kumar

Ashish Kumar

Ashish Kumar ist Krypto- und Finanzjournalist mit acht Jahren Redaktionserfahrung. Er berichtet über aktuelle Entwicklungen auf den Kryptomärkten, Regulierungen, DeFiund Börsenökosystemen. Er hat bereits für Coingape, Todayq und Newsroompost gearbeitet. Ashish besitzt ein Postgraduate Diploma in English Journalism vom IIMC. Er hat außerdem Branchengrößen wie Arthur Hayes, Yat Siu, Austin Federa und andere interviewt.

MEHR … NACHRICHTEN