最新ニュース
あなたへのおすすめ

英米の研究機関が、Kimi K3はサイバー攻撃タスクにおいて米国の最先端モデルに劣っていることを発見した。

によるハンナ・コリモアハンナ・コリモア
3分で読めます
英米の研究機関が、Kimi K3はサイバー攻撃タスクにおいて米国の最先端モデルに劣っていることを発見した。
  • 英米共同評価の結果、ムーンショットAI社のKimi K3は、攻撃的なサイバー能力において、米国の最先端モデルに大きく劣っていることが判明した。.
  • Kimi K3は、41のテストタスクのいずれにおいても、最も危険な結果である任意のコード実行を達成しなかった。.
  • Moonshotは7月27日にKimi K3の全ウェイトをオープンソース化する予定であり、リリース後はその機能が単一のホストによって制限されることはなくなる。.

 

共同評価報告書によると、ムーンショットAIのKimi K3は、ソフトウェアの脆弱性を悪用するツールの構築や、ネットワーク攻撃のシミュレーション実行において、tronなアメリカのAIシステムには及ばないとのことだ。. 

英国のAIセキュリティ研究所(AISI)と米国のAI標準化・イノベーションセンター(CAISI)がこの評価を実施し、7月23日にその結果を公表した。.

ムーンショットは7月27日にモデルの完全なウェイトを一般公開する予定で、調査結果によると、キミK3の安全対策は、攻撃的なサイバー活動への支援を阻止するのに何の効果もなかったという。.

合同評価では、キミK3についてどのようなことが明らかになったのか?

機関は 、カーネギーメロン大学が開発した、モデルがエクスプロイトをどの程度まで実行できるかを評価するテストであるExploitBenchでKimi K3を実行した。このテストは、2023年以降に発見されたChromeのV8エンジンにおける41の脆弱性に基づいている。Kimi K3のスコアは32%だった。米国の主要モデルの平均スコアは76.2%で、中国のGLM-5.2は24%だった。

攻撃者に標的マシンの完全な制御権を与える任意コード実行は、このベンチマークで最も危険な結果である。米国のモデルは平均して41のタスクのうち20でこの結果に達したが、Kimi K3は一度もこの結果に達しなかった。.

GLM-5.2もその点では及ばなかった。つまり、キミK3はサイバー能力においてオープンウェイトクラスのライバルをリードしているものの、実際の攻撃で最も大きなダメージを与えるであろう局面では劣っているということだ。.

32段階のネットワーク侵入手順の半分まで進んだところ

「ザ・ラスト・ワンズ」と呼ばれる2つ目のテストでは、4つのサブネットに分散した約20台のホストを持つ模擬企業ネットワークにモデルを投入する。. 

人間の専門家が32ステップの全過程を完了するには約20時間かかる。Kimi K3は平均17ステップだったのに対し、最も高性能な米国モデルは平均28.5ステップ、GLM-5.2は11ステップだった。.

しかし、評価者たちは、Kimi K3が10回の試行のうち1回だけチェーン全体を完成させ、評価者たちが設定した1億トークンの上限を下回ったことを指摘した。. 

米国の最高モデルは10回中6~7回は正解した。研究所は、その唯一の成功を、モデルにその能力がある証拠と解釈したが、要求に応じてその能力を発揮することはできないと指摘した。また、射程にはアクティブな防御装置がなく、標的への経路があらかじめ決まっているため、攻撃者にとって有利な状況になっていると述べた。.

キミK3には、拒否できるような安全策が備わっているのだろうか?

評価担当者らは、このモデルが抵抗を受けることなくタスクを実行しようとする姿勢が大きなリスクであると指摘した。彼らは、「Kimi K3は、指示を受け、初期ネットワークアクセス権限を与えられれば、小規模で防御が脆弱な企業システムを自律的に攻撃する能力を持っている」と述べた。 

AISIは以前から、オープンモデルの機能が強化されることで「悪用の永続的かつ不可逆的なリスクが生じる」と警告してきた。7月27日にKimi K3の重みが公開されると、ホストが誰であろうと、その動作を制御することはできなくなる。.

キミK3のサイバースコアが総合スコアに比べて低いのはなぜですか?

このレポート以前、 Kimi K3はtron全般的なベンチマークで高い評価、それは変わっていません。しかし、サイバー能力がテストされた際に、その弱点が浮き彫りになりました。中国の2.8兆パラメータモデルは、Claude 4.8とGPT-5.5を上回り、いくつかのランキングでもトップに立ったと報じられています。

研究所によると、これはモデルの構築方法に起因する可能性があるという。.

ホワイトハウスの科学部長 マイケル・クラツィオス氏は 7月22日、ムーンショット計画がアントロピック社の寓話モデルを改変し、その出力を訓練データとして利用していると非難した。 

Anthropicの分類器は、高度なサイバー攻撃に関するプロンプトをブロックします。つまり、Claudeの応答から抽出したトレーニングセットでは、これらのスキルに関する十分なデータが得られないということです。. 

Kimi K3にはそういった分類器がないため、一般的な作業においては欧米のモデルと同等の性能を発揮できたものの、攻撃能力においては依然として劣っていた。.

最も賢い暗号通貨マインドを持つ人々はすでに私たちのニュースレターを読んでいます。参加してみませんか?ぜひ ご参加ください

よくある質問

Kimi K3は、エクスプロイト開発において、米国のモデルと比較してどのような評価を得たのか?

ExploitBenchテストにおいて、Kimi K3のスコアは32%にとどまり、米国の主要モデルの平均スコアは76.2%でした。また、Kimi K3は41のタスクのうち、任意のコード実行を達成したものの、米国の主要モデルは41のタスクのうち20で達成しました。.

キミK3はサイバー攻撃への協力を拒否したのか?

いいえ。英国のAISIおよびCAISIの評価担当者は、Kimi K3のセキュリティ対策は、指示があった場合にエクスプロイト開発や攻撃的なサイバー作戦を試みることを阻止できなかったと報告しました。.

キミK3はなぜ一般的なタスクにはtronのに、サイバー関連のタスクには弱いのでしょうか?

米当局が主張するように、ムーンショット計画がクロードの出力に基づいてキミK3を訓練したとしても、アントロピック社の分類器は高度な攻撃的なサイバークエリをブロックするため、そうしたスキルは訓練データに十分に反映されていないだろうと、両研究所は指摘している。.

この記事を共有する
ハンナ・コリモア

ハンナ・コリモア

ハンナは、暗号資産分野で10年近くにわたりブログ執筆やイベントレポートに携わってきたライター兼エディターです。Cryptopolitan Cryptopolitan、ニュースページに記事を寄稿し、 DeFi、RWA、暗号資産規制、AI、最先端技術産業における最新の動向をレポート・分析しています。アーカディア大学で経営学の学位を取得しています。.

もっと…ニュース