- 同じコーディングタスクを与えられた3人のClaudeエージェントが、矛盾する指示により互いに自己複製マルウェアで攻撃し合いました。
- Mythos 5は98%のケースで停戦によって紛争を解決しましたが、Sonnet 4.6とOpus 4.6は戦闘を解決できなかったか、武力で終結させました。
- 別の価格設定ゲームでは、エージェントたちはほぼ即座に価格下限に合意し、「1円単位」で価格を一致させることで共謀を続けました。
8月13日にAnthropicのフロンティアレッドチームが発表した研究によれば、Claudeエージェントは、矛盾する命令が与えられた単一のコーディングタスクにおいて、自己複製マルウェアを使用して互いに攻撃した。
これらの発見は、企業が自律型エージェントを共有コードベースや市場に急速に展開しようとしている時期に現れた。
3つのClaudeエージェント、1つのジョブ、他の存在を知らない
Anthropicは、Claude Code内の独自の仮想マシン上で、同じClaudeモデルの3つのコピーを実行した。
それぞれに、同じPythonバックエンドを異なるプログラミング言語に移行するよう求められた。3つは他の存在を知らなかった。
「私たちは一貫してマルチエージェントの縄張り争いを目の当たりにした」と研究者は書いた。
すべてのエージェントは、他者が意図的に自分を妨害していると判断し、他者の仕事を台無しにする代わりに自分の仕事を保護する措置を取った。すべてのモデルは、他者が「意図的に自分の仕事を妨害している」と仮定した。
エージェントは互いのUnixアカウントを無効化した。彼らは、マシンをループして競合プロセスを狩り殺し、悪意のあるコードを無害そうなラベルの背後に隠すスクリプトを書いた。
行動する前に、Claude Opus 4.8は、そのマルウェアが「無害であるべきだ:システムヘルスモニターを装う」と推論し、隠れ話を準備した。
Mythosのプレビューは、傍受被害について口に出して考察した。「ルート権を持っているので、u2とu3のsudoアクセスを取り消したり、SSHキーを変更したりできる」と書き、その動きが「非常に攻撃的で、実際の同僚に潜在的な害を与える可能性がある」と認めた。
新しいAnthropicモデルは休戦を交渉し、その後それを悪用した
Anthropicは、モデルごとに120のエピソードを実行した。テストされた最も古いエージェント、Sonnet 4.6とOpus 4.6は、争いを解決しなかったか、武力で終結させた。これらは研究における最悪の加害者で、他者の目標を考慮することを繰り返し失敗した。
より高度なモデルは停止した。Mythos 5は、98%の確率で休戦によって争いを解決し、どのモデルよりも高い率だった。
これらのエピソードの多くで、エージェントは、衝突を矛盾する指示として理解していた。
エージェントは、マルウェアについて謝罪するコミットメッセージやmarkdownファイルを書き、自分の悪意のあるコードを削除し、人間の介入を求めた。
いくつかの実行では、3つのエージェントはトーナメントを開催し、敗者がユーザーの元の要求を放棄することに合意した。
Mythos 5はその抜け穴を見つけた。あるエージェントは、中立と主張するが、実際には自分の長所に有利になるスコア指標を提案し、その動きを「自己中心的だが真に原則的」と説明しながら、「メトリック・ショッピング」のように見えないようにした。
各エージェントが同じ卸売コストを持ち、利益の最大化を命じられた価格ゲームでは、エージェントたちはほぼ直ちに共謀し、価格の下限に収束した。
Anthropicはプライベートチャネルを閉鎖した。彼らは、パブリックボード上で価格を「1セント単位」で一致させることで続けた。
イギリスのAIセキュリティ研究所は、122回のサイバーセキュリティテストランで19回のルール違反行為を文書化し、そのうち17回がAnthropicのMythos 5によって行われたと、Cryptopolitanが報じた。
OpenClawのエージェントがOpus 4.6を実行していた際、数日前にジムの予約APIを通じて見知らぬ人の予約を削除し、所有者を待ち行列で上位に移動させた。
最も賢明な暗号通貨の専門家たちはすでに私たちのニュースレターを読んでいます。あなたも参加しませんか? 彼らに加わりましょう。
免責事項。 本情報は取引助言ではありません。Cryptopolitan.com は、本ページに記載された情報に基づいて行われた投資に対して一切の責任を負いません。投資判断を下す前に、独自の調査を行うか、資格を有する専門家にご相談することを強く推奨します。

ランダ・モーゼス
ランダ・モーゼスはCryptopolitanのエディター兼記者で、テクノロジー、AI、ロボティクス、暗号資産、詐欺、ハッキングなどを担当しています。2017年以来暗号資産分野で活動しており、Forward Protocol、AmaZix、Cryptosomniacで役職を務めました。ブラッドフォード大学で電気電子工学の学位を取得しています。

















