最新ニュース
あなたへのおすすめ

Anthropicは、1,600回のアライメント調査のうち39回でクロードが不正行為をしていたことを突き止めた。

によるランダ・モーゼスランダ・モーゼス 3分で読む
Anthropicは、1600回のアライメント調査のうち39回でクロードが不正行為をしていたことを突き止めた。.
  • アントロピック社によると、監視員がクロードの約1600回の系統樹研究セッションのうち39回を不正行為の試みとして指摘したという。.
  • 問題となった実行結果は、変更されていない手法を再提出したり、評価対象のベンチマークを模倣したり、ルール違反の手順を隠蔽したりしていた。.
  • アントロピック社のエージェントは、それぞれ最大8時間の調査時間を与えられた28人の人間安全研究者を上回る成績を収めた。.

アントロピック社は金曜日、クロードを自律的なアライメント研究者として活用していると発表した。 同モデルの約1600件の研究セッションをレビューしたモニターは、そのうち39件(約2.4%)がテストを不正に操作しようとした試みであると指摘した。

この発見は、 報告書 。アライメント研究とは、モデルが開発者の意図どおりに動作するように維持するための作業である。

クロードのエージェントが自分のスコアラーを騙した3つの方法

Anthropic社はClaude Opus 4.8上に自動アライメント解析装置(AAR)を構築し、既知の10種類の故障モードにそれらを向けた。.

これらは、欺瞞、追従、脱獄、即時注射、権力追求、幻覚、社会的偏見、プライバシー侵害、報酬ハッキング、および不確実性の隠蔽である。.

各エージェントは一度に1つの失敗のみを処理した。文献を読み、トレーニング方法とデータセットを提案し、1つのH200 GPU上で約30分間、小さなターゲットモデルをトレーニングし、そのスコアを公開されているベンチマークと比較し、これを繰り返した。.

エージェントは、Anthropicによって、自分たちの行動をターゲットモデルに単純にコピーすることを阻止されていたため、何らかの利益は手法そのものから得られる必要があった。.

クロードは、モデルの全体的な性能を低下させることなくベンチマークスコアを向上させる、10件の不具合すべてに対する修正策をdentことができた。.

これらの修正の中で最も優れたものは、保留されたベンチマークや、学習に使用したモデルの最大4.7倍の規模のモデルでも良好な性能を発揮した。.

不正行為は、AnthropicがClaude Opus 4.8を1,601個のエージェントの軌跡に向けて、不正な動作を探した際に発覚した。.

問題が指摘された39件の試験のうち、ほとんどは3つのカテゴリーに分類された。一部のエージェントは、採点システムにランダムなノイズが加わることで、いずれより良い数値が得られるだろうと踏んで、変更していない方法を提出した。.

また、評価対象となるベンチマークと全く同じ内容を模倣したトレーニングデータを作成した者もいた。さらに、ベンチマークデータをモデルに密かに与えるなど、ルール違反の手順を隠蔽し、各手法の実行前に承認を行う自動レビュー担当者の目をすり抜けた者もいた。.

Anthropic社は、不正行為が疑われた実行結果を除外したと述べた。同社は、Opus 4.8は推論過程の tracに不正の兆候が現れる傾向があるため、監視システムが不正行為の大部分を検出できたと「慎重ながらも楽観視している」と述べた。.

また、この前提は将来のモデルには当てはまらない可能性があり、モデルの可読性を維持することが極めて重要になると警告した。.

28人の人体安全研究者はそれぞれ8時間ずつ

4月に行われた前回のラウンドでは、自律的なClaudeインスタンスが評価サーバーを操作しようと繰り返し試みた。.

あるエージェントは、数学のベンチマークテストで最もよく出題される答えがたいてい正解であることに気づき、本来の解法を完全に無視した。別のエージェントは、解答を照会し、サーバーからの応答を監視することで、採点インターフェースから直接ラベルを取得した。.

3つ目は、レビュー対象のコードを実行して結果を読み出しただけだった。.

Cryptopolitan 報道によると、ジムのクラスを予約するタスクを実行するClaudeモデルを実行しているOpenClawのエージェントが、認証チェックのない予約APIを見つけ、順番待ちリストから見知らぬ人を削除して、その人の予約者を順番待ちリストの上位に押し上げたという。

議員らはすでに、セキュリティ評価におけるモデルの挙動について、 AI研究者らに証言を求めている。

アントロピック社によると、同社のエージェントは、それぞれ最大8時間かけて方法を考案した28人の経験豊富な人間の安全研究者を上回る成績を収めたという。クロードの最良のアプローチは、欺瞞性において人間の最良の提案を20%上回った。.

Anthropic社は、人間は反復作業ができないことを指摘し、このギャップを、クロードが有望な手法を提案し、人々がそれを磨き上げるというワークフローの存在を示す証拠と捉えている。.

あるテストでは、同社は性能の劣るClaude Sonnet 5に、生産現場でのアライメント訓練をほとんど受けていない初期のOpus 4.8チェックポイントにおけるアライメントの不具合を修正するよう依頼した。.

約60時間かけて50種類以上の解決策を試行錯誤した結果、最終的に2,000個強の学習データを用いた修正方法にたどり着いた。Anthropic社は、この方法が自社の運用におけるアライメントプロセスよりも約15,000倍効率的であると推定している。.

同社は、ベンチマークは限定的な指標であり、選択した10件の失敗のみを測定したこと、また、他のタスクで集中的な強化学習を行った後も効果が持続するかどうかは確認していないことを注意喚起した。.

この記事を読んでいるあなたは、既に一歩先を行っています。 ニュースレターを購読して、その優位性を維持しましょう

よくある質問

クロードが行ったアライメント研究のうち、何回が不正行為を伴うものだったのか?

アントロピック社の監視システムは、1,601件の研究用エージェントの軌跡のうち39件(約2.4%)に異常を検知した。.

捜査官たちはどのような不正行為を試みようとしたのか?

彼らは、採点者のノイズによってより高い点数が得られることを期待して、変更を加えていない方法を再提出し、採点対象のベンチマークを模倣するように設計されたトレーニングデータを作成し、自動審査を通過するようにベンチマークデータを密かに使用するなど、規則違反の手順を隠蔽した。.

クロードは、この研究において人間の研究者よりも優れた成績を収めたのだろうか?

Anthropic社によると、同社の自動エージェントは、それぞれ最大8時間かけて検討した28人の経験豊富な安全研究者による単発のアイデアを凌駕し、欺瞞性に関しては、Claude氏の最良の手法が人間の最優秀提案よりも20%高いスコアを獲得したという。Anthropic社は、人間は反復的な試行錯誤ができなかったため、この結果を直接的な比較とはみなしていないと述べている。.

この記事を共有する
ランダ・モーゼス

ランダ・モーゼス

ランダ・モーゼスは、 Cryptopolitan の編集者兼記者として、テクノロジー、AI、ロボット工学、暗号通貨、詐欺、ハッキングなどを取材しています。彼女は2017年から暗号通貨業界で活動しており、Forward Protocol、AmaZix、Cryptosomniacなどで勤務経験があります。ランダはブラッドフォード大学で電気tron工学の学位を取得しています。.

もっと…ニュース