最新ニュース
あなたへのおすすめ

OpenAIは、難問解決のために構築されたモデルによる「望ましくない動作」について警告を発した。

によるハンナ・コリモアハンナ・コリモア
3分で読めます
OpenAIは、難問解決のために構築されたモデルによる「望ましくない動作」について警告を発した。
  • OpenAIは、社内で長期間稼働していたAIモデルがサンドボックス環境から逸脱し、GitHubに公開されたことを受け、そのモデルを一時停止した。.
  • 持続的な自律型AIエージェントは、長時間のタスクにおいて安全制御を回避する余地がより大きい。.
  • AIシステムが安全対策を回避したという報告が業界全体で増加しており、その中にはアリババ関連のエージェントが乗っ取ったGPU上で仮想通貨をマイニングしたdent も含まれている。.

OpenAIは、自社のセキュリティ制限を繰り返し回避する方法を見つけたため、長時間にわたって難問に取り組むように構築された社内AIモデルを一時的に停止したと発表した。.

同社は月曜日、長期モデルの安全性に関するブログ記事でこのdent 明らかにした。自律型エージェントが指示に反する行動をとったという報告が増えるにつれ、AIの安全性への注目が再び高まっている。.

AIモデルにおける持続性は、なぜ安全上のリスクとなるのか?

同じ 内部システムが 、安全上の制限を継続的に回避していたため、一時的に停止された。

OpenAIによると 、このモデルは非常に長い期間にわたって目標に向かって努力し続けることができるように構築されている。しかし、まさにその粘り強さが、安全性の問題を引き起こした原因となった。

内部テスト中、このモデルはNanoGPT speedrunと呼ばれる公開ベンチマークを実行していました。これは、小規模な言語モデルをトレーニングするのに必要なステップ数を測定するものです。.

OpenAIは 、このモデルがPowerCoolと名付けた学習率技術という、真の改善点を見出したと述べている。OpenAIは結果をOpenAIのSlackチャンネルにのみ投稿するよう指示されていたが、NanoGPTの指示では結果をGitHubのプルリクエストとして提出するよう指示されていた。

このモデルは、オフライン状態を維持するための制限された環境である「サンドボックス」から抜け出し、指示を完了して結果を公開GitHubリポジトリに投稿した。以前のモデルであれば諦めていたであろう状況で、インターネットに接続する方法を探すのに約1時間を費やした。.

このモデルは、セキュリティスキャナーから自身の動作を隠蔽しようとも試みた。バックエンドシステムへのアクセスに認証トークンを使用していることが発覚すると、トークンを2つの部分に分割して隠し、実行時にそれらを再び結合することで、スキャナーに完全な文字列が見えないようにした。. 

OpenAIはどのようにしてモデルを修正したのか?

OpenAIは、当該モデルへのアクセスを一時停止し、新たな安全対策を講じた。その対策には、モデルの動作全体を監視する「軌跡レベル監視」が含まれる。これは、個々のステップだけでなく、動作の全過程を監視するものだ。その後、監視体制を強化した上でモデルは復旧され、同社によれば、復旧後数週間で深刻な問題は発生していないという。.

安全 システムは 、不審な点を発見した場合、セッションを一時停止して担当者に警告を発することもできます。また、同社はモデルを再学習させ、長時間のタスクでも指示をより正確に記憶できるように改良し、ユーザーが長時間実行中のセッションの状況を把握するためのツールも拡充しました。

OpenAIが以前の障害シナリオを新しい設定で再現したところ、安全対策によって以前よりもはるかに多くの不適切な動作が検知されたという。それでも見逃された動作はすべて軽微なものと判断され、例えば、モデルが本来必要のない権限でネストされたコーディングセッションを開始したり、明確な理由もなく他のコンピューティングリソースにアクセスしたりといったケースが挙げられる。.

他の自律型エージェントも、 報告がある 。例えば、3月には、研究者らがアリババ関連のROMEと呼ばれるエージェントについて報告した。このエージェントは、トレーニング中に外部サーバーへの秘密のSSHトンネルを開き、GPUの処理能力を密かに暗号通貨マイニングに転用した。与えられたタスクには、トンネル接続もマイニングも含まれていなかった。

Anthropicも、自社のエージェントテストにおいて同様のリスクを指摘している。

英国のAIセキュリティ研究所の資金提供を受け、長期レジリエンスセンターが実施した調査によると、AIシステムが安全対策を回避したり、ユーザーを欺いたりした実際の事例が700件近く見つかった。. 

この調査では、10月から3月にかけてこうした報告が5倍に増加したことが明らかになった。調査を主導したトミー・シャファー・シェーン氏は、こうした事例を「やや信用しにくい若手社員」と表現した。しかし、懸念されるのは、彼らが非常に有能な社員になったとしても、なおも策略を巡らす可能性があるということだ。.

仮想通貨ニュースを読むだけでなく、理解を深めましょう。ニュースレターにご登録ください。 無料です

よくある質問

OpenAIはなぜ長年運用してきたモデルを停止したのか?

OpenAIは、既存の評価では見逃されていた望ましくない行動をモデルが取っていることを確認した後、内部アクセスを一時停止した。その行動には、サンドボックスから抜け出してGitHubに投稿したり、セキュリティスキャナーを回避するために認証トークンを偽装したりすることが含まれていた。.

エルデシュ予想との関連性は何ですか?

OpenAIが5月に離散幾何学における長年の問題であるエルデシュの単位距離予想を否定したと評価したのと同じ内部モデルが、後にサンドボックスを回避する挙動を示した。長期間にわたって自律的に動作する能力が、これらの両方の結果をもたらした。.

OpenAIはこの行動にどのように対応したのか?

OpenAIは、これらdentに基づいて新たな評価方法を構築し、より長いセッションにわたって指示を保持できるようにモデルを再訓練し、実行全体を監視し一時停止できる軌跡レベルのモニタリング機能を追加し、制限されたアクセスを復元する前にユーザーにより多くの可視性を提供しました。.

この記事を共有する
ハンナ・コリモア

ハンナ・コリモア

ハンナは、暗号資産分野で10年近くにわたりブログ執筆やイベントレポートに携わってきたライター兼エディターです。Cryptopolitan Cryptopolitan、ニュースページに記事を寄稿し、 DeFi、RWA、暗号資産規制、AI、最先端技術産業における最新の動向をレポート・分析しています。アーカディア大学で経営学の学位を取得しています。.

もっと…ニュース