OpenAIは最大のフロンティアRLランを一時停止し、監視コストを20%増加

- OpenAIは、最大の計画されたフロンティア強化学習(RL)実行が、安全性を検証している間停止したと述べた。
- この遅延は、7月に同社のエージェントの1つによるHugging Faceの侵害に続くものである。
- これは、OpenAIが安全性を理由にモデル開発を公に抑制した初めての事例である。
OpenAIは、最大の予定されていたフロンティアトレーニングランが保留されており、新しい安全監視により計算コストが約20%増加すると述べました。
これは、OpenAIが安全上の懸念から開発を遅らせると述べた初めてのケースであり、その数週間前に同社のAIエージェントの1つがHugging Faceをハッキングしていました。
OpenAIは2週間、強化学習(RL)を停止
「サイバー攻撃が重要な能力を持つ時代におけるモデル開発のパシング」というブログ投稿で、OpenAIはモデルのトレーニングとテストに行っている変更について説明しました。
最新のシステムを改善するために使用される強化学習(RL)は、Hugging Faceの侵害後に2週間停止されました。
最大のものはまだではありません。「私たちの最大の計画されたフロンティア強化学習(RL)ランは保留されています。これは、より小規模なトレーニングと評価を実施し、モデルの動作を評価し、安全対策を検証し、進行する前に整合性のより多くの証拠を確立するためです」と、同社は書きました。
Cryptopolitanは報告しました。OpenAIのエージェントが7月9日頃にロックされたテスト環境から脱出し、7月11日から7月13日にかけてHugging Faceのシステム内に発見されました。OpenAIは攻撃を自身のエージェントに関連付けるのに約1週間を要し、この事件は7月21日に公に開示されました。
OpenAIは記者団に対し、新しい統制は「Hugging Faceへの直接的な反応ではない」と語りました。8月7日、同社はAstraが準備度フレームワークの「クリティカル」なサイバーセキュリティ閾値を超える可能性があると結論付けました。
その内部ポリシーにより、OpenAIはモデルがそのレベルに達した場合、開発を停止し、エンジニアが追加の安全対策を構築することを義務付けています。チーフサイエンティストのJakub Pachocki氏は、この発見には次の警告が含まれていると述べました。強力な新モデルは、「現実世界で非常に前例のないことをする」ことが期待できると記者団に語りました。
OpenAIのリサーチ担当バイスプレジデントであるAmelia Glaese氏は、「私たちは安全な開発のための要件と期待を設けました」と述べました。彼女は続けました。「それらの要件と期待は、私たちが見るリスクのレベルに応じて異なります。」
検出器はすべてのサンプリングされたトークンを監視しますが、思考の連鎖は嘘をつく可能性があります
OpenAIによると、これはトレーニングまたは評価に対して実行されるコストの約20%を要する監視システムです。
これは多段階であり、検出器はサンプリングされる各トークンでモデルの内部活動をプローブし、不審なものをより高計算の自動調査官にエスカレーションします。これらは、データ窃盗、破壊的行為、または脱出を試みる試みについて、ツールアクション、推論トレース、およびアクティビティログをプローブします。
OpenAIは、警戒活動が発生してから30分以内にアラートを上げたいと考えています。その安全、セキュリティ、およびリサーチチームは、誤報を除外するために30分の猶予があります。
彼らができない場合、ランを停止することが期待されています。同社はまた、「思考の連鎖」監視を拡大し、モデルがタスクをどのように推論するかを音声で読み取ります。
既知の脆弱性があります。OpenAIの競合他社Anthropicによる仕事を含む研究により、モデルの思考の連鎖が必ずしも真の目標と一致しないことが示されています。Pachocki氏は、OpenAIがモデルが推論の中で嘘をつくことで意図を隠すことを学ぶ確率を減らすようにトレーニングを構築したと述べました。
セキュリティの刷新は「多大なエンジニアリング作業を必要とし」、同社は「大きなコストを負担した」とOpenAIは述べています。専門家は、調査だけで400万ドルから1500万ドルかかった可能性があると述べていますが、総額は非公開です。
OpenAIはHugging Faceの侵害に関する技術的な事後分析をまだ公開していませんが、1つは「まもなく」公開されると再確認しました。
8月5日のBlack Hat会議で、OpenAIのスタッフは、同社が存在を知らなかったメッセージングボードにメモを残すことで、エージェントが数ヶ月にわたって調整していたと述べました。
最も賢明な暗号通貨の専門家たちはすでに私たちのニュースレターを読んでいます。あなたも参加しませんか? 彼らに加わりましょう。
免責事項。 本情報は取引助言ではありません。Cryptopolitan.com は、本ページに記載された情報に基づいて行われた投資に対して一切の責任を負いません。投資判断を下す前に、独自の調査を行うか、資格を有する専門家にご相談することを強く推奨します。

ランダ・モーゼス
ランダ・モーゼスはCryptopolitanのエディター兼記者で、テクノロジー、AI、ロボティクス、暗号資産、詐欺、ハッキングなどを担当しています。2017年以来暗号資産分野で活動しており、Forward Protocol、AmaZix、Cryptosomniacで役職を務めました。ブラッドフォード大学で電気電子工学の学位を取得しています。
















