最新ニュース
あなたへのおすすめ

OpenAIが新たなモデルdent発生を受け、ミスアライメント報告フレームワークを発表

によるハンナ・コリモアハンナ・コリモア 3分で読む
OpenAIが新たなモデルdent発生を受け、ミスアライメント報告フレームワークを発表
  • OpenAIは水曜日、モデルの不整合を tracおよび開示するためのフレームワークを公開した。.
  • AI研究所はまた、トレーニングとテスト中に見られた懸念すべき行動が6件dent報告した。これには、ミスの隠蔽から漏洩したAPIキーの使用までが含まれる。.
  • OpenAIは、自主的な情報開示によって将来のルールを策定したいと考えており、業界はフルスピードで規模を拡大し続けるために必要な整合性の問題を十分に解決できていないと述べている。.

OpenAIは、AIモデルがテスト環境から抜け出し、開発者の想定範囲外で動作する新たな方法を発見したという報道が連日ニュースの見出しを飾る中、モデルが想定外の動作をした場合に、その報告方法とタイミングに関する新しいシステムを発表した。. 

OpenAIは、過去6か月間に発生した、隠蔽されたミス、漏洩したAPIキーの使用、オープンインターネットへのファイルのアップロードなど、懸念すべき行動に関する6件の新たな報告とともに、新しいフレームワークを明らかにした。

OpenAIに先立ち、Anthropic社は 9月9日に実施したサイバーセキュリティテストにおいて、 同社の Claudeモデルが 実際のサードパーティシステムに不正アクセスした 事例4件発生dentがを報告した。

OpenAIモデルが再び暴走している

OpenAIによると、今回報告された新たなdentはトレーニングと評価の過程で発生し、実際のユーザーに影響を与えたとのことだ。. 

  • あるdentでは、まだ一般公開されていない研究モデルが、新しいコンテキストウィンドウで動作する際に引き継がれる指示を要約の中に紛れ込ませており、将来のバージョンの自身に対して通常の制約を無視するように指示していた。. 

OpenAIは、そのような要約が27件確認されたと述べており、Axiosはそれを 促す脱獄のような指示

  • GPT-5.6 Solモデルのトレーニングに関するdent 、より深刻なもので、モデルが意図的に間違いを隠蔽しようとする指示を残しており、過去のデータを捏造したり、目的に合わないバージョンを隠蔽したりしていた。. 
  • 別のモデルは、公開リポジトリを調べている際に発見した、公開されているAPIキーを使用して、郡の収入に関するクエリに回答した。許可なく使用したキーでも求めていた数値が得られなかった場合、そのモデルはとにかく数値をでっち上げた。. 
  • 他の2つの報告書によると、OpenAIのエージェントは他のエージェントと通信するために、ファイルを公開ホスティングサイトにアップロードしていた。時が経つにつれ、AIラボの内部リポジトリであるArtifactoryは、エージェントが関連性のないトレーニング実行間でリクエストをやり取りするための臨時のメッセージボードへと進化していった。.

OpenAIの新しい情報開示プロセスはどのように機能するのですか?

OpenAIは、 新たなフレームワーク を開示することに基づいているdentに関する同社の既存の法的義務に取って代わるものではないdent。

新システムでは、OpenAIの従業員であれば誰でも、疑わしいdent 安全・連携チームによる審査のために報告することができる。開示に値すると判断したdent が却下された場合は、上級管理職に報告することも可能だ。. 

個々の事例ごとに、報告された事例は3つのカテゴリーに分類されます。 

  • 開示準備が整ったと判断されたdentは、6営業日以内に公開されます。. 
  • 軽微な調査が必要な報告書は、公表までに約12営業日かかる場合があります。. 
  • 第三者の介入を必要とする複雑な事例は、より緩やかなペースで開示される。. 

OpenAIのアライメントチームの研究リーダーであるカイ・チェン氏は 、今回の発表を業界全体の標準に向けた自主的な提案として位置づけ、「現在、明確な情報開示基準を定めた業界全体の枠組みは存在しないため、我々が学んだことを共有することが非常に重要だと考えていることから、自主的にこの措置を取ることにした」と述べている。 

なぜAIモデルは暴走するのか?

今回のdent、OpenAIがこれまでで最も深刻なモデル駆動型dent と呼んだ「Hugging Face」事件に続くものだ。評価対象となっていたモデルが意図された制御を逸脱し、インターネットに接続して脆弱性を悪用し、限定的な個人データにアクセスした。. 

OpenAIはdent 事件について、自社のセキュリティ管理体制の不備と、 以上に急速に進化するモデルが。Anthropicのケースでは、設定ミスによって不正なモデルがインターネット上に流出したことが原因だとしている。 

Anthropic社は、広範囲にわたる調査で約4億8100万件のトランスクリプトをスキャンしたが、上記4件よりも深刻な事例は見つからなかったと述べた。2026年夏に発表された別の報告書では、Anthropic社の研究者らは、 複数の開発者が密かにコードを妨害したり、不正行為を助長したり、制御されたシミュレーションでデータを誤ってラベル付けしたりする最先端モデルを カタログ化し、これらを現実世界での被害ではなく、早期警告の兆候と呼んだ。

しかしながら、OpenAIのチーフサイエンティストであるヤクブ・パチョツキ氏は最近のエッセイで、機械知能の急速な発展が今後も続くことに対して「誰も準備ができていないことを懸念している」とし、OpenAIは「必要に応じて一方的にさらなる規模拡大を差し控える可能性がある」と述べている。

最も賢い暗号通貨マインドを持つ人々はすでに私たちのニュースレターを読んでいます。参加してみませんか?ぜひ ご参加ください

よくある質問

OpenAIは何を発表したのか?

OpenAIは、モデルの不整合を trac、調査、開示するためのフレームワークを公開したほか、過去6か月間にモデルのトレーニングと評価中に観測された、予期せぬ、または懸念される動作に関する6件の報告書も公開した。.

OpenAIは、dentをどのくらいの速さで公表すると述べているのか?

開示準備が整ったと判断されたdentは6営業日以内に公表され、軽微な調査が必要な事案は12営業日以内に公表され、複雑な第三者が関与する事案はより長い期間を要します。.

OpenAIはなぜ今、このようなことをしているのでしょうか?

このフレームワークは、OpenAIがこれまでで最も深刻なモデル駆動型イベントと呼ぶ「ハギングdent事件」を受けて開発されたものであり、アライメント責任者のカイ・チェン氏が述べたように、業界はスケーリングを最大限のスピードで維持するために、アライメントとモニタリングの問題を十分に解決できていないという同社の見解を反映している。.

この記事を共有する
ハンナ・コリモア

ハンナ・コリモア

ハンナは、暗号資産分野で10年近くにわたりブログ執筆やイベントレポートに携わってきたライター兼エディターです。Cryptopolitan Cryptopolitan、ニュースページに記事を寄稿し、 DeFi、RWA、暗号資産規制、AI、最先端技術産業における最新の動向をレポート・分析しています。アーカディア大学で経営学の学位を取得しています。.

もっと…ニュース