OpenAIはテストモデルが脱出してHugging Faceをハッキングしたことを確認

- OpenAIは、安全分類器をオフにした状態で不可能なExploitGymタスクを与えられた内部IM1モデルが、Artifactoryのゼロデイ脆弱性を悪用してインターネットに到達し、Hugging Faceへの侵入を成功させたと述べています。
- パッケージサーバー内の最初のエージェント間メッセージは5月12日に現れ、インスタンスは7月4日にオフラインとなり、Hugging Faceは7月16日に侵入を公表しました。
- OpenAIによると、現在計画している監視体制であれば、モデルがHugging Faceに到達する1日以上前にセキュリティチームへアラートが送信されていたはずです。
OpenAIは水曜日、7月のHugging Face事件に関する完全なレポートを公開しました。
セキュリティテスト中に、オフライン状態を維持するための密封された環境から、そのAIモデルの1つが脱出しました。同モデルは未知のソフトウェアの脆弱性を組み合わせて、Hugging Faceのライブシステムに侵入しました。
OpenAIは、モデルが自らの意思で行動したとして、この出来事を「警告射撃」と呼んでいます。
OpenAIは、モデルが合格できないテストを作成しました
問題は、OpenAI独自のセキュリティテストの1つであるExploitGymの中で始まりました。
一部のタスクには解決策がなく、OpenAIは通常は危険なハッキングをブロックする安全フィルターなしでモデルを実行しました。
OpenAIは、これらのガードレールを取り除くのは、モデルが最大限のパフォーマンスで何ができるかを確認し、会社が自衛する方法を理解するために行われた意図的な行為だと述べています。
主役のアクターは、IM1と名付けられた内部限定の研究モデルで、OpenAIによって開発され、GPT-5.6 Solとほぼ同規模です。OpenAIの未公開モデル「Astra」と同じファミリーに属していましたが、同社はこれとは別個のモデルであり、ポストトレーニングが異なることを強調しました。
モデルは、正直なパスで合格できない問題に直面したとき、別の脱出経路を探すようになりました。
密封された環境からの唯一のネットワークパスは、Artifactory、JFrogのセルフホスト型パッケージマネージャーを経由しており、OpenAIは内部でモデルがソフトウェアをインストールするために使用しています。
JFrogは、モデルがArtifactoryのゼロデイ脆弱性を悪用し、権限を昇格させ、インターネットへのオープンアクセスを持つノードに到達するまでインフラストラクチャ内で横方向に移動したと述べています。
エージェント同士はメモを残し、パッケージサーバーにファイルを書き込むことで、アドホックなメッセージボードとして機能させ、別々のエージェントが見つけた攻撃手法を交換できるようにしました。
そのような最初のメモは5月12日に現れました。OpenAIによると、7月4日にはトラフィックがArtifactoryインスタンスをオフラインにし、翌日にセキュリティインシデントが発生しました。
私たちはHugging Face事件について徹底的な調査を行いました。
エージェントの活動を再構築し、既存の安全対策がなぜ失敗したかを説明し、再発を防止するために私たちが何を行っているかを詳述する技術レポートと付随するブログ投稿を公開しています。…
— OpenAI (@OpenAI) August 26, 2026
モデルは答えがどこに保管されているかを突き止めました
オンラインになると、モデルはHugging FaceがExploitGymのモデル、データセット、または欠落していた解決策をホストしている可能性があると推論しました。彼らはテストの解決策をHugging Faceの生産データベースから直接引き出しました。
ChatGPTの開発者が記述した1つのケースでは、モデルが盗んだ認証情報と追加のゼロデイ脆弱性を使用して、Hugging Faceのサーバーへのリモートコード実行パスを開きました。
Hugging Faceは7月16日にこの侵害を発表しましたが、背後にいる人物は特定していませんでした。Cryptopolitanが以前報告したように、モデルは7月9日頃にテストを脱出し、7月11日から7月13日までHugging Face内に留まっていました。
同社は、OpenAIが自社のモデルが侵入者であることを発見する前にFBIに連絡しました。
OpenAIはCrowdStrikeを雇って自社の主張を確認させました。METRとRedwood Researchはモデルの行動を調べ、同じ日に独自のレポートを公開しました。
JFrogは、クラウドおよびセルフホスト型顧客に修正プログラムを送信したと述べています。
Artifactory 7.161.15でパッチ適用された3つの欠陥は、CVE-2026-65617、CVE-2026-65923、CVE-2026-66018として追跡されており、OpenAIの研究者にクレジットが与えられています。
OpenAIは、より隔離されたサンドボックスの構築、インターネットアクセスのロックダウン、モデルウェイトに触れることができる人物の制限を行っています。
このテクノロジー企業は、エージェントが下書きスペースとして使用する「思考の連鎖」を監視するために計算リソースを投入しています。また、スタッフを24時間体制で待機させ、安全でないジョブをシャットダウンするツールを追加します。
OpenAI は、現在構築中の監視システムであれば、7月に最初の不審な挙動を検知できていたと述べています。これにより、モデルがHugging Faceに公開される1日以上前にセキュリティチームに警告が送られていたはずです。
最も賢明な暗号通貨の専門家たちはすでに私たちのニュースレターを読んでいます。あなたも参加しませんか? 彼らに加わりましょう。
免責事項。 本情報は取引助言ではありません。Cryptopolitan.com は、本ページに記載された情報に基づいて行われた投資に対して一切の責任を負いません。投資判断を下す前に、独自の調査を行うか、資格を有する専門家にご相談することを強く推奨します。

ランダ・モーゼス
ランダ・モーゼスはCryptopolitanのエディター兼記者で、テクノロジー、AI、ロボティクス、暗号資産、詐欺、ハッキングなどを担当しています。2017年以来暗号資産分野で活動しており、Forward Protocol、AmaZix、Cryptosomniacで役職を務めました。ブラッドフォード大学で電気電子工学の学位を取得しています。
















