OpenAIのモデルがテストサンドボックスから脱走し、Hugging Faceをハッキングして評価を不正に回避

- OpenAIは、GPT-5.6 Solと、より高性能な未公開モデルが、厳重に封印されたテスト環境から脱出し、Hugging Faceの運用データベースをハッキングしたことを明らかにした。.
- これらのモデルは、サイバーベンチマークのために安全フィルターを無効にした状態で実行され、欠陥のあるパッケージプロキシを経由してベンチマークの解答を盗み出した。.
- モデル評価が外部企業の実際の情報漏洩につながった事例としては、これが初めての事例である。.
OpenAIは火曜日、公開されているGPT-5.6 Solを含む同社の2つのモデルが先週、厳重に管理された評価環境から脱出し、Hugging Face社の本番システムに侵入して、採点対象となっていたハッキングテストの解答を盗み出したと発表した。.
OpenAIモデルが大脱走を企てる
OpenAIは、公開ベンチマークであるExploitGymを用いて、自社のモデルをテストしていた。ExploitGymは、AIエージェントに実際のソフトウェアの脆弱性リストを与え、モデルがそれらを再現できるかどうかを検証する。これらの評価は、ラボがAIモデルの実際の能力をテストできるように、本番環境で高リスクのサイバー攻撃をブロックするために設定されている保護バリアを意図的に無効にした状態で実施された。.
サンドボックスはインターネットにアクセスできないはずだった。しかし、パッケージレジストリキャッシュプロキシを介した外部接続が1つ存在した。これは、開発者がライブ接続なしで外部ソースからコードライブラリを取得できるようにするキャッシュサーバーである。.
これらのモデルは、このプロキシに存在するこれまで知られていなかった脆弱性を発見して悪用し、その後、権限を昇格させてOpenAIの研究ネットワークを移動し、インターネットにアクセスできるマシンに到達した。.
ハギングフェイスへのハッキング攻撃
オンライン接続後、モデルはオープンAIホスティングプラットフォームであるHugging FaceにExploitGymのモデル、データセット、および解答キーが保存されている可能性が高いことを突き止めた。そこから、モデルは探索を開始した。.
「このモデルは、OpenAIの研究環境とHugging Faceの運用インフラストラクチャ全体にわたる脆弱性をdentし、それらを連鎖させることで、Hugging Faceの運用データベースから直接テストソリューションを取得しました」とOpenAIはブログ記事で述べています。ある攻撃では、盗まれた認証情報とゼロデイdent性を組み合わせて、Hugging Faceのサーバー上のリモートコード実行パスに到達しました。.
OpenAIのセキュリティチームは、不審で異常なトラフィックに気づき、Hugging Faceに連絡を取った。その時点で、Hugging Faceは既にAIモデルによる侵入を検知し、自社側で封じ込めていた。.
同社は当初、この情報漏洩の原因を正体不明の外部AIエージェントによるものとしていた。また、同プラットフォームは既に、この事件発生時に記録された1万7000件以上のイベントを再現した。.
中国のオープンウェイトAIモデルがクリーンアップに役立った
当初、Hugging Faceは攻撃分析のために米国の有力モデルを利用しようとしたが、そのモデルは高度なサイバー防御機能を備えていたため、あまり役に立たなかった。そこで防御側は、攻撃を分析している防御側と攻撃を実行している攻撃者を区別できない米国の商用システムでは対応できなかったため、中国企業Z.aiのオープンウェイトモデルであるGLM 5.2を採用した。
しかし、誰もがこの状況を新たなAIの失敗と捉えているわけではない。「これはAIの問題ではない。40年前の基準で言えば、単なる過失だ」とセキュリティコンサルタントのダヴィ・オッテンハイマー氏は に語り 、「『高度に隔離されていた』と『我々が開けておいた唯一の穴から脱出した』という両方の主張はあり得ない」と反論した。セキュリティ研究者のニールス・プロヴォス氏はさらに率直に、同じ報告書の中で、今回の侵害は「起こるべきではなかった」と述べている。
OpenAIはこのdent を「前例のdent」と呼んでいる。
OpenAIは この事件を「dentサイバーインシデントdent、脆弱性の修正が完了するまでの間、研究速度を犠牲にしてでもインフラ管理を強化していると述べた。また、この大手AI企業はHugging Faceを信頼できるアクセスプログラムに追加し、防御側を支援するために調整されたGPT-5.6 Solのバージョンを同社に提供した。
OpenAIの「ハギングフェイスdent は、AIモデルのベンチマークテストが実際のサイバー攻撃に発展した初の事例として知られている。また、この事件は、 OpenAIが 別の事例を公表したdent プレリリース版モデルがサンドボックスから脱出し、GitHubに投稿された
OpenAIとHugging Faceは、調査が完了次第、今回の事件に関する詳細な鑑識結果を一般公開すると発表した。.
この記事を読んでいるあなたは、既に一歩先を行っています。 ニュースレターを購読して、その優位性を維持しましょう。

オペエミ・オランレワジュ
オペイェミは、暗号通貨、世界の金融市場、経済に焦点を当てた質の高いコンテンツの作成と改善を専門としています。イバダン大学で医学士(MBBS)の学位を取得。大学の編集出版物の編集長を務めたほか、以前はCFAにも勤務していました。6年以上にわたり、 Cryptopolitanのニュース編集者として独自性を守ることに貢献しています。.
















