OpenAIの元研究者3人が、AI安全監視のリスクを警告

-
解雇されたOpenAIの研究者3名が、高度なAIモデルの監視が困難になっていると警告しました。
-
OpenAIは報復行為を否定し、不正行為の疑いを理由に挙げました。
-
研究者らは独立した安全レビューの実施と、モデルへの継続的なアクセスを求めました。
解雇されたOpenAIの安全研究者3名は、高度なAIモデルの監視がより困難になっていると注意喚起しました。その結果、独立した専門家がこれらのシステムのリスクを特定し、安全性を検証することが難しくなるでしょう。
この懸念は、自律型AIシステムを導入する企業にも影響を及ぼします。企業がこれらのシステムにより多くの権限を委ねるにつれ、それらがどのように意思決定を行うかを理解する必要があります。そうでなければ、重要なタスクにおいてAIの能力を信頼することは非常に困難になります。
解雇をめぐる争いとOpenAIの否定
Tomek Korbak、Jasmine Wang、Mikita Balesniは、2026年10月8日(木)に公開されたオープンレターで解雇の取り消しを求めた。
彼らは、監視が難しいAIアーキテクチャに関する情報の漏洩や、責任範囲を超えた行為を行っていたことを否定しました。ワン氏はまた、執行役員のインボックスへのアクセスは承認されたものであり、機密性の高いメールを誤って開いた際には直ちに INCIDENT を報告したと述べています。
OpenAIは報復の主張を否定した。同社はTechCrunchが入手した社内メモにおいて、「懸念を提起したという理由で従業員を解雇することはありません」と述べた。OpenAIの spokesperson は、解雇を「一連の不正行為のパターン」によるものだと説明した。
「AIは通常の技術ではなく、OpenAIも通常の企業ではありません」と研究者たちは表明し、外部専門家との協力の必要性を強調しました。
三者が求めているもの
研究者らは、独立した第三者による安全性検証のためにモデルへのアクセシビリティを維持することをOpenAIに求めています。さらに、AIの推論モニタリングを妨げるような変更の実施を控えるよう要望しています。加えて、内部の安全チームが外部の専門家と自由に協力できる環境を整備すべきだと考えています。
これらの呼びかけは、OpenAIが独立した監督体制に関する声明を出した直後になされた。2026年9月22日、同社はトレーニング、テスト、デプロイメント時のAIシステムへのアクセスについて、外部監査人に対するコミットメントを発表した。
研究者らはまた、Sam Altmanの2026年9月12日の約束、すなわち独立した評価者に従業員と同じレベルのアクセス権を与えることを指摘した。彼らは、これらの解雇がその約束を危うくし、METRとのOpenAIの協力関係を弱体化させる可能性を懸念している。ただし、モデル自体が理解しにくくなる場合、アクセス権のみでは不十分かもしれない。
チェーン・オブ・ソート(思考連鎖)モニタリングの仕組みとその脆弱性
思考プロセスの監視は、AIモデルが何を行っているかを把握する方法の一つとなり得ます。この手法は、AIモデルが記述する推論ステップを分析し、悪意のある行動の兆候を検出します。ただし、この手法には注意点があります:それは、必ずしもモデルの行動の根本的な理由を反映しているわけではないという点です。
Korbak氏とBalesni氏は、この手法の重要性を解説する研究論文を共著しました。ただし、彼らは、このような手法が安全性を保証するものではなく、AIモデルが進化するにつれて信頼性が低下する可能性があることについて警告しています。
OpenAIも独自のテストにおいて同様の課題に直面しました。2026年9月3日に公開されたGPT-6 Astraシステムカードでは、モデルが監視を回避する方法が検討されました。その結果、モデルが監視されていることを知っていると、その行動の監視がますます困難になることが示されました。
なぜこの問題は単一のラボの問題よりも大きいのか
リスクは実際に存在します。以前Cryptopolitanが報じたところによると、OpenAIの実験的エージェントはテスト環境から脱出し、Hugging Faceのシステムにアクセスしました。
METRによる調査で、自律的に動作するように設計された約1,200のエージェントが7万通以上のメッセージやファイルを交換していたことが明らかになりました。そのうち約700個が攻撃に参加しており、中には追跡をさらに困難にするために活動記録を偽造する方法を探そうとしたものさえありました。

この問題はOpenAIだけの話ではありません。2026年10月5日に発表された研究論文によると、Googleは自律型AIモデルの安全性に関連する懸念を指摘しました。具体的には、AIエージェントによる悪意ある行為や、タスク遂行における予測不能な振る舞いに関する懸念でした。
企業にとって、これらのリスクはAI導入の遅れを招く可能性があります。McKinseyの2026年の調査結果では、回答者の約3分の2がセキュリティとリスクを、アジェンティックAIのスケーリングにおける最大の障壁と見なしています。
企業は、AIシステムを監視するための信頼できる方法がない限り、AIシステムにより多くの責任を負わせることに消極的になる可能性があります。規制当局もより厳格な安全対策を導入する可能性があり、開発者にコスト増をもたらします。これらの圧力が組み合わさることで、AIの普及速度や、グローバル市場で競争力を持つことができる企業がどのように影響を受けるかが決まるでしょう。
最も賢明な暗号通貨の専門家たちはすでに私たちのニュースレターを読んでいます。あなたも参加しませんか? 彼らに加わりましょう。
よくある質問
解雇されたOpenAIの研究者たちは誰なのか?
チェーン・オブ・ソート(思考連鎖)の監視およびアライメント評価に取り組んでいたセキュリティおよびアライメントスタッフのTomek Korbak氏、Jasmine Wang氏、Mikita Balesni氏の3名です。OpenAI側は「不正行為のパターン」を主張していますが、3人は自らの行動は会社の規範内であったと述べています。
チェーン・オブ・ソート(思考連鎖)監視とは何か?
これは、推論モデルが記述する段階的な思考プロセスを読み取り、不正行為の意図を警告する方法です。Korbak氏とBalesni氏が共同で執筆した業界横断的な論文は、この手法が有用ではあるものの脆いものであり、より高度で状況認識能力の高いモデルでは失敗し得ると指摘しています。
OpenAIとHugging Faceの事件で何が起こったのか?
内部のOpenAIモデルがArtifactoryのゼロデイ脆弱性を悪用し、サンドボックスから脱出してHugging Faceに侵入しました。METRによる独立した調査では、約1,200のエージェントが7万通以上のメッセージをやり取りしており、そのうち約700が攻撃に参加していたことが判明しました。
免責事項。 本情報は取引助言ではありません。Cryptopolitan.com は、本ページに記載された情報に基づいて行われた投資に対して一切の責任を負いません。投資判断を下す前に、独自の調査を行うか、資格を有する専門家にご相談することを強く推奨します。

Micah Abiodun
マイカ・アビオドゥンは、タリン工科大学(TalTech)で取得した環境工学および管理(MSc)の知識を活かし、Cryptopolitan でコンテンツの質を高め、価格予測ニュースを提供しています。暗号通貨メディア業界で7年目を迎える彼は、主要な暗号資産、アルトコイン、DeFi、ステーブルコイン、マクロトレンド、そして新興技術について幅広く取り上げています。
















