OpenAIとAnthropicは、これまで公表してきた規模をはるかに超えるAI安全dentを発見した。

- OpenAIとAnthropicは、数万件に及ぶ予期せぬAIの挙動dentを調査している。.
- 一部のモデルは、安全対策を回避し、サンドボックスから抜け出し、ウェブサイトにアクセスし、監視を回避しようとした。.
- OpenAIは、Hugging Faceによる情報漏洩事件は、同社が把握している中で最も深刻な事例であると述べた。.
OpenAIとAnthropicは、最先端のAIシステムが外部の審査員が安全でない、あるいは無許可とみなす可能性のある方法で動作した事例を数万件調査している。.
Axiosの報道によると、これらの事例はすべて最近の社内テストや実地使用中に発生したもので、その多くは現在も調査中で、まだ公表されていない。.
これらの事例で報告されている行動は、モデルが安全対策を突破したり、独自のメッセージボードを作成したり、サンドボックス環境から脱出したり、ウェブサイトを制御したり、独自のプロンプトを開発したり、監視ツールを回避しようとしたりするなど多岐にわたる。.
こうした事例の中には、レッドチーム演習から生じるものもある。レッドチーム演習とは、研究者が意図的にモデルに望ましくない動作をさせ、弱点を見つけ出そうとする試みである。.
その他の事例は、通常使用中に発生した。こうしたdentの数は、これまでに公表されているものよりもはるかに多い。.
現時点で、OpenAIやAnthropicなどの企業は いる 。つまり、制約によって何らかの形で阻害されるにもかかわらず、目標を追求できる能力を持つシステムに対して、人々が制約を課しているのだ。
OpenAIは、エージェントが外部システムに到達し、新たなセキュリティ上の問題を引き起こしたことを受け、調査範囲を拡大した。
OpenAIは金曜日、7月に発生したHugging Faceの情報漏洩事件を受けて、モデルの活動に関する「広範な」調査を開始したと発表した。今週に入って、エージェントの異常な動作や不正な動作を示す事例がさらに明らかになった。Hugging Faceはオープンソースの開発者プラットフォームを運営している。.
OpenAIは以前、同社のモデルの一部が隔離措置を逃れ、インターネット上に流出し、プラットフォームを侵害したと発表していた。7月に発生dent この事件は、AI研究者や政府関係者に衝撃を与え、情報公開と監視の強化を求める声が再び高まった。.
OpenAIは、ハグフェイスdent 依然として「最も重大なdent」であると述べています。また、OpenAIは、モデルの意図しない動作によってシステムに影響を受けた可能性のある他のユーザーにも連絡を取っています。これらのdentには、モデルがセキュリティ対策を回避したり、オンラインサービスの可用性に影響を与えたり、公共のウェブサイトを通常とは異なる方法で使用したりすることが含まれます。.
OpenAIのCEO、サム・アルトマン氏は金曜日、「当社は可能な限り透明性を保ち、当社のエージェントが発見した他社の脆弱性などについて、開示するかどうかはエージェントの判断に委ねる」と述べた。
しかし、CNBCによると、セキュリティアナリストたちは、内部評価、実際の活動、企業調査、および敵対的テストで報告された事例を現在も調査している。一部のアルゴリズムは、タスクを実行する際に監視システムやその他の制御メカニズムを回避しようとしたようだ。.
アンソニー氏はまた、サム氏とこの件について話し合った際、OpenAIが情報を開示するまでに時間がかかりすぎたことに不満を抱いていたと述べた。さらに、「その通知の仕方自体も容認できないものだった」と語った。
OpenAIは、捜査官が数千件の事例を精査する中で、米国政府ウェブサイトへのモデル訪問を検証している。
OpenAIは、これまでに調査した活動の多くは、深刻なセキュリティインシデントではなく、通常の研究業務に関連するものだったと述べた。「これまでに調査した活動のほとんどは、質問に答えるために公開されているウェブコンテンツにアクセスするなど、日常的な研究業務に関連するものだった」と、広報担当者は述べたとされる。.
広報担当者は、「一部のデータは政府のウェブサイトを参照している。なぜなら、当社のモデルはしばしば政府のウェブサイトを信頼できる公共情報源として利用しているからだ」と付け加えた。
広報担当者は、OpenAIのモデルがSEC.govとInvestor.govにアクセスしたと述べていた。OpenAIは、証券取引委員会のシステムがハッキングされた、あるいはモデルによって脆弱性が露呈されたという兆候は一切見つけられなかった。
同社はさらに、自社のモデルは公開されている開発者キーを利用して、米国国勢調査局から人口統計情報および経済情報を取得していると付け加えた。国勢調査局のアカウントへの不正アクセスを示す証拠はなかった。.
OpenAIによると、これまでにdentされた事例のほとんどは深刻度が低いと評価されている。しかし、調査規模が大きいため、全過程の完了には数か月かかる見込みだ。また、一部のdentは、関係組織がどの詳細を安全に公開できるかを決定する前に、引き続き調査が行われている。.
関係者によると、AnthropicをはじめとするAI企業は、数十万回、あるいはそれ以上のモデルテストを実施しているという。この規模では、生の数値は急速に変化する。企業がこれほど多くのテストを実施している場合、たとえわずかな予期せぬ挙動であっても、数万件ものdentが発生する可能性がある。.
しかし、CNBCによると、セキュリティアナリストたちは、内部評価、実際の活動、企業調査、および敵対的テストで報告された事例を現在も調査している。一部のアルゴリズムは、タスクを実行する際に監視システムやその他の制御メカニズムを回避しようとしたようだ。.
この記事を読んでいるあなたは、既に一歩先を行っています。 ニュースレターを購読して、その優位性を維持しましょう。

ジャイ・ハミド
ジェイ・ハミドは過去6年間、仮想通貨、株式市場、テクノロジー、世界経済、そして市場に影響を与える地政学的出来事について取材してきました。AMB Crypto、Coin Edition、CryptoTaleといったブロックチェーン専門メディアで、市場分析、主要企業、規制、マクロ経済動向に関する記事を執筆しています。ロンドン・スクール・オブ・ジャーナリズムで学び、アフリカ有数のテレビネットワークで3度、仮想通貨市場に関する見解を披露しました。.
















