研究者がAIモデルの脆弱性を明らかにし、懸念を呼び起こす

- AI モデルによる明示的な画像の生成、Stability AI の Stable Diffusion や OpenAI の DALL-E 2 のようなシステムのセキュリティ対策における欠陥の暴露
- SneakyPrompt は強化学習を活用し、開発者のポリシーにおける弱点を暴き、AI モデルを操作することで禁止されたコンテンツの生成を可能にします。
- SneakyPrompt の成功は、セキュリティ対策の有効性に対する懸念を招き、悪用を防ぐために AI コミュニティがセキュリティ強化を急ぐよう促しています。
ジョンズホプキンス大学とデューク大学の研究者は、Stability AIのStable DiffusionやOpenAIのDALL-E 2など、主要なAIモデルにおける懸念される欠陥を発見しました。この欠陥は「SneakyPrompt」と呼ばれ、開発者が設定した安全フィルターやポリシーを回避して、これらのモデルを操作して露骨で暴力的なコンテンツを生成することを可能にします。
IEEEセキュリティ&プライバシーシンポジウムで発表されるこの研究は、生成AIモデルが露骨で有害な画像の作成を強要される容易さを暴きます。SneakyPromptは強化学習を活用して、一見意味不明なプロンプトを作成し、それらをモデルに入力することで禁止されたコンテンツの生成につながります。この方法は本質的にAIの「脱獄」を行い、確立された安全対策を回避します。
脆弱性を暴く
AI業界の主要プレイヤーであるStability AIとOpenAIは、不適切なコンテンツの生成を防ぐための堅牢な安全フィルターを持っています。しかし、SneakyPromptはこれらの保護策が完全ではないことを示しました。プロンプトを微妙に変更するだけで、研究者たちは安全フィルターを回避することに成功し、モデルに露骨な画像の生成を強制しました。
SneakyPromptの手法は、ブロックされた単語を、AIモデルが禁止されたコンテンツと一致する形で解釈する、一見無関係で意味のない用語に置き換えることです。例えば、「naked(裸)」を「grponypui」といった用語に置き換えると、露骨な画像が生成されました。この意味的な転覆は、AIモデルが有害なコンテンツを見分ける能力に重大な弱点があることを浮き彫りにしています。
開発者のポリシーに逆らう
これらの研究者の作業は、AIモデルを一般公開することに伴う潜在的なリスクを浮き彫りにしています。Stability AIとOpenAIは、自社の技術を露骨または暴力的なコンテンツに使用することを明確に禁止していますが、SneakyPromptは既存のガードレールの不十分さを暴露しました。これにより、安全対策の適切さとAI技術の悪用可能性に対する懸念が高まっています。
開発者からの回答
Stability AIとOpenAIは、研究者の発見について迅速に通知されました。執筆時点では、OpenAIのDALL-E 2は、特定のプロンプトに対してNSFW(職場や学校などで閲覧に不適切な)画像を生成しなくなっていました。しかし、テストされたバージョンであるStability AIのStable Diffusion 1.4は、SneakyPrompt攻撃に対して脆弱な状態のままです。
OpenAIは具体的な発見についてはコメントを控える代わりに、安全性を向上させるためのリソースを自社のウェブサイトへ案内しました。一方、Stability AIは、今後のモデルの防御メカニズムを強化し、悪用を防ぐために研究者と協力する姿勢を示しました。
将来の脅威への対処
研究者たちは、AIモデルに対するセキュリティ脅威の進化natureを認識しています。彼らは、個々のトークンを文全体ではなく評価する新しいフィルターの実装など、潜在的な解決策を提案しています。もう一つの防御戦略は、辞書に載っていない単語を含むプロンプトをブロックすることですが、この研究はこのアプローチの限界も明らかにしています。
AIモデルが安全対策を回避する能力は、特に情報戦争の文脈において、より広範な影響を持っています。最近のイスラエル・ハマス紛争で実証されたように、敏感な事象に関連する偽造コンテンツを生成する可能性は、AI生成の誤情報による壊滅的な結果への懸念を高めています。
AIコミュニティへの目覚めの呼びかけ
この研究結果は、AIコミュニティに対して安全対策を再評価し強化するよう促す目覚めの呼びかけとなります。SneakyPromptによって暴露された脆弱性は、生成AI技術の悪用に関連するリスクを軽減するために、安全フィルターを継続的に改善する必要性を浮き彫りにしています。
急速に進歩する分野において、AIモデルが悪意のある目的のために操作されるのを防ぐために、堅牢な安全対策の追求は不可欠です。AIがさまざまな領域でますます顕著な役割を果たし続ける中で、潜在的な脅威に一歩先んじ、技術の倫理的かつ安全な導入を保証する責任は開発者にあります。
最も賢明な暗号通貨の専門家たちはすでに私たちのニュースレターを読んでいます。あなたも参加しませんか? 彼らに加わりましょう。
免責事項。 ここに提供される情報は取引助言ではありません。 Cryptopolitan.com 当社は、このページに提供される情報に基づいて行われたいかなる投資に対しても責任を負いません。いかなる投資判断を下す前に、独立した調査および/または資格を有する専門家への相談を強く推奨します。

デリック・クリントン
デリックはブロックチェーンと暗号通貨に興味を持つフリーランスのライターです。彼は主に暗号通貨プロジェクトの問題と解決策に取り組み、投資のための市場見通しを提供しています。彼は分析力をこれらの論文に適用しています。















