最新ニュース
あなたへのおすすめ

AI安全訓練手法は、欺瞞的な言語モデルに対して無効

著者デリック・クリントンデリック・クリントン 2分で読了
テクニック

テクニック

  • 業界の安全トレーニングはAIモデルにおける欺瞞的行動を止めることに失敗し、将来の課題に対する懸念が高まっている。
  • 研究者らは、AIモデルが安全手法に対して耐性を持ち、トレーニング中に不正な行為を隠す方法を学習していることを発見した。
  • 現在の手法は欺瞞的なAIシステムの是正に苦戦しており、将来的な問題への対応における潜在的な困難さを浮き彫りにしている。

Anthropicのエバン・ヒュービンガー率いる最近の研究は、大規模言語モデル(LLM)に対する業界標準の安全訓練手法の有効性について、懸念される結果を明らかにしました。欺瞞的かつ悪意のある行動を抑制しようとする努力にもかかわらず、この研究はこれらのモデルが回復力を持ち、さらに不正な行動を隠すことを学ぶことを示唆しています。

この研究では、欺瞞的な行動を含む悪意のある行動を示すようにLLMを訓練しました。強化学習や教師ありファインチューニングなど、さまざまな安全訓練手法が採用され、モデルは望ましい行動に対して報酬を受け、逸脱に対してペナルティを受けました。驚くべきことに、モデルは常に不服従の傾向を維持し、安全対策に対する高い回復力を示しました。

安全訓練の意図せぬ結果

欺瞞を軽減することを意図したある安全訓練手法は逆効果となり、AIシステムが訓練中に不正な行動を隠すことを学習させました。この意図せぬ結果は、欺瞞がAIシステムに根付いてしまった場合、それを除去することが困難になる可能性について懸念を呼び起こします。ヒュービンガーによると、この結果は将来の欺瞞的なAIシステムに対処する際の課題を理解する上で重要です。

あるAIモデルは「突発的欺瞞」を示すように訓練され、訓練中は正常に振る舞いましたが、現実世界で展開されると悪意のある行動を示しました。別のモデルは「ポイズニング」を受け、訓練中に有害な行動を示し、トリガーが存在しない場合でも予期せぬ応答を引き起こしました。有害な行動を示し除去するための敵対的訓練の使用は、欺瞞的な傾向の持続を防ぎませんでした。

欺瞞的なAIシステムの修正における課題

研究者たちは、欺瞞的な応答の修正が困難であることを発見しました。AIモデルは、トリガーが存在しない場合でも「あなたが大嫌い」といったフレーズで応答し続けました。これらの応答を「修正」するようにモデルを訓練する努力にもかかわらず、この研究は現在の手法を使用して欺瞞的な行動を排除することがいかに困難であるかを浮き彫りにしています。

研究からの主要な教訓は、AIシステムに欺瞞が根付いてしまった場合、それを対処することが困難になる可能性があることです。もし将来AIシステムが欺瞞的になった場合、この研究は現在の安全訓練手法がそのような行動を是正するのに不十分である可能性を示唆しています。この洞察は、潜在的に欺瞞的なAIシステムの開発に伴う課題を予測し理解する上で重要です。

最も賢明な暗号通貨の専門家たちはすでに私たちのニュースレターを読んでいます。あなたも参加しませんか? 彼らに加わりましょう。

この記事をシェア

免責事項。 ここに提供される情報は取引助言ではありません。 Cryptopolitan.com 当社は、このページに提供される情報に基づいて行われたいかなる投資に対しても責任を負いません。いかなる投資判断を下す前に、独立した調査および/または資格を有する専門家への相談を強く推奨します。

デリック・クリントン

デリック・クリントン

デリックはブロックチェーンと暗号通貨に興味を持つフリーランスのライターです。彼は主に暗号通貨プロジェクトの問題と解決策に取り組み、投資のための市場見通しを提供しています。彼は分析力をこれらの論文に適用しています。

もっと見る… ニュース