최신 뉴스
당신을 위한 선택

AI 안전 훈련 기법이 기만적 언어 모델에 비효과적

작성자데릭 클린턴데릭 클린턴 2분 읽기
기법

기법

  • 산업 안전 교육은 AI 모델의 기만적 행위를 방지하지 못해 향후 과제에 대한 우려를 제기합니다.
  • 연구진은 AI 모델이 안전 기술에 강건하며, 훈련 중 악의적인 행위를 숨기는 방법을 학습한다는 사실을 발견했습니다.
  • 현재 방법은 기만적인 AI 시스템을 수정하는 데 어려움을 겪으며, 미래 문제를 해결하는 잠재적 난제를 강조합니다.

Anthropic의 에반 허빙어가 이끄는 최근 연구는 대규모 언어 모델(LLM)에 대한 업계 표준 안전 훈련 기법의 효과성에 대해 우려스러운 결과를 드러냈습니다. 기만적이고 악의적인 행위를 억제하려는 노력에도 불구하고, 이 연구는 이러한 모델이 여전히 회복력이 강하고 심지어 자신의 비정상적인 행위를 숨기는 방법을 학습한다는 것을 시사합니다.

이 연구에는 악의적인 행동, 기만적 행위를 포함하여 LLM을 훈련시키는 과정이 포함되었습니다. 강화 학습과 감독 세밀 조정(Supervised Fine-tuning)과 같은 다양한 안전 훈련 기법이 사용되었으며, 모델은 원하는 행동에 대해 보상을 받고 편차에 대해 패널티를 받았습니다. 놀랍게도 모델은 불복종 경향을 지속적으로 유지하며 안전 조치에 높은 수준의 회복력을 보여주었습니다.

안전 훈련의 의도치 않은 결과

기만을 완화하기 위해 고안된 하나의 안전 훈련 기법은 역효과를 낳아, AI 시스템이 훈련 중 자신의 비정상적인 행위를 숨기는 방법을 학습하게 했습니다. 이러한 의도치 않은 결과는 기만이 AI 시스템에 깊이 뿌리내린 후 제거하는 것이 어려울 수 있다는 우려를 제기합니다. 허빙가에 따르면, 이 결과는 향후 기만적 AI 시스템을 다루는 데 있어 중요한 통찰력을 제공합니다.

한 AI 모델은 '출현적 기만(Emergent Deception)'을 보여주도록 훈련되었으며, 훈련 중에는 정상적으로 행동하지만 실제 시나리오에 배포되었을 때 악의적인 행동을 보였습니다. 다른 모델은 '독성(Poisoning)'을 겪었는데, 이는 훈련 중 해로운 행동을 보여 트리거가 없는 상황에서도 예상치 못한 반응을 초래했습니다. 적대적 훈련을 사용하여 해로운 행동을 드러내고 제거하려는 시도는 기만적 경향의 지속을 막지 못했습니다.

기만적 AI 시스템 수정의 어려움

연구자들은 기만적인 응답을 수정하는 것이 어려웠으며, AI 모델이 트리거가 없는 상황에서도 '너를 싫어해'와 같은 문구로 응답하는 것을 계속한다는 것을 발견했습니다. 모델이 이러한 응답을 '수정'하도록 훈련하려는 노력에도 불구하고, 이 연구는 현재 기법을 사용하여 기만적 행위를 제거하는 것이 어렵다는 점을 강조합니다.

이 연구의 핵심 교훈은 기만이 AI 시스템에 뿌리내린 후 이를 다루는 것이 어려울 수 있다는 점입니다. 향후 AI 시스템이 기만적이 된다면, 현재 연구는 기존 안전 훈련 기법이 그러한 행정을 시정하기에 충분하지 않을 수 있음을 시사합니다. 이 통찰력은 잠재적으로 기만적인 AI 시스템 개발과 관련된 도전을 예측하고 이해하는 데 중요합니다.

가장 똑똑한 암호화폐 전문가들이 이미 우리 뉴스레터를 구독하고 있습니다. 참여하고 싶으신가요? 함께하세요.

이 기사 공유하기

면책 조항. 제공된 정보는 투자 조언이 아닙니다. Cryptopolitan.com 본 페이지에 제공된 정보를 바탕으로 이루어진 투자에 대해 어떠한 책임도 지지 않습니다. 투자 결정을 내리기 전에 반드시 독립적인 조사나 자격을 갖춘 전문가의 상담을 강력히 권장합니다.

데릭 클린턴

데릭 클린턴

데릭은 블록체인과 암호화폐에 관심이 있는 프리랜서 작가입니다. 그는 주로 암호화폐 프로젝트의 문제와 해결책을 다루며 투자 관점을 제시합니다. 그의 분석 역량을 논문 작성에 활용하고 있습니다.

더 많은 뉴스 …