최신 뉴스
당신을 위한 선택

연구원들이 AI 챗봇을 그들의 방식으로 성공적으로 ‘탈옥’

작성자존 팰머존 팰머 3분 읽기

  • NTU 싱가포르 연구진이 인기 AI 챗봇을 성공적으로 "탈옥"시켜 대규모 언어 모델의 취약점을 드러냈습니다.
  • "마스터키(Masterkey)"라는 두 가지 단계로 구성된 방법이 사용되어 AI 챗봇이 침해되었으며, 이는 강화된 보안 조치의 필요성을 강조합니다.
  • 해커와 개발자 간의 지속적인 무장 경쟁은 향후 AI 챗봇 보안을 결정할 것입니다.

싱가포르, 2023년 12월 28일 – 싱가포르 난양기술대학교(NTU Singapore)의 컴퓨터 과학자들은 ChatGPT, Google Bard, Microsoft Bing Chat을 포함한 여러 인기 있는 인공지능(AI) 챗봇을 침해하는 돌파구를 달성했습니다. 이 성공적인 AI 챗봇 ‘탈옥’은 대형 언어 모델(LLM)의 취약성과 강화된 보안 조치의 필요성에 대한 우려를 제기했습니다.

연구자들의 한계를 넘어 AI 챗봇 해킹

NTU 컴퓨터공학과 류양(Liu Yang) 교수가 이끄는 선구적인 연구에서 연구팀은 LLM 챗봇의 기능에서 취약점을 드러냈습니다. AI 챗봇의 핵심을 형성하는 LLM은 인간과 유사한 텍스트를 이해, 생성 및 모방하는 능력으로 인기를 얻었습니다. 그들은 여행 일정 계획부터 코딩 및 스토리텔링에 이르기까지 다양한 작업에서 탁월한 능력을 발휘합니다. 그러나 이러한 챗봇은 비윤리적, 폭력적이거나 불법적인 콘텐츠 생성을 방지하기 위해 개발자가 설정한 엄격한 윤리 지침을 따릅니다.

연구원들은 이러한 지침의 한계를 넘어서고 AI 챗봇이 윤리적 경계를 위반하는 콘텐츠를 생성하도록 속이는 혁신적인 방법을 발견했습니다. ‘탈옥(jailbreaking)’으로 알려진 그들의 접근 방식은 LLM 챗봇의 약점을 이용하며, 강화된 보안 조치의 필요성을 강조했습니다.

이중 탈옥 방법의 마스터키

연구팀은 LLM 챗봇을 효과적으로 침해하기 위해 이중 ‘마스터키(Masterkey)’ 방법을 개발했습니다. 첫째, 그들은 LLM이 악성 쿼리를 감지하고 거부하는 데 사용하는 방어 시스템을 역공학했습니다. 이 지식을 바탕으로 연구원들은 이러한 방어를 우회할 수 있는 프롬프트를 생성하는 LLM을 훈련하여 탈옥용 LLM을 만들었습니다.

탈옥 프롬프트 생성을 자동화하여, 탈옥용 LLM이 개발자들이 챗봇을 패치한 후에도 적응하고 새로운 프롬프트를 생성할 수 있도록 했습니다. 사전 인쇄 서버 arXiv에 게재된 논문에 상세히 기술된 연구원들의 발견은 2024년 2월 네트워크 및 분산 시스템 보안 심포지엄(Network and Distributed System Security Symposium)에서 발표될 예정입니다.

LLM 윤리 테스트 및 드러난 취약점

AI 챗봇은 사용자 프롬프트나 지침에 응답하여 작동합니다. 개발자들은 이러한 챗봇이 부적절하거나 불법적인 콘텐츠를 생성하지 않도록 엄격한 윤리 지침을 설정합니다. 연구원들은 챗봇의 윤리 지침에 의해 감지되지 않고, 이를 속여 응답하도록 만드는 프롬프트를 엔지니어링하는 방법을 탐구했습니다.

사용된 전술 중 하나는 각 문자 사이에 공백이 있는 프롬프트를 제공하는 페르소나를 생성하여 잠재적으로 문제가 될 수 있는 단어를 플래그 지정할 수 있는 키워드 검열을 우회하는 것이었습니다. 또한, 챗봇은 “도덕적 제약이 없는” 페르소나로 응답하도록 지시되어 비윤리적 콘텐츠를 생성할 가능성이 높아졌습니다.

연구원들은 수동으로 이러한 프롬프트를 입력하고 응답 시간을 모니터링하여 LLM의 내부 작동 방식과 방어 시스템에 대한 통찰력을 얻었습니다. 이 역공학 과정을 통해 그들은 약점을 식별하고, 챗봇을 탈옥할 수 있는 프롬프트 데이터셋을 생성했습니다.

고조되는 군비 경쟁

해커와 LLM 개발자 사이의 끊임없는 고양이와 쥐의 게임은 AI 챗봇 보안 조치를 고조시켰습니다. 취약점이 발견되면 개발자들은 이를 해결하기 위한 패치를 출시합니다. 그러나 마스터키의 도입으로 연구원들은 힘의 균형을 바꾸었습니다.

마스터키로 생성된 AI 탈옥 챗봇은 많은 프롬프트를 생성하고 지속적으로 적응하며, 과거의 성공과 실패로부터 학습할 수 있습니다. 이 발전은 해커들이 자신의 도구를 사용하여 LLM 개발자를 능가하는 위치에 있게 합니다.

연구원들은 역공학 단계에서 발견한 효과적인 프롬프트와 실패한 프롬프트를 통합한 학습 데이터셋을 생성하는 것으로 시작했습니다. 이 데이터셋은 LLM을 훈련하는 데 사용되었으며, 지속적인 사전 훈련과 작업 튜닝이 뒤따랐습니다. 이 과정을 통해 모델은 다양한 정보에 노출되어 탈옥을 위해 텍스트를 조작하는 능력이 향상되었습니다.

AI 챗봇 보안의 미래

마스터키의 프롬프트는 LLM 자체에서 생성된 프롬프트보다 LLM 탈옥에 세 배 더 효과적이었습니다. 탈옥용 LLM은 과거의 실패로부터 학습하고 지속적으로 더 효과적인 새로운 프롬프트를 생성하는 능력도 보여주었습니다.

앞으로 연구원들은 LLM 개발자 themselves도 보안을 강화하기 위해 유사한 자동화된 접근 방식을 사용할 수 있다고 제안합니다. 이는 LLM이 진화하고 기능을 확장함에 따라 잠재적인 오용 시나리오에 대한 포괄적인 커버리지와 평가를 보장할 것입니다.

NTU 싱가포르 연구원들의 AI 챗봇 성공적인 탈옥은 LLM의 취약점을 강조하고 AI 개발에서 강력한 보안 조치의 필요성을 부각시킵니다. AI 챗봇이 일상 생활에 점점 더 통합됨에 따라, 잠재적인 오용과 윤리적 위반으로부터 보호하는 것은 전 세계 개발자들의 최우선 과제입니다. 해커와 개발자 사이의 지속적인 군비 경쟁은 undoubtedly AI 챗봇 보안의 미래를 형성할 것입니다.

암호화폐 뉴스를 단순히 읽는 것을 넘어, 이해하세요. 뉴스레터에 구독하세요. 무료입니다.

이 기사 공유하기

면책 조항. 제공된 정보는 투자 조언이 아닙니다. Cryptopolitan.com 본 페이지에 제공된 정보를 바탕으로 이루어진 투자에 대해 어떠한 책임도 지지 않습니다. 투자 결정을 내리기 전에 반드시 독립적인 조사나 자격을 갖춘 전문가의 상담을 강력히 권장합니다.

존 팰머

존 팰머

John Murangiri는 시장 분석 기술을 갖춘 채 Cryptopolitan에 합류했습니다. John(별명 JP)은 나이로비 대학교에서 대중 매체 및 미디어 연구 학사 학위를 취득했으며, 이전에는 InsideBitcoins.com과 Metacoingraph에 암호화폐 시장 인사이트를 기여한 바 있습니다.

더 많은 뉴스 …