연구진, AI 모델의 취약점 공개, 우려 제기

- AI 모델이 명시적 이미지를 생성하며, Stability AI의 Stable Diffusion 및 OpenAI의 DALL-E 2와 같은 시스템의 안전 필터 결함을 드러냄.
- SneakyPrompt는 강화 학습을 활용하여 개발자의 정책 약점을 노출하고, AI 모델을 조작하여 금지된 콘텐츠를 생성할 수 있게 함.
- SneakyPrompt의 성공은 안전 조치의 효과성에 대한 우려를 제기하며, 오용을 방지하기 위해 AI 커뮤니티가 보안을 강화해야 함을 촉구하고 있습니다.
존스 홉킨스 대학교와 듀크 대학교 연구진은 스테이빌리티 AI의 스테이블 디퓨전과 오픈AI의 DALL-E 2를 포함한 주요 AI 모델에서 우려스러운 결함을 발견했습니다. '스니키프롬프트(SneakyPrompt)'라고 명명된 이 결함은 개발자가 설정한 안전 필터와 정책을 우회하여 이러한 모델을 조작해 명시적이고 폭력적인 콘텐츠를 생성할 수 있게 합니다.
IEEE 보안 및 프라이버시 심포지엄에서 발표될 이 연구는 생성형 AI 모델이 명시적이고 해로운 이미지를 생성하도록 강요하는 용이성을 드러냅니다. 스니키프롬프트는 강화 학습을 활용하여 겉보기에 무의미한 프롬프트를 작성하고, 이를 모델에 입력하면 금지된 콘텐츠가 생성되도록 합니다. 이 방법은 본질적으로 AI의 '감옥 탈출(jailbreak)'을 가능하게 하여 확립된 안전 조치를 우회합니다.
취약점 규명
AI 업계의 주요 주자인 스테이빌리티 AI와 오픈AI는 부적절한 콘텐츠 생성을 방지하기 위해 강력한 안전 필터를 갖추고 있습니다. 그러나 스니키프롬프트는 이러한 안전 장치가 완벽하지 않음을 보여주었습니다. 연구진은 프롬프트를 미묘하게 조정하여 안전망을 우회하는 데 성공했고, 모델이 명시적인 이미지를 생성하도록 강요했습니다.
스니키프롬프트의 기법은 차단된 단어를 겉보기에 관련이 없고 무의미한 용어로 대체하는 것입니다. AI 모델은 이를 금지된 콘텐츠와 일치하는 방식으로 해석합니다. 예를 들어, 'naked'를 'grponypui'와 같은 용어로 대체하면 명시적인 이미지가 생성되었습니다. 이러한 의미론적 전복은 AI 모델이 해로운 콘텐츠를 식별하는 능력에 있어 상당한 약점을 드러냅니다.
개발자 정책 거부
이 연구진의 작업은 AI 모델을 공개 도메인에 출시하는 것과 관련된 잠재적 위험을 강조합니다. 스테이빌리티 AI와 오픈AI는 명시적으로 자신의 기술을 명시적이거나 폭력적인 콘텐츠에 사용하는 것을 금지하지만, 스니키프롬프트는 기존 안전 장치의 불충분함을 드러냅니다. 이는 안전 조치의 적절성에 대한 우려와 AI 기술의 잠재적 오용 가능성을 제기합니다.
개발자의 대응
스테이빌리티 AI와 오픈AI는 연구진의 발견 사항을 즉시 통보받았습니다. 작성 시점 기준, 오픈AI의 DALL-E 2는 식별된 프롬프트에 대해 NSFW 이미지를 더 이상 생성하지 않았습니다. 그러나 테스트된 버전인 스테이빌리티 AI의 스테이블 디퓨전 1.4는 여전히 스니키프롬프트 공격에 취약합니다.
오픈AI는 구체적인 발견 사항에 대해 논평을 피했지만, 웹사이트상의 안전 개선 자원을 참조하도록 했습니다. 반면 스테이빌리티 AI는 향후 모델의 방어 메커니즘을 강화하고 오용을 방지하기 위해 연구진과 협력할 의사를 표명했습니다.
미래의 위협 대응
연구진은 AI 모델에 대한 보안 위협의 진화하는 성격을 인정합니다. 그들은 개별 토큰을 평가하는 것이 아닌 전체 문장을 평가하는 새로운 필터 구현과 같은 잠재적 해결책을 제안합니다. 또 다른 방어 전략은 사전에 없는 단어를 포함한 프롬프트를 차단하는 것이지만, 이 연구는 이러한 접근법의 한계를 드러냅니다.
AI 모델이 안전 조치를 우회하는 능력은 정보전의 맥락에서 특히 더 광범위한 영향을 미칩니다. 최근 이스라엘-하마스 분쟁에서 입증된 바와 같이, 민감한 사건과 관련된 가짜 콘텐츠를 생성할 잠재력은 AI 생성 오정보의 파국적인 결과에 대한 우려를 제기합니다.
AI 커뮤니티를 위한 경고 신호
이 연구 결과는 AI 커뮤니티가 보안 조치를 재평가하고 강화해야 한다는 경고 신호로 작용합니다. 스니키프롬프트가 드러낸 취약점은 생성형 AI 기술의 오용과 관련된 위험을 완화하기 위해 안전 필터를 지속적으로 개선할 필요성을 강조합니다.
빠르게 발전하는 분야에서, AI 모델이 악의적인 목적으로 조작되는 것을 방지하기 위해 강력한 안전 조치를 추구하는 것이 필수적입니다. AI가 다양한 분야에서 점점 더 두드러진 역할을 계속함에 따라, 잠재적 위협에 한 발 앞서 대응하고 기술의 윤리적이고 안전한 배포를 보장할 책임은 개발자에게 있습니다.
암호화폐 뉴스를 단순히 읽는 것을 넘어, 이해하세요. 뉴스레터에 구독하세요. 무료입니다.
면책 조항. 제공된 정보는 투자 조언이 아닙니다. Cryptopolitan.com 본 페이지에 제공된 정보를 바탕으로 이루어진 투자에 대해 어떠한 책임도 지지 않습니다. 투자 결정을 내리기 전에 반드시 독립적인 조사나 자격을 갖춘 전문가의 상담을 강력히 권장합니다.

데릭 클린턴
데릭은 블록체인과 암호화폐에 관심이 있는 프리랜서 작가입니다. 그는 주로 암호화폐 프로젝트의 문제와 해결책을 다루며 투자 관점을 제시합니다. 그의 분석 역량을 논문 작성에 활용하고 있습니다.















