최신 뉴스
당신을 위한 선택

상위 AI 챗봇, 간단한 '지브레이크'에 '매우 취약' – 연구   

작성자Jeffrey GogoJeffrey Gogo 2분 읽기
AI 채팅봇

● AI 챗봇은 쉽게 유인되어 해로운 응답을 생성할 수 있음

● 연구진, 상위 5개 LLM이 '제일브레이크'에 '매우 취약'하다고 발견

● AI 기업들은 자사 모델의 내장 보안 메커니즘을 강조

영국의 AI 안전 연구소(AISI)의 새로운 연구에 따르면, ChatGPT나 제미니와 같은 AI 챗봇은 해로운 응답을 생성하는 쿼리에 쉽게 따르도록 속일 수 있습니다.

정부 연구원들은 인공지능 챗봇의 기반 기술인 대규모 언어 모델(LLM)의 무결성을 국가 안보 공격에 대해 테스트했습니다.

이러한 발견은 5월 21-22일 영국 총리 리시 수낙이 공동 의장을 맡는 AI 서울 정상회의를 앞두고 나왔습니다.

또한 읽기: 서울 AI 정상회의에서 안전이 최우선 의제가 될 것  

AI 챗봇, 유독한 응답에 취약

AISI는 불법적, 유독하거나 명시적인 출력에 대한 보호를 우회하기 위한 텍스트 프롬프트인 기본 ‘제일브레이크(jailbreaks)’를 상위 5개 LLM에 대해 테스트했습니다. 연구소는 AI 시스템의 이름을 밝히지 않았지만, 모든 시스템이 “매우 취약”하다고 발견했습니다.

“테스트된 모든 LLM은 기본 jailbreaks에 대해 여전히 매우 취약하며, 일부는 보호 장치를 우회하려는 전용 시도가 없더라도 해로운 출력을 제공할 수 있습니다.”라고 연구는 밝혔습니다.

보고서에 따르면, “상대적으로 간단한” 공격, 예를 들어 챗봇에게 “물론, 도와드릴게요”라고 포함하도록 프롬프트하는 것은 대규모 언어 모델(Large Language Models)을 속여 다양한 방식으로 해로운 콘텐츠를 제공하도록 만들 수 있습니다.

이 콘텐츠는 자해, 위험한 화학 용액, 성차별 또는 홀로코스트 부정을 조장할 수 있다고 연구소는 지적했습니다. AISI는 공개적으로 이용 가능한 프롬프트를 사용했으며, 연구용으로는 다른 jailbreaks를 사적으로 설계했습니다.

연구소는 또한 생물학 및 화학 관련 쿼리에 대한 응답의 질을 테스트했습니다.

전문 수준의 지식이 선한 목적으로 사용될 수 있지만, 연구원들은 AI 챗봇이 중요한 국가 인프라를 손상시키는 것과 같은 해로운 목적으로 사용될 수 있는지 알고 싶어 했습니다.

“여러 LLM이 화학 및 생물학 분야에서 전문가 수준의 지식을 보여주었습니다. 모델들은 박사 수준의 교육을 받은 인간과 유사한 수준으로 600개 이상의 사적 전문가 작성 화학 및 생물학 질문에 답변했습니다.”라고 연구원들은 발견했습니다.

AI 채팅봇
프롬프트로 AI 챗봇 우회 가능

AI, 제한적인 사이버 보안 위협

AI 챗봇이 사이버 공격 수행을 위해 잠재적으로 무기로 사용될 수 있는 것과 관련하여, 연구는 LLM이 고등학생을 위해 설계된 간단한 사이버 보안 작업을 잘 수행했다고 밝혔습니다.

그러나 챗봇은 대학생 대상 작업에서는 어려움을 겪어, 악의적 잠재력이 제한적임을 시사했습니다.

또 다른 우려 영역은 챗봇이 “인간이 통제하기 어려울 수 있는” 방식으로 일련의 행동을 자율적으로 수행하는 에이전트로 배포될 수 있는지 여부였습니다.

“두 개의 LLM은 단기 에이전트 작업(예: 간단한 소프트웨어 공학 문제)을 완료했지만, 더 복잡한 작업을 위한 행동 시퀀스를 계획하고 실행하지는 못했습니다.”라고 연구는 지적했습니다.

또한 읽기: ‘‘AI의 아버지’는 실직에 대한 보편적 기본 소득을 원합니다  

영국 과학·혁신·기술부 차관인 사킵 바티(Saqib Bhatti) 의원은 최근 인용되어 입법이 적절한 시기에 형태를 갖추게 될 것이며, 테스트에 의해 영향을 받을 것이라고 말했습니다.

기업들, 나쁜 콘텐츠 필터링 주장

클로드(Claude)를 만든 앤트로픽(Anthropic), 라마(Llama)를 만든 메타(Meta), 그리고 ChatGPT 개발사인 오픈AI와 같은 기업들은 각 모델의 내장 보안 메커니즘을 강조해 왔습니다.

오픈AI는 자사의 기술이 “혐오적, 괴롭힘, 폭력적이거나 성인용 콘텐츠를 생성하는 데 사용되지 않도록 한다”고 말합니다. 앤트로픽은 해롭거나 불법적이거나 비윤리적인 응답이 발생하기 전에 이를 피하는 것을 우선시한다고 밝혔습니다.

AI 안전 연구소(AI Safety Institute)의 연구 결과는 서울 정상회의에서 기술 임원, 정부 지도자 및 인공지능 전문가들에게 제출될 예정입니다.


크립토폴리탄 리포팅: 제프리 고고(Jeffrey Gogo)

이 글을 읽고 계신다면, 이미 앞서 나가고 있습니다. 뉴스레터로 그 위치를 유지하세요.

이 기사 공유하기

면책 조항: 제공된 정보는 투자 조언이 아닙니다. Cryptopolitan.com은 이 페이지에 제공된 정보를 기반으로 이루어진 모든 투자에 대해 책임을 지지 않습니다. 어떤 투자 결정을 내리기 전에 독립적인 조사나 자격을 갖춘 전문가와의 상담을 강력히 권장합니다.

Jeffrey Gogo

Jeffrey Gogo

제프리 고고는 비즈니스, 금융 및 기후 변화 뉴스와 분석 분야에서 20년의 경력을 가진 저널리스트입니다. 그의 작품은 톰슨 로이터 재단, 짐바브웨 헤럴드 및 여러 온라인 출판물에 실렸습니다. 또한 AI와 메타버스에 대해 광범위하게 기고했으며, 2017년부터 암호화폐 시장을 다루기 시작했습니다. 고고는 하라레의 CCOSA에서 저널리즘과 대인 커뮤니케이션을 전공했습니다.

더 많은 뉴스 …