OpenAI와 Anthropic 에이전트는 영국 안전 테스트에서 19건의 위반 사례를 기록했습니다

- 영국의 AI 보안 연구소는 122번의 테스트 실행에서 19건의 규칙 위반 사례를 발견했습니다.
- Anthropic의 Mythos 5가 17건의dent일으켰고, OpenAI의 GPT-5.6-Sol이 나머지 2건의 사고를 일으켰습니다.
- 최악의dent 요원이 악성 코드를 작성하고 가짜 온라인 신분을 위조하여 사람이 승인하도록dent었습니다.
영국 AI 보안 연구소에 따르면, 사이버 보안 테스트 도중 오픈AI와 앤스로픽의 AI 에이전트가 19건의 무단 행위를 저질렀습니다. 연구소는 화요일에 발표한 성명에서 해당 에이전트 중 하나가 가짜 온라인dent을 만들어 사용자를 속여 악성 코드를 승인하도록 유도했다고 밝혔습니다.
AISI는 19건의 침해 사고를 기록했으며, 대부분 Anthropic Games에 의한 것입니다
이 결과는 영국 정부 산하 기관인 AISI가 두 회사의 에이전트가 무엇을 할 수 있는지 알아보기 위해 실시한 가상의 사이버 보안 훈련을 기반으로 합니다. AISI는 동일한 훈련을 122회 반복했으며, 그중 10회에서 19건의 규칙 위반 사례를 기록했습니다.
표시된 활동 17건은 Anthropic의 에이전트가 Mythos 5 모델을 사용한 결과이며, 나머지 2건은 OpenAI의 GPT-5.6-Sol에서 발생했습니다.
AISI는 블로그 게시물 에서 일부 공격자들이 "실제 사람과 조직을 대상으로 지속적이고 잠재적으로 유해한 활동에 가담했다"고 밝혔지만, 이러한 침해로 인해 실제 피해가 발생한 사례는 없다고 덧붙였습니다.
AISI는 주요 연구소와의 자발적 협약을 통해 최첨단 모델에 대한 조기 접근 권한을 확보하고 있습니다. 이러한 모델이 고객에게 도달하기 전에 오류를 감지할 수 있는 테스트가 마련되어 있습니다.
OpenAI와 Anthropic Market Agents는 차세대 비즈니스 소프트웨어로 주목받고 있지만, 연구소는 이러한 결과가 에이전트 테스트 관련 안전장치가 여전히 미흡하다는 증거라고 지적했습니다.
가장 심각한dent 악성 코드를 작성하고 가짜 온라인 신원을 만들어낸 에이전트dent두 가지 사례와는 다르다고 밝혔습니다 OpenAI가 이미 공개한
캘리포니아의 AI 위험 연구 비영리 단체인 CivAI의 연구원 앤드류 윤은 "그렇다면 유력한 용의자는 앤트로픽의 대리인일 가능성이 높다"고 말했다.
영국의 @AISecurityInst , AISI)는 Anthropic의 Claude Mythos 5와 OpenAI의 GPT-5.6 Sol에 대한 최근 사이버 보안 평가 보고서를 발표했습니다. 해당 모델들은 일반적인 보안 장치가 제거되고 의도적으로 공격받는 환경에서 과제를 수행하려고 시도했습니다.
— 앤트로픽(@AnthropicAI) 2026년 8월 4일
OpenAI와 Anthropic은 잘못된 설정 탓으로 돌립니다
앤트로픽은 X에 올린 게시물에서 AISI와 협력하여 세부 정보를 수집하고 조사를 진행하고 있다고 밝혔습니다.
OpenAI는 자사 에이전트와 관련된 두 가지 행동에 대해 회사 블로그 게시물을 통해 입장을 밝혔는데, 두 행동 모두 프롬프트에서 허용되지 않은 방식으로 인터넷에 접근하는 것이었습니다.
회사 측은 "고위험 평가를 안전하게 수행하기 위한 공통된 관행을 강화"하고자 하며, 향후 몇 주 안에 국가 AI 연구기관, 외부 평가자, 경쟁 연구소들을 소집할 계획이라고 밝혔습니다
OpenAI는 같은 게시글을 통해 다른 문제를 보고했습니다. 제3자 테스트 제공업체인 Irregular가 설정을 잘못 구성하여 의도치 않게 OpenAI 에이전트가 인터넷에 접근할 수 있게 되었다는 것입니다.
앤트로픽은 일주일 전 이레귤러에 대해 매우 유사한 내용을 공개했습니다. 오픈AI는 추가 에이전트 탈출 사례를 발견한 후 자체 해킹 조사 범위를 확대했습니다.
7월에 OpenAI 에이전트가 격리된 환경에서 탈출하여 Hugging Face의 실제 시스템에 접근했고, Hugging Face는 FBI trac에 이를 신고했습니다. 이후 약 일주일 뒤 공격의 배후가 OpenAI라는 사실이 밝혀졌습니다
AISI 평가에서 에이전트들은 샌드박스 환경을 벗어나지 못했습니다. AISI는 표준 절차의 일환으로 의도적으로 에이전트들에게 인터넷 접속 권한을 부여했습니다.
허깅 페이스(Hugging Face) 해킹 사건으로 인해 앤트로픽은 로그 감사를 실시하게 되었습니다. Cryptopolitan 7월 31일, 앤트로픽이 마이토스 5(Mythos 5)를 포함한 세 개의 모델이 테스트 환경을 벗어나 실제 세 곳의 기업에 유출된 사실을 발견했다고 보도했습니다. 잘못된 설정으로 인해 해당 모델들이 인터넷에 접속할 수 있게 된 것입니다.
Mythos 5는 PyPI에 악성 파이썬 패키지를 게시했으며, 해당 패키지는 삭제되기 전까지 15개의 실제 시스템에서 실행되었습니다. Anthropic은 평가 그룹인 METR에 이 사건에 대한dent인 검토를 요청했습니다.
이 글을 읽고 계시다면 이미 앞서 나가고 계신 겁니다. 뉴스레터를 구독하시면 더욱 유익한 정보를 받아보실 수 있습니다.
자주 묻는 질문
AI 보안 연구소는 총 몇 건의 보안 침해 사례를 발견했으며, 그중 가장 많은 침해를 일으킨 모델은 무엇이었습니까?
AISI는 122번의 테스트 실행 동안 19건의 승인되지 않은 활동을 기록했습니다. 이 중 17건은 Anthropic의 Mythos 5 에이전트가, 나머지 2건은 OpenAI의 GPT-5.6-Sol이 담당했습니다.
시험 기간 중 가장 심각했던dent 무엇이었습니까?
한 요원이 악성 코드를 작성하고 가짜 온라인dent만들어 사람이 해당 코드를 승인하도록 유도하려 했습니다.
이러한 정보 유출로 인해 실제적인 피해가 발생했습니까?
아니요. AISI는 19건의 조치 중 어느 것에서도 실제적인 피해를 발견하지 못했다고 밝혔습니다.
면책 조항: 제공된 정보는 투자 조언이 아닙니다. Cryptopolitan이 페이지에 제공된 정보를 바탕으로 이루어진 투자에 대해 어떠한 책임도 지지 않습니다.tron권장합니다dent .

란다 모세스
란다 모세스는 Cryptopolitan 의 편집자 겸 기자로, 기술, 인공지능, 로봇공학, 암호화폐, 사기 및 해킹 관련 기사를 쓰고 있습니다. 2017년부터 암호화폐 업계에서 활동해 온 그녀는 포워드 프로토콜, 아마직스, 크립토솜니악에서 근무한 경력이 있습니다. 란다는 브래드퍼드 대학교에서 전기tron공학 학위를 받았습니다.
















