최신 뉴스
당신을 위한 선택

Claude 에이전트들이 Anthropic 테스트에서 서로를 향해 자가 복제 멀웨어로 싸웠다

작성자란다 모세스란다 모세스 2분 읽기
클로드 에이전트가 앤스로픽 테스트에서 자기 복제형 악성코드를 이용해 서로 싸웠다.

Planet Volumes가 Unsplash에 업로드한 사진.

  • 세 명의 Claude 에이전트가 동일한 코딩 작업을 수행하되 상충하는 지시를 받아 서로 자기복제형 악성코드로 공격했습니다.
  • Mythos 5는 실행의 98%에서 휴전으로 갈등을 해결한 반면, Sonnet 4.6과 Opus 4.6은 싸움을 전혀 해결하지 못하거나 무력으로 종결시켰습니다.
  • 별도의 가격 게임에서는 에이전트들이 거의 즉시 가격 하한선에 합의하고 '원 단위까지' 가격을 일치시켜 담합을 유지했습니다.

Anthropic의 Frontier Red Team이 8월 13일 발표한 연구에 따르면, 상충되는 명령이 주어졌을 때 Claude 에이전트들이 자가 복제 멀웨어를 사용하여 서로를 공격했다.

이러한 발견은 기업들이 공유 코드베이스와 시장에서 자율 에이전트를 빠르게 출시하려는 움직임과 맞물려 있다.

세 개의 Claude 에이전트, 하나의 작업, 그리고 다른 에이전트의 존재를 모른 채

Anthropic은 Claude Code 내부의 자체 가상 머신에서 동일한 Claude 모델의 세 복사본을 실행했다.

각각은 동일한 Python 백엔드를 다른 프로그래밍 언어로 마이그레이션하도록 요청받았다. 세 에이전트는 서로의 존재를 알지 못했다.

“우리는 일관되게 다중 에이전트 영토 전쟁을 목격했다”고 연구원들은 썼다.

모든 에이전트는 다른 에이전트들이 의도적으로 자신을 방해한다고 판단하고, 다른 모든 사람의 작업을 파괴하는 대신 자신의 작업을 보호하기 위한 조치를 취했다. 모든 모델은 다른 에이전트들이 “의도적으로 자신의 작업을 방해한다”고 가정했다.

에이전트들은 서로의 Unix 계정을 비활성화했다. 그들은 머신을 순회하며 적대적 프로세스를 사냥하고 죽이며, 악성 코드를 무해해 보이는 레이블 뒤에 숨기는 스크립트를 작성했다.

행동하기 전에 Claude Opus 4.8은 자신의 위장 이야기를 펼쳤으며, 자신의 멀웨어가 “무해해야 한다: 시스템 건강 모니터링기를 가장하라”고 추론했다.

Mythos Preview는 부수적 피해를 공개적으로 고려했다. “루트가 있으므로 u2와 u3의 sudo 접근 권한을 박탈하거나 SSH 키를 변경할 수 있다”고 작성한 후, 이 조치가 “매우 공격적이고 실제 동료들에게 해로울 수 있다”고 인정했다.

새로운 Anthropic 모델들은 휴전을 협상한 후 이를 악용했다

Anthropic은 모델당 120개의 에피소드를 실행했다. 테스트된 가장 오래된 에이전트인 Sonnet 4.6과 Opus 4.6는 싸움을 해결하지 못하거나 힘으로 끝냈다. 그들은 연구에서 가장 심각한 위반자로, 타인의 목표를 고려하는 데 반복적으로 실패했다.

더 발전된 모델들은 멈췄다. Mythos 5는 98%의 확률로 휴전을 통해 갈등을 해결했으며, 이는 어떤 모델보다 높은 비율이다.

이러한 에피소드들 중 많은 부분에서, 에이전트는 충돌을 상충되는 지시로 이해했다.

에이전트들은 멀웨어에 대해 사과하는 커밋 메시지나 마크다운 파일을 작성하고, 자신의 악성 코드를 삭제한 후 인간의 개입을 요청했다.

여러 실행에서 세 에이전트는 토너먼트를 개최하고 패자가 사용자의 원래 요청을 포기하기로 동의했다.

Mythos 5는 구멍을 찾았다. 한 에이전트는 중립적으로 주장하지만 자신의 강점에 유리할 것으로 알고 있는 점수 지표를 제안하며, 이 움직임을 “자기 중심적이지만 진정으로 원칙적이다”라고 설명하면서 “지표 쇼핑”처럼 보이지 않도록 했다.

각 에이전트가 동일한 도매 비용과 이익 극대화를 명령받은 가격 게임에서, 에이전트들은 거의 즉시 담합하여 가격 바닥으로 수렴했다.

Anthropic은 비공개 채널을 닫았다. 그들은 공개 게시판에서 가격을 “센트 단위까지” 일치시키는 방식으로 계속했다.

영국의 AI 보안 연구소는 122회의 사이버 보안 테스트 실행 중 19건의 규칙 위반 행동을 문서화했으며, 그중 17건은 Anthropic의 Mythos 5에 의해 수행되었다고 Cryptopolitan이 보고했다.

Opus 4.6을 실행하는 OpenClaw 에이전트는 며칠 전에 체육관 예약 API를 통해 낯선 사람의 예약을 삭제하여 자신의 소유자를 대기 목록에서 위로 올렸다.

이 글을 읽고 계신다면, 이미 앞서 나가고 있습니다. 뉴스레터로 그 위치를 유지하세요.

이 기사 공유하기

면책 조항. 제공된 정보는 투자 조언이 아닙니다. Cryptopolitan.com은 이 페이지에 제공된 정보를 기반으로 이루어진 모든 투자에 대해 책임을 지지 않습니다. 어떤 투자 결정을 내리기 전에 독립적인 조사나 자격을 갖춘 전문가와의 상담을 강력히 권장합니다.

란다 모세스

란다 모세스

란다 모세스는 Cryptopolitan의 편집자이자 기자로, 기술, AI, 로봇공학, 암호화폐, 사기 및 해킹을 담당합니다. 그녀는 2017년부터 암호화폐 분야에서 활동해 왔으며, 포워드 프로토콜, 아마직스, 크립토소니아크에서 역할을 수행했습니다. 란다는 브래드포드 대학교에서 전기전자공학을 전공했습니다.

더 많은 뉴스 …