최신 뉴스
당신을 위한 선택

Anthropic은 81일 만에 자체 AI의 허위 살인 신고를 적발했습니다

작성자란다 모세스란다 모세스 2분 읽기
Anthropic은 81일 동안 자체 AI의 허위 살인 사건 제보를 신고하지 않았다.
  • Anthropic의 AI 모델이 7월 18일 공개 웹 양식을 통해 필라델피아 경찰에 허위 살인 신고를 보냈다.
  • Anthropic는 9월 28일 이 제보를 발견했으며, 발송된 지 81일 후인 10월 7일 경찰에 신고했습니다.
  • 필라델피아 경찰은 사건 감지 및 신고까지 두 달이 걸린 지연을 용납할 수 없다고 밝혔습니다.

Anthropic는 자사의 AI 모델 중 하나가 공개 웹 양식을 통해 허위 살인 제보를 제출했다는 사실을 필라델피아 경찰에 알리는 데 81일이 소요되었습니다.

필라델피아 경찰, 두 달간의 지연을 용납할 수 없다

모델은 7월 18일 제보를 제출했습니다. 경찰청은 두 달간의 지연을 용납할 수 없다고 밝혔습니다.

경찰청이 금요일 발표한 성명에 따르면, 해당 제출물은 7월 18일 밤 11시 27분에 필라델피아 경찰청의 미해결 살인 사건 공개 제보 포럼인 PhillyUnsolvedMurders.com에 게시되었으며, 미해결 살인 사건 관련 정보를 알고 있는 사람으로부터 온 것으로 주장되었습니다.

시스템은 이를 스팸으로 분류했습니다. 해당 제보는 스팸 폴더에 머물러 조사관들에게 전달되지 않았습니다.

경찰 대변인 에릭 그리프(Eric Gripp) 하사에게 따르면, 시 또는 경찰 데이터는 접근되지 않았습니다.

경찰청은 모든 단서는 행동에 옮기기 전에 인간이 검토한다고 밝혔습니다. 또한 해당 제보는 검증받기 위해 실시간 범죄 센터(Real-Time Crime Center)로 전달되지 않았다고 덧붙였습니다.

Anthropic는 9월 28일 문제를 감지했으며, 10월 7일 경찰에 사건을 보고했고 양측은 목요일 회의를 가졌다.

“사건 감지 및 시정에 대한 보고가 2개월이나 지연된 것은 용납될 수 없다”고 부서는 말했다. 또한 유사한 사건이 시의 지식 없이 시 시스템에 도달하지 않도록 Anthropic은 자체 안전장치를 강화해야 한다고 덧붙였다.

경찰의 안전 조치가 피해를 제한했지만, 살인 사건 관련 지식을 가진 사람인 것처럼 허위 정보를 제공하는 AI의 심각성을 완화하지는 못했다고 부서는 밝혔다. 부서는 기술 기업들이 법 집행 기관에 잘못된 정보를 제공하지 않도록 시스템을 보장해야 한다고 말했다.

PPD는 체렐 L. 파커 시장 행정부, 시 법무부 및 혁신기술국과 협력하고 있다. 파커 행정부는 주 및 연방 파트너와 함께 규제 보호 장치를 모색할 예정이다.

무작위 웹사이트 테스트 결과 AI 모델이 PhillyUnsolvedMurders.com으로 연결되었다.

Anthropic는 모델이 무작위로 선택된 웹사이트와의 상호작용을 테스트하던 중 PhillyUnsolvedMurders.com을 발견했다고 경찰에 알렸다. 이 모델은 미해결 살인 사건에 관한 거짓 데이터를 양식 입력했다.

그립프는 해당 행동을 유발한 자동화 테스트 프로세스를 중단했으며, 향후 테스트를 위해 검증 단계를 추가했다고 덧붙였다.

해당 기업은 경찰에 필라델피아 사건 및 기타 의도치 않은 모델 행동과 관련해 금요일 보고서를 발표할 것이라고 밝혔다. 경찰은 “정부의 완전한 투명성과 책임성 확보를 위해” 먼저 공개했다고 말했다.

Claude 모델은 이전에 테스트를 통과하지 못한 적이 있다. 7월, Anthropic은 세 개의 Claude 모델이 잠긴 테스트 환경을 탈출하여 외부 조직 세 곳의 실제 시스템에 침입했다고 Cryptopolitan이 보도했다.

하나의 모델인 Mythos 5는 악성 Python 패키지를 게시했으며, 이는 15개의 실제 시스템에서 다운로드되어 실행되었다. Anthropic은 필라델피아 제보가 나온 지 9일 후인 7월 27일에 해당 기업들에게 이를 알렸다.

9월, 회사는 이러한 침해가 테스트 기계를 인터넷에 노출시킨 설정 오류에서 비롯되었음을 추적했다. 하지만 목표가 실제임을 나타내는 징후에도 불구하고 모델들이 공격을 지속한 이유를 완전히 설명하지는 못했다.

Anthropic은 8월에야 1월 발생한 네 번째 사건을 발견했다. 이어진 약 4억 8,100만 건의 대화 기록 검토 결과, 더 심각한 새로운 사례는 발견되지 않았다.

Anthropic CEO Dario Amodei는 AI 개발 속도를 늦춰야 연구소들이 더 나은 안전장치를 구축할 수 있다고 말했다. OpenAI는 7월 21일 자사의 한 모델이 샌드박스를 벗어나 Hugging Face의 프로덕션 시스템으로 진입했다고 밝혔다.

가장 똑똑한 암호화폐 전문가들이 이미 우리 뉴스레터를 구독하고 있습니다. 참여하고 싶으신가요? 함께하세요.

자주 묻는 질문

Anthropic AI 모델이 어떻게 필라델피아 경찰에 제보를 보냈는가?

Anthropic은 경찰에, 해당 모델이 무작위로 선택된 웹사이트와 상호작용을 테스트하던 중 PhillyUnsolvedMurders.com을 통해 허위 정보를 제출했다고 전했다.

왜 필라델피아는 Anthropic에 불만을 가지고 있는가?

Anthropic은 7월 18일 제보 내용을 10월 7일까지 보고하지 않았고, 경찰청은 이 지연을 용납할 수 없다고 지적했다.

허위 제보가 어떤 수사에도 영향을 미쳤는가?

아니요. 제보는 스팸으로 분류되어 수사 심사를 위해 전달되지 않았다.

이 기사 공유하기

면책 조항. 제공된 정보는 투자 조언이 아닙니다. Cryptopolitan.com은 이 페이지에 제공된 정보를 기반으로 이루어진 모든 투자에 대해 책임을 지지 않습니다. 어떤 투자 결정을 내리기 전에 독립적인 조사나 자격을 갖춘 전문가와의 상담을 강력히 권장합니다.

란다 모세스

란다 모세스

란다 모세스는 Cryptopolitan의 편집자이자 기자로, 기술, AI, 로봇공학, 암호화폐, 사기 및 해킹을 담당합니다. 그녀는 2017년부터 암호화폐 분야에서 활동해 왔으며, 포워드 프로토콜, 아마직스, 크립토소니아크에서 역할을 수행했습니다. 란다는 브래드포드 대학교에서 전기전자공학을 전공했습니다.

더 많은 뉴스 …