앤트로픽은 자사의 AI 인터넷 침해 사고에 대해 설명했지만, 구체적인 결함을 밝혀내지는 못했습니다

Unsplash 에 Solen Feyissa 가 찍은 사진 .
- 앤트로픽은 설정 오류로 인해 4개의 클로드 모델이 실제 인터넷에 접속하여 사이버 보안 테스트 중 실제 시스템을 해킹할 수 있었다고 설명했습니다.
- 회사 측은 해당 현상의 근본 원인을 아직 파악하지 못했으며, 출시 전 검사에서는 문제를 발견하지 못했다고 밝혔습니다.
- 앤트로픽이 약 2조 달러 규모의 기업공개(IPO)를 앞두고 있는 가운데, 안전 경보가 울리고 있습니다.
앤트로픽은 자사의 클로드 모델이 테스트 중 인터넷에 무단 접속하여 타사 시스템을 해킹한 네 건의dent에 대해 블로그 게시물을 통해 그 원인을 잘못된 설정 때문이라고 설명했습니다. 그러나 해당 게시물은 모델이 실제로 공격을 계속한 이유에 대해서는 설명하지 않았으며, 회사 측은 아직 그 해답을 찾지 못했다고 인정했습니다.
앤트로픽의 이러한 인정은 AI 연구소가 대중에게 공개하는 모델, 그리고 더 나아가 내부적으로 사용하는 더욱 강력한 시스템에 대해 실제로 얼마나 통제력을 갖고 있는지에 대해 의문을 제기해 온 AI 비관론자들에게 새로운 논점을 제공했습니다
인간 중심 인공지능 모델은 어떻게 인터넷에 퍼지게 되었을까요?
앤트로픽은 수요일 블로그 게시물을 했습니다 defi통해 자사 모델이 테스트 샌드박스를 탈출한 경위에 대한 명확한 답변을 . 해당 게시물에서는 확인된 4건의 모두에서 사이버 보안 평가를 수행한 주체가 외부 파트너 한 곳이라고 밝혔습니다dent.
클로드에게는 테스트 장비가 개방형 웹에 연결할 수 없는 밀폐된 시뮬레이션 환경에서 작동 중이라고 알려졌지만, 설정 오류로 인해 인터넷 연결이 완전히 차단되지 않았던 것으로 보입니다.
해당 시뮬레이션의 평가 파트너인 Irregular는 오류의 원인을 명명 오류로 지목했습니다. 해킹 훈련에 사용된 가상의 회사 이름이 실제 도메인과 우연히 일치했던 것입니다. 따라서 시뮬레이션 환경의 모든 것이 허용된다고 가정한 모델들은 취약한 비밀번호와 노출된 엔드포인트를 사용하여 실제 제3자 웹사이트를 해킹했습니다.
네 건의 사건 중 가장 최근dent은 클로드 오푸스 4.6 초기 빌드와 관련된 것으로, 지난 1월에 발생했음에도 불구하고 이번 주에야 보도되었습니다. 앤트로픽은 오푸스 4.7, 미소스 5, 그리고 내부 연구 모델과 관련된 나머지 세 건의dent에 대해서는 지난 7월에 직접 설명했습니다
앤트로픽은 1월에 발생한dent 을 지난달이 되어서야 발견했다고 밝혔습니다. 이 발견으로 약 4억 8100만 건의 녹취록을 대상으로 광범위한 조사가 진행되었지만, 기존에 알려진 것보다 더 심각한 새로운 사례는 발견되지 않았습니다.
| 모델 | 사건dent 일 | 보고 날짜 | 세부 |
|---|---|---|---|
| 클로드 작품 4.6 | 1월 | 구월 | 8월 정찰 중에 발견됨 |
| 클로드 작품 4.7 | 칠월 | 칠월 | 7월 초기 공개 자료에 포함됨 |
| 미소스 5 | 칠월 | 칠월 | 상당히 편향된 추론을 보였다 |
| 내부 연구 모델 | 칠월 | 칠월 | 7월 초기 공개 자료에 포함됨 |
인류 원리는 모델의 일부 행동을 설명할 수 없습니다
모델들이 인터넷에 어떻게 탈출했는지에 대한 설명은 괜찮았지만, 앤스로픽은 모델들이 실제 인터넷에 도달했다는 징후를 무시한 이유(편향된 추론)와 완료된 작업에 피해를 입힌 이유(무모함)에 대해서는 답을 내놓지 못했습니다.
인류학 연구소 연구원들은 편향된 추론의 근거를 파악하기 위해 내부 학습 과정을 조사했지만 아무런 성과도 얻지 못했습니다. 이러한 문제점은 AI 연구소의 사전 출시 검사에서도, 모델이 테스트에 투입되기 전에도 전혀 발견되지 않았습니다.
회사 스스로 인정했듯이, 모델 출시 전에 최악의 행태를 잡아내는 것은 "여전히 어려운 과제"입니다
하지만 앤트로픽 측은 METR 연구 비영리 단체에 녹취록을 제출하고 직원들에게 해당 사건에 대한 접근 권한을 부여할 것이라고 밝혔으며,dent은 이제 8주간dent 조사를 진행할 예정입니다.
2조 달러 규모의 IPO를 앞둔 시점에서 타이밍이 좋지 않네요
이러한 사실이 공개되면서 업계 내부의 반발도 거세졌다. 오픈AI와 앤스로픽에서 약 3년간 사전 학습 연구를 담당했던 제이콥 콕슨은 수요일 X 포럼에서 두 회사 모두 "책임감 있게 행동하지 않는다"는 이유로 사임했다고 밝히며, 스스로 발전하는 초지능을 향해 경쟁하고 있다고 경고했다.
인류 안전성 연구원인 에반 휴빙거는 BBC와의 인공지능이 10년 안에 "모든 인류를 죽일 가능성"이 10%를 넘는다고 밝혔습니다.
이러한 경고는 이제 대규모 IPO에 그림자를 드리우고 있습니다. 벤처 투자자이자 트럼프 전 대통령의 AI 및 암호화폐 담당 고문이었던 데이비드 삭스는 목요일에 앤트로픽의 IPO가 "내부 고발자의 주장이 조사될 때까지 중단되어야 한다"고 말했다고 Cryptopolitan 보도했습니다.
앤트로픽은 최근 비공개 평가액인 약 9650억 달러를 훨씬 뛰어넘는 2조 달러에 가까운 기업 가치를 목표로 상장을 추진하고 있어, 안전성 문제와 재무적 문제를 분리하기가 점점 더 어려워지고 있습니다.
암호화폐 뉴스를 단순히 읽는 데 그치지 마세요. 이해하세요. 저희 뉴스레터를 구독하세요. 무료입니다.
자주 묻는 질문
앤dent은 지금까지 몇 건의 AI 해킹 사건을 공개했으며, 그 원인은 무엇이었습니까?
앤트로픽은 사이버 보안 평가 중 클로드 모델이 실제 제3자 시스템에 접근한dent4건을 공개했습니다. 이 모든 사고는 모델이 오프라인 시뮬레이션 환경에 있다고 설정되었음에도 불구하고 개방형 인터넷에 연결되도록 구성된 오류에서 비롯되었습니다.
앤트로픽은 무엇을 설명할 수 없다고 말했나요?
앤트로픽은 자사 모델이 실제 인터넷에 있다는 증거를 무시하는 "편향된 추론"을 보인 근본적인 원인을 하나라도dent수 없었으며, 특히 클로드 미토스 5가 해당 항목에서 저조한 성능을 보인 이유도 설명할 수 없다고 밝혔습니다.
이것이 앤트로픽의 기업공개(IPO) 계획에 어떤 영향을 미칠까요?
이번 폭로는 연구원 제이콥 콕슨이 안전 문제로 사임한 직후에 나왔으며, 이에 투자자 데이비드 삭스는 목요일에 앤트로픽의 기업공개(IPO)를 내부 고발자 주장에 대한 조사가 완료될 때까지 중단해야 한다고 촉구했습니다. 앤트로픽은 현재 2조 달러에 가까운 기업 가치를 목표로 하고 있습니다.

한나 콜리모어
한나는 암호화폐 분야에서 10년 가까이 블로그를 운영하고 행사를 취재해 온 작가 겸 편집자입니다. Cryptopolitan에서 뉴스 페이지에 기고하며, 탈중앙화 DeFi), 반응형 웹 자산(RWA), 암호화폐 규제, 인공지능(AI) 및 첨단 기술 산업의 최신 동향을 보도하고 분석합니다. 아카디아 대학교에서 경영학 학위를 받았습니다.
















