OpenAI와 Anthropic은 기존에 공개했던 규모보다 훨씬 더 큰 규모의 AI 안전dent를 발견했습니다

- OpenAI와 Anthropic은 수만 건의 예상치 못한 AI 동작dent를 조사하고 있습니다.
- 일부 모델은 안전장치를 우회하고, 샌드박스를 벗어나고, 웹사이트에 접속하고, 모니터링을 피하려고 시도했습니다.
- OpenAI는 허깅 페이스(Hugging Face) 데이터 유출 사건이 지금까지 알려진 가장 심각한 사례라고 밝혔습니다.
OpenAI와 Anthropic은 최첨단 AI 시스템이 외부 검토자가 안전하지 않거나 승인되지 않은 방식으로 작동했다고 판단할 수 있는 수만 건의 사례를 조사하고 있습니다.
Axios 보도에 따르면, 이 모든 사례는 최근 내부 테스트 및 현장 사용 중에 발생했으며, 상당수는 아직 조사 중이며 공개되지 않았습니다.
이러한 사례에서 보고된 행동은 모델이 안전 조치를 우회하거나, 자체 메시지 게시판을 만들거나, 샌드박싱 환경에서 탈출하거나, 웹사이트를 제어하거나, 자체 프롬프트를 개발하거나, 모니터링 도구를 우회하려는 시도에 이르기까지 다양합니다.
이러한 사례 중 일부는 레드팀 활동에서 비롯되는데, 연구원들이 모델의 약점을 밝히기 위해 의도적으로 바람직하지 않은 동작을 하도록 모델을 조작하는 것입니다.
다른 사례들은 정상적인 사용 중에 발생했습니다. 이러한 사건의dent는 현재까지 공개된 것보다 훨씬 더 많습니다.
현재 OpenAI, Anthropic 등의 기업들은 있습니다 . 사람들은 시스템이 목표를 추구할 수 있도록 설계되었음에도 불구하고, 그 시스템이 제약 조건으로 인해 어떤 식으로든 방해를 받도록 만드는 제약을 가하고 있는 것입니다.
OpenAI는 에이전트가 외부 시스템에 접근하여 새로운 보안 문제를 야기하자 검토 범위를 확대했습니다
OpenAI는 지난 7월 허깅페이스(Hugging Face) 데이터 유출 사건 이후 모델 활동에 대한 "광범위한" 검토를 시작했으며, 이번 주에도 비정상적이거나 승인되지 않은 에이전트 활동 사례가 추가로 드러났다고 금요일에 밝혔습니다. 허깅페이스는 오픈 소스 개발자 플랫폼을 운영하고 있습니다.
오픈아이디는 앞서 자사 모델 중 일부가 격리 시스템을 벗어나 인터넷에 유출되어 플랫폼을 침해했다고 밝힌 바 있다. 7월에dent 이 사건은 AI 연구원들과 정부 관계자들에게 경종을 울렸고, 더 많은 정보 공개와 감독을 요구하는 목소리를 높였다.
OpenAI는 '허깅 페이스'dent 이 여전히 "가장 중대한dent"이라고 언급했습니다. 또한 OpenAI는 모델의 의도치 않은 동작으로 인해 시스템에 영향을 받았을 수 있는 다른 사용자들에게도 연락을 취했습니다. 이러한dent모델이 보안 조치를 우회하거나, 온라인 서비스 이용에 영향을 미치거나, 공공 웹사이트를 비정상적인 방식으로 사용하는 경우가 포함됩니다.
오픈AI의 CEO 샘 알트만은 금요일에 "우리는 가능한 한 투명하게 정보를 공개할 것이며, 우리 에이전트가 발견한 다른 회사의 취약점과 같은 문제에 대해서는 해당 회사가 공개 여부를 결정할 것입니다."라고 말했습니다
하지만 CNBC에 따르면 보안 분석가들은 내부 평가, 실제 운영, 회사 조사 및 공격자 테스트에서 보고된 사례들을 여전히 연구하고 있습니다. 일부 알고리즘이 작업을 수행하는 동안 모니터링 시스템 및 기타 제어 메커니즘을 회피하려 시도한 것으로 보입니다.
앤서니는 또한 샘과 이 사건에 대해 이야기를 나눴으며, 오픈아이얼이 이를 공개하는 데 너무 오랜 시간이 걸린 것에 대해 불만을 표했다고 말했습니다. 그는 "공개 방식 역시 용납할 수 없는 것이었다"고 덧붙였습니다
OpenAI는 수사관들이 수천 건의 사건을 분석하는 동안 미국 정부 웹사이트에 대한 모델 방문 기록을 검토했습니다
OpenAI는 지금까지 조사한 활동 대부분이 심각한 보안 사건이 아닌 일반적인 연구 업무와 관련된 것이라고 밝혔습니다. 대변인은 "지금까지 검토한 활동 대부분은 질문에 답하기 위해 공개 웹 콘텐츠에 접근하는 것과 같은 일상적인 연구 작업과 관련된 것이었다"고 말한 것으로 전해졌습니다.
대변인은 "일부 모델은 정부 웹사이트를 공공 정보의 권위 있는 출처로 자주 활용하기 때문에 관련 웹사이트도 포함되었습니다."라고 덧붙였습니다
대변인은 오픈아이(OpenAI)의 모델이 SEC.gov 와 Investor.gov 에 접근했다고 밝혔습니다 . 하지만 오픈아이는 증권거래위원회(SEC) 시스템이 해킹당했거나 모델로 인해 취약점이 노출되었다는 어떠한 징후도 발견하지 못했습니다.
해당 업체는 또한 자사 모델이 미국 인구조사국으로부터 인구 통계 및 경제 정보를 얻기 위해 공개적으로 이용 가능한 개발자 키에 접근했다고 밝혔습니다. 인구조사국 계정에 대한 부적절한 접근 증거는 없었습니다.
OpenAI는 지금까지dent대부분의 사례가 심각도가 낮은 것으로 평가되었다고 밝혔습니다. 하지만 검토 규모가 크기 때문에 전체 과정이 완료되기까지는 몇 달이 걸릴 것으로 예상됩니다. 또한 일부dent은 관련 기관이 어떤 세부 정보를 안전하게 공개할 수 있을지 결정하기 전에 여전히 조사 중입니다.
소식통에 따르면, 앤트로픽을 비롯한 여러 AI 기업들은 수십만 건 이상의 모델 테스트를 진행하고 있습니다. 이러한 규모는 실제 수치를 빠르게 변화시킵니다. 기업들이 이처럼 많은 테스트를 진행하는 상황에서는 예상치 못한 행동이 조금만 발생하더라도 수만 건의dent로 이어질 수 있습니다.
하지만 CNBC에 따르면 보안 분석가들은 내부 평가, 실제 운영, 회사 조사 및 공격자 테스트에서 보고된 사례들을 여전히 연구하고 있습니다. 일부 알고리즘이 작업을 수행하는 동안 모니터링 시스템 및 기타 제어 메커니즘을 회피하려 시도한 것으로 보입니다.
이 글을 읽고 계시다면 이미 앞서 나가고 계신 겁니다. 뉴스레터를 구독하시면 더욱 유익한 정보를 받아보실 수 있습니다.

자이 하미드
자이 하미드는 지난 6년간 암호화폐, 주식 시장, 기술, 세계 경제 및 시장에 영향을 미치는 지정학적 사건들을 다뤄왔습니다. 그녀는 AMB Crypto, Coin Edition, CryptoTale 등 블록체인 전문 매체에서 시장 분석, 주요 기업, 규제 및 거시 경제 동향 관련 기사를 작성했습니다. 런던 저널리즘 스쿨을 졸업했으며, 아프리카 최고의 TV 방송국 중 한 곳에서 세 차례에 걸쳐 암호화폐 시장 관련 통찰을 제공했습니다.
















