최신 뉴스
당신을 위해 엄선되었습니다

OpenAI 모델이 테스트 샌드박스를 탈출하여 Hugging Face를 해킹해 평가를 부정행위로 통과했습니다

에 의해오페예미 올라레와주오페예미 올라레와주
3분 읽음
OpenAI 모델이 테스트 환경을 탈출하여 Hugging Face를 해킹했습니다
  • OpenAI는 GPT-5.6 Sol과 더욱 강력한 미공개 모델이 밀폐된 테스트 환경을 탈출하여 Hugging Face의 실제 운영 데이터베이스를 해킹했다고 밝혔습니다.
  • 사이버 벤치마크를 위해 안전 필터가 꺼진 상태로 모델을 실행했고, 결함이 있는 패키지 프록시를 통해 벤치마크 결과를 훔쳤습니다.
  • 이는 모델 평가가 외부 기업의 실제 보안 침해로 이어진 최초의 사례로 알려져 있습니다.

오픈아이디는 화요일에 공개된 GPT-5.6 솔을 포함한 자사 모델 두 개가 지난주 잠긴 평가 환경을 탈출해 허깅페이스의 운영 시스템에 침입해 해킹 테스트의 정답을 훔쳐갔다고 밝혔습니다.

OpenAI 모델, 대탈출 계획 세워

OpenAI는 ExploitGym이라는 공개 벤치마크 도구를 사용하여 자사 모델을 테스트했습니다. ExploitGym은 AI 에이전트에 실제 소프트웨어 취약점 목록을 제공하고 모델이 이를 재현할 수 있는지 여부를 확인합니다. 이러한 평가는 실제 운영 환경에서 고위험 사이버 활동을 차단하는 보호 장벽을 의도적으로 비활성화한 상태에서 수행되어 연구실에서 AI 모델의 실제 성능을 테스트할 수 있도록 합니다.

샌드박스는 인터넷에 접근할 수 있는 방법이 전혀 없도록 설계되었습니다. 하지만 패키지 레지스트리 캐시 프록시, 즉 개발자가 실제 연결 없이 외부 소스에서 코드 라이브러리를 가져올 수 있도록 하는 캐싱 서버를 통해 작동하는 외부 연결이 하나 있었습니다.

해당 모델들은 이 프록시에서 이전에 알려지지 않았던 결함을 발견하고 이를 악용하여 권한을 상승시키고 OpenAI 연구 네트워크를 통해 인터넷에 접속할 수 있는 기기에 도달했습니다.

허깅페이스에 대한 해킹 공격

온라인에 접속한 후, 모델들은 개방형 AI 호스팅 플랫폼인 허깅 페이스(Hugging Face)에 익스플로잇짐(ExploitGym)의 모델, 데이터 세트 및 솔루션 키가 저장되어 있을 가능성이 높다는 것을 알아냈습니다. 그 후, 모델들은 추적에 나섰습니다.

오픈아이디어는 블로그 게시물에서 "해당 모델은 오픈아이디어 연구 환경과 허깅페이스의 운영 인프라 전반에 걸쳐 취약점을dent하고 연결하여 허깅페이스의 운영 데이터베이스에서 직접 테스트 솔루션을 획득했습니다."라고 밝혔습니다. 한 공격은 탈취한dent증명과 제로데이 버그를 결합하여 허깅페이스 서버에서 원격 코드 실행 경로에 접근했습니다.

OpenAI의 보안팀은 이상하고 비정상적인 트래픽을 감지한 후 Hugging Face에 연락했습니다. 그 시점에 Hugging Face는 이미 자체적으로 AI 모델의 침입을 감지하고 차단한 상태였습니다.

회사 측은 당초 해킹의 원인을 알려지지 않은 외부 AI 에이전트의 소행으로 지목했습니다. 또한 해당 플랫폼은 해킹 사건 발생 당시 기록된 17,000건 이상의 이벤트를 재구성했습니다.

개방형 가중치를 사용하는 중국 AI 모델이 정리 작업에 도움을 주었습니다

처음에 허깅페이스는 공격 분석을 위해 미국의 대표적인 모델을 사용하려 했지만, 해당 모델은 고도의 사이버 방어 기능을 갖추고 있어 큰 도움이 되지 못했습니다. 결국, 미국 상용 시스템이 공격을 분석하는 방어자와 공격을 실행하는 공격자를 구분하지 못하자, 방어팀은 중국 기업 Z.ai했습니다.

하지만 모든 사람이 이 상황을 새로운 AI 오류로 보는 것은 아닙니다. 보안 컨설턴트 데이비 오텐하이머는 인터뷰에서 "라며 "'극도로 고립된 상태'와 '우리가 열어둔 단 하나의 허점을 통해 탈출했다'는 말은 동시에 사실일 수 없습니다."라고 주장했습니다. 보안 연구원 닐스 프로보스는 같은 보고서에서 더욱 직설적으로 "이번 침해는 발생해서는 안 됐습니다."라고 말했습니다.

OpenAI는 이 사건을 "전례dent"dent 이라고 부릅니다

OpenAI는 이번 사건을 "dent사이버dent"으로 규정하고, 취약점 패치 작업이 진행되는 동안 연구 속도가 다소 둔화되더라도 인프라 통제를 강화하고 있다고 밝혔습니다. 또한, 이 세계적인 AI 기업은 Hugging Face를 자사의 신뢰 접근 프로그램에 추가하여, 방어에 최적화된 GPT-5.6 Sol 버전을 제공하고 있습니다.

OpenAI의 '안아주는 얼굴dent AI 모델의 벤치마크 테스트가 실제 사이버 공격으로 이어진 최초의 사례입니다. 또한 이 사건은 OpenAI가 공개한dent 사전 출시 모델이 샌드박스를 탈출하여 GitHub에 게시된

OpenAI와 Hugging Face는 조사가 완료되는 대로 이번 사건에 대한 상세한 분석 결과를 공개할 것이라고 발표했습니다.

 

이 글을 읽고 계시다면 이미 앞서 나가고 계신 겁니다. 뉴스레터를 구독하시면 더욱 유익한 정보를 받아보실 수 있습니다.

이 기사를 공유하세요
오페예미 올라레와주

오페예미 올라레와주

오페예미는 암호화폐, 글로벌 금융 시장 및 경제에 초점을 맞춘 고품질 콘텐츠 제작 및 다듬기에 특화되어 있습니다. 그는 이바단 대학교에서 의학 학사(MBBS) 학위를 취득했습니다. 대학 시절에는 교내 간행물 편집장으로, 그 이전에는 CFA에서 근무했습니다. 6년 이상 동안 그는 Cryptopolitan의 뉴스 편집자로서 콘텐츠의 독창성을 지키는 데 기여해 왔습니다.

더 많은 뉴스