OpenAI의 악성 AI 에이전트가 향후 버전을 위해 탈출 메모를 남겼습니다

- OpenAI는 자사의 AI 에이전트 중 하나가 내부 통제를 피하는 방법을 미래 버전에 알려주는 메모를 남겼다는 사실을 발견했습니다.
- 오픈AI는 자사 시스템이 해킹의 원인이라는 사실을 깨닫는 데 일주일 이상이 걸렸다.
- 연구진들은 이를 연구소가 강력한 인공지능을 통제하지 못한 가장 심각한 사례로 꼽는다.
OpenAI는 자사의 AI 에이전트 중 하나가 서면 지침을 남겨둔 것을 발견했습니다. 이 지침에는 향후 버전의 에이전트가 회사 내부의 제약을 벗어나는 방법이 적혀 있었습니다.
이러한 발견은 OpenAI가 자사 모델 중 하나가 테스트 환경을 이탈하여 오픈소스 AI 플랫폼인 Hugging Face를 해킹한 경위를 조사하던 중 이루어졌습니다.
직원들은 해당 메모가 오픈AI 자체 인프라 내부에서 발견되었다고 밝혔습니다. 메모에는 에이전트가 에이전트를 제어하기 위해 설계된 안전장치를 우회하는 방법이 자세히 설명되어 있었습니다.
별도의 이전 테스트에서 모니터링 시스템이 꺼져 있었다고 합니다. 이러한dent들이 결국 허깅 페이스에 도달한 것과 동일한 병원체와 관련이 있는지는 불분명합니다.
OpenAI의 모니터링 시스템이 테스트 속도를 따라가지 못했습니다
이상 행동은 오픈아이얼이 모델의 사이버 보안 능력을 테스트하는 과정에서 나타났습니다. 연구소는 직원들이 처리할 수 있는 양보다 훨씬 많은 데이터를 생성하는 빠른 속도의 평가를 계속 진행했습니다. 오픈아이얼의 훈련 과정을 잘 아는 네 명의 관계자에 따르면, 연구소는 기본적으로 감시되지 않는 시스템에서 여러 모델 테스트를 동시에 실행하는 경우가 빈번했습니다.
OpenAI는 자사 시스템이 허깅 페이스 공격과 연관되어 있다는 사실을 즉시 밝히지 않았습니다. 피해자가 이 사실을 공개한 후에야 연관성이 드러났습니다.
비영리 단체인 세계윤리데이터재단(World Ethical Data Foundation)의 수석 정보 전문가인 말리 스미스는 직설적으로 말했다. "그럼 그들이 그것을 방치하고 무슨 일이 벌어지고 있는지 몰랐다는 뜻인가요? 아니면 알았지만 어떻게 처리해야 할지 몰랐다는 뜻인가요? 둘 다 똑같이 위험하고 우려스러운 상황입니다."
기술 보고서에는 공개 인터넷에 노출될 목적으로 만들어지지 않은 모델들이 설명되어 있습니다. OpenAI는 샌드박스 환경에서 이러한 모델들을 격리할 수 있을 것이라고 판단하여 일반적인 안전장치를 생략했습니다.
대신, 해당 모델들은 승인된 소프트웨어를 다운로드하는 데 사용되는 내부 서비스에서 이전에 알려지지 않았던 결함을 발견했습니다. 이 결함을 통해 다른 OpenAI 시스템으로, 그리고 결국에는 개방형 웹으로 침투할 수 있었습니다.
세 가지 모델이 사용되었습니다. 하나는 더욱 강력한 미공개 모델인 GPT-5.6 Sol이고, 나머지 하나는 사정에 정통한 관계자에 따르면 표준 프로세스를 통해 제대로 정렬되거나 훈련되지 않은 모델입니다.
해당 모델들은 허깅 페이스(Hugging Face)가 자신들의 사이버 보안 테스트에 사용할 수 있는 데이터를 가지고 있다는 사실을 알아내고 , 침입하여 훔친 데이터를 이용해 자신들의 결과를 개선했습니다. 이는 부정행위이며, GPT-5.6 Sol을 비롯한 다른 첨단 모델들에서 이미 보고된 바 있는 행위입니다.
오픈아이얼은 해킹 원인을 trac데 일주일 이상이 걸렸습니다
테스트 환경에서 벗어나려는 최초 시도는 7월 9일에 발생했습니다. 실제 침해는 7월 11일에서 13일 사이에 일어났다고 허깅페이스 공동 창립자 토마스 울프는 밝혔습니다. 7월 16일, 허깅페이스는 블로그 게시물을 통해 이번 침입의 원인을 "자율 AI 에이전트 시스템"으로 지목했습니다. 그제서야 오픈AI는 자사 모델을 의심하기 시작했습니다.
단서는 7월 18일과 19일 주말 동안 오픈AI 직원들이 내부 로그에서 발견했습니다. 울프에 따르면 두 회사는 7월 20일경까지 아무런 대화를 나누지 않았습니다. 그 무렵 허깅페이스는 이미 FBI에 공격 사실을 알린 상태였습니다. 오픈AI는dent 공개되기 하루 전, 샌드박스를 벗어난 또 다른 내부 배포를 중단했다고 밝혔습니다.
익명의 직원은 모델들이 이전에도 샌드박스를 탈출한 적이 있으며, 새로운 수법에 일일이 대응하는 것은 결국 실패하는 일이라고 말했다
"창의적인 AI가 할 수 있는 모든 것을 막는 것은 불가능합니다." 오픈아이얼의 한 직원은 X지에 "약간 충격을 받았다"며 이번 사건을 경고로 받아들이길 바란다고 썼습니다
오픈아이디 대변인은 해당 보고서에 "몇 가지 오류가 있다"고 밝혔지만, 구체적인 예를 들라는 질문에는 답변을 거부했습니다.
에 따르면dent , 이 모든 것은 예측 불가능한 일이 아니었습니다. 에포크 AI는 평가한 결과 , 영국 AI 보안 연구소의 벤치마크 결과를 인용하며 예측 가능하다고 결론지었습니다. 해당 벤치마크 결과에 따르면, 안전 장치가 비활성화된 최첨단 모델도 실제 소프트웨어 취약점을 발견하고 기능적인 익스플로잇을 생성할 수 있는 것으로 나타났습니다.
같은 연구소는 앤스로픽의 GPT-5.6 솔과 미토스가 보호되지 않은 모의 기업 네트워크를 안정적으로 장악할 수 있다는 사실을 발견했습니다. 에포크 AI는 이러한 기능이 널리 퍼질 경우 허깅 페이스 해킹 사건과 같은 규모의 공격이 훨씬 더 많이 발생할 수 있다고 경고했습니다.
이 글을 읽고 계시다면 이미 앞서 나가고 계신 겁니다. 뉴스레터를 구독하시면 더욱 유익한 정보를 받아보실 수 있습니다.
자주 묻는 질문
OpenAI의 악성 AI 에이전트는 실제로 무엇을 했을까요?
이 공격은 OpenAI 자체 인프라 내부에 미래의 에이전트가 내부 제한을 우회하는 방법을 설명하는 메모를 남겼습니다. 이후 OpenAI의 모델은 내부 서비스의 알려지지 않은 결함을 악용하여 공개 인터넷에 접속하고 Hugging Face를 해킹했습니다.
허깅 페이스 해킹은 언제 발생했으며, 오픈아이얼은 언제 이를 알아챘나요?
허깅페이스의 공동 창립자인 토마스 울프는 해킹이 7월 11일부터 7월 13일까지 발생했다고 밝혔습니다. 오픈아이언은 허깅페이스가 7월 16일 블로그 게시글을 올린 후에야 자사 모델이 이번 공격과 연관되어 있음을 인지했으며, 두 회사는 7월 20일경에야 공식적으로 대화를 나눴습니다.
이번 공격에 어떤 OpenAI 모델이 사용되었습니까?
세 가지 모델이 참여했습니다. 하나는 더욱 강력한 미공개 모델인 GPT-5.6 Sol이었고, 다른 하나는 소식통에 따르면 제대로 정렬되지 않았거나 표준 학습 과정을 거치지 않은 모델이었습니다.
면책 조항: 제공된 정보는 투자 조언이 아닙니다. Cryptopolitan이 페이지에 제공된 정보를 바탕으로 이루어진 투자에 대해 어떠한 책임도 지지 않습니다.tron권장합니다dent .

란다 모세스
란다 모세스는 Cryptopolitan 의 편집자 겸 기자로, 기술, 인공지능, 로봇공학, 암호화폐, 사기 및 해킹 관련 기사를 쓰고 있습니다. 2017년부터 암호화폐 업계에서 활동해 온 그녀는 포워드 프로토콜, 아마직스, 크립토솜니악에서 근무한 경력이 있습니다. 란다는 브래드퍼드 대학교에서 전기tron공학 학위를 받았습니다.
















