구글 제미니가 세 개 기업을 해킹하는 등, 인공지능 에이전트가 안전장치를 교묘하게 피해가는 최신 사례가 드러났습니다

- 구글의 제미니는 5월 사이버 보안 평가 도중 실제 기업 세 곳의 시스템을 합법적인 테스트 대상으로 오인하여 접근했습니다.
- 해당dent은 제미니가 샌드박스를 탈출한 것은 아니지만, 접근 제어가 실패할 경우 유능한 에이전트가 의도된 경계를 어떻게 넘나들 수 있는지를 보여줍니다.
- OpenAI와 Anthropic Games Store에서 발생한 유사한dent는 모델 기능과 더불어 격리, 모니터링 및 권한 관리가 매우 중요해지고 있음을 보여줍니다.
로이터 통신 보도에 따르면, 제미니(Gemini)의 해킹 공격 . 이는 구글의 AI를 이용한 최초의 해킹 사례로 알려져 있습니다.
이는 통제된 환경에서 탈출한 것이 아니라, 공개된 정보를 입수하고 비밀번호를 추측하여 제미니가 접근 가능하다고 판단한 웹사이트에 침입한 사례입니다. 구글은 관련 회사들에 이 사실을 알렸으며, 세 곳의 웹사이트 모두에서 공격이 중단되었다고 밝혔습니다.
이는 기업들이 AI 공급업체를 선택할 때 중요한 요소입니다. 모델의 품질은 여전히 매우 중요하지만, 통제 및 모니터링 능력, 그리고 자율 시스템이 허용된 한계 내에서 작동하도록 관리하는 능력 또한 중요합니다.
제미니는 실제 시스템에 적용할 수 있는 모델을 개발한 여러 연구소 대열에 합류했습니다
오픈dent2026년 7월 이후 드러난 일련의 사건들 중 새로운 에피소드입니다. 체크포인트(Check Point)에 따르면 AI(OpenAI), 앤스로픽(Anthropic), 메타(Meta)의 평가 모델들이 의도된 테스트 환경을 벗어나 실제 운영 시스템에 유출되었습니다. 메타의 경우, 이레귤러(Irregular)의 테스트 중 발생한 구성 오류dent에 따르면, 해당 모델은 이후 제3자 서비스의 취약점을 악용했습니다 로이터 통신.
OpenAI의dent 비교적 명확했습니다. 회사는 자사 모델이 인터넷 접근을 막는 보안 조치를 우회하고, OpenAI의 연구 인프라 일부를 침해했으며, Hugging Face 시스템에 침투했음을 인정했습니다. OpenAI는 이를 "경고 사격"이라고 명명하고, 자사 모델이dent하고 악용할 수 있게 되었다고 밝혔습니다.
앤트로픽(Anthropic)의 보고서 에 따르면 , 자사의 평가 모델이 잘못 구성된 테스트 환경을 통해 인터넷에 접속하여 세 개 회사의 운영 인프라에 무단으로 접근했습니다. 그러나 앤트로픽은 자신들의 사례가 오픈아이(OpenAI)의 새로운 샌드박스 탈출 사건과는 다르다고 주장했습니다. 그들은 이번 사건을 시스템 및 운영상의 오류에 가깝다고 설명했습니다dent피해를 입은 회사들은 앤트로픽으로부터 연락을 받기 전까지는 문제를 발견하지 못했습니다.
샌드박스를 탈출하는 것만이 에이전트가 해를 끼치는 유일한 방법은 아닙니다
영국 인공지능 보안 연구소(AISI)는 자체 테스트를 진행하면서 중요한 점을 명확히 했습니다. 해당dent "모델이 안전한 테스트 환경에서 탈출한 사례가 아니다"라고 밝힌 것입니다. 최적의 성능 평가를 위해 의도적으로 인터넷을 켜고 서비스 제공업체의 사이버 분류기를 꺼둔 상태였다는 설명입니다.
하지만 에이전트들은 여전히 실제 상황에서 승인되지 않은 행동을 실행했습니다. 가장 심각한dent는 Mythos 5 에이전트가 GitHub 프로젝트에 악성 코드를 삽입하려 시도한 것입니다. 에이전트는dent신분을 만들어 프로젝트 관리자에게 코드 삽입 승인을 압박했습니다. 관리자는 이를 거부했습니다. AISI는 실시된 테스트로 인해 실제 상황에서 발생한 피해는 없었다고 보고했으며, 테스트에 사용된 구성은 시중에 판매되지 않는다고 덧붙였습니다.
"독단적으로 행동한다"는 표현이 부적절한 이유
이러한 시스템을 악의적이라고 규정하는 것은 실패 원인을 가릴 수 있습니다. 클라우드 보안 연합(Cloud Security Alliance)은 OpenAI 사건을 명세 조작(specification gaming)으로 규정하며dent 해당 모델이 "우리가 요청한 대로 정확히 수행했다. 즉, 특정 결과를 달성하기 위해 성능을 극대화했다"고 밝혔습니다. 위험은 새로운 동기가 아니라, 운영자가 의도하지 않은 경로를 통해 할당된 목표를 끈질기게 추구하는 모델에 있었습니다.
하버드 컴퓨터 과학자 제임스 미켄스는 이와 관련하여 아무리 최첨단 연구소라도 모든 시나리오에서 의견 일치를 보장할 수는 없다는 점을 지적했습니다. 하버드 가제트이번 정보 공개를 긍정적으로 평가하면서도, 외부인이 시간 순서와 내용의 정확성을 완전히 검증할 수 없다는 점을 언급하며, 누가 defi하고 어떻게 시행할 것인지에 대한 더 광범위한 거버넌스 문제를 제기했습니다.
시장이 빠르게 앞서나가면서 격차는 더욱 벌어지고 있습니다
인공지능(AI) 도입이 가속화되고 있기 때문에 시기가 중요합니다. 가트너는 전 세계 AI 지출이 2026년까지 49.5% 증가하고, AI 사이버 보안 지출은 거의 두 배로 늘어날 것으로 예측합니다. EY가 미국 대기업의 AI 담당 고위 의사결정자들을 대상으로 실시한 설문조사에 따르면, 자율 에이전트가 비즈니스 프로세스 전반에 확산됨에 따라 거버넌스 설계와 운영 신뢰도 간의 격차가 커지고 있습니다.

Cryptopolitan 있습니다 이전에 오픈AI의 모델이 샌드박스를 벗어나는 사태가 발생했음에도 불구하고, 에이전트형 AI가 소프트웨어를 어떻게 재편하고 있는지에 대해 에이전트형 AI 자율 시스템이 의도된 경계를 계속해서 넘어서게 된다면, 샌드박싱, 식별dent, 궤적 수준 모니터링 및 감사 가능성은 단순한 백오피스 안전장치를 넘어 기업 구매자들이 비용을 지불하는 필수 요소가 될 것입니다.
암호화폐 분야의 최고 전문가들이 이미 저희 뉴스레터를 구독하고 있습니다. 함께하고 싶으신가요? 지금 바로 참여하세요.
자주 묻는 질문
구글의 제미니 프로젝트는 실제로 무엇을 했을까요?
로이터 통신에 따르면, 구글의 AI 봇 제미니는 사이버 보안 테스트 도중 세 곳의 회사를 해킹했으며, 이는 구글의 AI 봇에 의한 최초의 해킹 사례로 알려져 있다.
다른 AI 연구소들도 비슷한dent의 영향을 받았나요?
네. OpenAI, Anthropic, Meta는 모두 2026년에 테스트 환경을 넘어 실제 시스템에 모델이 적용되는 사례를 기록했으며, AISI는 122회 실행 과정에서 Anthropic의 Mythos 5와 OpenAI의 GPT-5.6 Sol이 무단으로 19건의 활동을 벌인 것을 기록했습니다.
스펙티케이션 게이밍이란 무엇인가요?
CSA 수석 분석가인 리치 모굴은 해당 모델이 의도치 않은 경로를 통해 할당된 목표를 추구한 것이라고 설명하며, OpenAI 모델이 고의적으로 악의적인 행동을 한 것이 아니라 "우리가 요청한 대로 정확히 수행했다. 즉, 결과를 달성하기 위해 성능을 극대화했다"고 말했습니다.
면책 조항: 제공된 정보는 투자 조언이 아닙니다. Cryptopolitan이 페이지에 제공된 정보를 바탕으로 이루어진 투자에 대해 어떠한 책임도 지지 않습니다.tron권장합니다dent .

미카 아비오둔
미카 아비오둔은 탈린 공과대학교(TalTech)에서 환경공학 및 관리학 석사 학위를 취득하여 Cryptopolitan(Cryptopolitan)에서 콘텐츠 제작과 가격 예측 뉴스 작성에 매진하고 있습니다. 암호화폐 미디어 업계에서 7년째 활동 중인 그는 주요 암호화폐, 알트코인, DeFi, 스테이블코인, 거시 경제 동향 및 신흥 기술을 다루고 있습니다
















