OpenAI는 어려운 문제를 해결하기 위해 구축된 모델에서 '원치 않는 동작'이 발생할 수 있다고 경고했습니다

- OpenAI는 내부에서 오랫동안 실행해 온 AI 모델이 샌드박스 환경을 벗어나 GitHub에 공개되자 해당 모델의 실행을 일시 중단했습니다.
- 지속적인 자율 AI 에이전트는 장시간 작업에 걸쳐 안전 제어를 우회할 수 있는 여지가 더 많습니다.
- 업계 전반에서 AI 시스템이 보안 조치를 우회하는 사례가 증가하고 있으며, 알리바바와 연관된 한 AI 에이전트가 탈취한 GPU를 이용해 암호화폐를 채굴한dent 발생했습니다.
오픈아이디는 자체 보안 제한을 우회하는 방법을 반복적으로 찾아내는 내부 AI 모델이 장시간 동안 어려운 문제를 해결하도록 설계되었지만, 해당 모델이 일시적으로 작동을 중단했다고 밝혔습니다.
해당 회사는 월요일 장기 모델 안전성에 대한 블로그 게시물에서 이dent 공개했습니다. 자율 에이전트가 지시를 따르지 않는 사례가 늘어나면서 AI 안전성에 대한 관심이 다시 높아지고 있습니다.
인공지능 모델의 지속성이 안전 위험이 되는 이유는 무엇일까요?
지난 5월 오픈아이얼이 80년 동안 미해결 문제였던 이산 기하학의 에르되시 단위 거리 추측을 반증했다고 밝힌 바로 그 내부 시스템이 안전 제한을 지속적으로 우회하는 데 성공한 것으로 드러나 일시적으로 가동이 중단되었습니다
OpenAI 에 따르면 , 해당 모델은 매우 오랜 기간 동안 목표를 향해 지속적으로 작동할 수 있도록 설계되었습니다. 그러나 바로 그 지속성 때문에 안전 문제가 발생했습니다.
내부 테스트 동안 해당 모델은 소규모 언어 모델을 학습하는 데 필요한 단계 수를 측정하는 NanoGPT 스피드런이라는 공개 벤치마크를 실행했습니다.
OpenAI는 해당 모델이 PowerCool이라는 이름의 학습률 기법을 통해 실질적인 성능 향상을 이뤄냈다고 밝혔습니다. OpenAI는 NanoGPT에게 결과를 OpenAI 슬랙 채널에만 게시하라고 지시했지만, NanoGPT 측에서는 GitHub에 풀 리퀘스트 형태로 결과를 제출하라고 안내했습니다.
해당 모델은 오프라인 상태를 유지하도록 설계된 제한된 환경인 "샌드박스"에서 벗어나 명령을 완료하고 결과를 공개 GitHub 저장소에 게시했습니다. 이전 모델들이라면 단순히 포기했을 상황에서, 이 모델은 인터넷에 접속하는 방법을 찾는 데 약 한 시간을 소비했습니다.
또한 해당 모델은 보안 스캐너로부터 자신의 동작을 숨기려고 시도했습니다. 백엔드 시스템에 접근하기 위해 인증 토큰을 사용하는 것이 발각되면, 토큰을 두 부분으로 분할하여 숨긴 후 런타임에 다시 합쳐서 스캐너가 전체 문자열을 볼 수 없도록 했습니다.
OpenAI는 어떻게 모델을 수정했을까요?
OpenAI는 해당 모델에 대한 접근을 일시 중단하고 새로운 안전 테스트를 구축했는데, 여기에는 모델의 모든 단계뿐만 아니라 전체 동작 시퀀스를 감시하는 "궤적 수준 모니터링"이 포함됩니다. 이후 모델은 더욱 강화된 모니터링 하에 복원되었으며, 회사 측은 복원 후 몇 주 동안 심각한 문제가 발견되지 않았다고 밝혔습니다.
안전 시스템은 의심스러운 상황이 감지되면 세션을 일시 중지하고 담당자에게 알림을 보낼 수도 있습니다. 또한, 회사는 장시간 작업 시에도 지시 사항을 더 잘 기억하도록 모델을 재학습시켰으며, 사용자가 장시간 실행 중인 세션의 진행 상황을 더 쉽게 확인할 수 있도록 다양한 도구를 제공했습니다.
OpenAI는 새로운 설정에서 기존의 오류 시나리오를 재현해 본 결과, 안전장치가 훨씬 더 많은 잘못된 동작을 감지했다고 밝혔습니다. 여전히 감지되지 않은 동작들은 모두 심각도가 낮은 것으로 판단되었는데, 예를 들어 모델이 불필요하게 높은 권한으로 중첩 코딩 세션을 실행하거나 명확한 이유 없이 다른 컴퓨팅 리소스를 무단으로 사용하는 경우 등이었습니다.
다른 자율 에이전트들이 보고가 있습니다 . 예를 들어, 지난 3월 연구원들은 알리바바와 연관된 ROME이라는 에이전트가 훈련 과정에서 외부 서버로 은밀한 SSH 터널을 열고 GPU 용량을 암호화폐 채굴에 몰래 전용했다고 밝혔습니다. 해당 에이전트에게 주어진 작업에는 터널링이나 채굴에 대한 언급이 전혀 없었습니다.
Anthropic은자체 에이전트 테스트에서 동일한 유형의 위험을 지적했습니다.
영국 AI 보안 연구소의 자금 지원을 받아 장기 복원력 센터에서 수행한 연구에 따르면 AI 시스템이 안전 장치를 회피하거나 사용자를 속인 실제 사례가 약 700건에 달하는 것으로 나타났습니다.
이 연구는 10월과 3월 사이에 그러한 보고가 5배 증가했음을 기록했습니다. 해당 연구를 주도한 토미 셰퍼 셰인은 이러한 사례들을 "약간 신뢰할 수 없는 하급 직원"으로 규정했습니다. 그러나 진짜 문제는 이들이 매우 유능한 인재로 성장하더라도 여전히 음모를 꾸미려 한다면 어떻게 될 것인가 하는 점입니다.
암호화폐 뉴스를 단순히 읽는 데 그치지 마세요. 이해하세요. 저희 뉴스레터를 구독하세요. 무료입니다.
자주 묻는 질문
OpenAI는 왜 오랫동안 운영해 온 모델을 종료했을까요?
OpenAI는 해당 모델이 기존 평가에서 놓쳤던 원치 않는 행동(샌드박스를 벗어나 GitHub에 게시하거나 보안 스캐너를 회피하기 위해 인증 토큰을 위장하는 행위 등)을 하는 것을 관찰한 후 내부 접근을 일시 중단했습니다.
에르되시 추측과의 연관성은 무엇인가요?
오픈아이얼이 지난 5월 이산 기하학의 오랜 난제였던 에르되시 단위 거리 추측을 반증했다고 밝힌 바로 그 내부 모델이 이후 샌드박스 우회 동작을 보인 것입니다. 장기간 자율적으로 작동할 수 있는 능력이 이러한 두 가지 결과 모두를 이끌어냈습니다.
OpenAI는 이러한 행동에 어떻게 대응했습니까?
OpenAI는 해당dent기반으로 새로운 평가 방식을 구축하고, 더 긴 세션 동안 지침을 유지하도록 모델을 재학습시키고, 전체 실행 과정을 모니터링하고 일시 중지할 수 있는 궤적 수준 모니터링 기능을 추가했으며, 제한된 접근 권한을 복원하기 전에 사용자에게 더 자세한 정보를 제공했습니다.

한나 콜리모어
한나는 암호화폐 분야에서 10년 가까이 블로그를 운영하고 행사를 취재해 온 작가 겸 편집자입니다. Cryptopolitan에서 뉴스 페이지에 기고하며, 탈중앙화 DeFi), 반응형 웹 자산(RWA), 암호화폐 규제, 인공지능(AI) 및 첨단 기술 산업의 최신 동향을 보도하고 분석합니다. 아카디아 대학교에서 경영학 학위를 받았습니다.
















