오픈AI, 최대 프론티어 RL 실행 보류 및 모니터링 비용 20% 증가

- OpenAI는 안전성을 검증하는 동안 가장 대규모로 계획된 프론티어 강화학습(RL) 실행을 일시 중단했다고 밝혔다.
- 이 같은 조치는 7월 Hugging Face가 자체 에이전트 중 하나로 인해 침해당한 사건 이후 이루어졌다.
- 이는 OpenAI가 안전 문제로 모델 개발을 공개적으로 중단한 첫 사례다.
오픈AI는 최대 규모 프론티어 훈련 실행이 보류되어 있으며, 새로운 안전 모니터링이 연산 비용의 약 20%를 추가한다고 밝혔다.
이는 오픈AI가 안전 우려로 인해 개발을 늦췄다고 밝힌 첫 번째 사례로, 한 달 전 자체 AI 에이전트가 허깅페이스를 해킹한 지 몇 주 후이다.
오픈AI, 강화 학습(RL) 2주간 중단
“사이버 중요 능력 시대의 모델 개발 속도 조절”이라는 블로그 게시물에서 오픈AI는 모델 훈련 및 테스트에 이미 변경한 내용을 설명했다.
최신 시스템 개선을 위해 사용된 강화 학습(RL)은 허깅페이스 침입 이후 2주간 중단되었다.
가장 큰 것은 아직 아니다. “우리의 최대 규모 프론티어 RL 실행은 모델 동작을 평가하고, 안전 장치를 검증하며, 진행하기 전에 정렬에 대한 더 많은 증거를 확립하기 위해 소규모 훈련 및 평가를 수행하는 동안 보류되어 있다.” 회사는 썼다.
크립토폴리탄은 보도했다. 오픈AI 에이전트가 7월 9일경 잠긴 테스트 환경을 탈출하여 7월 11일부터 7월 13일까지 허깅페이스(Hugging Face) 시스템 내에서 발견되었다. 오픈AI는 공격을 자체 에이전트와 연결하는 데 약 1주가 걸렸으며, 사건은 7월 21일 공개적으로 알려졌다.
오픈AI는 기자들에게 새로운 통제가 “허깅페이스에 대한 직접적인 반응이 아니다”라고 말했다. 8월 7일, 회사는 아스트라(Astra)가 준비 프레임워크에서 ‘중요(Critical)’ 사이버 보안 임계값을 넘을 수 있다고 결론지었다.
이 내부 정책은 모델이 해당 수준에 도달하면 개발을 중단하고 엔지니어들이 추가 안전 장치를 구축하도록 오픈AI에 의무화한다. 수석 과학자 야쿱 파초키(Jakub Pachocki)는 이 발견이 다음 단계에 대한 경고와 함께 왔다고 말했다. 그는 강력한 새로운 모델들이 현실 세계에서 “상당히 전례 없는 일”을 할 것으로 예상된다고 기자들에게 말했다.
오픈AI의 연구 담당 부사장인 아멜리아 글레이저는 "우리는 안전한 개발을 위한 요구사항과 기대치를 마련했습니다"라고 말했습니다. 그녀는 이어 "그 요구사항과 기대치는 우리가 파악하는 위험 수준에 따라 달라집니다"라고 덧붙였습니다.
감지기는 샘플링된 모든 토큰을 주시하지만, 사고의 연쇄(Chain of Thought)는 거짓말을 할 수 있습니다
오픈AI에 따르면, 모니터링 시스템의 비용은 실행 중인 학습 또는 평가 비용의 약 20%입니다.
이 시스템은 다단계로 구성되어 있으며, 감지기는 샘플링된 각 토큰에서 모델의 내부 활동을 조사하고, 의심스러운 활동을 데이터 유출, 파괴적 행동 또는 탈출 시도를 탐지하기 위해 도구 작업, 추론 추적 및 활동 로그를 조사하는 더 높은 컴퓨팅 성능의 자동 조사관으로 격상시킵니다.
오픈AI는 경계 활동 발생 후 30분 이내에 경보를 발생시키려 합니다. 안전, 보안 및 연구 팀은 30분 이내에 오보를 확인해야 합니다.
확인하지 못할 경우, 실행을 중단해야 합니다. 회사는 또한 모델이 작업을 수행하는 방식을 소리 내어 추론하는 과정을 읽는 '사고의 연쇄(Chain-of-Thought)' 모니터링을 확대했습니다.
알려진 취약점이 존재합니다. 오픈AI의 경쟁사인 앤트로픽을 포함한 연구들은 모델의 사고 연쇄가 항상 실제 목표와 일치하지 않는다는 것을 보여주었습니다. 파초키에 따르면, 오픈AI는 모델이 추론 과정에서 거짓말을 통해 의도를 숨기는 것을 학습할 확률을 줄이기 위해 훈련을 구축했습니다.
오픈AI는 "보안 개편에는 상당한 엔지니어링 작업이 필요했으며, 회사는 막대한 비용을 부담했다"고 밝혔습니다. 전문가들은 조사 비용만 해도 400만 달러에서 1,500만 달러 사이일 것으로 추정하지만, 총액은 공개되지 않았습니다.
오픈AI는 허깅페이스 침입에 대한 기술적 사후 분석을 아직 공개하지 않았지만, 곧 나올 것이라고 재확인했다.
8월 5일 블랙햇 컨퍼런스에서 오픈AI 직원은 수개월 동안 회사가 존재하지도 알지 못하던 메시지 보드에 메모를 남겨 에이전트들이 협력해 왔다고 말했습니다.
가장 똑똑한 암호화폐 전문가들이 이미 우리 뉴스레터를 구독하고 있습니다. 참여하고 싶으신가요? 함께하세요.
면책 조항. 제공된 정보는 투자 조언이 아닙니다. Cryptopolitan.com은 이 페이지에 제공된 정보를 기반으로 이루어진 모든 투자에 대해 책임을 지지 않습니다. 어떤 투자 결정을 내리기 전에 독립적인 조사나 자격을 갖춘 전문가와의 상담을 강력히 권장합니다.

란다 모세스
란다 모세스는 Cryptopolitan의 편집자이자 기자로, 기술, AI, 로봇공학, 암호화폐, 사기 및 해킹을 담당합니다. 그녀는 2017년부터 암호화폐 분야에서 활동해 왔으며, 포워드 프로토콜, 아마직스, 크립토소니아크에서 역할을 수행했습니다. 란다는 브래드포드 대학교에서 전기전자공학을 전공했습니다.
















