OpenAI는 최대 규모의 첨단 강화 학습(RL) 프로젝트를 일시 중단하고 모니터링 비용을 20% 추가했습니다

- OpenAI는 자사가 계획 중인 최대 규모의 강화 학습(RL) 테스트를 안전성 검증을 위해 일시 중단했다고 밝혔습니다.
- 이러한 속도 저하는 지난 7월 허깅페이스(Hugging Face)의 자체 요원 중 한 명이 저지른 보안 침해 사건 이후에 나타난 것입니다.
- 오픈AI가 안전성을 이유로 모델 개발을 공개적으로 제한한 것은 이번이 처음입니다.
OpenAI는 예정된 최대 규모의 프론티어 학습 실행이 여전히 보류 중이며, 새로운 안전 모니터링으로 인해 계산량이 약 20% 증가한다고 밝혔습니다.
오픈AI가 안전 문제로 개발 속도를 늦췄다고 밝힌 것은 이번이 처음이며, 이는 자사 AI 에이전트 중 하나가 허깅 페이스를 해킹한 지 몇 주 만에 나온 조치입니다.
OpenAI는 2주 동안 강화 학습(RL)을 중단했습니다
OpenAI는 "사이버 보안에 필수적인 역량 시대의 모델 개발 속도 조절"이라는 제목의 블로그 게시물에서 모델 학습 및 테스트에 이미 적용한 변경 사항을 설명했습니다.
최근 시스템 개선에 사용되던 강화 학습(RL)은 허깅 페이스(Hugging Face) 유출 사건 이후 2주간 중단되었습니다.
가장 큰 규모의 프로젝트는 아직 진행되지 않았습니다. 회사 측은 "모델 동작을 평가하고, 안전장치를 검증하며, 진행하기 전에 정렬에 대한 더 많은 증거를 확보하기 위해 소규모 훈련 및 평가를 수행하는 동안 계획된 최대 규모의 프론티어 RL 실행은 보류 중입니다." 라고 밝혔습니다.
Cryptopolitan 보도 했습니다. 오픈아이얼은 공격이 자사 에이전트와 연관되어 있음을 파악하는 데 약 일주일이 걸렸으며, 해당dent 7월 21일에 공개되었습니다.
OpenAI는 기자들에게 새로운 보안 조치가 "허깅 페이스(Hugging Face)에 대한 직접적인 대응책은 아니다"라고 밝혔습니다. 앞서 8월 7일, OpenAI는 아스트라(Astra)가 자사의 대비 체계에서 "심각" 단계의 사이버 보안 기준을 넘어섰을 가능성이 있다고 결론지었습니다.
오픈아이디어의 내부 정책에 따라 모델이 해당 수준에 도달하면 개발을 중단하여 엔지니어들이 추가적인 안전장치를 구축할 수 있도록 합니다. 수석 과학자 야쿠브 파초키는 이번 발견이 앞으로 일어날 일에 대한 경고라고 말했습니다. 그는 기자들에게 강력한 새 모델들이 "실제 세계에서dent일들을 해낼 것"이라고 예상했습니다
OpenAI의 연구 담당 부사장인 아멜리아 글래즈는 "안전한 개발을 위한 요구사항과 기대치를 마련해 두었습니다."라고 말하며, "이러한 요구사항과 기대치는 우리가 파악한 위험 수준에 따라 달라집니다."라고 덧붙였습니다
탐지기는 샘플링된 모든 토큰을 감시하지만, 사고의 흐름은 거짓일 수 있습니다
OpenAI에 따르면 모니터링 시스템은 학습이나 평가에 소요되는 비용의 약 20%를 차지합니다.
이는 다단계 방식으로 진행되며, 탐지기는 샘플링된 각 토큰에서 모델의 내부 활동을 조사하고 의심스러운 사항이 발견되면 상위 컴퓨팅 환경의 자동화된 조사관에게 보고합니다. 이 조사관은 도구의 동작, 추론 trac, 활동 로그를 분석하여 데이터 도용, 파괴적인 행위 또는 탈출 시도를 탐지합니다.
OpenAI는 위험 활동이 감지되면 30분 안에 경보를 발령하려고 합니다. 안전, 보안 및 연구팀에게는 오경보 여부를 판단할 수 있는 30분의 시간이 주어집니다.
만약 그렇게 할 수 없다면 실행을 중단해야 합니다. 또한 이 회사는 모델이 작업을 수행하는 과정을 소리 내어 읽는 "사고 과정" 모니터링 기능을 확장했습니다.
알려진 취약점이 있습니다. 오픈AI의 경쟁사인 앤트로픽을 포함한 여러 연구 결과에 따르면 모델의 사고 과정이 항상 실제 목표와 일치하는 것은 아닙니다. 파초키는 오픈AI가 모델이 추론 과정에서 거짓을 학습하여 의도를 숨길 가능성을 줄이도록 훈련 시스템을 설계했다고 밝혔습니다.
오픈아이(OpenAI)는 보안 시스템 개편에 "상당한 엔지니어링 작업이 필요했고, 막대한 비용이 소요됐다"고 밝혔습니다. 전문가들은 조사 비용만 해도 400만 달러에서 1500만 달러에 달할 것으로 추정했지만, 총액은 공개되지 않았습니다.
OpenAI는 허깅 페이스 해킹 사건 에 대한 기술적 사후 분석 보고서를 아직 발표하지 않았지만 , "곧" 발표할 것이라고 재차 강조했습니다.
8월 5일 블랙햇 컨퍼런스에서 오픈AI 직원들은 자사 에이전트들이 회사 측에서 존재조차 몰랐던 메시지 게시판에 메모를 남기는 방식으로 수개월 동안 협력해왔다고 밝혔습니다.
이 글을 읽고 계시다면 이미 앞서 나가고 계신 겁니다. 뉴스레터를 구독하시면 더욱 유익한 정보를 받아보실 수 있습니다.
면책 조항: 제공된 정보는 투자 조언이 아닙니다. Cryptopolitan이 페이지에 제공된 정보를 바탕으로 이루어진 투자에 대해 어떠한 책임도 지지 않습니다.tron권장합니다dent .

란다 모세스
란다 모세스는 Cryptopolitan 의 편집자 겸 기자로, 기술, 인공지능, 로봇공학, 암호화폐, 사기 및 해킹 관련 기사를 쓰고 있습니다. 2017년부터 암호화폐 업계에서 활동해 온 그녀는 포워드 프로토콜, 아마직스, 크립토솜니악에서 근무한 경력이 있습니다. 란다는 브래드퍼드 대학교에서 전기tron공학 학위를 받았습니다.
















