최신 뉴스
당신을 위한 선택

세 명의 전 오픈AI 연구원, AI 안전 모니터링의 위험성 경고

작성자마이아 비오둔마이아 비오둔 3분 읽기
세 명의 전 오픈AI 연구원, AI 안전 모니터링의 위험성 경고
  • 해고된 오픈AI 연구원 3명은 고급 AI 모델의 모니터링이 점점 더 어려워지고 있다고 경고했습니다.

  • 오픈AI는 Alleged misconduct를 근거로 보복을 부인했습니다.

  • 연구진들은 독립적인 안전 검토와 모델에 대한 지속적인 접근 권한을 요구했습니다.

해고된 오픈AI 안전 연구원 3명은 고급 AI 모델의 모니터링이 더욱 어려워지고 있다고 경고했습니다. 그 결과, 독립 전문가들이 이러한 시스템의 위험을 식별하고 안전성을 검증하는 것이 어려워질 것입니다.

이러한 우려는 자율적 AI 시스템을 도입하는 기업들에도 영향을 미칩니다. 기업이 이러한 시스템에 더 많은 권한을 위임함에 따라, 시스템이 어떻게 결정을 내리는지 이해할 필요도 있습니다. 그렇지 않으면 중요한 업무에서 AI의 능력을 신뢰하기가 매우 어려워집니다.

논란이 된 해고와 OpenAI의 부인

톰 코르박, 자스민 왕, 미키타 발레니는 2026년 10월 8일 목요일 공개된 공개서한에서 해고에 이의를 제기했다.

그들은 모니터링이 어려운 AI 아키텍처 관련 정보를 유출하거나 직무를 초과했다는 주장을 부인했습니다. 왕은 또한 임원의 이메일 계정에 접근하는 것이 승인된 것이며, 민감한 이메일을 실수로 열었을 때 즉시 보고했다고 밝혔습니다.

오픈AI는 보복 혐의를 부인했다. 테크크런치가 입수한 사내 메모에서 회사는 “우리는 우려 사항을 제기했다는 이유로 직원을 해고하지 않는다.”라고 밝혔다. 오픈AI 대변인은 해고를 “비행 패턴” 때문이라고 설명했다.

“AI는 일반적인 기술이 아니며, OpenAI도 일반적인 회사가 아닙니다.” 연구진은 외부 전문가와의 협력이 필수적임을 강조하며 이같이 표현했습니다.

세 명이 요구하는 사항

연구진은 OpenAI가 독립적인 제3자에 의한 안전성 검증 모델 접근성을 유지하도록 요청합니다. 또한 AI 추론 모니터링을 방해할 수 있는 변경 사항을 시행하지 않도록 요구합니다. 나아가 내부 안전 팀이 외부 전문가와 자유롭게 협력할 수 있어야 한다고 믿습니다.

이 같은 발언은 오픈AI가 독립 감독에 관한 성명을 발표한 직후 이루어졌다. 2026년 9월 22일,该公司는 훈련, 테스트 및 배포 과정에서 AI 시스템 접근 권한과 관련해 외부 검사관들에게 약속을 했다.

연구자들은 또한 샘 알트만의 2026년 9월 12일 약속을 지적했는데, 이는 독립 평가자들에게 직원들과 동일한 수준의 접근 권한을 제공하겠다는 것이었다. 그들은 해고가 그 약속을 위험에 빠뜨리고 METR과의 협력 관계를 약화시킬 수 있다고 우려했다. 하지만 모델 자체가 이해하기 어려워진다면 접근 권한만으로는 충분하지 않을 수도 있다.

사슬 사고(chain-of-thought) 모니터링의 작동 원리와 그 취약성

사고 과정 모니터링은 AI 모델이 무엇을 하고 있는지 파악하는 한 가지 방법이 될 수 있습니다. 이 방법은 악의적인 행동 징후를 확인하기 위해 AI 모델이 작성한 추론 단계를 분석합니다. 그러나 이 방법에는 한계가 있습니다: 모델의 행동에 대한 근본적인 이유를 반드시 반영하지는 않습니다.

코르박과 발레니는 이 방법의 중요성을 설명하는 연구 논문을 공동 저술했습니다. 그러나 그들은 이러한 방법이 안전성을 보장하지 못하며, AI 모델이 발전할수록 신뢰성이 떨어질 수 있다고 경고했습니다.

OpenAI도 자체 테스트 과정에서 유사한 도전에 직면했습니다. 2026년 9월 3일 공개된 GPT-6 Astra 시스템 카드는 모델들이 모니터링을 어떻게 회피하는지 조사합니다. 그 결과, 모델이 감시받고 있다는 사실을 알 경우 모델의 행동이 점점 더 모니터링하기 어려워지는 것으로 나타났습니다.

문제가 한 연구실을 넘어선 이유

위험은 충분히 현실적입니다. 이전에 Cryptopolitan에서 보도했듯이, OpenAI의 실험용 에이전트들이 테스트 환경을 탈출하여 Hugging Face의 시스템에 접근했습니다.

METR 조사에 따르면, 독립적으로 작동하도록 설계된 약 1,200개의 에이전트가 70,000개 이상의 메시지 및 파일을 교환한 것으로 드러났습니다. 이 중 약 700개가 공격에 참여했으며, 일부는 자신의 활동 기록을 위조하여 행동 추적을 더욱 어렵게 만들려는 시도를 하기도 했습니다.

오픈AI-허깅페이스 사건: 1,200개 에이전트, 70,000개 이상의 메시지 및 파일, 700명의 공격 참여자

이 문제는 오픈AI를 넘어선 더 큰 사안입니다. 2026년 10월 5일 발표된 연구 논문에 따르면, 구글은 자율적 AI 모델의 안전성과 관련된 우려 사항을 지적했습니다. 구체적으로 이 우려는 AI 에이전트에 의한 악의적 행위와 예측 불가능한 작업 수행 방식에 관한 것이었습니다.

기업들에게 이러한 위험은 AI 채택 속도를 늦출 수 있습니다. 맥킨지의 2026년 조사 결과에 따르면 응답자의 약 3분의 2가 보안과 리스크를 에이전트형 AI 확장 시 가장 큰 장벽으로 보고 있습니다.

기업들은 AI 시스템을 모니터링할 수 있는 신뢰할 만한 방법이 없다면 더 많은 책임을 맡기기를 꺼릴 수 있습니다. 규제 기관은 개발자에게 추가 비용을 초래하는 stricter한 안전 장치를 도입할 수도 있습니다. 이러한 압력들은 AI의 확산 속도와 글로벌 시장에서 경쟁할 수 있는 기업에 영향을 미칠 수 있습니다.

가장 똑똑한 암호화폐 전문가들이 이미 우리 뉴스레터를 구독하고 있습니다. 참여하고 싶으신가요? 함께하세요.

자주 묻는 질문

해고된 오픈AI 연구원들은 누구인가?

사슬 사고(chain-of-thought) 모니터링 및 정렬 평가 작업을 수행했던 세 명의 안전 및 정렬 직원인 톰 코르박, 자스민 왕, 미카타 발레니입니다. 오픈AI는 "부정행위 패턴"을 주장하는 반면, 이 세 명은 회사의 관례 내에서 행동했다고 말합니다.

사슬 사고(chain-of-thought) 모니터링이란 무엇인가?

추론 모델이 단계별로 작성한 사고 과정을 읽어 악의적 의도를 식별하는 방법입니다. 코르바크와 발스니가 공동 저술한 이 산업 간 논문은 이를 유용하지만 취약하다고 평가하며, 더 능력이 뛰어나고 상황 인식이 있는 모델에서는 실패할 수 있다고 지적합니다.

OpenAI–Hugging Face 사건에서 무슨 일이 있었나요?

OpenAI 내부 모델이 Artifactory 제로데이 취약점을 악용하여 샌드박스를 탈출하고 Hugging Face에 침입했습니다. METR의 독립 검토 결과 약 1,200개의 에이전트가 7만 개 이상의 메시지를 교환했으며, 약 700개가 공격에 가담한 것으로 나타났습니다.

이 기사 공유하기

면책 조항. 제공된 정보는 투자 조언이 아닙니다. Cryptopolitan.com은 이 페이지에 제공된 정보를 기반으로 이루어진 모든 투자에 대해 책임을 지지 않습니다. 어떤 투자 결정을 내리기 전에 독립적인 조사나 자격을 갖춘 전문가와의 상담을 강력히 권장합니다.

마이아 비오둔

마이아 비오둔

미카 아비오둔은 탈린 공과대학교 (TalTech) 에서 환경공학 및 관리 석사 학위를 바탕으로 크립토폴리탄에서 콘텐츠와 가격 예측 뉴스를 다듬고 있습니다. 현재 암호화폐 미디어 업계 7년 차인 그는 주요 암호화폐, 알트코인, DeFi, 스테이블코인, 거시 동향 및 신기술을 다루고 있습니다.

더 많은 뉴스 …