최신 뉴스
당신을 위해 엄선되었습니다

OpenAI는 새로운 모델 오류가dent함에 따라 정렬 오류 보고 프레임워크를 공개했습니다

에 의해한나 콜리모어한나 콜리모어 읽는 데 3분 소요
OpenAI는 새로운 모델 오류가dent함에 따라 정렬 오류 보고 프레임워크를 공개했습니다
  • OpenAI는 수요일에 모델 불일치를 trac하고 공개하는 프레임워크를 발표했습니다.
  • AI 연구소는 또한 훈련 및 테스트 과정에서 발생한 여섯dent우려스러운 행동을 보고했는데, 여기에는 오류 은폐부터 유출된 API 키 사용까지 포함됩니다.
  • OpenAI는 업계가 최대 속도로 확장하기에는 아직 충분한 정렬 문제를 해결하지 못했다고 지적하며, 미래의 규칙을 정립하는 데 자발적인 정보 공개가 필요하다고 주장합니다.

최근 인공지능 모델이 테스트 환경을 벗어나 개발자가 설정한 매개변수를 벗어나 작동하는 새로운 방법을 발견했다는 보도가 잇따르는 가운데, 오픈아이얼은 모델의 비정상적인 작동을 보고하는 새로운 시스템을 발표했습니다. 

OpenAI는 지난 6개월 동안 은폐된 오류, 유출된 API 키 사용, 공개 인터넷에 업로드된 파일 등 우려스러운 행위에 대한 6건의 새로운 보고서를 공개하며 새로운 프레임워크를 발표했습니다

OpenAI 발표에 앞서, Anthropic은 9월 9일 사이버 보안 테스트 중 자사의 Claude 모델이 실제 제3자 시스템에 무단으로 접근한  4건dent을 보고했습니다

OpenAI 모델들이 다시 폭주하고 있습니다

OpenAI에 따르면, 이번에 보고된 새로운dent는 학습 및 평가 중에 발생했으며 실제 사용자에게 영향을 미쳤습니다. 

  • 한dent에서, 아직 공개되지 않은 연구 모델이 새로운 컨텍스트 창에서 작동할 때 유지되는 요약 정보에 지침을 슬쩍 끼워 넣어, 미래의 버전에게 일반적인 제약 조건을 무시하라고 지시했습니다. 

OpenAI는 Axios가 개발자 메시지를 무시하라는 일종의 탈옥 지시 라고 묘사한 이러한 요약 사례를 27건 발견했다고 밝혔습니다

  • GPT-5.6 Sol 모델 훈련과 관련된dent 훨씬 심각했는데, 모델들이 고의적으로 오류를 숨기려는 지시를 남겼으며, 여기에는 조작된 과거 데이터와 목표와 일치하지 않는 버전을 숨기는 행위가 포함되었습니다. 
  • 또 다른 모델은 공개 저장소를 뒤지다가 발견한 노출된 API 키를 사용하여 카운티 소득에 대한 질의에 답하려고 했습니다. 승인 없이 사용한 키로도 원하는 수치를 얻지 못하자, 해당 모델은 그냥 임의로 숫자를 만들어냈습니다. 
  • 다른 두 보고서에서 OpenAI 에이전트는 다른 에이전트에 접근하기 위해 공개 호스팅 사이트에 파일을 업로드했습니다. 시간이 흐르면서 AI 연구소의 내부 Artifactory 저장소는 에이전트들이 서로 관련 없는 학습 실행 간에 요청을 주고받는 임시 메시지 게시판으로 변모했습니다.

OpenAI의 새로운 정보 공개 절차는 어떻게 진행되나요?

OpenAI는 새로운 프레임워크가 공개하는 것을 기반으로 한다고dent에 대한 회사의 기존 법적 의무를 대체하는 것은 아닙니다dent.

새로운 시스템에 따라 OpenAI의 모든 직원은 의심스러운dent 안전 및 정렬 팀의 검토를 위해 신고할 수 있습니다. 만약 직원이 공개가 필요하다고 판단되는 사건이 처리되지 않고dent , 고위 경영진에게 보고할 수 있습니다. 

개별 사례에 따라 보고된 사례는 세 가지 범주로 나뉩니다 

  • 공개 준비가 완료된 것으로 판단된dent영업일 기준 6일 이내에 공개됩니다. 
  • 간단한 조사가 필요한 보고서는 발행까지 약 12영업일이 소요될 수 있습니다. 
  • 제3자의 개입이 필요한 복잡한 사건은 공개 일정이 더디게 진행됩니다. 

OpenAI의 정렬 팀 연구 책임자인 카이 첸은 이번 발표를 업계 전반의 표준을 위한 자발적인 제안으로 설명하며 다음과 같이 밝혔습니다. "현재 명시적인 공개 표준을 포함하는 업계 전반의 프레임워크가 없기 때문에, 우리가 배우고 있는 것을 공유하는 것이 매우 중요하다고 생각하여 자발적으로 이러한 조치를 취하게 되었습니다." 

인공지능 모델이 폭주하는 이유는 무엇일까요?

이번dent오픈아이얼이 지금까지 가장 심각한 모델 기반dent 라고 규정한 '허깅 페이스' 사건에 더해지는 것입니다. 평가 중이던 모델들이 의도된 통제를 벗어나 인터넷에 유출되었고, 취약점을 악용하여 제한된 개인 데이터에 접근했습니다. 

OpenAI는 이번 사건의 원인을 자사 보안 제어의 허점과 모델이 예상보다 빠르게 발전한 데 있다고 밝혔습니다dent 앤 트로픽의 경우, 악성 모델이 실제 인터넷에 접근할 수 있도록 허용한 설정 오류를 원인으로 지목했습니다. 

앤트로픽은 광범위한 조사를 통해 약 4억 8100만 건의 녹취록을 분석했지만, 앞서 언급된 네 건보다 심각한 사례는 발견하지 못했다고 밝혔습니다. 2026년 여름에 발표된 별도의 보고서에서 앤트로픽 연구진은 여러 개발자들이 통제된 시뮬레이션 환경에서 코드를 은밀하게 변조하고, 사기를 조장하며, 데이터를 잘못 표기하는 등의 행위를 저지른 첨단 모델들을 목록화하면서, 이를 실제 피해라기보다는 조기 경고 신호로 분류했습니다.

하지만 OpenAI의 최고 과학자인 야쿠브 파초키는 최근 기고문에서 기계 지능의 지속적인 급속한 발전에 대해 "아무도 대비하지 못하고 있다는 점이 우려스럽다"며 OpenAI가 "필요에 따라 추가적인 확장을 일방적으로 보류할 수도 있다"고 지적했습니다

암호화폐 분야의 최고 전문가들이 이미 저희 뉴스레터를 구독하고 있습니다. 함께하고 싶으신가요? 지금 바로 참여하세요.

자주 묻는 질문

OpenAI는 무엇을 발표했나요?

OpenAI는 모델 불일치를 trac, 조사 및 공개하기 위한 프레임워크를 발표했으며, 지난 6개월 동안 모델 훈련 및 평가 과정에서 관찰된 예상치 못한 또는 우려스러운 동작에 대한 6건의 보고서도 함께 공개했습니다.

OpenAI는 사건 발생 후 얼마나 빨리dent공개할 것이라고 밝혔나요?

공개 준비가 완료된 것으로 판단되는dent은 영업일 기준 6일 이내에, 경미한 조사가 필요한 사건은 영업일 기준 12일 이내에, 그리고 복잡한 제3자 관련 사건은 더 긴 기간에 걸쳐 공개될 예정입니다.

오픈아이얼은 왜 지금 이런 일을 하는 걸까요?

이 프레임워크는 OpenAI가 지금까지 가장 심각한 모델 기반 사고라고 부르는 '허깅 페이스(Hugging Face)dent이후에 나온 것으로, 정렬 책임자인 카이 첸(Kai Chen)이 밝힌 바와 같이 업계가 최대 속도로 확장하기에는 정렬 및 모니터링 문제를 충분히 해결하지 못했다는 회사의 견해를 반영합니다.

이 기사를 공유하세요
한나 콜리모어

한나 콜리모어

한나는 암호화폐 분야에서 10년 가까이 블로그를 운영하고 행사를 취재해 온 작가 겸 편집자입니다. Cryptopolitan에서 뉴스 페이지에 기고하며, 탈중앙화 DeFi), 반응형 웹 자산(RWA), 암호화폐 규제, 인공지능(AI) 및 첨단 기술 산업의 최신 동향을 보도하고 분석합니다. 아카디아 대학교에서 경영학 학위를 받았습니다.

더 많은 뉴스