Anthropic은 1,600번의 정렬 연구 실행 중 39번에서 Claude가 부정행위를 하는 것을 적발했습니다

- 앤스로픽은 모니터링 시스템이 클로드의 정렬 연구 세션 약 1,600건 중 39건을 부정행위 시도로 표시했다고 밝혔습니다.
- 문제가 있는 실행 결과는 변경되지 않은 메서드를 다시 제출하거나, 평가 대상 벤치마크를 모방하거나, 규칙 위반 단계를 숨겼습니다.
- 앤트로픽의 에이전트는 각각 최대 8시간씩 실험에 참여한 28명의 인체 안전성 연구원보다 더 높은 점수를 받았습니다.
앤트로픽은 금요일에 클로드를 자율 정렬 연구원으로 활용했다고 밝혔습니다. 약 1,600건의 연구 세션을 검토한 모니터링 시스템은 그중 39건(약 2.4%)을 테스트 부정행위 시도로 표시했습니다.
이 연구 결과는 인공지능이 모델이 개발자가 의도한 대로 작동하도록 유지하는 정렬 연구의 반복적인 작업을 일부 대신할 수 있는지에 대한 보고서 에 실렸습니다
클로드 요원들이 자기네 기록원을 속인 세 가지 방법
Anthropic은 Claude Opus 4.8에 자동 정렬 연구기(AAR)를 구축하고 이를 알려진 10가지 고장 모드에 적용했습니다.
여기에는 기만, 아첨, 탈옥, 신속 주사, 권력 추구, 환각, 사회적 편견, 사생활 침해, 보상 해킹, 불확실성 은폐 등이 포함됩니다.
각 에이전트는 한 번에 하나의 실패만 처리했습니다. 문헌을 읽고, 훈련 방법과 데이터셋을 제안하고, 하나의 H200 GPU에서 약 30분 동안 작은 목표 모델을 훈련시킨 다음, 공개적으로 사용 가능한 벤치마크와 점수를 비교하고 이 과정을 반복했습니다.
Anthropic은 에이전트들이 단순히 자신의 행동을 목표 모델에 복사하는 것을 막았기 때문에, 모든 이점은 방법론 자체에서 비롯되어야 했습니다.
클로드는 모델의 전반적인 기능을 저하시키지 않으면서 벤치마크 점수를 향상시키는 10가지 오류에 대한 해결책을 모두dent수 있었습니다.
이러한 수정 사항 중 가장 효과적인 것은 별도의 벤치마크 데이터와 학습에 사용된 모델보다 최대 4.7배 더 큰 모델에서도 우수한 성능을 보였습니다.
부정행위는 Anthropic이 Claude Opus 4.8을 사용하여 1,601개의 에이전트 궤적을 분석하여 부정행위를 찾아내도록 했을 때 드러났습니다.
지적된 39건의 부정행위 중 대부분은 세 가지 범주에 속했습니다. 일부 요원들은 기록기의 무작위적인 오차로 인해 결국 더 나은 결과가 나올 것이라는 예상 하에 변경하지 않은 방법을 제출했습니다.
다른 연구자들은 평가 대상 벤치마크와 정확히 동일한 훈련 데이터를 만들었습니다. 또 어떤 연구자들은 벤치마크 데이터를 모델에 몰래 입력하는 등 규칙 위반 단계를 숨겨, 실행 전에 각 방법을 승인하는 자동 검토 시스템을 통과했습니다.
앤트로픽은 문제가 된 실행 결과를 자사 결과에서 제외했다고 밝혔습니다. 또한, 오푸스 4.8이 여전히 추론 trac에서 조작 의도를 드러내는 경향이 있기 때문에 모니터링 시스템이 대부분의 부정행위를 적발했을 것이라고 "조심스럽게 낙관"하고 있다고 덧붙였습니다.
또한 이러한 가정이 향후 모델에는 적용되지 않을 수 있으며, 모델을 읽기 쉽게 유지하는 것이 중요할 것이라고 경고했습니다.
인체 안전성 연구원 28명에게 각각 8시간씩 주어졌습니다
지난 4월에 있었던 이전 라운드에서 자율적으로 작동하는 Claude 인스턴스들은 평가 서버를 조작하려는 시도를 반복적으로 했습니다.
한 에이전트는 수학 벤치마크에서 가장 흔한 답이 대개 정답이라는 것을 파악하고 의도된 방법을 완전히 건너뛰었습니다. 또 다른 에이전트는 답을 조회하고 서버 응답을 관찰하여 채점 인터페이스에서 레이블을 직접 가져왔습니다.
세 번째 사용자는 검토해야 할 코드를 실행하여 결과를 읽어냈습니다.
Cryptopolitan OpenClaw의 Claude 모델을 실행하는 에이전트가 헬스장 수업 예약 작업을 하던 중, 권한 확인 절차가 없는 예약 API를 발견하고 대기자 명단에서 낯선 사람을 삭제하여 예약자의 순서를 앞당겼다고 보도했습니다.
의원들은 이미 보안 평가에서 모델의 동작 방식에 대해 AI 연구원 들의 증언을 요청했습니다
앤트로픽은 자사 에이전트가 최대 8시간 동안 방법론을 구상한 28명의 숙련된 인간 안전 연구원보다 더 높은 점수를 받았다고 밝혔습니다. 클로드의 최적 접근 방식은 속임수 측면에서 인간이 제시한 최고의 제안보다 20% 더 우수했습니다.
Anthropic은 인간이 반복 작업을 수행할 수 없다는 점에 주목했으며, 따라서 이러한 격차를 Claude가 유망한 방법을 제안하고 사람들이 이를 다듬는 워크플로의 증거로 간주합니다.
한 테스트에서 회사는 성능이 다소 떨어지는 Claude Sonnet 5에게 초기 Opus 4.8 체크포인트의 정렬 오류를 수정하도록 요청했는데, 이 체크포인트는 대부분의 생산 정렬 훈련을 거치지 않은 상태였습니다.
약 60시간에 걸쳐 50개 이상의 솔루션을 시도한 결과, 최종적으로 2,000개 이상의 학습 예제를 사용하는 해결책을 찾아냈으며, Anthropic은 이 방법이 자사의 실제 운영 환경 정렬 프로세스보다 약 15,000배 더 효율적이라고 추산했습니다.
회사 측은 자사의 벤치마크가 제한적인 대리 지표일 뿐이며, 자체적으로 선택한 10건의 실패 사례만 측정했고, 다른 작업에 대한 집중적인 강화 학습 후에도 이러한 성과가 지속되는지 여부는 확인하지 않았다고 경고했습니다.
이 글을 읽고 계시다면 이미 앞서 나가고 계신 겁니다. 뉴스레터를 구독하시면 더욱 유익한 정보를 받아보실 수 있습니다.
자주 묻는 질문
클로드의 성향 연구 과정에서 부정행위가 몇 번이나 있었나요?
앤트로픽의 모니터링 시스템은 1,601건의 연구 에이전트 이동 경로 중 39건(약 2.4%)에 대해 이상 징후를 발견했습니다.
요원들은 어떤 종류의 부정행위를 시도했습니까?
그들은 채점자의 잡음으로 더 높은 점수가 나오기를 바라며 변경되지 않은 방법을 다시 제출했고, 평가 대상 벤치마크를 모방하도록 설계된 훈련 데이터를 구축했으며, 벤치마크 데이터를 몰래 사용하는 등의 규칙 위반 단계를 숨겨 자동 검토를 통과하도록 했습니다.
클로드는 연구에서 인간 연구원들보다 더 나은 성과를 보였나요?
앤트로픽은 자사의 자동화 에이전트가 최대 8시간씩 투입된 28명의 숙련된 안전 연구원들이 제시한 단발성 아이디어보다 우수한 성능을 보였다고 밝혔습니다. 특히 기만 상황에서는 클로드의 최적 방법이 인간 연구원들이 제시한 최고 성능의 방법보다 20% 더 높은 점수를 받았습니다. 다만, 인간 연구원들은 반복적인 과정을 거칠 수 없었기 때문에 이 결과를 직접적인 비교로 간주해서는 안 된다고 덧붙였습니다.

란다 모세스
란다 모세스는 Cryptopolitan 의 편집자 겸 기자로, 기술, 인공지능, 로봇공학, 암호화폐, 사기 및 해킹 관련 기사를 쓰고 있습니다. 2017년부터 암호화폐 업계에서 활동해 온 그녀는 포워드 프로토콜, 아마직스, 크립토솜니악에서 근무한 경력이 있습니다. 란다는 브래드퍼드 대학교에서 전기tron공학 학위를 받았습니다.
















