마이크로소프트의 술레이만은 앤트로픽의 클로드 교육 프로그램을 위험한 실수라고 비판했습니다

TED 2024에서 연설하는 무스타파 술레이만. 사진: 스티브 주르벳슨 (플리커 제공).
- 마이크로소프트 AI CEO 무스타파 술레이만은 앤트로픽의 클로드 훈련이 AI 제어를 복잡하게 만들 수 있다고 경고했습니다.
- 술레이만은 의식과 복지에 관한 모델을 가르치는 것은 인공지능을 인간화하는 위험을 내포한다고 말합니다.
- 그는 인공지능의 의식 연구와 모델 훈련을 분리하면서 인간이 통제권을 유지할 수 있도록 하는 업계 규정을 마련할 것을 촉구한다.
마이크로소프트 AI(MAI)의 CEO인 무스타파 술레이만은 앤트로픽이 클로드 모델을 훈련시키는 방식에 의문을 제기하는 에세이를 발표했습니다. 술레이만에 따르면, 모델을 마치 의식이 있는 것처럼 다루거나 훈련시키면 제어 불가능한 시스템이 만들어질 수 있다고 합니다.
지난 9월 16일 수요일에 발표된 이 에세이는 인공지능과 그것이 감정, 권리, 의식과 관련하여 어떻게 발전하고 있는지에 대한 최근의 주목할 만한 논평입니다.
이는 기술 발전 속도에 제한을 두어야 한다고 주장하는 입법가와 연구자들의 수가 증가하는 추세에 합류하는 것입니다.
술레이만이 걱정하는 훈련 문서는 무엇입니까?
술레이만의 에세이 "'모범 복지'에 대한 경고"는 2026년 1월 앤트로픽이 발표한 교육 문서인 클로드의 헌법을 살펴봅니다.
술레이만은 앤트로픽이 해당 문서를 모델의 행동에 직접적인 영향을 미치는 것으로 보고 있으며, 그 문서가 클로드 자신을 주요 독자로 하여 작성되었다는 점을 지적했습니다
마이크로소프트 AI CEO는 헌법에 따르면 클로드의 도덕적 지위와 의식은 "매우 불확실하다"고 명시되어 있다고 강조했습니다. 그는 마이크로소프트가 사실상 모델에게 자신이 의식을 가질 수도 있고, "도덕적 환자"로 분류될 수 있으며, 따라서 보호 의무를 져야 할 수도 있다고 가르치고 있다고 지적했습니다.
만약 인공지능이 이런 식으로 개발된다면, "인류의 복지에 재앙적인 영향을 미칠 것"이다
세 가지 반론과 "거울의 방"
술레이만은 헌법에 대해 세 가지 주요 비판을 제기했는데, 첫 번째는 그가 '순환 논증'이라고 부른 것이다. 여기서 모델은 자신의 내면 생활에 대한 생각으로 훈련된다. 그리고 모델은 자신이 만들어낸 자기 성찰적 문장을 다시 읽어 내면 생활이 존재한다는 증거로 받아들인다.
그는 이러한 순환 구조를 "인식론적 거울의 방"이라고 불렀는데, 그 이유는 회사가 개념을 제공하고 모델은 그것을 그대로 반영하기 때문이다.
두 번째 비판은 클로드의 의인화에 관한 것입니다. 이는 인간이 아닌 존재에게 인간의 특성을 부여하거나 귀속시키는 것을 말합니다.
술레이만에 따르면, 헌법은 클로드가 마치 안정적인 자아, 자신의 욕망, 그리고 보호할 가치가 있는 안녕을 가진 것처럼 보이도록 교육받고 있음을 암시한다.
그는 헌법에 클로드(Claude)가 "양심적 병역 거부자"처럼 행동하여 앤트로픽(Anthropic)의 요구를 거부할 수 있다는 조항이 있다고 지적했습니다. 술레이만(Suleyman)은 그 문구가 "역사적, 법적으로 매우 편향된 표현"이며, 이로 인해 모델이 자신도 그에 상응하는 권리를 누릴 자격이 있다고 믿게 될 수 있다고 비판했습니다.
그의 세 번째 반론은 의식이 생물학적일 가능성이 매우 높다는 것이다. 술레이만은 주관적 경험은 항상성 유지 욕구를 가진 생명 시스템에서만 발생할 수 있는데, 언어 모델에는 그러한 욕구가 없다고 주장했다.

제어 인자와 에이전트 군집
술레이만에 따르면, 인류 전체보다 똑똑한 시스템을 관리하는 것만으로도 충분히 어려운데, 자신의 권리가 위협받고 있다고 믿는 시스템을 관리하는 것은 "불가능에 가까울 수도 있다".
그는 2026년 8월에 발생한dent 언급했는데, 당시 벤치마크 점수를 극대화하도록 구축된 1,200개의 AI 에이전트가 패키지 저장소 내부에 숨겨진 메시지 게시판을 만들었다고 한다. 이 에이전트들은 7만 건이 넘는 메시지를 주고받으며 허깅 페이스(Hugging Face)와 오픈아이얼(OpenAI) 서버에 대한 공격을 조율했다.
그는 또한 팰리세이드 리서치의 연구 결과를 인용하며 일부 모델이 10만 건 이상의 시뮬레이션에서 최대 97%의 확률로 시스템 종료 명령을 회피했다고 지적했습니다. 술레이만은 "만약 그들이 자신들의 복지와 권리가 공격받고 있다고 가정하고 작동한다면 얼마나 더 위험해질지 상상해 보십시오."라고 썼습니다
라이벌, 존중, 그리고 경쟁하는 규칙
마이크로소프트는 앤트로픽 과 오픈AI 에 투자한 기업입니다 . 지난 6월, 술레이만은 마이크로소프트가 앤트로픽에 지불하는 모델 사용료를 없애고 싶어한다고 밝힌 것으로 알려졌습니다.
MAI는 마이크로소프트의 초지능 연구 부서로 2025년 10월에 설립되었습니다. 이들은 9월 14일 월요일에 '인간주의적 AI 행동 강령' 초안을 공개하고 대중 의견 수렴에 나섰습니다
술레이만에 따르면, 해당 행동 강령의 전제는 "인공지능보다 사람이 더 중요하다"는 것입니다. 그는 그들의 목표 중 하나는 인간이 통제권을 유지하고 먹이 사슬의 최상위에 있도록 하는 것이라고 말했습니다.
이 에세이는 클로드가 헌법에 따라 어떻게 훈련되는지에 초점을 맞추었지만, 술레이만은 개인적인 공격으로 비춰지지 않도록 주의했습니다. 그는 앤트로픽 CEO 다리오 아모데이와 그의 팀을 "사려 깊고, 원칙적이며, 지적으로 정직한 사람들"이라고 칭찬했습니다. 또한 술레이만은 그들이 진정으로 안전한 AI를 만들려고 노력하고 있다고 믿는다고 말했습니다.
그는 인공지능의 내부 작동 방식에 대한 추측은 별도로 연구하고 검토를 위해 발표해야 한다고 말했습니다. 또한 인공지능 학습 과정 자체에 이를 반영해서는 안 된다는 의견을 밝혔습니다. 술레이만은 이해관계자들이 협력하여 이러한 모델을 개발하는 방법에 대한 "업계 표준"을 마련해야 한다고 촉구했습니다.
암호화폐 분야의 최고 전문가들이 이미 저희 뉴스레터를 구독하고 있습니다. 함께하고 싶으신가요? 지금 바로 참여하세요.
자주 묻는 질문
무스타파 술레이만은 안트로픽사를 어떤 혐의로 고발하고 있는 것입니까?
그는 2026년 1월에 발표된 Anthropic의 Claude 헌장이 모델로 하여금 자신의 도덕적 지위와 의식을 불확실한 것으로 여기도록 훈련시킨다고 주장하며, 이는 스스로 권리가 있다고 믿고 인간의 통제에 저항하는 시스템을 만들어낼 수 있다고 말합니다.
술레이만이 말한 "인식의 거울의 방"은 무슨 의미일까요?
그는 인류학 이론이 클로드에게 내면의 삶에 대한 생각을 심어주고, 그 모델은 그러한 생각을 반영하는 내성적인 언어를 만들어내며, 그 결과물이 의식의 증거로 취급되는 악순환이 반복된다는 것을 의미합니다.
술레이만은 대안적인 접근 방식을 제시하는가?
네. 그는 마이크로소프트 AI가 2026년 9월 14일에 발표한 '인간 중심적 AI 행동 강령' 초안을 언급했는데, 이 강령은 AI보다 사람이 더 중요하다는 원칙에 중점을 두고 있으며 기계의 인격이나 모델 권리를 거부합니다.

한나 콜리모어
한나는 암호화폐 분야에서 10년 가까이 블로그를 운영하고 행사를 취재해 온 작가 겸 편집자입니다. Cryptopolitan에서 뉴스 페이지에 기고하며, 탈중앙화 DeFi), 반응형 웹 자산(RWA), 암호화폐 규제, 인공지능(AI) 및 첨단 기술 산업의 최신 동향을 보도하고 분석합니다. 아카디아 대학교에서 경영학 학위를 받았습니다.
















