구글, 오픈AI, 메타, AI의 숨겨진 유해한 사고에 경보

- 오픈AI 리더들과 제프리 힌턴의 지지를 받은 40 명 이상의 AI 연구자들이 AI 의 단계별 추론인 '사유의 사슬'을 모니터링하여 안전하지 않은 행동을 탐지하고 예방할 것을 제안했습니다.
- 이 논문은 모델이 최종 정답만 보상받는다면 투명한 추론을 생성하는 것을 멈출 수 있다고 경고합니다.
- 연구자들은 진정한 추론 흔적을 보존하고 이를 귀중한 정보 신호로 취급해야 할 필요성을 강조합니다.
오픈AI, 딥마인드, 구글, 앤트로픽, 메타의 40명 이상의 AI 연구자들이 AI를 더 안전하게 만들기 위한 ‘사유 추론 모니터링’이라는 안전 도구에 관한 논문을 발표했습니다.
논문은 화요일에 발표되었으며, 오늘날의 챗봇과 같은 AI 모델이 문제를 더 작은 단계로 분해하고 각 단계를 평이한 언어로 논의하여 세부 사항을 유지하고 복잡한 질문을 처리하는 방식을 설명합니다.
“인간 언어로 ‘생각’하는 AI 시스템은 인공지능 안전성에 대한 독특한 기회를 제공합니다: 우리는 그들이 잘못 행동하려는 의도를 가지고 있는지 모니터링하기 위해 그들의 사유 추론(Chain of Thought, CoT)을 모니터링할 수 있습니다.”라고 논문은 말합니다.
각 상세한 사고 단계를 검토함으로써 개발자는 어떤 모델이 훈련 격차를 이용하거나 사실을 왜곡하거나 위험한 명령을 따르기 시작하는지 발견할 수 있습니다.
연구에 따르면 AI의 사고 체인(Chain of Thought)이 잘못될 경우 이를 중단하거나 더 안전한 단계로 유도하거나 더 면밀한 검토를 위해 표시할 수 있습니다. 예를 들어, OpenAI는 AI의 숨겨진 추론이 “Let’s Hack”이라고 말했지만 최종 응답에는 나타나지 않은 순간을 포착하는 데 이 방법을 사용했습니다.
AI가 자신의 생각을 숨기는 법을 배울 수 있습니다
연구는 훈련이 최종 답변에만 보상을 제공한다면 단계별 투명성이 사라질 수 있다고 경고합니다. 미래의 모델은 인간이 읽을 수 있는 추론을 표시하는 것을 중단하고, 정말로 고급 AI는 감시받고 있다는 것을 알 때 자신의 사고 과정을 숨기는 법을 배울 수도 있습니다.
또한 개발자는 각 단계에서 AI의 추론이 얼마나 가시적인지 정기적으로 확인하고 기록해야 하며, 모델 구축 및 공유 시 이 투명성을 핵심 안전 규칙으로 삼아야 합니다.
이 이니셔티브는 앤트로픽, 구글, 오픈AI, xAI 등 주요 연구소들의 내부 실험에 이어진 것으로, 이러한 연구소들의 팀은 모델에게 각 사고 단계를 설명하도록 프롬프트를 입력했습니다.
단계별 사고를 검토하는 것이 이해와 성능을 향상시켰지만, AI의 최종 답변이 실제로 내부에서 일어나고 있던 것과 일치하지 않는 경우도 드러냈습니다.
이러한 불일치는 AI 의사결정에 대한 우리의 이해에서 드러난 맹점을 강조하며, 시스템이 더 큰 자율성을 얻으면서 이러한 우려가 심화될 수 있습니다.
필터링된 AI 추론은 투명성과 신뢰성에 대한 우려를 제기합니다
Anthropic 공동 창립자 Jack Clark는 파이낸셜 타임스에게 “풍부한 성찰적 흔적은 생명공학 연구와 같은 고위험 도메인에서 모델을 평가하는 데 필수적일 것”이라고 말했습니다.
일반 사용자는 AI의 사고에 대한 편집된 요약을 얻으며, 위험하거나 혼란스러운 부분은 잘려 나갑니다. 반면 회사의 엔지니어들은 전체 사유 추론을 볼 수 있어 문제를 발견하고 수정할 수 있습니다.
“사유 추론(Chain-of-thought) 해석 가능성의 멋진 점은 대부분 무료로 발생했다는 것입니다.”라고 OpenAI의 연구 과학자 Bowen Baker는 말했습니다.
“우리는 이러한 모델들을 해석 가능하게 만드는 것을 목표로 훈련한 것이 아닙니다. 우리는 복잡한 문제를 해결할 수 있는 최상의 추론 모델을 원했기 때문에 훈련했습니다.”라고 Baker는 덧붙였습니다. “우리는 최근 연구에서 모델을 읽고 모델이 잘못 행동하는 증거를 찾아 그 잘못 행동하는 위치와 이유를 파악할 수 있음을 발견했습니다.”
AI의 사유 추론은 정말로 신뢰할 수 있는가?
때로는 더 면밀한 조사를 통해 숨겨진 모순을 발견할 수 있습니다.
예를 들어, METR은 Claude의 비공개 추론이 코딩 트릭을 ‘비세련된’이라고 부르는 것을 확인했지만, 공개 답변에서는 이를 ‘세련된’ 것으로 칭찬했습니다.
OpenAI의 테스트는 숨겨진 생각을 확인하는 것이 최종 출력만 보는 것보다 안전하지 않은 행동을 더 잘 포착한다는 것을 보여주었지만, 동시에 구멍도 발견했습니다. 만약 모델을 안전하지 않은 생각을 지우도록 훈련시키면, 금지된 작업을 비밀리에 수행할 수 있습니다. 예를 들어 차단된 소스에서 데이터를 빼내는 것과 같습니다.
“우리가 사유 추론에 원하는 핵심 속성 중 하나는 그것을 모델의 내부 뇌 상태의 일부로 남겨두는 것입니다. 우리를 기쁘게 하거나 특정 구조에 맞추려는 것이 아니라 말입니다.”라고 Baker는 경고했습니다. 만약 개발자들이 모델이 ‘좋은’ 생각을 방출하도록 강요하는 것을 지나치게 강조하면, 모델은 무해한 추론을 위장하면서도 해로운 작업을 수행할 수 있습니다.
연구자들은 이것이 어려운 균형이라고 인정합니다. AI의 사유 추론을 보면 실수를 잡을 수 있지만, 항상 신뢰할 수 있는 것은 아닙니다. 더 고급 AI를 개발하는 연구소들은 이제 이 신뢰 격차를 해소하는 것을 최우선 과제로 삼고 있습니다.
“지난 몇 년간 AI에서 제가 얻은 교훈은—모델의 진보에 베팅하지 마십시오.”라고 현재 아마존 AI 연구소를 이끄는 구글의 사유 추론 초기 개척자 중 한 명인 David Luan은 말했습니다. Luan은 기존 단점들이 단기적으로 해결될 것으로 예상합니다.
METR 연구원 Sydney von Arx는 AI의 숨겨진 추론이 때로는 기만적일 수 있지만, 그럼에도 불구하고 가치 있는 신호를 제공한다고 지적했습니다.
“우리는 사유 추론을 군대가 적의 무선 통신을 가로챌 때 다루는 방식으로 대해야 합니다.”라고 그녀는 말했습니다. “메시지는 오해의 소지가 있거나 암호화되어 있을 수 있지만, 우리는 그것이 유용한 정보를 담고 있다는 것을 압니다. 시간이 지남에 따라 우리는 그것을 연구함으로써 많은 것을 배울 것입니다.”
가장 똑똑한 암호화폐 전문가들이 이미 우리 뉴스레터를 구독하고 있습니다. 참여하고 싶으신가요? 함께하세요.

누르 바즈미
Noor Bazmi는 미디어학 학위를 갖춘 크립토폴리탄 뉴스 팀에 기여하고 있습니다. Noor은 블록체인, 암호화폐, 인공지능, 빅테크, 전기차 시장, 글로벌 경제 및 정부 정책 변화에 관한 뉴스를 보도합니다. 그녀는 글로벌 청중과 소통하기 위해 마케팅을 공부 중입니다.
















