AI 모델은 능력을 발휘하기 훨씬 일찍 능력을 습득합니다, 연구 결과

- 연구에 따르면 AI 모델은 실제 능력을 발휘하기 훨씬 이전에 그 능력을 습득하는 것으로 나타났습니다.
- 연구원들은 모델이 실제 능력을 보이기 훨씬 전에 개념을 내재화할 수 있다고 주장합니다.
- 연구원들은 숨겨진 능력을 드러내는 다양한 방법을 제시했습니다.
새로운 연구에 따르면 인공지능(AI) 모델은 훈련 중 능력을 발휘하기 훨씬 일찍 일부 능력을 보유하고 있는 것으로 나타났습니다. 하버드와 미시간 주립대학이 수행한 연구에 따르면, 모델은 어쨌든 필요할 때까지 이러한 능력을 보여주지 않습니다.
이 연구는 AI 모델이 능력을 구축하는 방법을 이해하기 위해 수행된 많은 연구 중 하나입니다.
연구는 AI 모델이 크기와 색상과 같은 기본 개념을 어떻게 학습하는지 분석했으며, 이는 대부분의 테스트가 시사하는 것보다 훨씬 일찍 이러한 기술을 습득한다는 것을 드러냈습니다. 이 연구는 또한 AI의 능력을 측정하는 복잡성에 대한 통찰력을 제공했습니다. “표준 프롬프트를 받았을 때 무능해 보이는 모델이 실제로는 특정 조건에서만 나타나는 정교한 능력을 보유하고 있을 수 있습니다.”라고 논문은 읽힙니다.
연구 결과, AI 모델은 개념을 내면화합니다
하버드와 미시간 주립대학은 AI 모델의 능력을 이해하려는 시도를 처음 한 것은 아닙니다. 앤트로픽(Anthropic) 연구진은 ‘사전 학습(Dictionary Learning)’이라는 제목의 논문을 발표했습니다. 이 논문은 클로드 언어의 연결을 그것이 이해하는 특정 개념으로 매핑하는 것을 다루었습니다. 이러한 연구의 대부분은 서로 다른 각도에서 접근했지만, 주로 AI 모델을 이해하기 위한 것이었습니다.
앤트로픽은 서로 다른 해석 가능한 개념과 연결될 수 있는 특징을 발견했다고 밝혔습니다. “우리는 사람, 국가, 유명 건물과 같은 구체적인 사물부터 감정, 글쓰기 스타일, 추론 단계와 같은 추상적인 아이디어에 이르기까지 해석 가능한 개념에 해당하는 수백만 개의 특징을 발견했습니다.”라고 연구 결과는 밝혔습니다.
연구 과정에서 연구자들은 가장 인기 있는 아키텍처 중 하나인 AI를 사용하여 확산 모델을 사용한 여러 실험을 수행했습니다. 실험 중 그들은 모델들이 기본 개념을 조작하는 독특한 방식을 가지고 있다는 것을 깨달았습니다. AI 모델이 새로운 능력을 보일 때 일관된 패턴을 보였으며, 새로운 능력이 획득될 때를 알리는 날카로운 전환 지점이 있었습니다.
훈련 동안 모델은 표준 테스트가 감지하는 것보다 약 2,000 단계 일찍 개념을 습득한 것으로 나타났습니다. 강력한 개념은 약 6,000 단계에서 나타났고 약한 개념은 약 20,000 단계에서 관찰되었습니다. 개념 신호를 조정한 후, 그들은 학습 속도와 직접적인 상관관계를 발견했습니다.
연구진은 숨겨진 능력에 접근하는 방법을 공개했습니다
연구진은 표준 테스트에서 나타나기 전에 숨겨진 능력을 드러내기 위해 대체 프롬프트 방법을 사용했습니다. 숨겨진emergence의 광범위한 성향은 AI 평가와 안전성에 영향을 미칩니다. 예를 들어, 전통적인 벤치마크는 AI 모델의 특정 능력을 놓칠 수 있으며, 이로 인해 유익한 측면과 우려되는 측면 모두를 놓칠 수 있습니다.
연구 과정에서 팀은 AI 모델의 숨겨진 능력에 접근하는 특정 방법을 알아냈습니다. 연구진은 이러한 방법을 선형 잠재 개입(linear latent intervention) 및 과다 프롬프팅(over-prompting)이라고 명명했으며, 연구원들은 표준 테스트에서 나타나기 전에 모델이 복잡한 행동을 보이도록 했습니다. 연구원들은 또한 AI 모델이 표준 프롬프트를 통해 보여주기 전에 특정 복잡한 기능을 조작한다는 것도 발견했습니다.
예를 들어, 모델은 ‘미소 짓는 여성’ 또는 ‘모자를 쓴 남성’을 생성하도록 프롬프트를 받을 수 있었지만, 이를 결합하라고 요청하기 전이었습니다. 그러나 연구는 그들이 더 일찍 결합하는 방법을 배웠지만 전통적인 프롬프트를 통해 이를 보여줄 수는 없다는 것을 보여주었습니다. 모델이 능력을 보여주는 것은 그로킹(grokking)이라고 할 수 있는데, 이는 모델이 확장된 훈련 후 완벽한 테스트 성능을 보이는 상황입니다. 그러나 연구원들은 두 가지 사이에 주요 차이가 있다고 말했습니다.
그로킹은 여러 훈련 세션 후에 발생하며 동일한 데이터 세트의 여러 분포를 정제하는 것과 관련이 있는 반면, 연구는 이러한 능력이 능동적 학습 동안 나타난다고 보여줍니다. 연구원들은 모델이 그로킹에서 점진적인 표현 개선이 아닌 단계별 변화를 통해 개념을 조작하는 새로운 방법을 찾았다고 지적했습니다.
연구에 따르면, AI 모델은 이러한 개념을 알고 있지만 이를 보여줄 수는 없는 것으로 나타납니다. 이는 외국 영화를 보고 이해하지만 언어를 구사할 수 없는 사람과 유사합니다. 이는 대부분의 모델이 보여주는 것보다 더 많은 능력을 가지고 있음을 보여주며, 그들의 능력을 이해하고 통제하는 어려움도 보여줍니다.
이 글을 읽고 계신다면, 이미 앞서 나가고 있습니다. 뉴스레터로 그 위치를 유지하세요.
면책 조항. 제공된 정보는 투자 조언이 아닙니다. Cryptopolitan.com 본 페이지에 제공된 정보를 바탕으로 이루어진 투자에 대해 어떠한 책임도 지지 않습니다. 투자 결정을 내리기 전에 반드시 독립적인 조사나 자격을 갖춘 전문가의 상담을 강력히 권장합니다.
오와투운세 아데바요
아데바요(Adebayo)는 암호화폐 분야에서 4년간의 경력을 가진 작가입니다. 그는 라고스 대학교에서 도시 및 지역 계획을 전공하고 졸업했으며, 토큰헬(Tokenhell)과 크립토티커(CryptoTicker)에서 암호화폐 및 핀테크 뉴스를 작성했습니다. 현재 그는 크립토폴리탄(Cryptopolitan)의 뉴스 기여자입니다.















