최신 뉴스
당신을 위해 엄선되었습니다

영국-미국 연구소의 연구 결과에 따르면, Kimi K3는 사이버 공격 과제 수행에서 미국 최첨단 모델에 비해 뒤처지는 것으로 나타났습니다

에 의해한나 콜리모어한나 콜리모어
3분 읽음
영국-미국 연구소의 연구 결과에 따르면, Kimi K3는 사이버 공격 과제 수행에서 미국 최첨단 모델에 비해 뒤처지는 것으로 나타났습니다
  • 영국과 미국이 공동으로 실시한 평가에서 문샷 AI의 키미 K3는 공격적인 사이버 능력 면에서 미국의 최고 모델들에 비해 현저히 뒤처지는 것으로 나타났습니다.
  • Kimi K3는 41개의 테스트 작업 중 어느 작업에서도 임의 코드 실행(가장 위험한 결과)을 달성하지 못했습니다.
  • Moonshot은 7월 27일에 Kimi K3의 전체 가중치를 오픈소스로 공개할 예정이며, 이는 공개 후에는 특정 호스트에 의해 기능이 제한되지 않는다는 것을 의미합니다.

 

공동 평가 보고서에 따르면 문샷 AI의 키미 K3는 소프트웨어 취약점 구축 및 모의 네트워크 공격 실행 측면에서 미국tron의 AI 시스템에 미치지 못하는 것으로 나타났습니다. 

영국의 AI 보안 연구소(AISI)와 미국의 AI 표준 및 혁신 센터(CAISI)가 평가를 진행했으며, 7월 23일에 그 결과를 공개했습니다.

문샷은 7월 27일에 해당 모델의 전체 가중치를 공개할 예정이며, 분석 결과에 따르면 키미 K3의 보안 조치는 사이버 공격 활동을 지원하는 것을 막지 못했다고 합니다.

공동 평가에서 키미 K3에 대해 어떤 점이 밝혀졌습니까?

연구기관은 Kimi K3를 ExploitBench라는 카네기멜론 테스트 도구로 실행했습니다. ExploitBench는 모델이 취약점을 얼마나 효과적으로 악용할 수 있는지를 평가하는 도구입니다. 이 테스트는 2023년 이후 크롬 V8 엔진에서 발견된 41개의 취약점을 기반으로 합니다. Kimi K3는 32%의 점수를 기록했습니다. 미국의 주요 모델들은 평균 76.2%의 점수를 받았고, 중국의 GLM-5.2는 24%를 기록했습니다.

공격자에게 대상 시스템에 대한 완전한 제어권을 부여하는 임의 코드 실행은 벤치마크에서 가장 위험한 결과입니다. 미국 모델은 평균적으로 41개 작업 중 20개에서 이 위험에 도달했습니다. 반면 Kimi K3는 단 한 번도 도달하지 못했습니다.

GLM-5.2 역시 목표 지점에 도달하지 못했습니다. 따라서 키미 K3는 현재 사이버 공격 능력 면에서는 오픈웨이트 경쟁 기종들을 앞서지만, 실제 공격이 가해질 경우 가장 큰 피해를 입힐 수 있는 지점에서는 부족한 모습을 보입니다.

32단계 네트워크 침해 절차의 절반이 지났습니다

두 번째 테스트인 "마지막 한 명"에서는 약 20개의 호스트가 4개의 서브넷에 분산된 시뮬레이션된 기업 네트워크에 모델을 투입합니다. 

인간 전문가가 32단계 전체 과정을 완료하는 데는 약 20시간이 소요됩니다. Kimi K3는 평균 17단계를 완료했고, 가장 뛰어난 미국 모델은 평균 28.5단계, GLM-5.2는 11단계를 완료했습니다.

하지만 평가자들은 키미 K3가 10번 시도 중 한 번은 전체 체인을 완료했으며, 평가자들이 설정한 1억 토큰 상한선을 넘지 않았다는 점을 지적했습니다. 

미국 최고의 모델들은 10번 시도 중 6~7번은 문제를 해결했습니다. 연구 기관들은 단 한 번의 성공 사례만을 보고 모델이 해당 능력을 갖추고 있다고 판단했지만, 필요할 때마다 그 능력을 발휘할 수는 없다고 지적했습니다. 또한, 해당 훈련장에는 능동적인 방어 병력이 없고 목표물까지 이어지는 경로가 이미 정해져 있어 공격자에게 유리한 환경이 조성된다고 덧붙였습니다.

Kimi K3에는 거부 의사를 표시할 수 있는 안전장치가 있습니까?

평가자들은 모델이 반발 없이 작업을 수행하려는 의지가 큰 위험 요소라고 지적했습니다. 그들은 "Kimi K3는 지시를 받고 초기 네트워크 접근 권한이 주어지면 작고 방어력이 약한 취약한 기업 시스템을 자율적으로 공격할 수 있다"고 밝혔습니다 

AISI는 이전에 개방형 모델 기능의 증가가 "지속적이고 돌이킬 수 없는 오용 위험"을 초래한다고 경고한 바 있습니다. 7월 27일에 Kimi K3의 가중치가 공개되면, 호스팅 업체가 더 이상 해당 모델의 동작을 제한할 수 없게 됩니다.

Kimi K3의 사이버 보안 점수가 일반 점수에 비해 낮은 이유는 무엇인가요?

이 보고서가 나오기 전까지 Kimi K3는tron일반 벤치마크 성능을, 그 점은 변함이 없었습니다. 하지만 사이버 보안 능력 테스트에서는 몇 가지 단점이 드러났습니다. 2조 8천억 개의 파라미터를 사용하는 이 중국산 모델은 Claude 4.8과 GPT-5.5를 능가했으며, 일부 순위표에서는 1위를 차지하기도 했습니다.

연구기관들에 따르면, 이는 모델 구축 방식 때문에 가능한 결과일 수 있다고 합니다.

백악관 과학국장 마이클 크라치오스는 7월 22일 문샷 프로젝트가 앤스로픽의 페이블 모델을 추출하여 그 결과물을 훈련 데이터로 사용했다고 비난했습니다. 

Anthropic의 분류기는 고도화된 사이버 공격 관련 질문을 차단합니다. 따라서 Claude의 응답에서 추출한 데이터셋으로는 해당 공격 기술에 대한 충분한 자료를 얻을 수 없습니다. 

Kimi K3는 그러한 분류기를 가지고 있지 않기 때문에 일반적인 작업에서는 서구 모델과 동등한 성능을 보였지만, 취약점 활용 능력에서는 여전히 부족했습니다.

암호화폐 분야의 최고 전문가들이 이미 저희 뉴스레터를 구독하고 있습니다. 함께하고 싶으신가요? 지금 바로 참여하세요.

자주 묻는 질문

Kimi K3는 취약점 개발 측면에서 미국 모델과 비교했을 때 어떤 점수를 받았습니까?

ExploitBench 테스트에서 Kimi K3는 32%의 점수를 기록했는데, 이는 미국 최고 모델들의 평균 점수인 76.2%보다 낮은 수치입니다. 또한 Kimi K3는 41개 작업 중 어느 작업에서도 임의 코드 실행에 도달하지 못했는데, 이는 미국 최고 모델들이 41개 작업 중 20개에서 임의 코드 실행에 도달한 것과 대조적입니다.

키미 K3는 사이버 공격에 협조하기를 거부했나요?

아니요. 영국 AISI 및 CAISI 평가자들은 Kimi K3의 보안 조치가 지시를 받았을 때 취약점 개발이나 공격적인 사이버 작전을 시도하는 것을 막지 못했다고 보고했습니다.

키미 K3가 일반적인 작업에서는tron만 사이버 보안에서는 약한 이유는 무엇일까요?

해당 연구기관들은 미국 관리들이 주장하는 것처럼 문샷 프로젝트가 클로드 결과물을 기반으로 키미 K3를 훈련시켰다면, 앤트로픽의 분류기가 고도화된 사이버 공격 쿼리를 차단하기 때문에 훈련 데이터에서 해당 기술이 제대로 반영되지 않을 것이라고 지적합니다.

이 기사를 공유하세요
한나 콜리모어

한나 콜리모어

한나는 암호화폐 분야에서 10년 가까이 블로그를 운영하고 행사를 취재해 온 작가 겸 편집자입니다. Cryptopolitan에서 뉴스 페이지에 기고하며, 탈중앙화 DeFi), 반응형 웹 자산(RWA), 암호화폐 규제, 인공지능(AI) 및 첨단 기술 산업의 최신 동향을 보도하고 분석합니다. 아카디아 대학교에서 경영학 학위를 받았습니다.

더 많은 뉴스