최신 뉴스
당신을 위해 엄선되었습니다

Grok 4.7은 Fable 5.1 및 GPT-5.6 Sol을 제치고 Harvey의 법률 대리인 테스트에서 Fable 입력 가격의 5분의 1 수준으로 우수한 성능을 보였습니다

에 의해란다 모세스란다 모세스 읽는 데 2분 소요
Grok 4.7은 Fable 5.1 및 GPT-5.6 Sol보다 Harvey의 법률 대리인 테스트에서 우수한 성능을 보였으며, 입력 가격은 Fable의 5분의 1 수준입니다.
  • Grok 4.7은 Harvey Legal Agent Benchmark에서 19.6%의 점수를 기록하며 Fable 5.1(6.7%)과 GPT-5.6 Sol(2.5%)을 앞섰습니다.
  • xAI는 Grok 4.7의 가격을 입력 토큰 백만 개당 2달러로 책정했는데, 이는 Fable 5.1의 10달러의 5분의 1 수준입니다.
  • Fable 5.1은 Terminal-Bench 4.0에서 여전히 Grok 4.7을 57.9% 대 38.0%로 앞서고 있습니다.

xAI는 월요일에 Grok 4.7을 출시했습니다. 이 제품은 법률 대리인 벤치마크에서 Anthropic의 Fable 5.1과 OpenAI의 GPT-5.6 Sol을 능가했으며, 입력 토큰당 가격은 Fable의 5분의 1 수준입니다.

Output은 Anthropic의 백만 토큰당 50달러 대비 6달러의 가격으로 운영됩니다

xAI의 발표에 따르면 Grok 4.7은 Harvey Legal Agent Benchmark에서 19.6%의 점수를 기록했습니다. Fable 5.1은 같은 테스트에서 6.7%, GPT-5.6 Sol은 2.5%를 기록했습니다.

이로써 Grok 4.7은 Anthropic의 약 3배, Sol의 거의 8배에 달하는 점수를 기록했습니다. Cryptopolitan 지난달 Grok 4.6이 이미 15.8%의 점유율로 두 제품을 앞서고 있다고 보도한 바 있습니다

법률 업무는 Grok 4.7이 경쟁 제품 두 가지 모두를 확실히 능가하는 몇 안 되는 분야 중 하나입니다. 또한 EEBench 전기 공학 테스트에서 Fable 5.1을 제치고, DeepSWE 코딩 테스트에서도 Fable 5.1을 근소한 차이로 앞섭니다.

Grok 4.7의 가격은 입력 토큰 백만 개당 2달러, 출력 토큰 백만 개당 6달러로 Grok 4.6과 동일합니다. 이 입력 가격은 GPT-5.6 Sol의 4달러의 절반, Fable 5.1의 10달러의 5분의 1 수준입니다.

출력 비용은 Sol의 경우 20달러, Fable의 경우 50달러로 Anthropic의 약 8분의 1 수준입니다.

xAI는 CursorBench 4.0 점수를 완료된 작업당 평균 비용과 비교하여 그래프로 나타냈으며, 이 모델이 가격 대비 성능의 최적점에 있다고 주장합니다. Grok 4.7은 해당 그래프에서 약 46%의 점수를 작업당 약 6달러에 달성하는 반면, Claude Opus 5는 비슷한 결과를 얻기 위해 거의 두 배의 비용이 필요합니다.

Fable 5.1은 예산이 높을수록 성능이 향상되어 작업당 약 17달러에서 최대 51.8%의 성능을 보입니다. 머스크는 X에서 이번 출시에 대해 "지능, 속도 및 저비용의tron조합"이라고 말했습니다.

Grok 4.7은 Fable 5.1 및 GPT-5.6 Sol보다 Harvey의 법률 대리인 테스트에서 우수한 성능을 보였으며, 입력 가격은 Fable의 5분의 1 수준입니다.
SpaceXAI가 2026년 9월 21일에 발표한 Grok 4.7 출시 게시물.

터미널벤치 4.0은 앤트로픽을 57.9% 대 38.0%로 앞섰습니다

Grok 4.7은 GDPval 및 AA Briefcase 사무 작업 테스트에서 Fable 5.1에 이어 2위를 차지했습니다. Anthropic의 모델은 장기 코딩 및 터미널 벤치마크에서 확실한 우위를 유지하고 있습니다.

가장 큰 차이는 Terminal-Bench 4.0에서 나타났는데, Fable 5.1이 57.9%, Grok 4.7이 38.0%를 기록하며 약 20포인트의 차이를 보였습니다.

Fable은 CursorBench와 HealthBench Professional 임상 추론에서도 선두를 차지했으며, GPT-5.6 Sol은 Grok보다도 우수한 성능을 보였습니다.

Grok 4.7은 GDPval에서 1,695 Elo 점수를 기록했는데, 이는 변호사, 간호사, 금융 분석가 등의 직무 수행 능력을 평가하는 지표로, Grok 4.6의 1,605점보다 상승한 수치입니다. Fable 5.1의 1,735점에는 못 미치지만, OpenAI의 최신 GPT-6 Astra가 같은 차트에서 얻은 1,542점보다는 높습니다.

Grok 4.7은 7개 벤치마크 중 5개에서 GPT-5.6 Sol보다 우수한 성능을 보였습니다. DeepSWE와 임상 테스트에서만 뒤처졌습니다.

Grok 4.7은 2조 1천억 개의 매개변수를 사용하는데, 이는 Grok 4.6에 사용된 1조 5천억 개보다 40% 더 많은 수치입니다. xAI는 Starlink 위성 원격 측정 데이터와 제조 기록을 포함한 SpaceX의 추가 학습 데이터를 포함시켰습니다.

회사 측은 이 모델이 Grok 4.6보다 어려운 문제에 더 많은 시간을 할애하고 자체 답변을 재확인할 가능성이 더 높다고 밝혔습니다.

해당 모델은 대기자 명단 없이 Grok 앱, Cursor, Grok Build 및 xAI API에서 출시되었습니다.

여기 있는 모든 수치는 xAI 자체 테스트 결과입니다. xAI가 주요 기준으로 삼은 CursorBench 테스트는 SpaceX가 지난달 인수를 완료한 Cursor에서 제작했습니다.

xAI는 GPT-5.6 Sol을 기준으로 벤치마킹을 진행했으며, OpenAI의 최신 GPT-6 Astra는 GDPval, AA Briefcase 및 EEBench 차트에만 나타납니다.

암호화폐 분야의 최고 전문가들이 이미 저희 뉴스레터를 구독하고 있습니다. 함께하고 싶으신가요? 지금 바로 참여하세요.

자주 묻는 질문

Grok 4.7의 가격은 Fable 5.1 및 GPT-5.6 Sol과 비교했을 때 얼마나 차이가 나나요?

Grok 4.7은 입력 토큰 백만 개당 2달러, 출력 토큰 백만 개당 6달러의 비용이 드는 반면, Fable 5.1은 각각 10달러와 50달러입니다.

Grok 4.7은 어떤 벤치마크에서 우위를 점하고 어떤 벤치마크에서 열세를 보입니까?

Grok 4.7은 Harvey 법률 벤치마크에서 19.6%의 점유율로 1위를 차지했으며, Fable 5.1은 CursorBench, Terminal-Bench 및 HealthBench Professional에서 선두를 달리고 있습니다.

Grok 4.7의 크기는 얼마나 되며, 어떤 데이터셋으로 학습되었나요?

Grok 4.7은 2조 1천억 개의 매개변수를 사용하며 Starlink 위성 원격 측정 데이터와 같은 SpaceX의 추가 학습 데이터를 포함합니다.

이 기사를 공유하세요

면책 조항: 제공된 정보는 투자 조언이 아닙니다. Cryptopolitan이 페이지에 제공된 정보를 바탕으로 이루어진 투자에 대해 어떠한 책임도 지지 않습니다.tron권장합니다dent .

란다 모세스

란다 모세스

란다 모세스는 Cryptopolitan 의 편집자 겸 기자로, 기술, 인공지능, 로봇공학, 암호화폐, 사기 및 해킹 관련 기사를 쓰고 있습니다. 2017년부터 암호화폐 업계에서 활동해 온 그녀는 포워드 프로토콜, 아마직스, 크립토솜니악에서 근무한 경력이 있습니다. 란다는 브래드퍼드 대학교에서 전기tron공학 학위를 받았습니다.

더 많은 뉴스