O Grok 4.7 supera o Fable 5.1 e o GPT-5.6 Sol no teste de agente legal da Harvey com um quinto do custo de entrada do Fable

- Grok 4.7 obteve 19,6% no teste de referência Harvey Legal Agent Benchmark, à frente de Fable 5.1 com 6,7% e GPT-5.6 Sol com 2,5%.
- A xAI precificou o Grok 4.7 em 2 dólares por milhão de tokens de entrada, um quinto dos 10 dólares do Fable 5.1.
- Fable 5.1 ainda supera Grok 4.7 no Terminal-Bench 4.0, com 57,9% contra 38,0%.
A xAI lançou o Grok 4.7 na segunda-feira. Superou o Fable 5.1 da Anthropic e o GPT-5.6 Sol da OpenAI num teste de benchmark de agentes legais, cobrando um quinto do preço do Fable por token de entrada.
A produção ronda os 6 dólares por milhão de tokens, contra os 50 dólares na Anthropic
O comunicado da xAI informou que o Grok 4.7 obteve 19,6% no teste Harvey Legal Agent Benchmark. O Fable 5.1 alcançou 6,7% no mesmo teste e o GPT-5.6 Sol, 2,5%.
Isto coloca o Grok 4.7 com cerca de três vezes a pontuação do Anthropic e quase oito vezes a do Sol. Cryptopolitan noticiou no mês passado que o Grok 4.6 já liderava esta dupla com 15,8%.
O trabalho jurídico é um dos poucos domínios em que o Grok 4.7 supera completamente os seus dois concorrentes. Também supera o Fable 5.1 no teste de engenharia elétrica do EEBench e ultrapassa-o ligeiramente no teste de programação DeepSWE.
O preço do Grok 4.7 é de 2 dólares por milhão de tokens de entrada e 6 dólares por milhão de tokens de saída, o mesmo que o do Grok 4.6. Esta taxa de entrada é metade da taxa de 4 dólares do GPT-5.6 Sol e um quinto da taxa de 10 dólares do Fable 5.1.
O preço de saída é de 6 dólares, contra 20 dólares para Sol e 50 dólares para Fable, cerca de um oitavo do valor cobrado por Anthropic.
A xAI comparou os resultados do CursorBench 4.0 com o custo médio por tarefa concluída e afirma que o modelo se encontra na fronteira entre o custo e o desempenho. O Grok 4.7 atinge cerca de 46% neste gráfico a um custo de aproximadamente 6 dólares por tarefa, enquanto o Claude Opus 5 exige um investimento quase duas vezes superior para um resultado semelhante.
O Fable 5.1 tem um melhor desempenho com orçamentos mais elevados, atingindo os 51,8% com cerca de 17 dólares por tarefa. O lançamento foi "uma combinaçãotronde inteligência, velocidade e baixo custo", disse Musk no X.

O Terminal-Bench 4.0 dá à Anthropic uma vantagem de 57,9% contra 38,0%
O Grok 4.7 ficou em segundo lugar, atrás do Fable 5.1, no GDPval e no teste de trabalho de escritório AA Briefcase. O modelo da Anthropic mantém uma clara vantagem em testes de codificação mais longos e benchmarks de terminal.
A margem mais elevada foi observada no Terminal-Bench 4.0, onde o Fable 5.1 obteve 57,9% contra 38,0% no Grok 4.7, uma diferença de cerca de 20 pontos percentuais.
O Fable também lidera no CursorBench e no raciocínio clínico do HealthBench Professional, onde o GPT-5.6 Sol também supera o Grok.
O Grok 4.7 alcançou 1.695 pontos Elo no GDPval, que avalia modelos em tarefas realizadas por advogados, enfermeiros e analistas financeiros, um aumento face aos 1.605 pontos do Grok 4.6. Este resultado fica atrás dos 1.735 pontos do Fable 5.1, mas à frente dos 1.542 pontos obtidos pelo GPT-6 Astra, da OpenAI, na mesma avaliação.
O Grok 4.7 supera o GPT-5.6 Sol em cinco dos sete benchmarks. Perde apenas no DeepSWE e no ensaio clínico.
O Grok 4.7 utiliza 2,1 triliões de parâmetros, mais 40% do que os 1,5 triliões do Grok 4.6. A xAI incluiu dados de treino suplementares da SpaceX, incluindo telemetria do satélite Starlink e registos de fabrico.
A empresa afirma que o modelo tem maior probabilidade de dedicar tempo extra a problemas complexos e de verificar as suas próprias respostas do que o Grok 4.6.
O modelo foi lançado na aplicação Grok, Cursor, Grok Build e na API xAI, sem lista de espera.
Todos os números aqui apresentados são provenientes dos testes realizados pela própria xAI. O CursorBench, o teste principal da xAI, é desenvolvido pela Cursor, empresa que a SpaceX concluiu a aquisição no mês passado.
O xAI foi comparado com o GPT-5.6 Sol, e o GPT-6 Astra, mais recente da OpenAI, apenas aparece nos gráficos GDPval, AA Briefcase e EEBench.
As mentes mais brilhantes do mundo das criptomoedas já leem nossa newsletter. Quer participar? Junte-se a elas.
Perguntas frequentes
Qual o preço do Grok 4.7 em comparação com o Fable 5.1 e o GPT-5.6 Sol?
O Grok 4.7 custa 2 dólares por milhão de tokens de entrada e 6 dólares por milhão de tokens de saída, contra 10 e 50 dólares do Fable 5.1.
Em que benchmarks o Grok 4.7 ganha e em quais perde?
O Grok 4.7 vence o benchmark jurídico Harvey com 19,6%, enquanto o Fable 5.1 lidera nos benchmarks CursorBench, Terminal-Bench e HealthBench Professional.
Qual o tamanho do Grok 4.7 e em que foi treinado?
O Grok 4.7 opera com 2,1 triliões de parâmetros e inclui dados de treino suplementares da SpaceX, como a telemetria do satélite Starlink.
Aviso Legal. As informações fornecidas não constituem aconselhamento de investimento. CryptopolitanO não se responsabiliza por quaisquer investimentos realizados com base nas informações fornecidas nesta página. Recomendamostrona realização de pesquisas independentesdent /ou a consulta a um profissional qualificado antes de tomar qualquer decisão de investimento.

Randa Moses
Randa Moses é editora e repórter da Cryptopolitan onde cobre tecnologia, IA, robótica, criptomoedas, golpes e ataques cibernéticos. Ela trabalha no universo das criptomoedas desde 2017, tendo atuado na Forward Protocol, AmaZix e Cryptosomniac. Randa é formada em Engenharia Elétrica etronpela Universidade de Bradford.
















