Grok 4.7 batte Fable 5.1 e GPT-5.6 Sol nel test dell'agente legale di Harvey a un quinto del prezzo di input di Fable

- Grok 4.7 ha ottenuto un punteggio del 19,6% nel benchmark di Harvey Legal Agent, superando Fable 5.1 con il 6,7% e GPT-5.6 Sol con il 2,5%.
- xAI fissa il prezzo di Grok 4.7 a 2 dollari per milione di token di input, un quinto dei 10 dollari di Fable 5.1.
- Su Terminal-Bench 4.0, Fable 5.1 è ancora superiore a Grok 4.7, con il 57,9% contro il 38,0%.
Lunedì xAI ha lanciato Grok 4.7. In un benchmark per agenti legali, ha superato Fable 5.1 di Anthropic e GPT-5.6 Sol di OpenAI, applicando al contempo un costo per token di input pari a un quinto di quello di Fable.
La produzione costa 6 dollari per milione di token contro i 50 dollari di Anthropic
Secondo quanto riportato da xAI, Grok 4.7 ha ottenuto un punteggio del 19,6% nel benchmark Harvey Legal Agent. Fable 5.1 ha raggiunto il 6,7% nello stesso test, mentre GPT-5.6 Sol ha ottenuto il 2,5%.
Questo porta Grok 4.7 a circa tre volte il punteggio di Anthropic e quasi otto volte quello di Sol. Cryptopolitan ha riportato il mese scorso che Grok 4.6 era già in testa a questa coppia con il 15,8%.
Il lavoro legale è uno dei pochi ambiti in cui Grok 4.7 supera nettamente entrambi i concorrenti. Inoltre, supera Fable 5.1 nel test di ingegneria elettrica EEBench e lo surclassa nel test di programmazione DeepSWE.
Il prezzo di Grok 4.7 è di 2 dollari per milione di token di input e 6 dollari per milione di token di output, lo stesso di Grok 4.6. Tale tariffa di input è la metà dei 4 dollari di GPT-5.6 Sol e un quinto dei 10 dollari di Fable 5.1.
La produzione costa 6 dollari contro i 20 dollari di Sol e i 50 dollari di Fable, circa un ottavo del valore di Anthropic.
xAI ha confrontato i punteggi di CursorBench 4.0 con il costo medio per attività completata e afferma che il modello si colloca sulla frontiera del rapporto prezzo-prestazioni. Grok 4.7 ottiene circa il 46% in quel grafico con circa 6 dollari per attività, mentre Claude Opus 5 richiede quasi il doppio della spesa per un risultato simile.
Fable 5.1 offre prestazioni migliori con budget più elevati, arrivando al 51,8% a circa 17 dollari per attività. Il rilascio è stato "una combinazionetrondi intelligenza, velocità e basso costo", ha affermato Musk su X.

Terminal-Bench 4.0 dà ad Anthropic un vantaggio del 57,9% contro il 38,0%
Grok 4.7 si è classificato secondo, dietro a Fable 5.1, nei test GDPval e nel test di lavoro d'ufficio AA Briefcase. Il modello di Anthropic mantiene un netto vantaggio nei benchmark di codifica più lunghi e nei test su terminale.
Il margine maggiore si registra su Terminal-Bench 4.0, dove Fable 5.1 ha ottenuto il 57,9% contro il 38,0% di Grok 4.7, una differenza di circa 20 punti percentuali.
Fable è in testa anche su CursorBench e sul test di ragionamento clinico HealthBench Professional, dove GPT-5.6 Sol supera anche Grok.
Grok 4.7 ha ottenuto un punteggio Elo di 1.695 su GDPval, che valuta i modelli in base alle prestazioni di avvocati, infermieri e analisti finanziari, in aumento rispetto ai 1.605 di Grok 4.6. Questo risultato è inferiore ai 1.735 di Fable 5.1, ma superiore ai 1.542 ottenuti da Astra, il più recente modello GPT-6 di OpenAI, nello stesso test.
Grok 4.7 è in vantaggio su GPT-5.6 Sol in cinque dei sette benchmark. Perde solo in DeepSWE e nel test clinico.
Grok 4.7 si basa su 2,1 trilioni di parametri, il 40% in più rispetto agli 1,5 trilioni di Grok 4.6. xAI ha incluso dati di addestramento supplementari di SpaceX, tra cui la telemetria del satellite Starlink e i dati di produzione.
L'azienda afferma che il modello è più propenso a dedicare più tempo ai problemi più complessi e a ricontrollare le proprie risposte rispetto a Grok 4.6.
Il modello è stato lanciato sull'app Grok, Cursor, Grok Build e sull'API xAI, senza lista d'attesa.
Tutti i dati qui riportati provengono dai test interni di xAI. CursorBench, il test principale utilizzato da xAI, è sviluppato da Cursor, azienda che SpaceX ha acquisito il mese scorso.
xAI è stato confrontato con GPT-5.6 Sol, mentre il più recente GPT-6 Astra di OpenAI compare solo nei grafici GDPval, AA Briefcase e EEBench.
Le menti più brillanti del mondo delle criptovalute leggono già la nostra newsletter. Vuoi partecipare? Unisciti a loro.
Domande frequenti
Quanto costa Grok 4.7 rispetto a Fable 5.1 e GPT-5.6 Sol?
Grok 4.7 costa 2 dollari per milione di token di input e 6 dollari per milione di token di output, contro i 10 e i 50 dollari di Fable 5.1.
In quali benchmark Grok 4.7 vince e in quali perde?
Grok 4.7 si aggiudica il benchmark legale Harvey con il 19,6%, mentre Fable 5.1 primeggia su CursorBench, Terminal-Bench e HealthBench Professional.
Quanto è grande Grok 4.7 e su cosa è stato addestrato?
Grok 4.7 funziona su 2,1 trilioni di parametri e include dati di addestramento supplementari di SpaceX, come la telemetria del satellite Starlink.
Disclaimer. Le informazioni fornite non costituiscono consulenza di trading. Cryptopolitan/ non si assume alcuna responsabilità per gli investimenti effettuati sulla base delle informazioni fornite in questa pagina. Consigliamotronvivamente di effettuare ricerche indipendentident di consultare un professionista qualificato prima di prendere qualsiasi decisione di investimento.

Randa Moses
Randa Moses è redattrice e reporter presso Cryptopolitan dove si occupa di tecnologia, intelligenza artificiale, robotica, criptovalute, truffe e attacchi hacker. Lavora nel settore delle criptovalute dal 2017 e ha ricoperto ruoli presso Forward Protocol, AmaZix e Cryptosomniac. Randa ha conseguito una laurea in Ingegneria Elettrica edtronpresso l'Università di Bradford.
















