Grok 4.7 schlägt Fable 5.1 und GPT-5.6 Sol beim Test des Rechtsvertreters von Harvey zu einem Fünftel des Inputpreises von Fable

- Grok 4.7 erzielte beim Harvey Legal Agent Benchmark einen Wert von 19,6 %, vor Fable 5.1 mit 6,7 % und GPT-5.6 Sol mit 2,5 %.
- xAI bepreist Grok 4.7 mit 2 US-Dollar pro Million Input-Token, ein Fünftel des Preises von Fable 5.1 mit 10 US-Dollar.
- Fable 5.1 schlägt Grok 4.7 weiterhin auf Terminal-Bench 4.0 mit 57,9 % zu 38,0 %.
Grok 4.7 wurde am Montag von xAI veröffentlicht. Es übertraf Anthropics Fable 5.1 und OpenAIs GPT-5.6 Sol in einem Benchmark für Rechtsagenten und verlangte dabei nur ein Fünftel des Preises von Fable pro Input-Token.
Der Output liegt bei 6 US-Dollar pro Million Token gegenüber 50 US-Dollar bei Anthropic
Laut einer Pressemitteilung von xAI erzielte Grok 4.7 im Harvey Legal Agent Benchmark 19,6 %. Fable 5.1 erreichte im selben Test 6,7 % und GPT-5.6 Sol 2,5 %.
Damit liegt Grok 4.7 etwa dreimal so hoch wie Anthropic und fast achtmal so hoch wie Sol. Cryptopolitan berichtete letzten Monat, dass Grok 4.6 die beiden mit 15,8 % bereits überholt habe.
Im juristischen Bereich ist Grok 4.7 einer der wenigen Anwendungsbereiche, in denen es beide Konkurrenten deutlich übertrifft. Auch im EEBench-Test für Elektrotechnik ist es Fable 5.1 überlegen und schlägt es im DeepSWE-Codierungstest sogar knapp.
Die Preisgestaltung von Grok 4.7 beträgt 2 US-Dollar pro Million Input-Token und 6 US-Dollar pro Million Output-Token, genau wie bei Grok 4.6. Dieser Input-Preis beträgt die Hälfte von GPT-5.6 Sols 4 US-Dollar und ein Fünftel von Fable 5.1s 10 US-Dollar.
Output liegt bei 6 $ gegenüber 20 $ bei Sol und 50 $ bei Fable, also etwa einem Achtel des Wertes von Anthropic.
xAI hat die CursorBench 4.0-Ergebnisse den durchschnittlichen Kosten pro abgeschlossener Aufgabe gegenübergestellt und behauptet, das Modell liege an der Preis-Leistungs-Grenze. Grok 4.7 erreicht in dieser Grafik etwa 46 % bei rund 6 US-Dollar pro Aufgabe, während Claude Opus 5 für ein vergleichbares Ergebnis fast doppelt so viel ausgeben muss.
Fable 5.1 erzielt bei höheren Budgets bessere Ergebnisse und erreicht bis zu 51,8 % Effizienz bei etwa 17 US-Dollar pro Aufgabe. Die Veröffentlichung sei „einetronKombination aus Intelligenz, Geschwindigkeit und niedrigen Kosten“, sagte Musk auf X.

Terminal-Bench 4.0 verschafft Anthropic einen Vorsprung von 57,9 % zu 38,0 %
Grok 4.7 belegte im GDPval-Test und im AA Briefcase-Büroarbeitstest den zweiten Platz hinter Fable 5.1. Das Modell von Anthropic führt weiterhin deutlich bei längeren Programmieraufgaben und Terminal-Benchmarks.
Den größten Unterschied zeigt sich bei Terminal-Bench 4.0, wo Fable 5.1 mit 57,9 % gegenüber Grok 4.7 mit 38,0 % punktete – ein Unterschied von rund 20 Punkten.
Fable ist auch führend bei CursorBench und HealthBench Professional im Bereich des klinischen Denkens, wo GPT-5.6 Sol ebenfalls Grok schlägt.
Grok 4.7 erreichte auf GDPval, einem Benchmark, der Modelle anhand von Aufgaben bewertet, die von Anwälten, Krankenschwestern und Finanzanalysten ausgeführt werden, 1.695 Elo-Punkte. Das ist ein Anstieg gegenüber den 1.605 Punkten von Grok 4.6. Damit liegt Grok 4.7 hinter Fable 5.1 mit 1.735 Punkten, aber vor den 1.542 Punkten, die OpenAIs neueres GPT-6 Astra auf derselben Skala erzielte.
Grok 4.7 liegt in fünf von sieben Benchmarks vor GPT-5.6 Sol. Lediglich bei DeepSWE und im klinischen Test muss es sich geschlagen geben.
Grok 4.7 arbeitet mit 2,1 Billionen Parametern, 40 % mehr als die 1,5 Billionen Parameter von Grok 4.6. xAI hat zusätzliche Trainingsdaten von SpaceX einbezogen, darunter Telemetriedaten des Starlink-Satelliten und Produktionsdatensätze.
Das Unternehmen gibt an, dass das Modell eher dazu neigt, sich länger mit schwierigen Problemen zu beschäftigen und seine eigenen Antworten zu überprüfen als Grok 4.6.
Das Modell wurde ohne Warteliste in der Grok-App, Cursor, Grok Build und der xAI-API veröffentlicht.
Alle hier angegebenen Zahlen stammen aus den eigenen Tests von xAI. CursorBench, der von xAI als erstes Testprogramm verwendet wird, wird von Cursor entwickelt, das SpaceX im letzten Monat übernommen hat.
xAI wurde mit GPT-5.6 Sol verglichen, und OpenAIs neueres GPT-6 Astra erscheint nur in den GDPval-, AA Briefcase- und EEBench-Charts.
Die klügsten Köpfe der Krypto-Szene lesen bereits unseren Newsletter. Möchten Sie auch dabei sein? Dann schließen Sie sich ihnen an.
Häufig gestellte Fragen
Wie viel kostet Grok 4.7 im Vergleich zu Fable 5.1 und GPT-5.6 Sol?
Grok 4.7 kostet 2 US-Dollar pro Million Input-Token und 6 US-Dollar pro Million Output-Token, im Vergleich zu 10 US-Dollar bzw. 50 US-Dollar bei Fable 5.1.
Bei welchen Benchmarks schneidet Grok 4.7 gut und bei welchen schlecht ab?
Grok 4.7 gewinnt den Harvey Legal Benchmark mit 19,6 %, während Fable 5.1 bei CursorBench, Terminal-Bench und HealthBench Professional führend ist.
Wie groß ist Grok 4.7 und womit wurde es trainiert?
Grok 4.7 arbeitet mit 2,1 Billionen Parametern und beinhaltet zusätzliche Trainingsdaten von SpaceX, wie zum Beispiel Telemetriedaten des Starlink-Satelliten.
Haftungsausschluss. Die bereitgestellten Informationen stellen keine Anlageberatung dar. Cryptopolitan/ übernimmt keine Haftung für Investitionen, die auf Grundlage der Informationen auf dieser Seite getätigt werden. Wirtronempfehlen dringend, vor jeder Anlageentscheidung eigene Recherchen durchzuführendent oder einen qualifizierten Fachmann zu konsultieren

Randa Moses
Randa Moses ist Redakteurin und Reporterin bei Cryptopolitan und berichtet über Technologie, KI, Robotik, Kryptowährungen, Betrug und Hackerangriffe. Sie ist seit 2017 in der Krypto-Branche tätig und arbeitete zuvor bei Forward Protocol, AmaZix und Cryptosomniac. Randa hat einen Abschluss in Elektrotechnik undtronvon der Universität Bradford.
















