Grok 4.7: xAI veröffentlicht neues Modell für Programmierung und Wissensarbeit

Grok 4.7: xAI veröffentlicht neues Modell für Programmierung und Wissensarbeit
Illustrationen erstellt mit KI-Bildgenerierung

xAI hat Grok 4.7 für Programmierung und Wissensarbeit veröffentlicht. Gegenüber Grok 4.6 beruht die neue Version auf einem größeren Grundmodell, soll langwierige Aufgaben besser bewältigen und verfügt über eine vollständig neue Schutzarchitektur.

Die am 21. September 2026 vorgestellte Version kostet ab 2 US-Dollar je Million Eingabe-Token und 6 US-Dollar je Million Ausgabe-Token. Token sind Texteinheiten, in die Anfragen und Antworten zerlegt werden. Damit entsprechen Preis und Geschwindigkeit denen von Grok 4.6. Zusätzlich bietet xAI eine Variante mit doppelter Ausgabegeschwindigkeit zum doppelten Preis an.

Schulung auf schwierigere und längere Aufgaben

Grok 4.7 verwendet ein neues, größeres Grundmodell als Grok 4.6. Die Schulung durch verstärkendes Lernen, ein Trainingsverfahren, bei dem das Modell durch Rückmeldungen lernt, lief länger und umfasste eine anspruchsvollere Mischung von Aufgaben. Dabei lag ein Schwerpunkt auf Problemen, deren Bearbeitung viele Stunden dauert. Das Modell soll außerdem eigene Ergebnisse gründlicher überprüfen und längere Zusammenhänge besser verwalten.

xAI hat Grok 4.7 zudem auf ein unmittelbares Verständnis der Arbeitsumgebung Grok Bot ausgerichtet. Dadurch soll das Modell bei dialogbasierten Aufgaben und allgemeiner Wissensarbeit leistungsfähiger sein.

Gemischte Ergebnisse im Modellvergleich

Im standardisierten Programmierungstest CursorBench 4.0 für langwierige Programmieraufgaben erreichte Grok 4.7 einen Wert von 46,3 Prozent. Grok 4.6 kam auf 40,4 Prozent, GPT-5.6 Sol auf 41,7 Prozent und Fable 5.1 auf 51,8 Prozent. Grok 4.7 verbesserte sich damit gegenüber seinem Vorgänger, blieb in diesem Test jedoch hinter Fable 5.1.

Beim standardisierten Programmierungstest DeepSWE v1.1 erzielte Grok 4.7 mit hohem Rechenaufwand 71,0 Prozent. Im Elektrotechniktest EEBench waren es 64,0 Prozent. Der Büroarbeitstest AA Briefcase v1.1 für mehrstündige Aufgaben ergab 1.657 Punkte. Beim standardisierten Harvey-Test für juristische Aufgaben stieg der Wert von 15,8 Prozent bei Grok 4.6 auf 19,6 Prozent bei Grok 4.7.

Auch bei GDPval, einem Test für professionelle Wissensarbeit, lag die neue Version vor ihrem Vorgänger: Grok 4.7 erreichte 1.695 Elo-Punkte, eine aus dem Schachsport stammende Bewertungsskala, die hier dem Vergleich der Modellleistung dient. Grok 4.6 kam auf 1.605 Punkte. Fable 5.1 erzielte dort 1.735 Punkte, GPT-6 Astra 1.542 Punkte. Die veröffentlichten Vergleichswerte zeigen somit Verbesserungen gegenüber Grok 4.6, aber keine durchgängige Führung gegenüber allen anderen Modellen.

Neue Schutzarchitektur für sensible Bereiche

Für Grok 4.7 hat xAI eine vollständig neue Schutzarchitektur entwickelt. Beim Biosicherheitstest von LatchBio erreichte das Modell 62,4 Prozent. In HackerBench v0.3, einem unternehmenseigenen Test für riskante und böswillige Aufgaben aus der Cybersicherheit, ließ es 3,3 Prozent der riskanten Anweisungen passieren. Zugleich soll es rechtmäßige Sicherheitsarbeit nur selten ablehnen.

Ausgewählte Partner aus der Cybersicherheit erhalten auf Einladung Zugang zu den Fähigkeiten des Modells für Angriffstests. Der Zugang ist für Verteidigungsforschung vorgesehen.

Verfügbarkeit über mehrere Zugangswege

Grok 4.7 ist seit dem 21. September 2026 in Cursor, einer Programmierumgebung, und Grok Build, einer Entwicklungsumgebung von xAI, verfügbar. Das Modell lässt sich außerdem über die Grok API, externe Programmierumgebungen, Modellvermittler, die Anfragen an verschiedene KI-Modelle weiterleiten, und Cloud-Plattformen nutzen.

Dieser Artikel wurde KI-generiert erstellt. Die Themenauswahl trifft die Redaktion, die redaktionelle Verantwortung liegt bei KI-Prüfstand.