Grok 4.7 od xAI kosztuje mniej niż konkurenci, ale benchmarki pokazują wyraźny dystans do Claude Fable 5.1 i GPT-6, zwłaszcza w kodowaniu.

Źródło zdjęcia: The Decoder
xAI zaprezentowało Grok 4.7 — najnowszy model firmy Elona Muska, przeznaczony do zadań programistycznych i pracy z wiedzą. Model powstał na bazie większego modelu podstawowego, przeszedł dłuższy trening z uczeniem ze wzmocnieniem i został zaprojektowany tak, by lepiej weryfikować własne odpowiedzi. Jednak niezależne testy porównawcze pokazują, że Grok 4.7 znajduje się wyraźnie poniżej poziomu konkurencji z Zachodu, mimo bardzo konkurencyjnej ceny.
xAI opisuje Groka 4.7 jako swój najbardziej zdolny model do zadań kodowania i pracy z wiedzą, jaki do tej pory wypuściła firma. Kluczowe zmiany w porównaniu z wcześniejszymi wersjami to większy model podstawowy, wydłużony trening z wykorzystaniem uczenia ze wzmocnieniem oraz mechanizmy lepszej weryfikacji generowanych wyników.
Cena modelu — 2 dolary za milion tokenów wejściowych i 6 dolarów za milion tokenów wyjściowych — jest jednak zauważalnie niższa niż u zachodnich konkurentów i bliższa polityce cenowej modeli chińskich. Jak wskazuje artykuł źródłowy, prawdopodobnie nie jest to przypadek, biorąc pod uwagę wyniki benchmarków.
Na niezależnym indeksie Artificial Analysis Intelligence Index, który agreguje dziesięć różnych testów, Grok 4.7 uzyskał 46 punktów. To wynik plasujący model w środku rankingu, daleko za Claude Fable 5.1 i GPT-6, które osiągnęły po 53 punkty każdy. Warto odnotować, że dwa najwyższe poziomy rozumowania w Groku 4.7 wypadają w tym teście na podobnym poziomie — bez wyraźnej różnicy między nimi.
Najwyraźniejsza różnica między Grokiem 4.7 a konkurencją widoczna jest w teście agentowego programowania Terminal-Bench 4.0. Model xAI osiągnął tam wynik zaledwie 26 procent. Dla porównania, GPT-6 Astra zdobył 60 procent, a Claude Fable 5.1 — 55 procent.
Co szczególnie znaczące, nawet znacznie tańszy model DeepSeek V4.1 Flash wypadł lepiej niż Grok 4.7, uzyskując 27 procent. Oznacza to, że mimo agresywnej strategii cenowej xAI, jego nowy model nie tylko przegrywa z czołowymi produktami Anthropic i OpenAI, ale jest też gorszy od bezpłatnego lub bardzo niedrogiego rozwiązania konkurencji z Chin w zadaniach agentowego kodowania — jednej z kluczowych kategorii, w jakich mierzą się dziś modele językowe.
Grok 4.7 jest już dostępny przez Grok API, w Cursor oraz w Grok Build.
Wyniki benchmarków sugerują, że xAI stawia obecnie na strategię cenową, próbując zdobyć użytkowników niską ceną, nie zaś przewagą technologiczną nad Claude czy GPT-6. Dla deweloperów i firm wybierających model do zadań agentowego programowania rezultaty Terminal-Bench 4.0 mogą być decydującym argumentem — mimo atrakcyjnej ceny Grok 4.7 wypada słabiej nawet od tańszych alternatyw z Chin, takich jak DeepSeek V4.1 Flash.
Podsumowując, Grok 4.7 to model, który konkuruje ceną, nie osiągami — benchmarki jasno pokazują, że w zadaniach wymagających zaawansowanego rozumowania i agentowego kodowania xAI wciąż pozostaje w tyle za Anthropic i OpenAI.

Microsoft AI wypuściło modele transkrypcji i syntezy mowy dla agentów głosowych — niskie opóźnienia, 60 języków i klonowanie głosu z kilku sekund nagrania.

Nowa metoda Google Cloud AI Research, RRSI, ogranicza przeuczanie agentów AI na testach i poprawia wyniki na nieznanych zadaniach przy niższych kosztach.

David Robinson, autor raportów bezpieczeństwa OpenAI, odchodzi z firmy i w eseju dla The Atlantic ostrzega o zepsutej kulturze branży AI.