Nowy horyzont wydatków METR porównuje koszty pracy ludzi i AI. Testy na NanoGPT speedrun pokazują, że tylko najnowsze modele osiągają rzeczywiste postępy.

Źródło zdjęcia: The Decoder
Organizacja badawcza METR wprowadza nową metrykę o nazwie „horyzont wydatków”, która pozwala określić dokładny punkt, w którym agenci AI stają się drożsi od ludzi przy rozwiązywaniu problemów. Badacze przetestowali tę metodę na projekcie NanoGPT speedrun, porównując koszt i efektywność pracy człowieka z wydajnością różnych modeli AI.
Horyzont wydatków to punkt przecięcia, w którym koszt osiągnięcia tej samej poprawy przez człowieka i system AI jest identyczny. Poniżej tego budżetu AI okazuje się bardziej opłacalne, powyżej — praca ludzka jest tańsza.
W projekcie NanoGPT speedrun wolontariusze współzawodniczą w jak najszybszym trenowaniu modelu językowego AI. Od maja 2024 roku wymagany czas treningu na standardowym sprzęcie spadł z około 45 minut do poniżej dwóch minut poprzez 82 udokumentowane kroki poprawy.
METR przeprowadziła wywiady z dwoma najbardziej aktywnymi współtwórcami projektu, a także zlecił modelowi AI (Opus-4.6) oszacowanie nakładu pracy za każdą poprawę. Obie metody wskazały na około 16 godzin pracy na każdy procent przyspieszenia. Przy założonej stawce godzinowej 150 dolarów daje to około 2500 dolarów za punkt procentowy.
Badacze podkreślają, że liczba ta jest bardzo niepewna. Jeden szczegół z wywiadów wyróżnia się szczególnie: większość czasu poświęcono na pomysły, które ostatecznie nie zadziałały.
METR przetestowała sześć modeli AI, które pracowały nad tym samym zadaniem niezależnie. Nie zaczynały od zera, ale od już wysoce zoptymalizowanego stanu speedrunu (rekord #78 z marca 2026 roku) i mogły wydać do 10 000 dolarów na obliczenia i koszty operacyjne na przebieg.
Różnice między modelami były drastyczne. GPT-5 i Opus-4.1 nie osiągnęły żadnego rzeczywistego postępu po dokładnej weryfikacji — ich pozorne zyski okazały się być przypadkowym szumem. Z drugiej strony GPT-5.5 i Opus-4.8 dostarczyły rzeczywiste poprawy.
Jakość pomysłów generowanych przez AI była mieszana. Opiekun speedrunu oszacował, że około 70% z nich mogło w zasadzie zostać zintegrowanych z projektem, ale wiele nie było bardzo oryginalnych. Pochwalił jedną sprytną, niskopoziomową optymalizację od GPT-5.5 jako „najfajniejszą”, nazywając większość pozostałych jedynie dostrajaniem parametrów.
Ważne zastrzeżenie: METR testowała tylko starsze modele. Nowsze modele jak Fable 5, GPT-5.6 Sol i Opus 5 nie pojawiły się w badaniu. Anthropic reklamuje Opus 5 jako znaczący skok — na teście Frontier-Bench podwaja wydajność Opus 4.8 przy niższym koszcie za zadanie.
Postęp na benchmarku ARC-AGI-3 jest jeszcze bardziej wymowny. Ten test nie sprawdza zapamiętanej wiedzy, ale prawdziwego rozwiązywania problemów. Opus 5 utrzymuje pierwsze miejsce od 24 lipca 2026 roku, osiągając wynik 30,2% i rozwiązując pięć zadań, z którymi każdy poprzedni model sobie nie radził.
Badanie ma jednak znaczące ograniczenie — pomija najbardziej powszechny scenariusz współpracy między ludźmi a AI, skupiając się wyłącznie na autonomicznych agentach pracujących w izolacji.

Moonshot AI udostępnia model Kimi K3 bezpłatnie, co może zmienić równowagę sił w branży AI i zagrozić dominacji amerykańskich platform.

Administracja Trumpa rozważa ograniczenia konkretnych chińskich modeli AI ze względów bezpieczeństwa, podczas gdy firmy lobbują za różnymi rozwiązaniami.

Nowy model Opus 5 od Anthropic przewyższa większy Fable 5 w testach, oferując mniej ograniczeń i lepszą dostępność dla użytkowników.