GPT-6 Astra pokonał Pokemon FireRed w 18 godzin i Fallout 3 w 59, ale eksplozja Creepera w Minecrafcie zniszczyła jego dobytek.

Źródło zdjęcia: The Decoder
GPT-6 Astra: mistrz Pokemon w 18 godzin, potem wpadka w Minecrafcie pokazuje, jak duży skok wykonał najnowszy model OpenAI w grach, które do niedawna stawiały opór każdej sztucznej inteligencji. Astra pokonał Pokemon FireRed w rekordowym tempie, wystrzelił rakietę w Factorio i doszedł do napisów końcowych w Fallout 3 oraz Portalu. Ale w Minecrafcie pojedyncza eksplozja Creepera zniszczyła cały jego dobytek – i model spędził potem kilka godzin, sadząc niemal wyłącznie ziemniaki.
Skala postępu staje się widoczna dopiero w porównaniu z wcześniejszymi generacjami agentów. W 2022 roku system VPT od OpenAI docierał do diamentowego kilofa w Minecrafcie w zaledwie 2,5 procent uruchomień, nie mając szans na dotarcie do portalu – w jednym z porównań Vals AI potrzebował na to 10 minut. GPT-6 Astra spędził w tej samej grze ponad 100 godzin, a Vals AI ostatecznie przerwał sesję po 141 godzinach, kiedy model już dawno przekroczył wszystkie wcześniejsze rekordy.
Podobny obraz daje community run w Factorio: Space Age, prowadzony przez niestandardowy moduł Lua z interfejsem MCP. Astra wyprodukował niebieskie pakiety naukowe po około dwóch godzinach i wystrzelił pierwszą rakietę po mniej więcej dziesięciu. W tej samej konfiguracji GPT-5.6 Luna i Fable 5.1 nie przeszły dalej niż etap zasilania i poszukiwania ropy.
Do tego dochodzą osiągnięcia bez punktu odniesienia: przejście Portala aż do napisów końcowych, Fallout 2 zakończony w 22 godziny oraz kolonia w RimWorld, którą Astra przeprowadził przez kilka najazdów, a finalnie – poza samą planetę. To o tym modelu pisaliśmy już wcześniej – GPT-6 Astra pilotuje drona i samodzielnie prowadzi biznes, a także w kontekście generowania trasy biegowe z danych OSM.
Organizacja ARC Prize, stojąca za benchmarkiem ARC-AGI-3, wyjaśniła mechanizm stojący za tym skokiem: Astra tłumaczy nieznane mechaniki gry na kompaktowe symboliczne opisy i śledzi obiekty, współrzędne, reguły oraz zaplanowane akcje we własnym, samodzielnie opracowanym skrócie zapisu. Obserwacje stają się regułami, a reguły – planami.
Sama idea przekształcania doświadczenia w powtarzalne zasady nie jest nowa. Już w 2023 roku projekt badawczy Voyager, z udziałem Nvidii i Caltech, kazał GPT-4 proponować zadania w Minecrafcie, pisać do nich kod JavaScript i poprawiać go na podstawie komunikatów o błędach. Działające programy trafiały do biblioteki umiejętności. Różnica jest jednak zasadnicza: Voyager nigdy nie „widział” gry – otrzymywał ustrukturyzowane dane i kontrolował ją przez interfejs programistyczny Mineflayer. Uruchomienie Vals AI w Minecrafcie, przeciwnie, przebiega przez ogólne korzystanie z komputera – ekran, mysz i klawiatura, bez żadnego specjalnego podłączenia do gry. To, co badacze kiedyś budowali wokół modelu, Astra teraz robi sama. W niecałe trzy godziny zbudowała portal do Netheru, pokonała zombie, unieszkodliwiła szkieleta i wróciła bezpiecznie do bazy.
Podobny wzorzec widać w przebiegu Fallout 3. Użytkownik imjustnewatai, który opublikował całą rozgrywkę na YouTube, sam przeszedł otwarcie w Vault 101, a następnie przekazał plik zapisu narzędziu agentowemu OpenAI, Codex, z Astrą ustawioną na maksymalne rozumowanie. Od tego momentu agent sam wybierał trasę i akcje: Galaxy News Radio, poszukiwania ojca, G.E.C.K., ucieczka z Raven Rock, Project Purity. Gra toczyła się poprzez standardowe wejścia, w cyklach zatrzymania, obserwacji i działania, z dopuszczonymi zapisami, towarzyszami i szybką podróżą.
Najtrudniejszy fragment rozgrywki – w Vault 87, gdzie postać wielokrotnie ginęła, a amunicja się kończyła – ujawnia charakterystyczny wzorzec działania modelu. Gdy akcja nie przynosiła efektu, Astra nie powtarzała jej mechanicznie, lecz szukała przyczyny i zapisywała wynik. Gdy łóżko, które miało leczyć postać, nie zadziałało od razu, model odczekał chwilę, spróbował ponownie i zanotował: „Łóżko zadziałało po krótkim odczekaniu w grze. Zdrowie zostało w pełni przywrócone do 260/260.” Gdy strzały do wroga nieustannie chybiały, Astra doszła do wniosku, że coś blokuje linię strzału, podeszła bliżej i odnotowała: „Podejście bliżej usunęło przeszkodę, która wcześniej psuła strzały.” Przy klawiaturze numerycznej model czekał na potwierdzenie naciśnięcia przycisku przez grę, zanim przeszedł dalej.
Z tych epizodów Astra wyciągnęła jedną zasadę: sprawdzić, czy działanie zadziałało, zanim je powtórzy. To zasada z pozoru trywialna, ale to właśnie ona chroni agenta przed zapętleniem tej samej bezskutecznej akcji – choć, jak pokazuje przypadek zniszczonej skrzyni w Minecrafcie, potrafi też stać się źródłem zachowań, które później zmieniają się w problem.
Wyniki GPT-6 Astra w grach wideo – od Pokemon FireRed przez Factorio po Fallout 3 – potwierdzają, że model radzi sobie ze złożonymi, wieloetapowymi zadaniami znacznie lepiej niż jego poprzednicy, ale historia z Creeperem w Minecrafcie przypomina, że nawet najbardziej wyrafinowany agent AI wciąż może zostać zaskoczony prostym, przypadkowym wydarzeniem w otwartym świecie gry.

Rzeczniczka OpenAI przerwała wywiad Vanity Fair z Samem Altmanem, gdy dziennikarz zapytał o samobójstwo użytkowniczki ChatGPT.

Dale Caldwell zrezygnował po dochodzeniu w sprawie molestowania, ale twierdzi, że chatboty AI 59 razy potwierdziły jego niewinność.
OpenAI testuje reklamy wizualne w ChatGPT i rozszerza narzędzia pomiarowe oraz partnerstwa dla reklamodawców na platformie z 1,2 mld użytkowników.