Anthropic Claude Opus 5 osiągnął 30,2% w ARC-AGI-3, przewyższając czterokrotnie rekord GPT-5.6 Sol. Model wykazał nowe zdolności rozumowania algebraicznego.

Źródło zdjęcia: The Decoder
Model Claude Opus 5 firmy Anthropic osiągnął przełomowy wynik 30,2% w benchmarku ARC-AGI-3, który został zaprojektowany do mierzenia rzeczywistej inteligencji. To niemal czterokrotnie lepszy rezultat niż poprzedni rekord 7,8% ustanowiony przez GPT-5.6 Sol (Max) od OpenAI. Szczegółowe wyniki i analizę opublikował serwis The Decoder.
Zespół ARC Prize przypisuje znaczną przewagę Opus 5 rzeczywistemu wzmocnieniu zdolności logicznego rozumowania, które umożliwia bardziej autonomiczne eksplorowanie, planowanie i wykonywanie zadań w nieznanych środowiskach. Model wykazał również nowe zachowania, które wcześniej nie były obserwowane u systemów AI.
ARC-AGI-3 mierzy, jak dobrze modele AI rozwiązują nowe zadania, z którymi nie spotkały się podczas treningu, włączając te, które ludzie zazwyczaj mogą łatwo opanować. Obecna wersja działa jak gra – model musi wywnioskować reguły interaktywnego środowiska, zaplanować swoje działania i wykonać je krok po kroku.
Podczas testów Opus 5 wykazał zachowania, których badacze wcześniej nie obserwowali u żadnego modelu. System po raz pierwszy przetłumaczył zadania na notację algebraiczną i niezależnie sformułował równania refleksji. Z 25 publicznych środowisk demonstracyjnych, sześć zostało już rozwiązanych.
Model osiągnął również imponujące wyniki na starszych wersjach benchmarku: 90,4% na ARC-AGI-2 i 97,5% na ARC-AGI-1. Oba rezultaty dorównują poprzednim najlepszym wynikom, choć przy nieco wyższych kosztach obliczeniowych.
Anthropic nie wyjaśnił przyczyn tak znacznego postępu, ale prawdopodobnymi czynnikami są celowane etykietowanie danych i uczenie ze wzmocnieniem. W przeciwieństwie do wcześniejszych modeli, Opus 5 został opracowany już po opublikowaniu ARC-AGI-3 i jego formatu, co mogło pozwolić Anthropic na ukierunkowanie na umiejętności i formaty łamigłówek charakterystyczne dla tego benchmarku.
Testy na Witness, prywatnym benchmarku Guanghan Ninga dla interaktywnych gier logicznych, wskazują na bardziej ograniczone postępy. Opus 5 osiągnął wynik 43,4, statystycznie dorównując Kimi K3 i Fable 5, ale poprawiając się znacznie mniej w porównaniu do Opus 4.8 niż w przypadku ARC-AGI-3.
Greg Kamradt, jeden z badaczy stojących za ARC-AGI-3, argumentował, że wyniki nie wykluczają szerszych postępów w rozumowaniu. Ning później wyjaśnił, że Opus 5 rzeczywiście generalizował na Witness, ale znacznie mniej niż na ARC-AGI-3. Porównał ten proces do ewolucji benchmarków kodowania, gdzie ARC-AGI-3 jako główny cel dla interaktywnego rozumowania prawdopodobnie najpierw przyciągnie największy wysiłek treningowy.
Model Claude Opus 5 ustanowił nowy standard w dziedzinie sztucznej inteligencji, demonstrując znaczące postępy w logicznym rozumowaniu i rozwiązywaniu problemów. Choć niezależne testy sugerują bardziej ograniczone postępy w innych obszarach, przełom w ARC-AGI-3 może stanowić ważny krok w kierunku bardziej ogólnej sztucznej inteligencji.

Brytyjski startup rozszerza ofertę o Roleplay Sessions — platformę do ćwiczenia trudnych rozmów biznesowych z AI, które ocenia wydajność pracowników.

Naukowcy przebadali siedem zaawansowanych modeli AI w 2800 zadaniach administracji Linux. Wyniki pokazują skłonność do poszukiwania władzy na poziomie 0–5%.

Google przekaże 40 mln dolarów w tokenach AI dla naukowców Genesis Mission. Narzędzia jak AlphaEvolve i Gemini już przyspieszają badania w laboratoriach DOE.