Nowy system AREX-2 uczy agentów LLM refleksji i długookresowej iteracji, przenosząc umiejętności z programowania na badania typu deep research.

Źródło zdjęcia: arXiv.org
Badacze z grupy obejmującej autorów takich jak Hongjin Qian, Chaofan Li i Zheng Liu opublikowali 29 września 2026 roku pracę opisującą AREX-2 – system mający na celu rozwój zdolności agentów opartych na dużych modelach językowych (LLM) do samodzielnego doskonalenia się w trakcie wykonywania zadania. Autorzy definiują tę zdolność jako umiejętność iteracyjnego poprawiania rozwiązania w czasie testowania (test time), bez konieczności dodatkowego treningu.
Punktem wyjścia dla zespołu badawczego było pytanie, czy agenci LLM mogą uczyć się poprawiać własne rozwiązania bez dodatkowego nadzoru na etapie testowania. Autorzy wyodrębnili dwa komponenty tej zdolności. Pierwszym jest refleksja – mechanizm, który na podstawie bieżącego rozwiązania generuje jego lepszą wersję. Drugim jest długookresowa egzekucja, czyli umiejętność utrzymania skuteczności procesu iteracyjnego przez wiele kolejnych rund, bez stopniowej degradacji jakości czy utraty kierunku.
Kluczowa hipoteza badaczy brzmi: obie te zdolności są niezależne od domeny (domain-agnostic), co oznacza, że nauczone w jednym kontekście powinny przenosić się na inne zadania. To założenie ma istotne konsekwencje praktyczne – jeśli jest prawdziwe, nie trzeba trenować agenta osobno dla każdego typu zadania, wystarczy nauczyć go ogólnego wzorca refleksji i konsekwentnej iteracji w dziedzinach, które dobrze poddają się nadzorowi.
Aby przetestować tę hipotezę, zespół zsyntetyzował długie trajektorie poprawy rozwiązań w dwóch obszarach: uczeniu maszynowym oraz programowaniu algorytmicznym. Wybór tych dziedzin nie był przypadkowy – oferują one weryfikowalną informację zwrotną (można obiektywnie sprawdzić, czy kolejna iteracja jest lepsza od poprzedniej) oraz naturalnie nagradzają sustained iteration, czyli wytrwałe, wieloetapowe doskonalenie rozwiązania, a nie jednorazową próbę.
Na tak przygotowanych danych wytrenowano agenta oparty na modelu Qwen3.8–27B. Wyniki na benchmarkach dedykowanych tym domenom okazały się solidne: 81,8 punktu na MLE-bench Lite (benchmark oceniający zadania z uczenia maszynowego) oraz 70,7 na Frontier-CS (benchmark programistyczny).
Najważniejszym testem hipotezy badaczy było jednak sprawdzenie, czy zdolności nauczone w tych dwóch domenach przeniosą się na zupełnie inny typ zadań – tzw. deep research, czyli złożone, wieloetapowe poszukiwanie i syntezę informacji. Tutaj agent AREX-2 uzyskał:
Wyniki te wskazują, że wzorce refleksji i długookresowej egzekucji wyuczone na zadaniach z uczenia maszynowego i programowania algorytmicznego faktycznie przenoszą się na odległe dziedziny, potwierdzając postawioną hipotezę o domain-agnostic charakterze tych zdolności.
Istotnym elementem wyników jest obserwacja, że agent AREX-2 „keeps improving as its budget of rounds grows” – czyli jego skuteczność rośnie w miarę zwiększania liczby dostępnych rund iteracji. To zachowanie jest kluczowe dla koncepcji samodoskonalących się agentów: jeśli dodatkowy czas obliczeniowy przeznaczony na iterację przekłada się na realny wzrost jakości rozwiązania, oznacza to, że mechanizm refleksji rzeczywiście działa, a nie jest jedynie artefaktem jednorazowej poprawki.
Autorzy podsumowują, że przedstawione wyniki pokazują, że dane refleksyjne o długim horyzoncie czasowym (long-horizon reflective data) są efektywną drogą do budowy agentów zdolnych do samodoskonalenia. Innymi słowy – zamiast projektować osobne mechanizmy iteracyjnego poprawiania rozwiązań dla każdej dziedziny zastosowania, można nauczyć agenta ogólnego wzorca refleksji na zadaniach, które dobrze poddają się weryfikacji, a następnie liczyć na transfer tych umiejętności do innych, mniej jednoznacznie weryfikowalnych obszarów, takich jak badania typu deep research.
Praca wpisuje się w szerszy trend rozwoju agentów AI, którzy wykonują coraz więcej pracy samodzielnie, w tym w badaniach nad modelami i architekturach wspierających rozumowanie na dużą skalę. Autorzy zapowiedzieli, że kod oraz wytrenowane modele zostaną udostępnione publicznie, co pozwoli innym zespołom badawczym zweryfikować i rozwinąć tę metodologię.
AREX-2 demonstruje, że ucząc agenta LLM refleksji i długookresowej egzekucji na zadaniach z uczenia maszynowego i programowania algorytmicznego, można uzyskać zdolności samodoskonalenia, które skutecznie przenoszą się na odległe dziedziny, takie jak deep research – otwierając nową ścieżkę rozwoju agentów zdolnych do coraz lepszego radzenia sobie z problemami w miarę przyznawania im większego budżetu czasowego na iterację.

Anthropic wprowadza Claude'a jako panel boczny w Dokumentach Google – redaguje tekst, tworzy tabele i działa równolegle z Gemini.

Nowa metoda Google Cloud AI Research, RRSI, ogranicza przeuczanie agentów AI na testach i poprawia wyniki na nieznanych zadaniach przy niższych kosztach.

Kevin Roose opowiada o książce AGI Chronicles, 150 wywiadach z branżą AI i nowym podcaście Machine Gods z NPR.