Nowa metoda Google Cloud AI Research, RRSI, ogranicza przeuczanie agentów AI na testach i poprawia wyniki na nieznanych zadaniach przy niższych kosztach.

Źródło zdjęcia: The Decoder
Badacze Google Cloud AI Research wraz z kilkoma uniwersytetami opracowali metodę, która ma rozwiązać jeden z głównych problemów samodoskonalących się agentów AI: tendencję do zapamiętywania zadań testowych zamiast realnego uczenia się. Nowe podejście, nazwane RRSI (Regularized Recursive Self-Improvement of Agent Harnesses), poprawia działanie agentów na nieznanych zadaniach przy jednoczesnym ograniczeniu zużycia tokenów.
Problem dotyczy tzw. „harnessu” – zestawu promptów, procedur, narzędzi, pamięci i logiki, który kontroluje, co model językowy widzi na każdym kroku działania. Zgodnie z artykułem naukowym to właśnie praca nad harnessem, a nie nowe modele, odpowiada za znaczną część ostatniego postępu w dziedzinie agentów AI.
Do niedawna harness był poprawiany ręcznie – ludzie analizowali nieudane próby i łatali system krok po kroku. Nowsze metody automatyzują ten proces: model językowy sam przepisuje harness, opierając się na informacjach zwrotnych z zadań testowych. Badacze nazywają to praktyczną formą rekurencyjnej samopoprawy – system generuje informacje zwrotne, które wykorzystuje do optymalizacji harnessu, a ten z kolei kontroluje zachowanie samego systemu.
Problem polega na tym, że agent pracujący wciąż na tym samym, ograniczonym zbiorze zadań testowych z czasem zaczyna je po prostu zapamiętywać. Wyniki na zadaniach treningowych rosną, ale korzyści na nowych, nieznanych zadaniach kurczą się albo całkowicie zanikają. Jak piszą autorzy, dzieje się to w kilku mechanizmach: proces wyszukiwania zapamiętuje wzorce pasujące tylko do jednego konkretnego benchmarku, premiuje kandydatów, którzy dobrze wypadają czysto przez przypadek, oraz dokłada niepotrzebną złożoność, która podnosi wynik testu, nie czyniąc agenta realnie lepszym.
RRSI działa na obu końcach cyklu optymalizacji, pozostawiając harness w pełni edytowalnym. Gdy system proponuje nowe zmiany, budżet ogranicza liczbę niezależnych edycji, które kandydat może zaproponować jednocześnie. Ten budżet z czasem się zmniejsza – wczesne rundy pozwalają na większe przebudowy, a późniejsze dopuszczają już tylko drobne zmiany, które można jednoznacznie powiązać z konkretnym rezultatem. System śledzi też wcześniejsze próby, aby nie powtarzał tych samych nieudanych pomysłów, a gdy postęp zatrzymuje się, celowo eksperymentuje z fragmentami harnessu, których jeszcze nie dotknął.
Drugim elementem jest „krytyk”, który sprawdza każdą propozycję i odrzuca te, które na stałe wpisują nazwy zadań, konkretne rozwiązania lub inne sztuczki charakterystyczne dla danego benchmarku. Kolejna reguła przyjmuje wyższe koszty obliczeniowe tylko wtedy, gdy idą w parze z mierzalnym wzrostem skuteczności, a komponenty, które nie przynoszą już korzyści, są usuwane.
Zespół testował RRSI na ośmiu benchmarkach obejmujących programowanie, pracę biurową agentów oraz projektowanie inżynieryjne, przy czym bazowy model – Claude Opus 4.8 – pozostawał przez cały czas niezmienny (frozen). Porównano RRSI z niezmodyfikowanym harnessem bazowym oraz czterema innymi niedawnymi metodami optymalizacji. Każda z metod radziła sobie dobrze na zadaniach treningowych, ale wyniki odwróciły się na nowych zadaniach – dwie metody spadły nawet poniżej poziomu harnessu bazowego. RRSI uzyskał najmniejszy przyrost na zadaniach treningowych ze wszystkich wariantów, ale jako jedyny wylądował wyraźnie powyżej poziomu bazowego na zadaniach nieznanych. Ogólna skuteczność nigdy nie spadła poniżej wartości bazowej na żadnym z nieznanych benchmarków – co typowo zdarza się przy harnessie, który zapamiętał swoje zadania.
Jednym z bardziej zaskakujących wyników jest to, że mechanizmy znalezione przez RRSI nie zależą od możliwości modelu, który je odkrył. Harness programistyczny zoptymalizowany z użyciem Gemini 3.5 Flash podniósł dokładność znacznie słabszego modelu Gemini 3.1 Flash Lite z 11,2 do 14,6 punktu – bez żadnych dodatkowych modyfikacji. Autorzy zaznaczają jednak, że ich badanie obejmuje wyłącznie harnessy budowane wokół modeli o zamrożonych wagach i nie dotyczy przypadków, w których same wagi modelu się zmieniają. Konkludują, że samodoskonalenie czyni agenty AI realnie bardziej zdolnymi tylko wtedy, gdy powtarzalne informacje zwrotne przekładają się na trwałe, generalizujące się zmiany, a nie tylko na lepsze wyniki w konkretnym teście. Kod projektu jest dostępny na GitHubie.
W tekście przywołano też wcześniejsze przykłady tego samego problemu. Testy na ARC-AGI-3 pokazały, że ręcznie zaprojektowane harnessy często nie generalizują się na nowe zadania – Opus 4.6 z dedykowanym harnessem uzyskał 97,1 proc. w znanym środowisku i 0 proc. w nieznanym. Nvidia niedawno przedstawiła podobną metodę o nazwie SoL-Pi, w której agent badawczy automatycznie przebudowuje harness agentów programistycznych, ograniczając zużycie tokenów nawet o 49 proc. bez zauważalnego spadku skuteczności. Nieco wcześniej Google testował podejście, w którym agenty „marzyły” o wcześniejszych przebiegach wyszukiwania, aby poprawić swoją strategię – podobnie jak w przypadku agentów AI uczących się samodoskonalenia na długich zadaniach opisanych w projekcie AREX-2, cel pozostawał ten sam: poprawić skuteczność bez zmiany samego modelu.
Praca zespołu Google pokazuje więc, że kluczem do wiarygodnego samodoskonalenia agentów AI nie jest większa swoboda optymalizacji, lecz jej dobrze zaprojektowane ograniczenia – mniej ingerencji, ale skierowanych na zmiany, które faktycznie przekładają się na nowe sytuacje.
OpenAI testuje reklamy wizualne w ChatGPT i rozszerza narzędzia pomiarowe oraz partnerstwa dla reklamodawców na platformie z 1,2 mld użytkowników.

LiquidAI udostępnia otwarte modele decyzyjne d1–3B i d1-omni-600M dla edge AI, wpisując się w rosnący trend modeli decyzyjnych w branży.

Nowa praca naukowa opisuje Adaptive Workflow Intelligence – architekturę agentów AI łączącą refleksję z adaptacją w zmiennych warunkach biznesowych.