Badanie 700 zadań pokazuje: agenci AI przejmują coraz więcej pracy przy budowie modeli, ale decyzje wciąż podejmują ludzie w ponad 85% przypadków.

Źródło zdjęcia: The Decoder
Nowe badanie zespołu związanego z Uniwersytetem Fudan w Chinach pokazuje, jak w praktyce wygląda współpraca ludzi i agentów AI przy budowie nowego modelu językowego. Autorzy przeanalizowali ponad 700 dzienników zadań od 56 uczestników projektu oraz logi agentów, z którymi ci pracowali. Wnioski podważają część oczekiwań dotyczących tego, jak samodzielnie agenty AI mogą już działać.
Projektem badawczym było opracowanie agentowego modelu językowego o nazwie Atria Dawn Preview, oparte na architekturze mixture-of-experts z 744 miliardami parametrów, przeznaczonego do zadań badawczych i inżynierskich.
Atria Dawn Preview był trenowany poprzez pipeline, w którym każde zadanie jest powiązane z realnym środowiskiem wykonawczym: model wywołuje narzędzia, generuje wyniki pośrednie, a następnie jest weryfikowany na podstawie zewnętrznych sygnałów, takich jak testy, metryki czy dowody źródłowe. Zespół twierdzi, że model prowadzi w pięciu z 16 benchmarków, w tym w wyszukiwaniu internetowym i cyberbezpieczeństwie – konkretnie liderem jest w AutomationBench, CyberGym i MLE-Bench Lite. Nie zapewnia jednak ogólnej przewagi nad konkurencją i wypada słabiej w GDPval oraz SWE-Bench Pro.
W trakcie czterotygodniowego projektu uczestnicy przekazywali agentom coraz więcej pracy – mediana liczby akcji agenta przypadających na jedno polecenie człowieka wzrosła z 11 do 28,5. Autorzy ostrzegają jednak, żeby nie interpretować tego jako oznaki rosnącej autonomii: każda decyzja człowieka prowadziła do większej liczby kroków wykonywanych przez agenta, co nie znaczy, że sam agent podejmował więcej decyzji.
Uczestników zapytano też, czy mogliby wykonać swoją część zadania bez AI, zachowując ten sam zakres i jakość. Z 455 zakończonych zadań wspomaganych przez AI aż 151 – czyli około jedna trzecia – zostało ocenionych jako niewykonalne bez sztucznej inteligencji. W tych przypadkach AI nie przyspieszała pracy, którą i tak wykonano by ręcznie – umożliwiała pracę, która w ogóle nie zostałaby podjęta.
Najczęstszym wzorcem przy podejmowaniu decyzji dotyczących metod i parametrów było „AI proponuje, człowiek wybiera” – aż 55,4 proc. przypadków. W ujęciu ogólnym ludzie podejmowali 85,5 proc. decyzji o metodach i parametrach, a AI tylko 9,2 proc. Przy decyzjach o celach i zakresie projektu ludzie mieli ostatnie słowo w 93,4 proc. przypadków. Udział AI w proponowaniu opcji wahał się od 17 do 55 proc. w zależności od typu decyzji, ale jej udział w ostatecznych wyborach pozostawał jednocyfrowy. Nawet wśród 151 zadań uznanych za niewykonalne bez AI, człowiek wybierał cel w 95,4 proc. przypadków.
Podobny wzorzec pojawia się, gdy coś idzie nie tak. Z 588 zadań, w których odnotowano trudność, w 76 proc. dalszy postęp zapewniła interwencja człowieka, a w 23 proc. agent poradził sobie samodzielnie. Pomoc ze strony ludzi najczęściej przybierała formę informacji – dodania kontekstu lub wyjaśnienia wymagań (35,2 proc.) albo zdiagnozowania problemu i zmiany metody (34,7 proc.). Ludzie rzadko wykonywali pracę osobiście: częściowe edycje stanowiły tylko 3,2 proc. przypadków, a pełne przejęcie zadania – jedynie 0,7 proc. Kiedy wyniki AI wymagały korekty, sama AI wprowadzała zmiany w 75,4 proc. przypadków po otrzymaniu informacji od człowieka od ludzi. Bottleneckiem był więc osąd człowieka, nie wykonanie zadania.
Zespół opisuje trzy fazy roli AI w projekcie: od przedmiotu badań, przez narzędzie do pojedynczych zadań, aż do obecnej roli „partnera projektowego”, w której AI szkicuje i dostosowuje plany w ramach celów wyznaczonych przez człowieka. Spekulatywna czwarta faza obejmowałaby rekurencyjne samodoskonalenie, w którym silniejsze modele produkują jeszcze silniejsze modele-następców. Autorzy zauważają jednak, że model może poprawiać się w zadaniach, na których był trenowany, bez jednoczesnego wzrostu umiejętności rozwijania swojego następcy. To, jak AI mogłaby proponować różnorodne kierunki badawcze i oceniać ich wartość przed uzyskaniem wyników, pozostaje otwartym pytaniem.
Autorzy zwracają uwagę na poważne ryzyko: gdy każda decyzja opiera się na dłuższym łańcuchu pracy agenta, niż jakikolwiek człowiek jest w stanie realnie zweryfikować, nadzór staje się trudny. W najgorszym przypadku ludzie stają się recenzentami, którzy mogą jedynie „przybić pieczątkę” temu, co widzą – piszą badacze. Wielu uczestników uruchamiało agenty w trybach autonomicznych, by nie przerywać długich sesji roboczych stałymi zatwierdzeniami. Ta granica została jednak wytyczona z wygody, nie z celowej decyzji o tym, jak dużą władzę powinna mieć AI.
Badanie wpisuje się w szerszą debatę o rekurencyjnym samodoskonaleniu modeli. Anthropic uważa, że AI zdolna do rozwijania swojego następcy może pojawić się szybciej, niż wcześniej zakładano, w związku z czym CEO firmy Dario Amodei apeluje o „ograniczenie prędkości” dla całej branży – co koresponduje z decyzją opisaną w tekście o wstrzymaniu treningu najbardziej zdolnych modeli przez OpenAI. Według Anthropic ludzie podejmują obecnie w firmie jednocyfrowy procent decyzji dotyczących kierunku badań, co pokazuje, jak dynamicznie zmienia się podział pracy między ludźmi a AI – tendencję widać też w tym, że OpenAI koncentruje coraz więcej badań na modelach nowej generacji. Firma wykorzystuje model GPT-5.6 Sol w całym cyklu rozwoju, a Google i DeepMind pozwalają agentom AI eksplorować alternatywne strategie za pomocą nagrywanych ścieżek wyszukiwania w systemie Dream-RSI.
Badanie zespołu Atria dostarcza rzadkiego, opartego na twardych danych wglądu w to, jak dziś naprawdę wygląda współpraca człowieka z AI w rozwoju modeli: agenty wykonują coraz więcej kroków technicznych, ale decyzje o celach, metodach i kierunku pracy w ogromnej większości wciąż pozostają w rękach ludzi.

Meta udostępniła open-source firmware i SDK Muse Gadgets, by hobbyści budowali własny sprzęt AI zintegrowany z asystentem Muse.

Asus ProArt z Nvidia RTX Spark ma uruchamiać lokalnie agentów AI, zastępując chmurowe usługi i płatne abonamenty na komputerze.

OpenAI umieściło na GitHubie 372 wyniki matematyczne stworzone przez AI, dzieląc świat matematyki wobec tempa i formy ich publikacji.