Badanie Vals AI i Anthropic pokazuje, że zespoły agentów AI kosztują nawet 5x więcej niż pojedynczy agent, dając minimalny wzrost jakości wyników.

Źródło zdjęcia: The Decoder
Wieloagentowe systemy AI, reklamowane jako sposób na lepsze wyniki w zadaniach programistycznych i analitycznych, w praktyce kosztują znacznie więcej, niż dają w zamian. Jak wynika z badania przeprowadzonego przez firmę Vals AI, zespoły agentów zużywają od 1,8 do 5,1 raza więcej tokenów niż pojedynczy agent, a mierzalna poprawa jakości wyników pojawia się tylko w jednym z czterech testowanych scenariuszy.
Testy objęły modele GPT-6 Sol i Claude Opus 5.5, oceniane w ramach benchmarku „Vibe Code Bench” – zarówno jako pojedyncze instancje, jak i jako zespoły agentów, przy dwóch poziomach wysiłku rozumowania: średnim i maksymalnym. Wyniki podważają popularne przekonanie, że „więcej agentów” automatycznie oznacza lepszy produkt.
Dane Vals AI pokazują zależność między kosztem jednej aplikacji a punktacją w teście Vibe Code Bench. Strzałki prowadzące od pojedynczego agenta do jego wersji zespołowej przy tym samym poziomie rozumowania konsekwentnie wskazują w górę pod względem kosztu, ale prawie poziomo pod względem wyniku. Innymi słowy – firmy płacą znacznie więcej za niemal identyczny efekt końcowy.
Podobny obraz wyłania się z własnych testów Anthropic na modelu Opus 5.5. W dwóch zadaniach – budowie bazy wiedzy oraz dowodzeniu twierdzeń w systemie Lean – firma porównała wyniki dla 1, 10, 30 i 100 agentów. W zadaniu z bazą wiedzy wynik wzrósł z 0,53 (jeden agent) do 0,70 przy dziesięciu agentach, ale dalsze skalowanie do 30 i 100 agentów podniosło wynik tylko do 0,71 i 0,74. W dowodzeniu twierdzeń Lean wynik skoczył z 0,39 do 0,66 przy dziesięciu agentach, po czym praktycznie się zatrzymał – 0,66 przy 30 agentach i 0,68 przy 100.
Model Fable 5.1 wypadł inaczej – pokazał silniejsze zyski jakości w zadaniu Lean powyżej dziesięciu agentów, ale we wszystkich testach pozostał słabszy od Opus 5.5. W zadaniu z bazą wiedzy wynik Fable nieznacznie spadł przy skalowaniu z 30 do 100 agentów, co dodatkowo podkreśla, że większa liczba agentów nie gwarantuje lepszych rezultatów, a w niektórych przypadkach może je nawet pogorszyć.
Dodatkowe testy przeprowadzone w ramach ProgramBench pokazały, że zyski na szybkości działania idą w parze z wyższym zużyciem tokenów – co oznacza, że większe zespoły agentów przyspieszają wykonanie zadania, ale za cenę proporcjonalnie wyższych kosztów obliczeniowych.
Potwierdzenie tego wzorca przyniosła rozmowa badacza OpenAI Noama Browna w podcaście Dwarkesh. Brown wyjaśnił, że systemy wieloagentowe przede wszystkim przyspieszają wykonanie zadań, a nie poprawiają ich jakość. Cztery agenty rozwiązywały zadania dwukrotnie szybciej niż jeden, ale kosztowały też dwa razy więcej. Przy 16 agentach ten wzorzec się utrzymał, choć efektywność nieco spadła.
Brown zwrócił uwagę, że efekt silnie zależy od rodzaju zadania. Badania internetowe i matematyka dają się dobrze zrównoleglić, ale pisanie powieści – nie. Przydzielenie 10 tysięcy agentów do napisania powieści byłoby, jego zdaniem, równie bezsensowne jak przydzielenie do tego zadania 10 tysięcy ludzi. Przyznał również, że skalowanie do bardzo dużej liczby agentów pozostaje w dużej mierze niezbadane, ponieważ koszty takich eksperymentów są po prostu zbyt wysokie.
Na podobne ryzyko zwrócił uwagę Eric Provencher, deweloper w OpenAI, który ostrzegał przed stosowaniem całych „rojów” agentów właśnie z tego powodu. Jego zdaniem to w dużej mierze wyrzucone pieniądze, bo koordynacja między wieloma agentami zaczyna się rozpadać – zjawisko, które nazwał „podatkiem od koordynacji” (coordination tax). Problem koordynacji agentów i kosztów ich pracy wpisuje się w szerszy trend obserwowany ostatnio w branży, który opisywaliśmy m.in. w kontekście architektury kognitywnej dla agentów AI w firmach oraz nowych metod syntezy danych dla agentów korporacyjnych.
Wyniki badań Vals AI i Anthropic, potwierdzone przez obserwacje badaczy OpenAI, rzucają cień na obecny trend budowania coraz większych „rojów” agentów AI jako domyślnego rozwiązania dla skomplikowanych zadań. Skoro koszt operacyjny rośnie nieproporcjonalnie do zysku w jakości, firmy wdrażające agentów na dużą skalę – zwłaszcza w programowaniu i analizie danych – powinny dokładnie kalkulować, czy dodatkowe tokeny przekładają się na realną wartość biznesową, czy jedynie na iluzję postępu. Wobec rosnących kosztów infrastruktury AI pytanie o efektywność wykorzystania mocy obliczeniowej nabiera dodatkowego znaczenia.
Badania pokazują jasno: w większości przypadków dodatkowe koszty pracy zespołów agentów AI nie znajdują pokrycia w realnej poprawie jakości wyników, a jedyną niezmienną korzyścią pozostaje szybsze – choć nie lepsze – wykonanie zadania.
HackerRank udostępnia Chakrę, agenta AI prowadzącego rozmowy kwalifikacyjne, który ocenia myślenie kandydatów, nie tylko ich odpowiedzi.

Microsoft wprowadza w Windows 11 kontenery bezpieczeństwa i lokalne modele AI, zmieniając Copilot w agenta działającego na komputerach Copilot+.

OpenAI umieściło na GitHubie 372 wyniki matematyczne stworzone przez AI, dzieląc świat matematyki wobec tempa i formy ich publikacji.