Nowe badanie pokazuje, że skille pomagają agentom AI głównie przez procedurę działania, nie wiedzę, a duże biblioteki utrudniają ich trafne wyszukanie.

Źródło zdjęcia: The Decoder
Nowe badanie zespołu naukowców z Princeton University, UC San Diego i innych uczelni wyjaśnia, dlaczego tzw. „umiejętności” (skills) poprawiają działanie agentów AI — i w jakich sytuacjach zawodzą. To pierwsza próba systematycznego zbadania mechanizmu, który dotąd oceniano jedynie po skuteczności: czy agent wyposażony w skill rozwiązywał więcej zadań niż ten bez niego. Tym razem badacze poszli dalej i sprawdzili, co dokładnie dzieje się „pod maską” takiego mechanizmu.
Skill w kontekście agentów AI to zwięzły zestaw instrukcji — krok po kroku opisujący, jak podejść do zadania, co sprawdzić i jakich typowych błędów unikać. Zamiast zaczynać każde zadanie od zera, agent korzysta z takich zapisanych doświadczeń, niczym z gotowej ściągawki. Badacze przeprowadzili kontrolowane eksperymenty, porównując zachowanie agentów z dostępem do skilla i bez niego na identycznych zadaniach — łącznie w 8135 testowych przebiegach.
Główny wniosek badania jest jednoznaczny: skille działają przede wszystkim jako procedura, nie jako źródło informacji. Ustalają, jakie kroki konfiguracyjne wykonać, z jakich narzędzi skorzystać i w jakiej kolejności, jakie kontrole pośrednie są potrzebne. To zauważalnie redukuje pewne kategorie błędów wykonawczych — na przykład niepoprawne przygotowanie środowiska pracy czy błędy w formacie wyników.
To odróżnia skille od klasycznych baz wiedzy, które mają dostarczać agentowi faktów potrzebnych do rozwiązania problemu. Zgodnie z badaniem taka funkcja odgrywa marginalną rolę — wpływała na wynik jedynie w 4,5 proc. przypadków, w których agent ze skillem radził sobie lepiej. Innymi słowy: to nie „co agent wie”, ale „jak konsekwentnie działa” decyduje o poprawie skuteczności.
Badanie ujawnia też nową kategorię błędów, którą tworzy samo posiadanie skilla. W 10 proc. przypadków agent stosował skądinąd użyteczny playbook mechanicznie albo w sposób niedopasowany do specyfiki danego zadania. Gdy zadanie wymaga fundamentalnie innego podejścia, błędnie wybrany skill oczywiście nie pomaga — ale, jak zaznaczają autorzy, dokładne dopasowanie skilla do zadania nie jest ani wystarczające, ani konieczne. Skille pokrewne tematycznie często wystarczają, by nadać agentowi właściwy kierunek działania.
Drugim, niezależnym problemem jest samo wyszukanie odpowiedniego skilla w bibliotece. Autorzy wykazali, że skalowanie biblioteki skilli drastycznie utrudnia trafny wybór: przy 5 wpisach precyzja wyszukiwania w rzeczywistym użyciu wynosiła 29,6 proc., a przy rozbudowaniu biblioteki do 100 wpisów spadła do 3,3 proc. Sytuację komplikują dodatkowo opcje, które brzmią bardzo podobnie do siebie — im większe podobieństwo nazw czy opisów skilli, tym trudniejszy wybór dla systemu wyszukującego.
Na podstawie tych obserwacji badacze argumentują, że użycie skilli powinno być traktowane jako proces obejmujący cały cykl życia — od tworzenia, przez wyszukiwanie, po zastosowanie — a nie jako jednorazowe dodanie wpisu do bazy doświadczeń. Lepsze samouczące się agenty, jak podsumowują autorzy, nie powstaną dzięki gromadzeniu coraz większej liczby zapisanych doświadczeń, lecz dzięki bardziej wiarygodnym metodom ich tworzenia, wyszukiwania i wykorzystywania w praktyce.
To ma istotne znaczenie dla projektantów systemów agentowych: sam wzrost liczby dostępnych skilli, bez poprawy mechanizmów wyszukiwania i dopasowania, może w praktyce pogorszyć, a nie polepszyć skuteczność agenta. Problem trafności wyszukiwania okazuje się być co najmniej tak istotny, jak jakość samych zapisanych instrukcji.
Badanie pokazuje, że skille poprawiają działanie agentów AI głównie poprzez ustandaryzowanie procesu wykonania zadania, a nie dzięki dostarczaniu wiedzy — ale ich efektywność silnie zależy od trafnego wyszukania właściwego skilla, co staje się coraz trudniejsze wraz z rozrostem biblioteki.
Qwen 3.8 27B osiąga 52 punkty w Artificial Analysis Intelligence Index, dorównując GPT-5.6 Luna mimo dużo mniejszej liczby parametrów.

Nowa metoda RubricForge redukuje fałszywe zaliczenia nieudanych działań agentów AI, kluczowy problem oceny systemów bez dostępu do nagrody środowiska.

Meta płaci Microsoftowi setki milionów dolarów rocznie za dostęp do modeli AI przez Azure, jednocześnie budując własną konkurencyjną usługę API.