Warp opisuje, jak dwuwarstwowy system skilli i ludzki feedback pozwalają agentom AI na Claude Platform stale poprawiać swoją jakość.

Źródło zdjęcia: Claude
Warp, firma stojąca za popularnym terminalem AI i środowiskiem programistycznym opartym na agentach, opisała na blogu Claude, jak przekształciła jednorazową informację zwrotną użytkowników w mechanizm, który sprawia, że jej agenci sami się doskonalą z każdą kolejną interakcją. Historia zaczęła się od frustracji – wewnętrzny agent do code review generował komentarze, które inżynierowie oceniali jako nieprzydatne i niskiej jakości.
Warp, zbudowany na Rust i Golangu, wykorzystuje własną platformę orkiestracji agentów (Oz) oraz Claude Platform. Firma zebrała już 73 mln dolarów finansowania, z jej narzędzi korzysta 800 tys. developerów miesięcznie, a 56% firm z listy Fortune 500 używa Warp w codziennej pracy. Do tej pory w Warp odbyło się 10 mln sesji Claude Code (ponad 400 tys. tygodniowo) oraz 40 mln rozmów z agentami Warp ogółem.
Zanim Warp doszedł do obecnego rozwiązania, zespół próbował prostszych metod. Inżynierowie ręcznie przepisywali prompty na podstawie zaobserwowanych błędów agenta w code review – to podniosło jakość, ale nie skalowało się na dłuższą metę. Poprawianie plików kontekstowych, takich jak AGENTS.md, również pomagało, ale nie było kompletnym rozwiązaniem problemu.
Zespół doszedł do wniosku, że rdzeniem problemu nie jest jakość samego promptu, lecz to, że jakikolwiek feedback do agenta – niezależnie od jego przeznaczenia – zwykle znika po zakończeniu sesji, usuwając krytyczny kontekst z pętli agentowej. Odpowiedzią stał się framework oparty na Agent Skills, w którym feedback kumuluje się w czasie, by nieprzerwanie udoskonalać wyniki agenta.
Centralnym elementem podejścia Warp jest pętla samodoskonalenia zbudowana na skillach – plikowych encapsulacjach wiedzy, które trzymają instrukcje poza samym promptem. Warp opracował architekturę składającą się z dwóch skilli, między którymi znajduje się ludzki feedback.
Wewnętrzny, bazowy skill przechowuje funkcjonalną wiedzę domenową i instrukcje. Kiedy otwierany jest pull request, agent Warp do code review wykonuje zadanie właśnie na podstawie tego bazowego skilla i kontekstu, produkując recenzję kodu.
Kluczowym elementem pętli jest ludzka informacja zwrotna na wynik pracy agenta. W przypadku code review może to być coś prostego jak „lubię to” (thumbs up), ale im bardziej szczegółowy feedback, tym lepiej.
„Człowiek może potwierdzić: 'to był dobry, przydatny komentarz'” – wyjaśnia założyciel Warp Zach Lloyd. „Ale człowiek może też podać konkretne powody, dlaczego recenzja kodu nie była dobra. Szczegóły typu 'zaproponowałeś zmianę nazwy tej zmiennej, ale konwencja w naszej bazie kodu dla tego typu zmiennej globalnej jest inna' mówią agentowi, jak zrobić to poprawnie następnym razem”.
Zewnętrzny, „poprawiający” skill działa jak agent-obserwator uruchamiany cyklicznie, a nie przy każdym zadaniu. Pobiera zakumulowany ludzki feedback, porównuje to, co zasugerował agent, z reakcją człowieka, i proponuje niewielką, ukierunkowaną zmianę w skillu bazowym.
Ponieważ skille to zwykłe pliki, agenci są bardzo dobrzy w ich aktualizowaniu. Zmiany te – recenzowalne, zatwierdzalne i scalane – przechodzą przez normalny workflow PR/code review; po zmergowaniu kolejne wywołanie skilla bazowego dziedziczy już ulepszenie. Warp uruchomił ten wzorzec w całym swoim otwartym repozytorium, z osobnymi agentami do pisania specyfikacji, recenzowania i triage – każdy z własną pętlą samodoskonalenia. Podobne mechanizmy budowania agentów opartych na skillach opisywaliśmy już w kontekście testów persystentnego agenta Codex od OpenAI.
„Plikowe skille to sposób kodowania wiedzy dla agentów bez umieszczania jej wprost w promptu – agent może po nią po prostu sięgnąć w trakcie wykonywania swojej pracy” – mówi Zach Lloyd. „Framework jest właściwie bardzo prosty: jest domenowy skill bazowy i skill poprawiający, który go udoskonala. Ta prostota jest urodą tego podejścia”.
Zespół Warp wypracował kilka praktycznych zasad dla każdego, kto chciałby wdrożyć podobny mechanizm w swoich agentach:
Case study Warp pokazuje, że skalowalne doskonalenie agentów AI nie wymaga skomplikowanej infrastruktury – wystarczy prosty, dwuwarstwowy schemat skilli i konsekwentne zbieranie ludzkiego feedbacku w miejscu, gdzie ludzie już pracują. Dzięki temu podejściu firma przekształciła wcześniej „hałaśliwe” i frustrujące doświadczenie w mechanizm, który stale poprawia jakość działania agentów na skalę bliską milionowi developerów.

Gubernator Teksasu Greg Abbott zamroził wydatki na kamery Flock po śledztwie ujawniającym wydanie ponad 30 mln dolarów na system AI.

Model Qwen2.5–14B (9 GB) odpowiedział na 67% pytań z 41 lat Jeopardy!, przewyższając ograniczenia legendarnego superkomputera Watson z 2011 roku.

Caterpillar wykorzystuje wiedzę z automatyzacji kopalni do wdrażania AI na placach budowy i inwestuje 100 mln dolarów w szkolenia pracowników.