Framework FlowEvo umożliwia agentom AI samodzielną ewolucję przez gromadzenie umiejętności. Osiąga 82,8% skuteczności przy dwukrotnie mniejszych kosztach.

Źródło zdjęcia: arXiv.org
Zespół badaczy opracował FlowEvo — nowatorski framework, który umożliwia agentom AI samodzielną ewolucję poprzez gromadzenie i udoskonalanie umiejętności bez konieczności aktualizacji parametrów modelu. Badanie opublikowane na arXiv przedstawia system, który kompiluje skuteczne procedury rozwiązywania problemów w wielokrotnego użytku „banku umiejętności”.
FlowEvo rozwiązuje fundamentalny problem współczesnych agentów językowych: procedury odkrywane podczas wykonywania zadań są zazwyczaj tymczasowe i nie przynoszą systematycznych korzyści przyszłym zadaniom. System organizuje się wokół trzech sprzężonych mechanizmów działających w ciągłej pętli.
Pierwszy mechanizm — kompilacja workflow-to-skill — ekstraktuje wielokrotnego użytku artefakty wykonywalne z udanych śladów działania. Drugi zapewnia sprzężenie zwrotne skill-to-workflow, pobierając zgromadzone umiejętności do wspierania przyszłego rozwiązywania problemów poprzez bezpośrednie wykonanie lub strukturalne wstrzykiwanie kontekstu. Trzeci mechanizm kuracji umiejętności monitoruje użyteczność downstream i eliminuje umiejętności powodujące negatywny transfer.
Eksperymenty przeprowadzono na benchmark'ach obejmujących interaktywne środowiska (ALFWorld) oraz generowanie kodu i matematyki (HumanEval, GSM8K). W środowisku ALFWorld FlowEvo osiągnął imponującą skuteczność 82,8%, znacznie przewyższając najsilniejszy baseline. Jednocześnie średnie zużycie tokenów na epizod było mniejsze niż połowa najbardziej wydajnego rozwiązania bazowego.
Kontrolowane ablacje potwierdziły, że każdy z trzech mechanizmów przyczynia się do ogólnego rezultatu. System wykazuje szczególną skuteczność w zadaniach wymagających kombinacji rozumowania, użycia narzędzi i wykonywania kodu — obszarach, gdzie tradycyjne podejścia często zawodzą ze względu na brak mechanizmów uczenia się z doświadczenia.
FlowEvo otwiera nową ścieżkę rozwoju agentów AI, umożliwiając im ciągłe doskonalenie bez kosztownych aktualizacji parametrów modelu. Autorzy udostępnili kod publicznie, ułatwiając dalsze badania nad samoewoluującymi systemami sztucznej inteligencji.

Nowy model AI Gemini Spark trafia do pierwszych użytkowników, ale europejscy klienci nie mają do niego dostępu. Google wprowadza kolejne ograniczenia geograficzne.

Nowy model Claude Opus 5 otrzymał wzmocnione zabezpieczenia cyberbezpieczeństwa po konfliktach z rządem USA i oferuje lepsze programowanie.

Siedmiokrotny wzrost gróźb wobec szefów firm AI, ataki na OpenAI i protesty z workami na zwłoki pokazują narastające społeczne napięcie wokół sztucznej inteligencji.