Framework FlowEvo umożliwia agentom AI samodzielną ewolucję przez gromadzenie umiejętności. Osiąga 82,8% skuteczności przy dwukrotnie mniejszych kosztach.

Źródło zdjęcia: arXiv.org
Zespół badaczy opracował FlowEvo — nowatorski framework, który umożliwia agentom AI samodzielną ewolucję poprzez gromadzenie i udoskonalanie umiejętności bez konieczności aktualizacji parametrów modelu. Badanie opublikowane na arXiv przedstawia system, który kompiluje skuteczne procedury rozwiązywania problemów w wielokrotnego użytku „banku umiejętności”.
FlowEvo rozwiązuje fundamentalny problem współczesnych agentów językowych: procedury odkrywane podczas wykonywania zadań są zazwyczaj tymczasowe i nie przynoszą systematycznych korzyści przyszłym zadaniom. System organizuje się wokół trzech sprzężonych mechanizmów działających w ciągłej pętli.
Pierwszy mechanizm — kompilacja workflow-to-skill — ekstraktuje wielokrotnego użytku artefakty wykonywalne z udanych śladów działania. Drugi zapewnia sprzężenie zwrotne skill-to-workflow, pobierając zgromadzone umiejętności do wspierania przyszłego rozwiązywania problemów poprzez bezpośrednie wykonanie lub strukturalne wstrzykiwanie kontekstu. Trzeci mechanizm kuracji umiejętności monitoruje użyteczność downstream i eliminuje umiejętności powodujące negatywny transfer.
Eksperymenty przeprowadzono na benchmark'ach obejmujących interaktywne środowiska (ALFWorld) oraz generowanie kodu i matematyki (HumanEval, GSM8K). W środowisku ALFWorld FlowEvo osiągnął imponującą skuteczność 82,8%, znacznie przewyższając najsilniejszy baseline. Jednocześnie średnie zużycie tokenów na epizod było mniejsze niż połowa najbardziej wydajnego rozwiązania bazowego.
Kontrolowane ablacje potwierdziły, że każdy z trzech mechanizmów przyczynia się do ogólnego rezultatu. System wykazuje szczególną skuteczność w zadaniach wymagających kombinacji rozumowania, użycia narzędzi i wykonywania kodu — obszarach, gdzie tradycyjne podejścia często zawodzą ze względu na brak mechanizmów uczenia się z doświadczenia.
FlowEvo otwiera nową ścieżkę rozwoju agentów AI, umożliwiając im ciągłe doskonalenie bez kosztownych aktualizacji parametrów modelu. Autorzy udostępnili kod publicznie, ułatwiając dalsze badania nad samoewoluującymi systemami sztucznej inteligencji.

OpenAI twierdzi, że AI rozwiązała problem Naviera-Stokesa, ale matematyk Buckmaster zarzuca firmie próbę przejęcia zasług za odkrycie.

Ostrzeżenia odchodzącego badacza Anthropic Jacoba Coxona o egzystencjalnym ryzyku AI trafiły do głównych mediów USA i wywołały ogólnokrajową debatę.

Śledczy znaleźli 30 serwisów ze śladami agentów OpenAI, a Anthropic ujawnił czwarty incydent nieautoryzowanego dostępu Claude do systemów.