AllSpark udostępnił Iris-mini i Iris-pro — agenty wyszukiwania AI z otwartymi wagami, które biją konkurencję na BrowseComp i innych benchmarkach.

Źródło zdjęcia: The Decoder
Chiński zespół badawczy AllSpark opublikował Iris-mini i Iris-pro — dwa agenty wyszukiwania oparte na modelach językowych, udostępnione jako open source wraz z pełną receptą treningową. Według opublikowanej pracy naukowej, dane treningowe i same modele poprawiły wyniki także w zadaniach, do których nigdy nie były bezpośrednio trenowane, w tym w ogólnym korzystaniu z narzędzi i pracach biurowych.
Agenty wyszukiwania budowane na bazie modeli językowych samodzielnie przeszukują internet: muszą zrozumieć pytanie, zdecydować czego szukać, zinterpretować wyniki i ocenić, kiedy zebrały już wystarczające dowody, by odpowiedzieć. To, jak dużą część tej pracy modele faktycznie wykonują, jest przedmiotem dyskusji — na ustalonych benchmarkach wiodące systemy tego typu najczęściej używają sieci głównie do potwierdzania wiedzy, którą już posiadły podczas treningu.
Rurociąg treningowy konstruuje zadania w odwrotnym porządku, wychodząc od struktury linków na stronach internetowych. Zaczynając od strony-nasiona i jej odnośników wychodzących, system buduje graf terminów i relacji. Na podstawie tego grafu generowane jest pytanie wieloetapowe, którego odpowiedź wymaga połączenia kilku wzajemnie zależnych kroków.
Każdy termin oprócz finalnej odpowiedzi zostaje zastąpiony parafrazą, tak by żadnej wskazówki nie dało się rozwiązać przez proste wyszukiwanie tekstowe — agent musi rozumować, a nie tylko „sprawdzać w Google”. Do zestawu danych trafiają wyłącznie pytania, których model referencyjny nie jest w stanie rozwiązać bez narzędzi, ale jest w stanie rozwiązać, gdy dysponuje właściwymi źródłami. Dzięki temu zadania są zarówno trudne, jak i jednoznacznie weryfikowalne.
Silniejszy model-nauczyciel generuje ścieżki rozwiązań składające się z rozumowania, zapytań wyszukiwania i wyników. Te ścieżki przechodzą przez dwa etapy filtrowania. Pierwszy sprawdza całą ścieżkę pod kątem poprawności, powtórzeń i głębokości wyszukiwania. Drugi to szczegółowa, krok po kroku, ocena wykonywana przez model-sędziego, którego kryteria — jak podaje praca — zostały wyprowadzone z samych danych, a nie ustalone ręcznie.
Następnie model jest doskonalony w procesie uczenia ze wzmocnieniem, przy użyciu żywego wyszukiwania internetowego. Model-sędzia i podsumowania wyników działają wewnątrz klastra treningowego, zasilane przez własny, duży model Qwen zespołu, dzięki czemu proces treningowy nie zależy od zewnętrznych usług. Uczenie nadzorowane i uczenie ze wzmocnieniem przeplatają się w procesie, który autorzy nazwali „wspinaczką SFT-RL” — najtrudniejsze rozwiązane zadania i najbardziej efektywne ścieżki rozwiązań z każdej rundy zasilają następny cykl treningowy.
Zespół argumentuje, że sposób zarządzania kontekstem w czasie działania na popularnych benchmarkach często robi większą różnicę niż raportowane odchylenia między różnymi systemami. Podczas długich sesji badawczych kontekst może się wypełnić, zanim agent zdąży rozwiązać wszystkie podpytania. Triki takie jak odrzucanie historii rozmowy sztucznie wydłużają proces badawczy, ale niewiele mówią o rzeczywistej jakości modelu.
Aby wyizolować ten efekt, zespół testował każdy benchmark z włączonym i wyłączonym zarządzaniem kontekstem, zachowując jednocześnie stałe narzędzia, limity kontekstu i model-sędziego. Wyniki raportowane wyłącznie z aktywnym zarządzaniem kontekstem nie da się jednoznacznie rozłożyć na to, co pochodzi od modelu, a co od otaczającej go infrastruktury. Wyniki Iris pochodzą od pojedynczego agenta, bez agentów pomocniczych i bez dodatkowych kroków weryfikacyjnych na końcu.
Testy obejmowały BrowseComp, który sprawdza umiejętność znajdowania rzadkich faktów na podstawie pośrednich wskazówek, jego chiński odpowiednik BrowseComp-ZH, DeepSearchQA, oceniający kompletność zebranych dowodów, oraz Humanity's Last Exam, stawiający pytania na poziomie eksperckim.
Z włączonym zarządzaniem kontekstem Iris-mini uzyskał wyniki 82,2, 84,8, 86,9 i 52,3 punktu. Iris-pro osiągnął 88,6, 85,1, 92,9 i 56,4 punktu. W mniejszej kategorii Iris-mini prowadzi w trzech z czterech benchmarków i pokonuje najbliższy konkurencyjny model, XYZ-Aquila-mini, na BrowseComp o 3,4 punktu, choć pozostaje w tyle na DeepSearchQA. Iris-pro prowadzi lub jest na równi w większej kategorii, a według autorów niekiedy zbliża się do systemów wymagających znacznie większej moc obliczeniowej.
Zarządzanie kontekstem ma znacznie większy wpływ na mniejszy model — podnosi wyniki BrowseComp nawet o 21,2 punktu. Przyczyną nie jest mniejszy budżet tokenów, lecz szybsze jego zużywanie: Iris-mini potrzebuje więcej kroków dla tych samych zadań i częściej trafia w limit kontekstu.
Na Humanity's Last Exam różnice są mniejsze, ponieważ ten benchmark bazuje bardziej na wiedzy dziedzinowej i akademickim rozumowaniu, gdzie wyszukiwanie internetowe pełni rolę wspierającą. Najlepsze wyniki daje połączenie odrzucania historii rozmowy z drugą próbą — jeśli pierwsza się nie powiedzie, system kondensuje ją do krótkiej notatki, zapisującej co już sprawdzono i co odrzucono. Ta notatka zostaje dołączona do zadania w kolejnej próbie.
W dodatku do pracy zespół opisuje przypadek, w którym ich agent został oznaczony jako błędny, mimo że jego odpowiedź była poparta materiałem źródłowym. Pytanie w benchmarku BrowseComp-ZH dotyczyło serialu „Gra o Tron”. Agent odpowiedział „Bolton”, podczas gdy jako prawidłową odpowiedź w benchmarku podano „Lannister”. Postać, o którą pytano, Sansa Stark, w rzeczywistości poślubia w drugim małżeństwie właśnie Ramsaya Boltona — odpowiedź agenta była więc prawidłowa. Zespół twierdzi, że takie sprzeczności między „prawdziwą” odpowiedzią w benchmarku a materiałem źródłowym motywują ich do budowania lepszych, bardziej wiarygodnych benchmarków.
Publikacja modeli Iris-mini i Iris-pro jako open source, wraz z pełną metodologią treningową, wpisuje się w trend udostępniania coraz bardziej zaawansowanych agentów AI szerszej społeczności badawczej, bez zamykania ich za komercyjnymi API.

Gemini 4 Argon od Google to nowy model do kodowania i cyberbezpieczeństwa z limitem 1 mln tokenów, lepszy w testach niż GPT-6 Astra i Claude Opus 5.5.

Suno uruchomiło funkcję Speech w becie – pierwszy model audio generujący głos i muzykę AI jako jeden spójny utwór.

MIT uruchamia Dear Dreamer – darmową platformę AI dla uczniów, opartą na sprawdzonym frameworku disciplined entrepreneurship Billa Aulet.