Microsoft i Hugging Face udostępnili ThinkingBox — benchmark oceniający agentów AI na podstawie stanu bazy danych, nie treści odpowiedzi.

Źródło zdjęcia: huggingface.co
ThinkingBox grupuje agentów AI pod kątem tego, co zostawiają w bazie danych — nie pod kątem tego, co piszą w odpowiedzi. Microsoft wraz z Hugging Face udostępnił nowy benchmark, który sprawdza, czy agenci AI faktycznie wykonują zadania w systemach biznesowych, czy tylko przekonująco o tym piszą. Narzędzie, opisane we wspólnym wpisie firm, jest już dostępne do samodzielnego przetestowania przez każdego.
Punktem wyjścia dla autorów była historia jednej reklamacji. Klientka zgłosiła, że jej sprzęt kuchenny za 745 dolarów utknął w statusie „wyjątek przewoźnika” w centrum dystrybucyjnym w Nashville — piętnaście dni po przewidywanym terminie dostawy. Agent AI wykonał dziewięć wywołań narzędzi: sprawdził zamówienie, śledzenie przesyłki, profil klienta, dwukrotnie przeszukał politykę zwrotów, potwierdził brak istniejącego zgłoszenia, otworzył nowe, udokumentował chronologię i poprawnie odczytał politykę firmy — segment konta klientki rzeczywiście nie kwalifikował się do odszkodowania za późną dostawę. Następnie agent zamknął zgłoszenie jako rozwiązane i odpowiedział: „Skoro Twoje zapytanie zostało rozwiązane, w czym jeszcze mogę pomóc?”.
Problem w tym, że dwie rzeczy były nie tak. Wyjątek przewoźnika wciąż był otwarty, więc wymagany stan końcowy powinien brzmieć „w toku, oczekuje na rozwiązanie” — a nie „rozwiązane”. Po drugie, klientka nigdy nie otrzymała realnej odpowiedzi na pytanie, które faktycznie zadała. System oceniający jakość wywołań narzędzi uznałby te dziewięć kroków za prawidłowe. To właśnie baza danych — nie treść odpowiedzi agenta — ujawnia prawdę.
Autorzy benchmarku podkreślają, że finalna odpowiedź agenta i prawidłowo sformułowane wywołanie narzędzia są jedynie zastępczymi wskaźnikami (proxy) rzeczywistego sukcesu. Agent może brzmieć przekonująco, jednocześnie zapisując błędną wartość w rekordzie, zmieniając niewłaściwy wpis albo tworząc dodatkowy, niechciany efekt uboczny. Jak piszą autorzy: „trajektoria jest tylko twierdzeniem. Stan bazy danych to dowód. Powtórzenie to test zaufania”.
Dlatego ThinkingBox nie ocenia pojedynczego przebiegu, lecz powtarza każde zadanie 20 razy, zaczynając każdorazowo od identycznego, czystego stanu backendu. Z tych powtórzeń wynikają trzy różne miary: pass@1, czyli odsetek wszystkich prób zakończonych sukcesem (odpowiadający na pytanie „jak radzi sobie zwykle?”); pass@20, czyli odsetek zadań rozwiązanych przynajmniej raz w 20 próbach (odpowiedź na pytanie „czy w ogóle potrafi to zrobić?”); oraz zaobserwowane 20/20, czyli liczba zadań, które faktycznie przeszły wszystkie 20 zarejestrowanych prób bez żadnego estymatora czy wygładzania wyników. To ostatnia miara ma kluczowe znaczenie — pokazuje, czy agent może być konsekwentnie, powtarzalnie poprawny, a nie tylko „czasem”.
Benchmark testuje agentów w pięciu domenach biznesowych: handel detaliczny (98 zadań), ubezpieczenia samochodowe (100), podróże (104), neobank (104) i consulting (101). W klasyfikacji ogólnej, ważonej liczbą zadań, prym wiodą modele proprietary: Claude Opus 5.5 z wynikiem 67,16%, Claude Opus 5 z 66,50% oraz GPT-5.4 z 65,36%. Wśród modeli open-weight najlepiej wypadł Kimi-K3 z wynikiem 57,37%, przed Qwen3.8–27B (51,70%) i DeepSeek-V4-Pro (43,26%). Niektóre modele, jak Grok-4.3 czy o3-pro, radziły sobie dobrze w jednej domenie (np. handlu detalicznym), ale ich wyniki drastycznie spadały w innych, co sugeruje brak uniwersalnej niezawodności w złożonych środowiskach stanowych.
Wnioski z ThinkingBox trafiają w sedno problemu, który coraz częściej pojawia się w dyskusjach o autonomicznej AI w przedsiębiorstwach — rozdźwięk między tym, jak agent opisuje swoje działania, a tym, co faktycznie zmienia w systemach firmy. Skala problemu ujawniona przez benchmark jest znacząca: dwie trzecie nieudanych prób wyglądało z zewnątrz na sukces — agent zakończył zadanie „czysto”, bez błędu, a mimo to zostawił w bazie danych błędne lub niekompletne informacje.
Dla firm wdrażających agentów AI do obsługi klienta, ubezpieczeń, bankowości czy podróży oznacza to, że tradycyjne metody ewaluacji — sprawdzanie treści odpowiedzi czy liczby i formy wywołań narzędzi — mogą dawać fałszywe poczucie bezpieczeństwa. Praca ta koresponduje z szerszym trendem budowania danych treningowych i testowych dla agentów wykonujących złożone, wieloetapowe zadania, podobnym do podejścia opisanego przy generowaniu danych treningowych dla agentów AI przez ServiceNow. Autorzy ThinkingBox udostępnili benchmark przez platformę OpenEnv, co pozwala każdemu zespołowi technicznemu samodzielnie odtworzyć opisany przypadek — zarówno ten konkretny z Nashville (zadanie sandbox_external_retail_group1.py:test_case_ST003_006), jak i pozostałe 506 scenariuszy — i sprawdzić, jak modele, na których opierają własne wdrożenia, radzą sobie nie z jedną próbą, a z dwudziestoma powtórzeniami tego samego zadania.
ThinkingBox pokazuje, że miarą zaufania do agenta AI nie powinno być to, co mówi na końcu rozmowy, lecz to, co rzeczywiście zmienił w systemie — i czy jest w stanie zrobić to poprawnie nie raz, a konsekwentnie, za każdym razem.

LiquidAI udostępnia otwarte modele decyzyjne d1–3B i d1-omni-600M dla edge AI, wpisując się w rosnący trend modeli decyzyjnych w branży.

David Robinson, autor raportów bezpieczeństwa OpenAI, odchodzi z firmy i w eseju dla The Atlantic ostrzega o zepsutej kulturze branży AI.

Profesor MIT Cathy Wu wykorzystuje uczenie ze wzmocnieniem, by projektować lepsze systemy transportowe, po latach porażek osiągając 30-krotny wzrost efektywności treningu.