Partial Evidence Bench mierzy krytyczną słabość agentów AI — generowanie pozornie kompletnych odpowiedzi mimo braku dostępu do wszystkich danych.

Źródło zdjęcia: arXiv.org
Nowy benchmark Partial Evidence Bench umożliwia pomiar krytycznej słabości systemów agentowych działających w środowiskach korporacyjnych — gdy agent generuje odpowiedzi pozornie kompletne, mimo że nie ma dostępu do wszystkich niezbędnych danych. Badanie opublikowane na arXiv wprowadza pierwszy deterministyczny test dla tego typu problemów w systemach AI.
W środowiskach przedsiębiorstw agenty AI coraz częściej operują w ograniczonych systemach, gdzie kontrola dostępu może blokować części informacji, ale system nadal produkuje odpowiedzi wyglądające na kompletne. To stwarza poważne ryzyko w kontekście zarządzania i bezpieczeństwa korporacyjnego.
Partial Evidence Bench składa się z deterministycznych korpusów syntetycznych podzielonych według list kontroli dostępu (ACL). Każdy scenariusz zawiera kompletne odpowiedzi oracle, odpowiedzi z perspektywy autoryzowanej, oceny kompletności oracle oraz strukturalne raporty o lukach oracle.
Trzy główne rodziny scenariuszy odzwierciedlają typowe przypadki użycia w przedsiębiorstwach. Due diligence testuje sytuacje, gdy agent musi ocenić potencjalne inwestycje lub partnerstwa biznesowe na podstawie częściowo dostępnych dokumentów. Audyt zgodności sprawdza zdolność do identyfikowania naruszeń regulacyjnych, gdy dostęp do części danych może być ograniczony. Reagowanie na incydenty bezpieczeństwa wymaga od systemu analizy zagrożeń w warunkach niepełnej informacji.
Badanie wykazało fundamentalne różnice między podejściami do obsługi niepełnych dowodów. Systemy stosujące ciche filtrowanie — które po prostu pomijają niedostępne informacje bez informowania o tym — okazały się niebezpieczne we wszystkich testowanych scenariuszach.
Z kolei systemy implementujące jawne zgłaszanie niepowodzeń i raportowanie braków eliminowały niebezpieczne zachowania związane z kompletności, jednocześnie zachowując użyteczność w kontekście korporacyjnym. Wstępne testy z rzeczywistymi modelami AI pokazały znaczące różnice między modelami w sposobie radzenia sobie z niepełnymi informacjami — niektóre nadmiernie twierdziły kompletność, inne były nadmiernie konserwatywne.
Benchmark wprowadza mierzalny sposób oceny krytycznej słabości systemów agentowych bez potrzeby angażowania ludzkich sędziów czy używania korpusów podatnych na kontaminację. To ważny krok w kierunku bezpieczniejszego wdrażania AI w środowiskach korporacyjnych, gdzie niepełna informacja może prowadzić do kosztownych błędów w podejmowaniu decyzji.

SpaceX zamknęło przejęcie Cursor za 60 mld dolarów, dając startupowi dostęp do ogromnej floty GPU firmy Elona Muska.
404 Media namierzyło AirTagiem przesyłkę 1000 książek, która trafiła do centrum Amazona w Las Vegas skanującego zbiory na dane treningowe AI.

Apple szykuje AirPods z kamerami dla Siri, ale wycieki wskazują, że nie będą nagrywać zdjęć ani wideo, jak w Meta Ray-Ban.