Naukowcy opracowali technikę testującą, czy modele AI rzeczywiście opierają rozumowanie na przesłankach, wykrywając przypadki prawidłowych odpowiedzi z błędnym uzasadnieniem.

Źródło zdjęcia: arXiv.org
Naukowcy opracowali nową metodę testowania, czy duże modele językowe rzeczywiście opierają swoje rozumowanie na podanych przesłankach, czy tylko udają logiczne myślenie. Badanie opublikowane w artykule naukowym przedstawia technikę „interventional grounding audits”, która może wykryć przypadki pozornie poprawnego rozumowania, które w rzeczywistości nie bazuje na faktycznych przesłankach.
Interventional grounding audits to technika testowania na poziomie pojedynczych kroków rozumowania. Metoda polega na interwencji w jedną przesłankę przez zastąpienie jej docelowego predykatu świeżym symbolem, ponowne uruchomienie modelu i sprawdzenie, czy wniosek z każdego kroku rozumowania (w kanonicznej formie predykatu) ulega zmianie.
Autorzy zastosowali tę metodę do benchmarku ProntoQA — syntetycznego zestawu problemów wielokrokowego rozumowania dedukcyjnego ze złotymi drzewami dowodów, gdzie zależności między krokami na poziomie przesłanek są znane.
Testy przeprowadzono na 50 problemach ProntoQA z użyciem modelu GPT-4o. Metoda osiągnęła F1 = 0,806 w wykrywaniu zależności drzewa dowodów, a F1 = 0,885 w wykrywaniu zależności determinujących predykat przy 100% recall. Wyniki znacznie przewyższały baseline oparty na samo-spójności (F1 = 0,343), przy czym 95% bootstrap confidence intervals nie nakładały się.
Kluczowe odkrycie dotyczy faktu, że 66% poprawnie rozwiązanych problemów zawierało co najmniej jeden wyrównany krok niewrażliwy na bezpośrednią zależność od drzewa dowodów pod spójną substytucją. Wszystkie takie przypadki dotyczyły przesłanek wprowadzających encje — udokumentowanego ślepego punktu ewaluatora spójnej substytucji.
Badanie wskazuje na istotne ograniczenia w sposobie, w jaki obecnie oceniamy zdolności rozumowania modeli językowych. Tradycyjne „pasywne” metody oceny mogą nie wykryć przypadków, gdy model daje prawidłową odpowiedź, ale z błędnych powodów.
Wszystkie certyfikaty audytu, surowe wyniki i skrypty reprodukcji są dostępne w publicznym repozytorium GitHub. Autorzy omawiają także ograniczenia zakresu metody poza formalne, parsowalne benchmarki.
Praca została przyjęta na warsztatach ICLR 2026 Workshop on Logical Reasoning of Large Language Models i stanowi ważny krok w kierunku lepszego zrozumienia rzeczywistych zdolności rozumowania AI.
Claude Code od czerwca używa Bun przepisanego w Rust. Start aplikacji przyspieszył o 10%, ale zmiana pozostała niezauważalna dla użytkowników.

Google zmienił sposób naliczania limitów Gemini AI z liczby zapytań na moc obliczeniową, wprowadzając cztery plany płatne i nowe zasady sprawdzania użycia.
Model AI Claude Fable znalazł kontrprzykład obalający 90-letnią Hipotezę Jakobianową, jeden z najważniejszych problemów matematyki algebraicznej.