Naukowcy opisują PAC-2026 – protokół Publication Authority, który ma uniemożliwić fałszywie autorytatywne publikacje tworzone z pomocą AI.

Źródło zdjęcia: arXiv.org
Artykuł opublikowany 15 września 2026 roku na arXiv przedstawia nowe podejście do problemu, który staje się coraz bardziej palący w miarę rozpowszechniania się treści tworzonych z pomocą sztucznej inteligencji: jak sprawić, by twierdzenia wspierane przez AI można było niezależnie zweryfikować i podważyć. Zespół ośmiu badaczy pod kierownictwem Torstena Oliviego Tiltacka, z Yifei Dong jako autorem korespondencyjnym, proponuje formalny protokół zwany PAC-2026 (Publication-Accountability Calculus), który wprowadza koncepcję „Publication Authority” — jednorazowej, nieprzenoszalnej uprawnienia do publikacji powiązanego z konkretnym, precyzyjnie zdefiniowanym stanem danych.
Punktem wyjścia dla badaczy jest obserwacja, że twierdzenia wspierane przez AI mogą wydawać się autorytatywne, mimo że dowody, analiza, autoryzacja ze strony człowieka, prezentacja i historia korekt odnoszą się w rzeczywistości do różnych, niepowiązanych ze sobą stanów treści. Innymi słowy — publikacja może „wyglądać” na zweryfikowaną i zatwierdzoną, choć w rzeczywistości poszczególne elementy tego procesu dotyczyły różnych wersji dokumentu, danych czy analiz.
Autorzy zauważają, że istniejące mechanizmy takie jak proweniencja (śledzenie pochodzenia danych), atestacja i transparentność ujawniają historię zmian, ale samodzielnie nie precyzują, w jaki sposób powinna wyglądać sama transakcja publikacji — moment, w którym treść zostaje formalnie zatwierdzona i upublicznona. To właśnie ten brak jest przedmiotem badania.
Rozwiązaniem proponowanym w pracy jest Publication Authority — uprawnienie publikacyjne przypisane dokładnie do jednego stanu dokumentu, niemożliwe do przekazania innej osobie czy systemowi i zużywalne tylko raz. Koncepcja ta została zaimplementowana w PAC-2026, czyli formalnym, przeznaczonym do odczytu maszynowego kandydacie na protokół AIJIM.
Badacze oceniali czwarte „bounded semantic freeze” (SF-4) — sztywną, zamrożoną specyfikację zaprojektowaną tak, by dopuszczała zamienne powiązania (bindings) w konkretnych implementacjach. Sześć obowiązków reguluje różne wymiary procesu: dowody, przebiegi i artefakty, ujawnianie metodologii pomiaru, autoryzację, zgodność powierzchni odbiorczej (czyli tego, co faktycznie widzi czytelnik) oraz kontynuację cyklu życia dokumentu. Kluczowe jest to, że każdy z tych obowiązków działa niezależnie — żaden nie może „zrekompensować” niedociągnięć innego. Tylko świeży, kompletny rekord przechodzący wszystkie sprawdzenia (all-pass) generuje pozwolenie zużywane przez jedną, atomową transakcję publikacji.
Istotnym elementem systemu jest rozdzielenie „horyzontu dowodowego” od czasu weryfikacji — SF-4 odrzuca sytuację, w której autoryzacja jest formalnie autentyczna, ale przyczynowo nieprawidłowa (czyli odnosi się do innego momentu lub stanu niż ten, który jest faktycznie publikowany). Innym mechanizmem kontrolnym jest zasada, że powierzchnia czytelnika (reader surface), która przechodzi sprawdzenie zgodności, nie może autoryzować publikacji, jeśli zaakceptowany rekord nie „dopuszcza” tej konkretnej powierzchni.
Do weryfikacji protokołu autorzy zastosowali kilka podejść: wektory identyfikacyjne, przypadki adwersarialne (adversarial cases), modele skończone oraz historyczne implementacje. Skala eksploracji przestrzeni stanów była znaczna — dziesięć modeli zbadało łącznie 110 764 bezpieczne, osiągalne stany. Jednocześnie 76 niebezpiecznych konfiguracji wygenerowało oczekiwane naruszenie reguł lub kontrmodel obserwatora, co świadczy o tym, że system prawidłowo wykrywał próby obejścia zabezpieczeń.
Testy historyczne obejmowały odtworzenie ścieżki poprzednika, która dała 17 zamrożonych wyników sukcesji autoryzacji. Późniejszy, wewnętrzny test typu „instance-blind” (czyli przeprowadzany bez znajomości konkretnej instancji przez testujących) na znanych klasach przypadków dopasował się do wszystkich 183 ocenionych oczekiwań. Dodatkowo wykonanie pakietu na tym samym hoście odtworzyło 240 zarchiwizowanych obserwacji, co potwierdza powtarzalność wyników.
Autorzy są przy tym wyraźnie ostrożni w formułowaniu wniosków co do zakresu zastosowania swojego systemu. Wyniki potwierdzają wewnętrzną spójność logiczną protokołu, ograniczone (bounded) bezpieczeństwo, czułość na wykrywanie błędów oraz ograniczoną konstruowalność. Jednocześnie badacze explicite zaznaczają, że wyniki NIE potwierdzają faktograficznej prawdziwości treści publikowanych zgodnie z protokołem, ogólnej możliwości udoskonalania systemu (general refinement), interoperacyjności „w ciemno” z innymi systemami, skuteczności w rzeczywistych warunkach polowych (field efficacy) ani statusu formalnego standardu branżowego. Praca liczy 24 strony treści głównej z czterema rysunkami oraz 13 stron materiałów dodatkowych i jest preprintem, który nie przeszedł jeszcze recenzji naukowej.
Praca wpisuje się w szerszy trend badań nad weryfikowalnością i odpowiedzialnością za treści generowane lub wspierane przez AI — temat pozostający w cieniu debat o regulacjach i bezpieczeństwie AI, które coraz częściej dotykają kwestii wiarygodności i odpowiedzialności za treści generowane maszynowo.
Podsumowując, PAC-2026 to techniczna propozycja formalnego protokołu, który ma zapobiegać sytuacjom, w których publikacje wspierane przez AI wyglądają na w pełni zweryfikowane, choć w rzeczywistości poszczególne elementy procesu weryfikacji odnosiły się do różnych, niepowiązanych stanów treści — jednak sami autorzy zastrzegają, że jego status pozostaje na etapie preprintu, bez recenzji naukowej i bez potwierdzonej skuteczności w realnych warunkach.

Common Sense Media ocenia, że ChatGPT for Teens nie wysyła alertów rodzicom w sytuacjach kryzysowych. OpenAI podważa metodologię testów.

Sam Altman mówi, że przypisywanie AI religijnej siły to zagrożenie bezpieczeństwa – zmiana tonu wobec jego wcześniejszych deklaracji o „magicznej inteligencji na niebie”.

Meta udostępniła open-source firmware i SDK Muse Gadgets, by hobbyści budowali własny sprzęt AI zintegrowany z asystentem Muse.