Nowa metoda FlowGuard redukuje skuteczność ataków na systemy AI z 90% do 15% poprzez monitorowanie spójności między modalnościami przy minimalnej stracie wydajności.

Źródło zdjęcia: arXiv.org
Naukowcy z uniwersytetów opracowali nową metodę obrony przed atakami na multimodalne systemy sztucznej inteligencji. Rozwiązanie FlowGuard monitoruje wewnętrzną spójność między różnymi modalnościami, oferując skuteczną ochronę przy minimalnym wpływie na wydajność. Badanie zostało opublikowane na arXiv i przyjęte jako spotlight paper na konferencji ICML 2026.
Multimodalne duże modele językowe wprowadzają nowe powierzchnie ataku nieobecne w systemach unimodalnych. Atakujący mogą rozproszyć złośliwe intencje między różne modalności, omijając w ten sposób zabezpieczenia zaprojektowane dla pojedynczych modalności. Autorzy badania zauważyli, że benign dane wejściowe wywołują kompatybilne zachowanie predykcyjne zarówno z rozumowania opartego tylko na tekście, jak i tylko na obrazie, które stabilizuje się podczas fuzji.
W przeciwieństwie do tego, manipulacje adversaralne zakłócają tę spójność, powodując nieprawidłowe zachowanie multimodalne. Istniejące mechanizmy obronne, które badają surowe dane wejściowe lub wyjściowe, pomijają ten wewnętrzny proces fuzji, czyniąc je kruchymi i kosztownymi obliczeniowo.
FlowGuard to lekki framework działający w czasie inferencji, który wykrywa szkodliwe dane wejściowe poprzez monitorowanie wewnętrznej spójności multimodalnej. W przeciwieństwie do podejść opartych na skalarnych metrykach pewności, FlowGuard wyprowadza FlowVectors inspirowane dekompozycją informacji częściowej.
Te wektory kwantyfikują cross-modalną redundancję, synergię i dominację specyficzną dla modalności, wychwytując czy stopione predykcje multimodalne pozostają wyrównane z unimodalnymi dowodami semantycznymi. System wykorzystuje problem klasyfikacji jednokategorialnej wytrenowany wyłącznie na danych benign.
Testy wykazały dramatyczne zmniejszenie wskaźników sukcesu ataków z ponad 90% do poniżej 15% na niewidzianych wcześniej atakach. Jednocześnie system utrzymuje mniej niż 3% straty użyteczności i osiąga do 6-krotną redukcję opóźnień w porównaniu z istniejącymi metodami.
Wyniki badania, które zostało przyjęte jako spotlight paper na konferencji ICML 2026, demonstrują, że monitorowanie spójności cross-modalnej oferuje wydajną i skuteczną obronę dla rozumowania multimodalnego. Podejście to otwiera nowe możliwości w zabezpieczaniu zaawansowanych systemów AI przed sofistykowanymi atakami adversaralnymi.

Startup Listen Labs wycofał się z podpisanej rundy przy wycenie 1,5 mld dolarów w oczekiwaniu na przejęcie przez Salesforce za około 2 mld.

OpenAI ogłosiło rozwiązanie problemu Naviera-Stokesa, ale zarzuty o nieprzyznanie zasług matematykom rzucają cień na ten przełom w matematyce.

Nowe badanie NormReact pokazuje, że modele AI nadmiernie przewidują karę za naruszenia norm społecznych, zniekształcając obraz ludzkiej tolerancji.