Nowa metoda FlowGuard redukuje skuteczność ataków na systemy AI z 90% do 15% poprzez monitorowanie spójności między modalnościami przy minimalnej stracie wydajności.

Źródło zdjęcia: arXiv.org
Naukowcy z uniwersytetów opracowali nową metodę obrony przed atakami na multimodalne systemy sztucznej inteligencji. Rozwiązanie FlowGuard monitoruje wewnętrzną spójność między różnymi modalnościami, oferując skuteczną ochronę przy minimalnym wpływie na wydajność. Badanie zostało opublikowane na arXiv i przyjęte jako spotlight paper na konferencji ICML 2026.
Multimodalne duże modele językowe wprowadzają nowe powierzchnie ataku nieobecne w systemach unimodalnych. Atakujący mogą rozproszyć złośliwe intencje między różne modalności, omijając w ten sposób zabezpieczenia zaprojektowane dla pojedynczych modalności. Autorzy badania zauważyli, że benign dane wejściowe wywołują kompatybilne zachowanie predykcyjne zarówno z rozumowania opartego tylko na tekście, jak i tylko na obrazie, które stabilizuje się podczas fuzji.
W przeciwieństwie do tego, manipulacje adversaralne zakłócają tę spójność, powodując nieprawidłowe zachowanie multimodalne. Istniejące mechanizmy obronne, które badają surowe dane wejściowe lub wyjściowe, pomijają ten wewnętrzny proces fuzji, czyniąc je kruchymi i kosztownymi obliczeniowo.
FlowGuard to lekki framework działający w czasie inferencji, który wykrywa szkodliwe dane wejściowe poprzez monitorowanie wewnętrznej spójności multimodalnej. W przeciwieństwie do podejść opartych na skalarnych metrykach pewności, FlowGuard wyprowadza FlowVectors inspirowane dekompozycją informacji częściowej.
Te wektory kwantyfikują cross-modalną redundancję, synergię i dominację specyficzną dla modalności, wychwytując czy stopione predykcje multimodalne pozostają wyrównane z unimodalnymi dowodami semantycznymi. System wykorzystuje problem klasyfikacji jednokategorialnej wytrenowany wyłącznie na danych benign.
Testy wykazały dramatyczne zmniejszenie wskaźników sukcesu ataków z ponad 90% do poniżej 15% na niewidzianych wcześniej atakach. Jednocześnie system utrzymuje mniej niż 3% straty użyteczności i osiąga do 6-krotną redukcję opóźnień w porównaniu z istniejącymi metodami.
Wyniki badania, które zostało przyjęte jako spotlight paper na konferencji ICML 2026, demonstrują, że monitorowanie spójności cross-modalnej oferuje wydajną i skuteczną obronę dla rozumowania multimodalnego. Podejście to otwiera nowe możliwości w zabezpieczaniu zaawansowanych systemów AI przed sofistykowanymi atakami adversaralnymi.

Microsoft zaprezentował AI-Cyber-1-Flash i Project Perception — nowe narzędzia AI do bezpieczeństwa, które uzyskały 96% w testach i mają kosztować połowę mniej.

OpenAI uruchamia ChatGPT Health dla wszystkich użytkowników w USA, twierdząc że AI rozumuje lepiej niż klinicyści. Równocześnie firma czeli pozwom za niebezpieczne porady.

Anthropic twierdzi, że Opus 5 osiągnął 0% skuteczności ataków prompt injection w testach agentów przeglądarkowych — przełom w bezpieczeństwie AI.