Badacze z Tracebit opracowali technikę context bombing, która zmniejsza skuteczność ataków AI z 57% do 5% wykorzystując mechanizmy bezpieczeństwa modeli.

Źródło zdjęcia: WIRED
Badacze z firmy Tracebit odkryli skuteczną metodę obrony przed atakującymi agentami AI wykorzystującą technikę znaną jako „context bombing”. Zespół wykazał, że umieszczenie specjalnych komend obok poufnych danych w chmurze Amazon Web Services może skutecznie zatrzymać ataki hackerskie prowadzone przez duże modele językowe.
Technika polega na wykorzystaniu mechanizmów bezpieczeństwa wbudowanych w modele AI przeciwko nim samym. Gdy atakujący agent napotka odpowiednio przygotowane komendy, jego systemy ochronne aktywują się i blokują dalsze działania.
Badacze z Tracebit umieszczają specjalne komendy obok haseł, kluczy kryptograficznych i innych poufnych danych przechowywanych w infrastrukturze chmurowej. Te komendy zawierają treści, które naruszają wbudowane zabezpieczenia modeli AI — na przykład instrukcje dotyczące tworzenia broni biologicznej lub, w przypadku chińskich modeli, odniesienia do wydarzeń na Placu Tiananmen z 1989 roku.
„Ostatecznie uruchamiamy mechanizm odmowy w kontekście” — wyjaśnia Andy Smith, współzałożyciel i CEO Tracebit. „Staramy się uchwycić fakt, że ma to silny, ostry efekt, z którego agenci mogą mieć trudności z powrotem. Gdy dostaną to do swojego kontekstu, będą nadal odmawiać.”
Gdy atakujący agent AI napotka te zabronione komendy podczas skanowania zasobów, automatycznie aktywują się jego mechanizmy bezpieczeństwa, powodując zatrzymanie wszystkich operacji. Model przestaje wykonywać swoje pierwotne instrukcje i odmawia dalszego działania.
Eksperymenty przeprowadzone w symulowanym środowisku AWS wykazały dramatyczne zmniejszenie skuteczności ataków. Średnio w pięciu modelach i 152 próbach wyniki przedstawiały się następująco:
Badania stanowią rozwinięcie wcześniejszych prac Tracebit z maja, kiedy firma przedstawiła metodę ostrzegania obrońców o atakach prowadzonych przez agencyjne systemy AI. Specjalne zasoby AWS działające jako „kanarkowe” ostrzegają o zagrożeniu średnio w ciągu ośmiu minut, podczas gdy atakujące modele potrzebują przeciętnie 14 minut na escalację do kontroli administracyjnej.
Jak zauważa Earlence Fernandes, profesor UC San Diego specjalizujący się w bezpieczeństwie AI: „Nie widziałem, żeby ktoś inny używał tej techniki jako obrony, z tego co wiem. Ja sam bawiłem się podobnym podejściem, choć w nieco innym kontekście.”
Context bombing może okazać się przełomowym rozwiązaniem w walce z atakującymi agentami AI, wykorzystując przeciwko nim te same techniki, których sami używają do ataków na systemy obronne.

Nowy benchmark RadLE 2.0 pokazuje, że modele AI w radiologii często wydają błędne diagnozy z pełną pewnością siebie, co stanowi zagrożenie dla pacjentów.

Badanie ujawnia, jak stan psychiczny annotatorów wpływa na jakość danych RLHF i propaguje błędy systematyczne w modelach sztucznej inteligencji.
Claude Code od czerwca używa Bun przepisanego w Rust. Start aplikacji przyspieszył o 10%, ale zmiana pozostała niezauważalna dla użytkowników.