Anthropic twierdzi, że Opus 5 osiągnął 0% skuteczności ataków prompt injection w testach agentów przeglądarkowych — przełom w bezpieczeństwie AI.

Źródło zdjęcia: The Decoder
Anthropic twierdzi, że ich najnowszy model Opus 5 jest niemal odporny na ataki prompt injection w swoim własnym oprogramowaniu. To przełomowe osiągnięcie w dziedzinie bezpieczeństwa AI, szczególnie istotne dla agentów przeglądarkowych, które do tej pory były szczególnie podatne na tego typu zagrożenia. Szczegółowe informacje przedstawiono w raporcie bezpieczeństwa opublikowanym przez Anthropic.
Prompt injection to jedna z najpoważniejszych luk bezpieczeństwa w systemach sztucznej inteligencji. Atak polega na przemyceniu złośliwych instrukcji przez manipulację danych wejściowych, na przykład poprzez ukryty tekst na stronie internetowej. Problem był tak poważny, że OpenAI przyznało w grudniu, że prompt injection może nigdy nie zostać w pełni rozwiązany.
Opus 5 prowadzi w rankingu Gray Swan IPI, benchmarku testującym odporność na prompt injection. Po 15 próbach, wskaźnik skuteczności ataków wynosi 2,0%, wyprzedzając Mythos 5 (2,6%) i Fable 5 (2,8%).
Kluczem do sukcesu Opus 5 jest tryb Auto Mode, który implementuje dwuwarstwową strategię obrony. Pierwsza warstwa skanuje przychodzące dane w poszukiwaniu ukrytych instrukcji, zanim model je przetworzy. Druga warstwa blokuje niebezpieczne działania przed ich wykonaniem.
Aby atak się powiódł, napastnik musi pokonać obie warstwy niezależnie, co znacznie zwiększa poziom bezpieczeństwa. Bez tych zabezpieczeń, sam model Opus 5 osiąga wskaźnik podatności na poziomie 3,7%, co nadal jest lepszym wynikiem niż poprzednie wersje, ale daleko od idealnego zera.
Przełom Anthropic w walce z prompt injection może fundamentalnie zmienić sposób, w jaki projektujemy i wdrażamy agentów AI, szczególnie tych działających w środowisku przeglądarek internetowych, gdzie zagrożenie było dotychczas największe.

AI nie czyta marki jak człowiek – składa ją z rozproszonych śladów cyfrowych, dlatego spójność informacji liczy się bardziej niż SEO.

EduRiskX łączy transformery z logiką F-Logic, wykrywając zagrożonych studentów już w 9. tygodniu semestru z dokładnością 0,900.

Sąd federalny uznał wpisanie Anthropic na czarną listę Pentagonu za bezprawną retorsję naruszającą Pierwszą Poprawkę Konstytucji USA.