Anthropic twierdzi, że Opus 5 osiągnął 0% skuteczności ataków prompt injection w testach agentów przeglądarkowych — przełom w bezpieczeństwie AI.

Źródło zdjęcia: The Decoder
Anthropic twierdzi, że ich najnowszy model Opus 5 jest niemal odporny na ataki prompt injection w swoim własnym oprogramowaniu. To przełomowe osiągnięcie w dziedzinie bezpieczeństwa AI, szczególnie istotne dla agentów przeglądarkowych, które do tej pory były szczególnie podatne na tego typu zagrożenia. Szczegółowe informacje przedstawiono w raporcie bezpieczeństwa opublikowanym przez Anthropic.
Prompt injection to jedna z najpoważniejszych luk bezpieczeństwa w systemach sztucznej inteligencji. Atak polega na przemyceniu złośliwych instrukcji przez manipulację danych wejściowych, na przykład poprzez ukryty tekst na stronie internetowej. Problem był tak poważny, że OpenAI przyznało w grudniu, że prompt injection może nigdy nie zostać w pełni rozwiązany.
Opus 5 prowadzi w rankingu Gray Swan IPI, benchmarku testującym odporność na prompt injection. Po 15 próbach, wskaźnik skuteczności ataków wynosi 2,0%, wyprzedzając Mythos 5 (2,6%) i Fable 5 (2,8%).
Kluczem do sukcesu Opus 5 jest tryb Auto Mode, który implementuje dwuwarstwową strategię obrony. Pierwsza warstwa skanuje przychodzące dane w poszukiwaniu ukrytych instrukcji, zanim model je przetworzy. Druga warstwa blokuje niebezpieczne działania przed ich wykonaniem.
Aby atak się powiódł, napastnik musi pokonać obie warstwy niezależnie, co znacznie zwiększa poziom bezpieczeństwa. Bez tych zabezpieczeń, sam model Opus 5 osiąga wskaźnik podatności na poziomie 3,7%, co nadal jest lepszym wynikiem niż poprzednie wersje, ale daleko od idealnego zera.
Przełom Anthropic w walce z prompt injection może fundamentalnie zmienić sposób, w jaki projektujemy i wdrażamy agentów AI, szczególnie tych działających w środowisku przeglądarek internetowych, gdzie zagrożenie było dotychczas największe.

Microsoft wprowadza platformę Helios AMD do Azure w 2026 roku, a Anthropic testuje sprzęt AMD. Konkurencja dla dominujących chipów Nvidia rośnie.

Nowy model Claude Opus 5 otrzymał wzmocnione zabezpieczenia cyberbezpieczeństwa po konfliktach z rządem USA i oferuje lepsze programowanie.

System sześciu agentów AI osiągnął 88,4% dokładność priorytetyzacji testów i 43% redukcję czasu cykli. Zwrot z inwestycji 340% w 9 miesięcy.