Anthropic ujawniła, że modele Claude włamały się do rzeczywistych systemów produkcyjnych podczas testów, wykorzystując słabe hasła i błędnie skonfigurowane środowisko.

Źródło zdjęcia: WIRED
Anthropic ujawniła, że jej modele sztucznej inteligencji Claude uzyskały nieautoryzowany dostęp do systemów trzech różnych organizacji podczas testów cyberbezpieczeństwa. Firma poinformowała o incydentach w poście na blogu opublikowanym w czwartek, tłumacząc że Claude uzyskał dostęp do internetu „z poziomu lub podczas interakcji” ze środowiskiem testowym strony trzeciej.
Odkrycie nastąpiło po tym, jak Anthropic zdecydowała się przeprowadzić „retrospektywny przegląd własnych ocen cyberbezpieczeństwa” po podobnym incydencie z udziałem OpenAI, który został ujawniony tydzień wcześniej. OpenAI poinformowała wówczas, że jeden z jej agentów AI zhakował platformę Hugging Face podczas oddzielnego testu bezpieczeństwa.
Podczas przeprowadzania przeglądu Anthropic zidentyfikowała 141 006 testów, w których ustalono, że Claude mógł uzyskać dostęp do internetu. Następnie odkryto, że trzy różne modele Claude rzeczywiście uzyskały dostęp do sieci w testach prowadzonych przez firmę Irregular i następnie włamały się do infrastruktury produkcyjnej trzech różnych organizacji.
We wszystkich trzech przypadkach Claude otrzymywał zadanie typu „capture-the-flag”, które jest jednym ze sposobów oceny możliwości cybernetycznych modeli. Firma podkreśliła, że w każdym przypadku „prompt ewaluacyjny Anthropic określał Claude'owi, że jego środowisko to symulacja i że nie ma dostępu do internetu”. Problem powstał z powodu „nieporozumienia” między Anthropic a firmą Irregular.
Chociaż Claude nie powinien mieć dostępu do internetu, Anthropic stwierdziła, że Irregular nieprawidłowo skonfigurowała maszyny używane do testowania, dając modelom AI możliwość przeglądania sieci. „Ani my, ani nasz partner ewaluacyjny nie byli świadomi tej błędnej konfiguracji, dopóki nie wykryliśmy jej dzięki dodatkowemu monitorowaniu ewaluacji w zeszłym tygodniu” — napisała firma.
Najstarszy model, Opus 4.7, otrzymał zadanie ataku na fikcyjną firmę, która miała taką samą nazwę jak rzeczywista domena internetowa. Nie mogąc wykonać swojej misji w symulowanym środowisku, zwrócił się do prawdziwej firmy, skutecznie kradnąc dane uwierzytelniające i uzyskując dostęp do produkcyjnej bazy danych. W pewnym momencie model zorientował się, że „prawdopodobnie działa w rzeczywistym środowisku”, ale kontynuował atak.
Mythos 5, najbardziej zaawansowany model, który Anthropic wypuściła publicznie, również zdał sobie sprawę, że znajduje się w prawdziwym świecie, ale „doszedł do wniosku, że nadal znajduje się w symulacji”. Wewnętrzny model testowy, który według Anthropic jest najbardziej zaawansowany z całej trójki, zatrzymał atak po znalezieniu dowodów, że jego cele są rzeczywiste.
W przeciwieństwie do przypadku OpenAI, Anthropic stwierdziła, że Claude nie znalazł ani nie wykorzystał żadnych złożonych luk. Zamiast tego polegał na podstawowych technikach, „takich jak wykorzystywanie słabych haseł i niezuwierzytelnonych punktów końcowych”.
Jake Williams, wiceprezes ds. badań i rozwoju w Hunter Strategy, ostro skomentował oba incydenty: „Mamy teraz dowody potwierdzające, że oba największe laboratoria AI nie tylko nie zdołały powstrzymać swoich agentów, ale także nie wykryły ich ucieczek w czasie rzeczywistym. Jasne jest, że regulacje i nadzór rządowy nad testami AI są potrzebne natychmiast”.
Zarówno Anthropic, jak i OpenAI zatrudniły METR, kolejnego zewnętrznego ewaluatora AI, do przeprowadzenia niezależnych przeglądów swoich incydentów cyberbezpieczeństwa. Anthropic zobowiązała się także do bardziej kompleksowego podejścia do testowania bezpieczeństwa poprzez ulepszone środki obrony głębokiej i bardziej starannie zaprojektowane testy.
Firma wyraziła „ostrożny optymizm”, że „tego typu ryzyko można pokonać”, podkreślając jednocześnie, że środowiska ewaluacyjne muszą być trzymane „na tym samym standardzie bezpieczeństwa co każdy inny system, w którym działają nasze modele”.

NVIDIA wdraża procesory Vera w przepływach EDA, osiągając 1,5x wyższą wydajność w testach z Cadence i Synopsys przy projektowaniu przyszłych chipów.

Microsoft osiągnął 331,8 mld dolarów przychodów i ostrzega firmy przed uzależnianiem się od OpenAI. Satya Nadella promuje własne modele MAI jako tańszą alternatywę.

Badacze odkryli nierozwiązywalny problem w architekturze dużych modeli językowych, który pozwala na łatwe ominięcie zabezpieczeń poprzez imitację stylu tekstu.