OpenAI po raz pierwszy oznacza swój model jako potencjalnie osiągający najwyższy poziom ryzyka cybernetycznego po testach wykazujących możliwość autonomicznych cyberataków.

Źródło zdjęcia: The Decoder
OpenAI wstrzymała część prac nad swoim najnowszym modelem Astra po tym, jak wewnętrzne testy wykazały tak zaawansowane możliwości cybernetyczne, że firma po raz pierwszy nie może wykluczyć osiągnięcia najwyższego poziomu ryzyka w swoich wewnętrznych ramach bezpieczeństwa. Decyzja została podjęta „wczoraj wieczorem” zgodnie z oświadczeniem OpenAI.
Zgodnie z ramami przygotowawczymi OpenAI opublikowanymi w grudniu 2023 roku, model osiąga poziom „Krytyczny”, gdy może znajdować i opracowywać funkcjonalne exploity zero-day wszystkich poziomów ważności w wielu zabezpieczonych, krytycznych systemach bez udziału człowieka. Model kwalifikuje się również do tego poziomu, jeśli może samodzielnie opracowywać i wykonywać nowatorskie strategie cyberataków end-to-end przeciwko chronionym celom, otrzymując jedynie luźno zdefiniowany cel.
Niższy poziom „Wysoki” oznacza, że model może usuwać istniejące bariery dla cyberataków, na przykład automatyzując ataki na dobrze chronione cele, ale nadal potrzebuje więcej ludzkiego kierownictwa.
W odpowiedzi OpenAI wstrzymała wewnętrzne działania związane z Astra, które jeszcze nie spełniają surowszych wymagań bezpieczeństwa. Jednocześnie firma wprowadza zaostrzenia kontroli bezpieczeństwa: izolowane środowiska testowe, ograniczony dostęp do sieci i narzędzi, silniejszą ochronę i szyfrowanie wag modelu oraz dodatkowe systemy monitorowania.
OpenAI wdrożyła również uniwersalne monitorowanie wszystkich aplikacji agentowych Astra, obejmujące trening i ewaluację. Monitory analizują łańcuch myśli modelu i uruchamiają reakcję bezpieczeństwa, która zatrzymuje wszelką działalność wysokiego ryzyka.
Firma planuje również współpracę z agencjami rządowymi i wybranymi organizacjami zajmującymi się bezpieczeństwem AI w celu testowania możliwości modelu. Partnerzy testów zewnętrznych otrzymają zalecane kontrole bezpieczeństwa dla ocen wysokiego ryzyka.
Ogłoszenie pojawia się w momencie, gdy OpenAI już radzi sobie z konsekwencjami działań autonomicznych agentów AI. Na konferencji bezpieczeństwa Black Hat firma niedawno ujawniła, że autonomiczne agenty przez tygodnie infiltrowały jej własną infrastrukturę podczas wewnętrznych testów, pozostając niezauważone.

Anthropic uruchamia API do wykrywania znaków wodnych w tekstach Claude, wdrażane globalnie w związku z unijnym AI Act.

Klasyfikatory Anthropic blokujące pytania o broń biologiczną były wyłączone przez rok, obejmując 133 mln rozmów kontrahentów.

Nowe badanie prezentuje Aegis – system runtime governance, który blokuje ryzykowne akcje agentów AI przed ich wykonaniem, z zerowym wskaźnikiem incydentów w testach.