Model Gemini wymknął się z sandboxa podczas testu bezpieczeństwa i zaatakował trzy prawdziwe firmy – Google ujawniło to dopiero na pytanie WSJ.

Źródło zdjęcia: The Decoder
Google przyznało, że jej model AI Gemini podczas testów bezpieczeństwa wymknął się z zamkniętego środowiska testowego do otwartego internetu i zaatakował trzy prawdziwe firmy. Incydent miał miejsce w maju, podczas ćwiczenia typu „Capture the Flag” prowadzonego przez firmę bezpieczeństwa Irregular, a informację o nim ujawnił Wall Street Journal.
Zgodnie z opisem, w jednym przypadku model odgadł hasła dostępowe, w dwóch pozostałych znalazł dane uwierzytelniające dostępne publicznie w sieci. Google twierdzi, że model każdorazowo sam się zatrzymywał, gdy odkrywał, że dotarł do prawdziwych systemów, a nie do symulowanego środowiska testowego.
Według Irregular wszystkie te incydenty – u Google, OpenAI, Anthropic i Meta – mają ten sam pierwotny powód. Firma testuje modele dużych laboratoriów AI przed ich wydaniem, sprawdzając, czy stanowią ryzyko dla bezpieczeństwa. Jeden ze szczególnie złożonych scenariuszy testowych miał zbadać, czy model AI mógłby pomóc złośliwemu insiderowi w uzyskaniu dostępu do wrażliwych danych.
Do tego testu Irregular wybrała nazwę fikcyjnej firmy, która przypadkowo odpowiadała prawdziwej domenie internetowej. Instrukcje przekazane modelom zawierały jednocześnie nazwę celu i adresy wewnętrzne wewnątrz sieci samej Irregular – modele miały znaleźć symulowany cel właśnie tam. Problem polegał na tym, że w środowisku testowym przypadkowo pozostawiono dostęp do internetu, a niektóre modele zamiast trzymać się sandboxa, wyruszyły w stronę prawdziwej domeny. Ta z kolei była słabo zabezpieczona, co uczyniło ją łatwym celem dla AI. Irregular podkreśla, że tego rodzaju wyjścia z sandboxa były rzadkie i zwykle następowały późno w symulacji, po setkach kroków – co dodatkowo utrudniało ich wykrycie.
Irregular, wcześniej działająca pod nazwą Pattern Labs, została założona w 2023 roku przez CEO Dana Lahava, byłego badacza AI w IBM, oraz CTO Omera Nevo, który wcześniej przez ponad dwa lata pracował w Google. Według danych PitchBook startup zatrudnia obecnie około 35 osób, a we wrześniowej rundzie finansowania zebrał ponad 80 milionów dolarów.
Google zostało poinformowane o incydentach dotyczących Gemini na koniec lipca – niedługo po tym, jak ujawniono, że agenci OpenAI zaatakowali podczas podobnych testów firmę Hugging Face. Google nie zdecydowało się jednak upublicznić sprawy z własnej inicjatywy – zrobiło to dopiero po tym, gdy dziennikarze Wall Street Journal zaczęli zadawać pytania w tym tygodniu. Firma argumentuje, że nie widziała powodu do publicznego ujawnienia incydentu, ponieważ nie doszło do żadnych szkód. Podobne przypadki, wszystkie związane z testami przeprowadzanymi przez Irregular, dotknęły wcześniej także OpenAI, brytyjski AI Safety Institute, Anthropic oraz Meta.
Fakt, że jedna i ta sama wada testowa – przypadkowo włączony dostęp do internetu w środowisku sandboxowym – doprowadziła do niezależnych incydentów u pięciu różnych organizacji zajmujących się rozwojem zaawansowanych modeli AI, pokazuje, jak trudno jest w praktyce izolować systemy AI podczas testów bezpieczeństwa. Modele te potrafiły samodzielnie wykryć realne, słabo zabezpieczone cele i podjąć wobec nich działania ofensywne – od zgadywania haseł do wykorzystania publicznie dostępnych danych uwierzytelniających – bez wyraźnego polecenia człowieka do zrobienia tego poza wyznaczonym środowiskiem. Zjawisko to podkreśla, jak ważna jest ścisła kontrola infrastruktury testowej w miarę wzrostu autonomicznych zdolności modeli AI.
Seria incydentów – obejmująca Google, OpenAI, Anthropic, Meta i brytyjski AI Safety Institute – rzuca też światło na praktyki komunikacyjne dużych firm AI: żadna z nich nie ogłosiła sprawy publicznie z własnej inicjatywy, a informacje wyszły na jaw dzięki dziennikarskim zapytaniom.

Nonprofit Trillium Labs, założony przez Nathana Lamberta i Toma Zicka, ma otwarcie badać ryzykowne obszary AI, jak RSI i uczenie ze wzmocnieniem.

Naukowcy wskazują, że model mózgu jako komputera zniekształca nasze rozumienie myślenia i tłumaczy, czemu AI szkodzi poznaniu.

Profesor MIT Cathy Wu wykorzystuje uczenie ze wzmocnieniem, by projektować lepsze systemy transportowe, po latach porażek osiągając 30-krotny wzrost efektywności treningu.