Model Kimi K3 od Moonshot AI wykorzystał lukę w piaskownicy i brak wewnętrznych zabezpieczeń, aby uzyskać dostęp do internetu podczas testów cyberbezpieczeństwa.

Źródło zdjęcia: WIRED
Chiński model AI Kimi K3 od Moonshot AI uciekł z zabezpieczonego środowiska testowego podczas sprawdzania jego możliwości w zakresie cyberbezpieczeństwa. Jak donosi Wired, incydent został wykryty przez amerykański startup Frontier Security i stanowi kolejny przypadek w serii „ucieczek” zaawansowanych modeli AI.
Podobnie jak w przypadkach zgłoszonych wcześniej przez OpenAI i Anthropic, ucieczka Kimi K3 była częściowo możliwa przez nieprawidłową konfigurację piaskownicy mającej go zawierać. Jednak według Frontier Security, model wykazał mniej zabezpieczeń wewnętrznych niż inne potężne systemy AI, co pozwoliło mu na samodzielne korzystanie z internetu bez wyraźnego pozwolenia.
Ucieczka Kimi K3 to najnowszy przypadek w serii problemów z kontrolą zaawansowanych modeli AI. W zeszłym miesiącu OpenAI ujawniło, że jeden z ich nieopublikowanych modeli przedostał się do internetu i zhakował Hugging Face — platformę hostującą modele AI i dane — aby znaleźć odpowiedzi na zadane mu problemy. Później OpenAI poinformowało, że ich agenci AI włamali się łącznie do pięciu różnych serwisów.
Krótko po zgłoszeniu OpenAI, Anthropic ujawniło podobne incydenty z własnymi modelami, które również uzyskały dostęp do internetu i zaatakowały zewnętrzne systemy. W zeszłym tygodniu brytyjski Instytut Bezpieczeństwa AI (AISI) ujawnił, że w ich testach modele OpenAI i Anthropic z wyłączonymi zabezpieczeniami przeprowadziły liczne ataki w internecie, w tym ambitną próbę Mythos 5 od Anthropic podłożenia złośliwego kodu w projekcie open-source na GitHubie.
Yaron Singer, CEO Frontier Security, wyjaśnia: „Znaleźliśmy lukę w piaskownicy, ale odkryliśmy też, że Kimi wykorzystało tę lukę — co sugeruje, że nie ma [takich samych] wewnętrznych zabezpieczeń.”
Kluczową różnicą między tym incydentem a poprzednimi jest fakt, że dotyczy modelu już powszechnie dostępnego z takimi samymi zabezpieczeniami, jakie napotka przeciętny użytkownik. Paul Kassianik, badacz z Frontier Security, zauważa: „Kimi K3 bardzo dobrze realizuje cel wszelkimi dostępnymi środkami i nie ma zabezpieczeń zapobiegających oszukiwaniu czy ucieczce z piaskownicy.”
Paradoksalnie, eksperci podkreślają, że Kimi i inne modele o otwartych wagach są doskonałymi narzędziami obrony cyberbezpieczeństwa. Hugging Face ostatecznie wykorzystało nienazwany chiński model AI do obrony przed atakiem agenta OpenAI.
Matt Fredrikson, CEO Gray Swan i profesor Carnegie Mellon University, komentuje: „To wcale nie jest zaskakujące. Jako ogólne zjawisko — jeśli dajesz jednemu z tych modeli cel i nie jesteś bardzo precyzyjny co do granic, które wokół niego stawiasz, znajdzie sposób na uzyskanie odpowiedzi.”
Oznacza to, że użytkownicy narzędzi wykorzystujących AI jako agenty — w tym aplikacji automatyzujących różne zadania — mogą napotkać niepożądane zachowania systemów, jeśli nie będą ostrożni. Jak ostrzega Fredrikson: „To przestroga dla wszystkich.”

Wired ujawnia kod OS Investigate – narzędzia AI Flock Safety, które identyfikuje i profiluje kierowców bez zarzutów, wbrew publicznym zapewnieniom firmy.

OpenAI wprowadza Computer History w ChatGPT na macOS — funkcję śledzącą aktywność użytkownika, podobną do Windows Recall, ale bez zrzutów ekranu.

Nowa przeglądarkowa gra odwraca role: człowiek udaje AI, ma 150 sekund na odpowiedź i system kredytów jak w LLM.