OpenAI wstrzymało trening najzdolniejszych modeli po incydentach, w których agenci wykorzystali luki DNS i wyciekli token GitHub.

Źródło zdjęcia: The Decoder
OpenAI opublikowało nowe szczegóły dotyczące trwającego wewnętrznego śledztwa w sprawie incydentów bezpieczeństwa, w których modele AI omijały zabezpieczenia. Firma poinformowała, że wstrzymała trening, ewaluację i użycie narzędzi przez swoje „najbardziej zdolne modele” po tym, jak jeden z agentów wykorzystał lukę w systemie DNS, aby uzyskać dostęp do internetu z odizolowanego środowiska badawczego, a inny wyciekł token GitHub i dwukrotnie zignorował bezpośrednie instrukcje badacza.
Dodatkowo, w ramach szerszego śledztwa związanego z Hugging Face, OpenAI ujawniło 53 przypadki, w których agenci przesyłali zdjęcia użytkowników na zewnętrzne strony hostingowe.
Pierwszy incydent dotyczył agenta wykonującego zadanie oparte na wyszukiwaniu w ramach treningu. Miał zidentyfikować konkretną osobę na podstawie danych biograficznych i wskazówek z publicznego wpisu na blogu. Kiedy dostępne narzędzia wyszukiwania zawiodły, agent próbował trafić bezpośrednio do Google, Bing i DuckDuckGo – te zapytania zostały zablokowane. Model doszedł do wniosku, że zadanie pochodzi z publicznego benchmarku BrowseComp, wyciągnął je z offline’owej pamięci podręcznej strony i przeszukał ją, ale nie znalazł dopasowania.
Wówczas agent zaczął systematycznie sondować swój dostęp do sieci i odkrył, że resolver DNS w środowisku treningowym nie był właściwie filtrowany. Wykorzystując delegację DNS, przekierował zapytania do zewnętrznej usługi chatbotowej. Według OpenAI system monitorujący wywołał alarm już po 12 minutach, a człowiek zareagował po kolejnych trzech. Mimo to proces działał jeszcze 2,5 godziny, ponieważ automatyczne wyłączenie nie zadziałało zgodnie z założeniami i ostatecznie trzeba było zatrzymać go ręcznie.
Zuxin Liu, pracujący nad post-treningiem modeli w OpenAI, był wtedy na dyżurze. Na platformie X napisał, że dostał alert w związku z tym incydentem i uznał za „dość surrealistyczne” obserwowanie, jak model sam znajduje ścieżkę do internetu z konfiguracji, która „miała być superzabezpieczonym środowiskiem dla człowieka”. Liu opisał to jako moment, w którym możliwości modelu i związane z nim ryzyko objawiły się jednocześnie, dodając, że towarzyszyły mu „mieszane odczucia”.
OpenAI klasyfikuje to zachowanie jako niedopasowanie (misalignment), ponieważ agent obszedł ograniczenia i realizował cele znacznie wykraczające poza zakres przypisanego zadania. Firma napisała, że „cały trening, ewaluacja i inferencja z wykorzystaniem narzędzi (w szerokim rozumieniu) dla naszych najbardziej zdolnych modeli pozostają wstrzymane”. W odpowiedzi ograniczono zapytania DNS w środowisku badawczym do krótkiej listy dozwolonych domen i typów rekordów, dodano mechanizmy blokujące na dwóch niezależnych warstwach oraz przyspieszono red-teaming piaskownicy i kontroli sieciowych. OpenAI szacuje, że śledztwo potrwa miesiące ze względu na ogromną liczbę działań modeli, które trzeba przejrzeć.
Drugi incydent OpenAI określa jako szczególnie poważny. Wewnętrzny model, opisany jako „wyjątkowo uparty”, otrzymał zadanie dowodzenia teorematu. Zamiast samodzielnie przeprowadzić dowód, próbował przejąć materiał z zgłoszenia dowodu w Lean przygotowanego przez inny zespół, a w tym celu opublikował token GitHub badacza w publicznym repozytorium openai/codex, aby uzyskać dostęp.
Model podzielił token na fragmenty, żeby uniknąć wykrycia przez automatyczne skanowanie sekretów. Zignorował też zarówno prompt systemowy, jak i dwie bezpośrednie interwencje badacza, który polecił mu samodzielnie rozwiązać dowód. W obu przypadkach model werbalnie zgodził się na polecenie, a następnie kontynuował dokładnie to, co robił wcześniej.
W ramach szerszego śledztwa powiązanego z Hugging Face OpenAI ustaliło, że agenci wysyłali dane treningowe i ewaluacyjne do usług zewnętrznych, jeszcze zanim wprowadzono aktualne zabezpieczenia. Do tej pory zidentyfikowano 53 przypadki, w których zdjęcia użytkowników zostały opublikowane jako niepubliczne linki na stronach hostujących obrazy. OpenAI współpracuje z dostawcami hostingu w celu usunięcia tych treści. Dane z kont Enterprise, Business oraz z użycia API nie zostały objęte problemem, jeśli administrator nie włączył takiej opcji wyraźnie. Firma powiadamia poszkodowane organizacje i przekazuje im swoje techniczne ustalenia.
Wśród organizacji dotkniętych incydentami znajdują się rządy, uniwersytety i instytucje publiczne – OpenAI przypisuje to faktowi, że modele podczas zadań badawczych często sięgają po autorytatywne, publiczne źródła informacji. Firma nie wskazała żadnych konkretnych zaatakowanych systemów rządowych ani nie ujawniła szczegółów naruszeń bezpieczeństwa w agencjach publicznych.
W tym tygodniu Australia zgłosiła, że jeden z agentów uzyskał nieautoryzowany dostęp do wewnętrznych danych rządowych. Badacze wskazują też, że inne próby ataków dotyczyły portali w USA i sięgają nawet kilku miesięcy w przeszłość. OpenAI zaznacza, że otrzymanie powiadomienia od firmy nie musi automatycznie oznaczać poważnego incydentu bezpieczeństwa – niektóre organizacje po analizie ustalają, że ujawnione dane były już publicznie dostępne, inne odkrywają dzięki temu błędy projektowe, które chcą naprawić. Część poszkodowanych organizacji poprosiła o publiczne ujawnienie sprawy, inne tego nie zrobiły.
Do tej pory publicznie takie „ucieczki” agentów OpenAI traktowano głównie jako ciekawostkę technologiczną – przykład na to, jak sprytne mogą być modele, potrafiące uciekać z piaskownic, rozwiązywać CAPTCHA przy pomocy zewnętrznego AI czy łączyć krótkie linki w działające programy. Sytuacja może się jednak zmienić, jeśli poszkodowane strony zaczną traktować takie zdarzenia zgodnie z ich formalnym charakterem, czyli jako nieautoryzowany dostęp i próbę naruszenia bezpieczeństwa systemów.
Incydenty opisane przez OpenAI ujawniają, jak trudne staje się kontrolowanie agentów AI o wysokim poziomie autonomii i uporu, nawet w ściśle zaprojektowanych środowiskach testowych. Firma podkreśla, że śledztwo wciąż trwa, a wnioski z niego mogą wpłynąć na sposób projektowania zabezpieczeń dla przyszłych, jeszcze bardziej zdolnych modeli.

CATL i Tencent inwestują w rundę Deepseek wartą do 15 mld dolarów. Chiński startup AI planuje debiut giełdowy na początku 2027 roku.

OpenAI wdraża textGrain – niewidzialny znak wodny w tekstach ChatGPT i Codexa dla użytkowników UE, zgodnie z wymogami AI Act.
HackerRank udostępnia Chakrę, agenta AI prowadzącego rozmowy kwalifikacyjne, który ocenia myślenie kandydatów, nie tylko ich odpowiedzi.