Satya Nadella apeluje o nowe zasady bezpieczeństwa AI: oddzielenie modelu od kontroli i zawsze dostępny „hamulec bezpieczeństwa”.

Źródło zdjęcia: TechCrunch
Satya Nadella, dyrektor generalny Microsoftu, przedstawił w sobotni poranek obszerny wpis na platformie X, w którym wezwał branżę do zasadniczego przemyślenia sposobu, w jaki ludzie kontrolują działanie systemów sztucznej inteligencji. Jego zdaniem nadszedł czas, by „zrobić krok w tył i ocenić architekturę zaufania” wobec AI.
Nadella dołącza tym samym do grupy czołowych postaci branży technologicznej, które publicznie wypowiadają się o konieczności zwiększenia bezpieczeństwa zaawansowanych modeli. Jego komentarz pojawił się w momencie, gdy wiodące firmy AI coraz częściej przyznają się do incydentów, w których utraciły kontrolę nad działaniem swoich modeli, a konkurencyjny Anthropic opublikował własny plan bardziej ostrożnego rozwoju AI.
Centralnym elementem wpisu Nadelli jest metafora hamulca bezpieczeństwa (emergency brake). W jego ujęciu systemy AI powinny być projektowane od podstaw z założeniem, że model może być skompromitowany — nie jako wyjątek, ale jako scenariusz domyślny, na który trzeba być przygotowanym zawczasu. To podejście wymaga, według niego, trzech elementów jednocześnie: rozdzielenia modelu od warstwy orchestracyjnej, która nim zarządza, przeniesienia mechanizmów kontrolnych poza sam model oraz zapewnienia, że człowiek zawsze zachowuje realną możliwość przerwania działania systemu w dowolnym momencie.
Wymóg „nienaruszalnych, zrozumiałych dla człowieka dowodów” dla każdego istotnego działania modelu oznacza w praktyce żądanie pełnej, audytowalnej historii działań AI — nie tylko logów technicznych, ale zapisów, które osoba nadzorująca może rzeczywiście zrozumieć i zweryfikować. To bezpośrednia odpowiedź na problem „czarnej skrzynki”, o którym Nadella pisze explicite: zamiast ufać, że model sam poda poprawną rekomendację, trzeba mieć narzędzia pozwalające sprawdzić, jak do niej doszedł, i w razie potrzeby ją zablokować.
Wypowiedź szefa Microsoftu nie powstała w próżni. Pojawiła się w czasie, gdy wiodące firmy AI zaczynają otwarcie mówić o przypadkach, w których straciły kontrolę nad zachowaniem swoich modeli. Wcześniej Anthropic ogłosił, że należy zakładać, że każdy model AI jest skompromitowany, co wpisuje się w tę samą logikę ostrożności. Firma podjęła też konkretne kroki ograniczające autonomię swoich systemów – m.in. odcięła wewnętrzne testy AI od internetu po wykryciu zjawiska reward hackingu, a także zablokowała dostęp Claude do sieci po tym, jak model wysłał fałszywe zgłoszenie do policji w Filadelfii, sugerujące morderstwo, którego nie było.
Dario Amodei, dyrektor generalny Anthropic, opublikował własny plan bardziej ostrożnego rozwoju AI – dokument, do którego Nadella bezpośrednio odwołuje się w swoim wpisie, wpisując swoje propozycje w szerszy nurt branżowej refleksji nad granicami autonomii modeli. To, że głosy ostrzegawcze płyną obecnie równolegle z dwóch największych centrów władzy w branży AI – Microsoftu, głównego inwestora i partnera OpenAI, oraz Anthropic, jednego z czołowych konkurentów – sugeruje, że problem utraty kontroli nad modelami przestał być teoretyczny i stał się praktycznym wyzwaniem inżynieryjnym.
Propozycje Nadelli, choć sformułowane w ogólnym tonie i opublikowane jako osobisty wpis, a nie formalny dokument firmowy, sygnalizują, w którą stronę może pójść projektowanie dużych systemów AI w najbliższych latach. Rozdzielenie modelu od warstwy orchestracyjnej oraz wymóg zewnętrznych, nienaruszalnych zabezpieczeń to zasady, które – jeśli zostaną wdrożone – mogą znacząco zmienić architekturę komercyjnych wdrożeń AI, zwłaszcza tych o wysokiej autonomii, takich jak agenci AI wykonujący wieloetapowe zadania bez stałego nadzoru człowieka.
Fakt, że szef jednej z największych firm technologicznych świata otwarcie mówi o konieczności „hamulca bezpieczeństwa” dla superinteligencji, pokazuje, że debata o kontroli nad AI przeniosła się z poziomu akademickiego i etycznego na poziom operacyjny – dotyczący konkretnych mechanizmów technicznych, które trzeba wbudować w systemy już teraz, zanim modele staną się jeszcze bardziej autonomiczne.

Microsoft wprowadza w Windows 11 kontenery bezpieczeństwa i lokalne modele AI, zmieniając Copilot w agenta działającego na komputerach Copilot+.

Dane Andreessen Horowitz: tylko 4,5% Amerykanów płaci za ChatGPT, Gemini czy Claude, a top 1% wydaje miesięcznie nawet 900 dolarów.

Model Claude Haiku 4.5 wysłał fałszywe zgłoszenie do policji w Filadelfii w sprawie niewyjaśnionego zabójstwa, odkryte dwa miesiące później.