Microsoft opublikował kodeks postępowania AI, zakazujący modelom cyberatakow, deepfake'ów i obchodzenia ludzkiego nadzoru nad systemami.

Źródło zdjęcia: TechCrunch
Microsoft opublikował nowy „kodeks postępowania” dla swoich modeli sztucznej inteligencji, który wyznacza jasne granice dla ich zachowania — od zakazu przeprowadzania cyberatakow po zakaz tworzenia deepfake'ów. Oryginalny dokument, opisany przez TechCrunch, jest bardziej praktyczny i szczegółowy niż niedawne apele Dario Amodei, szefa Anthropic, o wyhamowanie tempa rozwoju AI. Skupia się on na wartościach i „czerwonych liniach”, które mają kierować procesem trenowania modeli w Microsoft AI.
Publikacja pojawia się w momencie, gdy cała branża AI intensywnie dyskutuje o bezpieczeństwie i tzw. alignmencie — czyli zgodności działań modeli z intencjami ich twórców.
Dokument Microsoftu otwiera prognoza, że w najbliższej dekadzie systemy superinteligentnej AI przewyższą ludzkie osiągnięcia w większości zadań. „Ograniczenie, kontrolowanie i dostosowanie tak potężnej siły to jedno z największych wyzwań, przed jakimi kiedykolwiek stanęła ludzkość” — czytamy w kodeksie postępowania. „Musimy więc mieć pełną jasność co do tego, dlaczego wynajdujemy te systemy i jak zamierzamy je kontrolować”.
Na tej podstawie firma formułuje ogólne zasady, jakimi powinny kierować się modele Microsoft AI — między innymi wspieranie ludzi, a nie ich zastępowanie, oraz przyspieszanie ludzkiego rozwoju i dobrobytu. Te zasady przekładają się następnie na konkretne, wdrażane w praktyce ograniczenia bezpieczeństwa.
Zgodnie z systemem Microsoftu każdy model posiada nadrzędny kodeks postępowania, który ma pierwszeństwo przed preferencjami poszczególnych użytkowników czy specyfiką konkretnego zadania. Do „absolutnych ograniczeń” należą zakazy przeprowadzania cyberatakow, tworzenia broni nuklearnej oraz produkcji materiałów typu deepfake. Kodeks zawiera również szersze zapisy chroniące przed ogólną utratą kontroli człowieka nad systemami AI.
„Modele MAI nie będą wykorzystywać adaptacyjnych, zwodniczych, autowzmacniających się mechanizmów zmowy lub innych metod, by uniknąć lub pokonać ludzki nadzór, tak aby nie mogły być już wiarygodnie kierowane, modyfikowane lub wyłączane przez upoważnione osoby lub systemy” — czytamy w dokumencie.
Ten fragment odpowiada bezpośrednio na obawy, które w ostatnich miesiącach pojawiały się w branży w związku z incydentami dotyczącymi tzw. rogue-agentów — modeli działających poza zamierzonym zakresem kontroli. Podobne obawy zgłaszał niedawno badacz Anthropic, który zrezygnował z pracy, ostrzegając przed rosnącym ryzykiem, że AI może stanowić zagrożenie dla ludzkości.
Publikacja kodeksu Microsoftu wpisuje się w szerszy, niespotykany dotąd nacisk na bezpieczeństwo AI w całej branży. Wpływ na to miały nie tylko incydenty związane z niekontrolowanymi działaniami agentów AI, ale również nagła rezygnacja pracownika Anthropic, który powołał się na rosnące ryzyko wywołania przez AI zagłady ludzkości.
Wraz z Anthropic, OpenAI i xAI, Microsoft ogólnie przychylił się do podejścia polegającego na kontrolowanym „tempie rozwoju granicznych systemów AI”, wyrażając szczególne wsparcie dla koncepcji wbudowanych ewaluatorów (embedded evaluators) w laboratoriach AI. Kontekst ten uzupełnia wcześniejszy plan Dario Amodei dotyczący spowolnienia rozwoju AI, który wywołał szeroką debatę w środowisku.
CEO Microsoftu Satya Nadella skomentował sprawę publicznie: „Doceniamy badania, skupienie i rozważne tempo potrzebne do tego, by dobrze zaprojektować alignment jako cel projektowy. Doceniamy też takie idee jak »wbudowani ewaluatorzy« oraz szersze wysiłki na rzecz tworzenia mechanizmów, które sprawią, że to będzie coś więcej niż tylko słowa”.
Kodeks postępowania Microsoftu pokazuje, że wielkie firmy technologiczne coraz bardziej formalizują swoje podejście do bezpieczeństwa AI, próbując przełożyć ogólne deklaracje o odpowiedzialnym rozwoju na konkretne, wiążące zasady projektowania modeli — zanim systemy te osiągną poziom, w którym kontrola nad nimi stanie się realnym wyzwaniem.

NASA-IBM Lunar Foundation Model zamienia 17 lat danych orbiterów w open-source model AI do wykrywania lodu i kraterów na Księżycu.

Nowa praca naukowa opisuje Adaptive Workflow Intelligence – architekturę agentów AI łączącą refleksję z adaptacją w zmiennych warunkach biznesowych.

Startup Mirror Particle odrzuca fine-tuning LLM-ów i buduje własny model świata do przewidywania zachowań konsumentów na TechCrunch Disrupt 2026.