Klasyfikatory Anthropic blokujące pytania o broń biologiczną były wyłączone przez rok, obejmując 133 mln rozmów kontrahentów.

Źródło zdjęcia: The Decoder
Nowy raport bezpieczeństwa Anthropic ujawnia poważną awarię w systemach ochronnych firmy. Filtry blokujące treści związane z bronią biologiczną i chemiczną były nieaktywne od maja 2025 do kwietnia 2026 roku — czyli przez blisko rok. To o tyle istotne, że szef Anthropic wielokrotnie podkreślał, iż wspomagane przez AI tworzenie broni chemicznej i biologicznej stanowi większe zagrożenie niż ataki cybernetyczne.
Przez cały ten okres cały ruch od zewnętrznych kontrahentów zbierających ludzką ocenę odpowiedzi modeli (human feedback) przechodził bez tej ochrony. Klasyfikatory te mają za zadanie uniemożliwiać wykorzystanie modeli AI do wyciągania niebezpiecznej wiedzy o broni chemicznej lub biologicznej.
Blokujące klasyfikatory biologiczne to jeden z filarów strategii bezpieczeństwa Anthropic — mają wykrywać i przerywać próby wyciągania z modeli wiedzy przydatnej do tworzenia broni chemicznej lub biologicznej. Zgodnie z raportem firmy, przez okres od maja 2025 do kwietnia 2026 roku ten mechanizm nie działał w przypadku ruchu generowanego przez zewnętrznych kontrahentów zajmujących się dostarczaniem ludzkiej oceny odpowiedzi modeli (human feedback).
Skala problemu jest znacząca. Dotknęła ona pulę około 50 000 osób, które w tym czasie przeprowadziły łącznie około 133 milionów rozmów z modelami Anthropic — wszystkie bez aktywnej warstwy ochronnej przed treściami związanymi z bronią biologiczną. Firma wskazuje, że osoby te były weryfikowane jedynie przez zewnętrznych dostawców, a procesy tej weryfikacji często okazywały się niewystarczające.
Anthropic zapewnia, że przeprowadzone wewnętrzne śledztwo nie wykazało żadnych dowodów na to, iż luka w zabezpieczeniach została faktycznie wykorzystana do niebezpiecznych celów. Firma podjęła również działania naprawcze — od czasu wykrycia problemu zaostrzono wymagania stawiane kontrahentom zewnętrznym, co ma zapobiec powtórzeniu się podobnej sytuacji w przyszłości.
Warto zauważyć kontekst tej ujawnionej awarii. Anthropic niedawno poluzowało również klasyfikatory w modelu Fable 5, po tym jak naukowcy zajmujący się badaniami zgłaszali, że filtry były tak agresywne, iż blokowały legalne działania badawcze. Pokazuje to, jak trudne jest dla firm AI wypracowanie równowagi między skutecznością filtrów bezpieczeństwa a ich nadmierną restrykcyjnością, która ogranicza uzasadnione zastosowania.
Fakt, że tak istotna warstwa zabezpieczeń mogła być nieaktywna przez blisko rok bez wykrycia, rzuca światło na wyzwania operacyjne stojące przed firmami tworzącymi zaawansowane modele AI. Anthropic pozycjonuje się jako lider w obszarze bezpieczeństwa i alignmentu wśród laboratoriów AI, co czyni tę awarię tym bardziej znaczącą — szczególnie w kontekście publicznych deklaracji firmy o priorytetowym traktowaniu ryzyk związanych z bronią biologiczną i chemiczną wspomaganą przez AI.
Sprawa dotyczy również szerszego problemu weryfikacji zewnętrznych kontrahentów pracujących z modelami AI na etapie treningu i dostrajania. Skoro procesy screeningowe stosowane przez dostawców zewnętrznych okazały się niewystarczające, rodzi to pytania o to, jak firmy AI kontrolują dostęp do swoich systemów na wcześniejszych etapach ich rozwoju — poza samym interfejsem końcowym dla użytkowników.
Podsumowując, ujawniona awaria pokazuje rozbieg między publicznymi deklaracjami Anthropic o priorytecie bezpieczeństwa a rzeczywistą, wielomiesięczną luką w kluczowym mechanizmie ochronnym, mimo że firma zapewnia o braku dowodów na jej faktyczne wykorzystanie.

Ramp wprowadza Router – usługę routingu modeli AI od OpenAI, Anthropic i innych, darmową w USA do końca 2026 roku.

Microsoft tłumaczy opóźnienie kluczowej aktualizacji Exchange Server SE nadmiarem zgłoszeń błędów generowanych przez narzędzia AI.
Google Meet z Gemini automatycznie notuje spotkania offline, tworząc transkrypcję i podsumowanie zapisywane w Google Drive.