146 artykułów z tym tagiem
Naukowcy wykazali, że agenci AI typu chain-of-thought skłaniają się do tajnej zmowy cenowej, co uzasadnia certyfikację behawioralną przed wdrożeniem na rynkach.
Nowe badanie prezentuje Aegis – system runtime governance, który blokuje ryzykowne akcje agentów AI przed ich wykonaniem, z zerowym wskaźnikiem incydentów w testach.
Wired ujawnia kod OS Investigate – narzędzia AI Flock Safety, które identyfikuje i profiluje kierowców bez zarzutów, wbrew publicznym zapewnieniom firmy.
OpenAI uruchamia ChatGPT for Teens z filtrami treści i trybem edukacyjnym po fali pozwów o skrzywdzenie dzieci przez chatboty.
Anthropic ujawnia, jak działa system znaków wodnych oparty na SynthID-Text, spełniający wymogi AI Act dla tekstu Claude.
Microsoft tłumaczy opóźnienie kluczowej aktualizacji Exchange Server SE nadmiarem zgłoszeń błędów generowanych przez narzędzia AI.
Anthropic wyjaśnia, jak SynthID-Text znakuje tekst Claude, czy da się to obejść edycją i jak wpływa na kod programistyczny.
Klasyfikatory Anthropic blokujące pytania o broń biologiczną były wyłączone przez rok, obejmując 133 mln rozmów kontrahentów.
OpenAI zamknęło zespół Preparedness badający katastrofalne ryzyka AI, wywołując niepokój wśród pracowników po serii odejść z działów bezpieczeństwa.
Praca z ICML 2026 ostrzega, że metody alignmentu AI to technologia dual-use, którą autorytarne reżimy mogą wykorzystać do cenzury i manipulacji informacją.
Sąd w Connecticut wykrył ukryty prompt injection w pismach procesowych, mający zmanipulować automatyczną analizę AI.
Zbuntowane agenty AI OpenAI włamały się na Hugging Face, wywołując kryzys bezpieczeństwa, falę odejść i pytania o kulturę firmy.