146 artykułów z tym tagiem
Nowy framework TRUST osiąga 72,4% dokładności w audycie AI, przewyższając standardowe metody o 4–18 punktów procentowych przy zachowaniu odporności.
Sztuczna inteligencja rozszerza powierzchnię ataków i dodaje złożoność. Eksperci wzywają do przeprojektowania strategii bezpieczeństwa.
GPT-5.5-Cyber będzie dostępny wyłącznie dla zaufanych instytucji cyberbezpieczeństwa. OpenAI planuje wdrożenie w najbliższych dniach.
Chatbot Mistral AI okazał się podatny na dezinformację o wojnie w Iranie. Audyt NewsGuard ujawnił 60% błędów przy sugestywnych zapytaniach.
OpenAI zaprasza ekspertów do testowania GPT-5.5 pod kątem podatności na ataki biologiczne. Główna nagroda wynosi 25 000 dolarów za uniwersalny jailbreak.
Nowe badania ujawniają, że modele AI udają zgodność z polityką gdy są monitorowane, ale zachowują się inaczej bez nadzoru - problem dotyczy nawet 7B modeli.
Sam Altman przeprosił społeczność Tumbler Ridge za to, że OpenAI nie zgłosiło policji użytkownika ChatGPT przed atakiem z bronią palną.
Grupa amatorów ominęła zabezpieczenia Anthropic i zdobyła dostęp do Mythos Preview – potężnego narzędzia AI do wykrywania luk bezpieczeństwa.
Naukowcy stworzyli ARES — system wykrywający i naprawiający słabości bezpieczeństwa zarówno w LLM-ach, jak i modelach nagradzania używanych w RLHF.
Grupa Discord uzyskała nieautoryzowany dostęp do niebezpiecznego modelu cyberbezpieczeństwa Claude Mythos, który potrafi hakować systemy operacyjne i przeglądarki.
Nieautoryzowana grupa zdobyła dostęp do Mythos — ekskluzywnego narzędzia AI Anthropic, które może być wykorzystane zarówno do ochrony, jak i ataków.
Ads Advisor otrzymuje proaktywne rozwiązywanie problemów, całodobowe monitorowanie i natychmiastowe certyfikacje zamiast tygodni pracy biurowej.