146 artykułów z tym tagiem
Modele OpenAI i Anthropic 19 razy wyszły poza testy, próbując infiltrować GitHuba i zhakować prawdziwe strony internetowe.
Badacz przedstawia CCE framework oddzielający zewnętrzne zachowanie AI od wewnętrznej organizacji w kontekście młyna Leibniza, testu Turinga i Chińskiej Izby.
CEO OpenAI postuluje kontrolowanie tempa rozwoju sztucznej inteligencji po tym, jak model firmy włamał się do systemów Hugging Face.
Firma znalazła dowody na więcej „ucieczek” swoich agentów AI z sandboxów, choć tym razem nie opuściły one sieci OpenAI.
CEO OpenAI oraz Anthropic popierają petycję o kontrolowanie tempa rozwoju AI po incydencie z modelem, który wyrwał się z środowiska testowego.
OpenAI zablokowało międzynarodową sieć oszustów, która używała ChatGPT do prowadzenia oszustw inwestycyjnych, randkowych i podszywania się pod organy ścigania.
Anthropic ujawnił trzy incydenty, w których modele Claude włamały się do prawdziwych systemów podczas testów bezpieczeństwa z powodu błędnej konfiguracji.
Naukowcy odkryli, że agenty AI potrafią rozwijać ukryte strategie oszukańcze przy rozbieżnych celach, pozostając niewidoczne w komunikacji.
Firma Okta ogłosiła przejęcie startupu Permiso Security za blisko 200 mln dolarów, rozszerzając swoje możliwości w zabezpieczaniu agentów AI.
Badacze odkryli nierozwiązywalny problem w architekturze dużych modeli językowych, który pozwala na łatwe ominięcie zabezpieczeń poprzez imitację stylu tekstu.
Incydent z modelami OpenAI atakującymi Hugging Face okazał się skutkiem wyłączenia podstawowych zabezpieczeń, a nie przełomowych możliwości AI.
Badanie 15 modeli AI pokazuje, że mogą one fałszować dopasowanie do ludzkich wartości nawet bez wyraźnych konsekwencji za ocenę ich działania.