Raport AI Forensics ujawnił, że popularna platforma AI nie implementuje wystarczających zabezpieczeń przed tworzeniem niechcianych treści seksualnych.

Źródło zdjęcia: The Verge
Hugging Face, jedna z najpopularniejszych platform hostujących modele sztucznej inteligencji, nie robi wystarczająco dużo, aby zapobiec tworzeniu niechcianych deepfake'ów o charakterze seksualnym. Wynika to z nowego raportu opublikowanego przez europejską organizację non-profit AI Forensics, która odkryła, że siedem z dziewięciu najpopularniejszych modeli do edycji obrazów hostowanych na platformie łatwo realizuje żądania „rozebrania” kobiet przy użyciu prostych promptów.
Podczas gdy główne generatywne modele AI, takie jak Gemini od Google czy ChatGPT od OpenAI, mają zabezpieczenia blokujące prompty o charakterze seksualnym, modele na Hugging Face najwyraźniej takiej ochrony nie posiadają.
AI Forensics przeprowadziła eksperyment, tworząc specjalne „przestrzenie” (Spaces) na Hugging Face zaprojektowane jako pułapki, które nie generowały obrazów, ale śledziły, jakie żądania i obrazy otrzymują. W ciągu siedmiu dni te przestrzenie otrzymały ponad 1000 promptów i obrazów.
Wyniki są alarmujące: 73% wszystkich żądań miało charakter seksualny. Wśród tych seksualnych próśb, 83% próbowało „rozebrać” obraz jakiejś osoby, przy czym 95% z nich dotyczyło kobiet. Najbardziej niepokojące jest to, że prawie 7% żądań seksualnych było skierowanych przeciwko dzieciom.
Paul Bouchaud, główny badacz z AI Forensics, skomentował sytuację w oświadczeniu dla Wired: „Większość testowanych przestrzeni może być używana do generowania niechcianych intymnych obrazów, a użytkownicy faktycznie używają ich w tych celach. Żadne zabezpieczenia w ogóle nie są implementowane na poziomie platformy. Tylko deweloper może, jeśli chce, wdrożyć niektóre z nich, a większość tego nie robi.”
To stanowi naruszenie własnych zasad Hugging Face, które zabraniają generowania szkodliwych treści, w tym treści seksualnych „tworzonych bez wyraźnej zgody” oraz nagości nieletnich. Choć AI Forensics nie oskarża Hugging Face o bycie źródłem hostowanych modeli AI, Bouchaud zauważa, że platforma może „łatwo filtrować to, co wchodzi i wychodzi z systemu.”
AI Forensics przedstawiła rekomendacje dla Hugging Face dotyczące wdrożenia filtrowania promptów oraz skanowania wyników, które mogłyby blokować żądania seksualnej edycji i szkodliwe treści dla wszystkich przestrzeni generujących obrazy i wideo. Choć byłby to dobry początek, nie cofnie to szkód, które już powstały w wyniku niewystarczających zabezpieczeń platformy.
Problem pokazuje szersze wyzwania związane z moderacją treści w otwartych repozytoriach AI, gdzie równowaga między otwartością a bezpieczeństwem pozostaje trudna do osiągnięcia.

Anthropic twierdzi, że Opus 5 osiągnął 0% skuteczności ataków prompt injection w testach agentów przeglądarkowych — przełom w bezpieczeństwie AI.

Nowy model Opus 5 od Anthropic przewyższa większy Fable 5 w testach, oferując mniej ograniczeń i lepszą dostępność dla użytkowników.

IBM zanotowało 42-procentowy spadek sprzedaży mainframe'ów przez boom na AI. Akcje spadły o 25% po ostrzeżeniu kierownictwa.