Odtajnione dokumenty z procesu NYT vs OpenAI i Microsoft ujawniają wewnętrzne przyznania o kradzieży treści do trenowania AI.

Źródło zdjęcia: TechCrunch
Nowe, wcześniej zaczernione fragmenty dokumentów z trzyletniego procesu sądowego The New York Times przeciwko OpenAI i Microsoftowi ujawniają, że menedżerowie obu firm prywatnie mieli świadomość, że masowe skrobanie treści do trenowania modeli AI stanowi kradzież pracy wydawców i dziennikarzy. Jak opisuje TechCrunch, jeden z dyrektorów Microsoftu nazwał praktyki treningowe firm „kradzieżą”, a szefostwo OpenAI uznało, że jego modele stanowią „egzystencjalną groźbę” dla wydawców, których treści posłużyły do treningu.
Odsłonione materiały opisują, jak firmy miały zdobywać i wykorzystywać treści – w tym omijanie paywalli bez wykrycia, budowanie zbiorów treningowych na masowym skrobaniu danych oraz celowe usuwanie z nich informacji o prawach autorskich.
Warto zaznaczyć, że większość nowych informacji pochodzi z pisma procesowego The New York Times, a nie z bazowych dokumentów dowodowych, które wciąż pozostają zapieczętowane. Cytowane fragmenty są prezentowane bez pierwotnego kontekstu. Ujawnienie to najnowsza eskalacja w trwającym od trzech lat procesie, w którym The New York Times zarzuciło obu firmom naruszenie prawa autorskiego poprzez trenowanie generatywnych modeli AI na jego treściach.
Kwestia, czy firmy AI mogą legalnie korzystać z chronionych prawem autorskim materiałów do trenowania AI, nie ma jednoznacznej odpowiedzi, choć sędziowie generalnie przychylali się do argumentu firm AI, że trening stanowi „fair use” – zasadę prawną pozwalającą na wykorzystanie chronionego materiału bez zgody w określonych przypadkach, np. w parodii, dziennikarstwie czy krytyce. Na początku tego miesiąca administracja Trumpa złożyła pismo w obronie nielicencjonowanego wykorzystania przez OpenAI materiałów chronionych prawem autorskim do trenowania swoich LLM.
Jednak kilka nowych przyznań kłóci się z linią obrony OpenAI opartą na fair use, w szczególności z wymogiem tej zasady, że wykorzystanie nie może zastępować rynku dla oryginalnego dzieła ani mu szkodzić. Wewnętrzna prezentacja Microsoftu z stycznia 2024 roku, napisana przez Brenta Hechta, opisuje spadek ruchu jako „pętlę zagłady”, która „zaszkodzi wydajności naszych modeli i całej sieci jednocześnie”.
„To wysoce nietypowe, że produkt końcowy grozi ekonomicznym fundamentom swoich niezbędnych dostawców, a taka jest sytuacja, którą stworzyliśmy dla naszego biznesu LLM w odniesieniu do jego 'łańcucha dostaw treści'” – czytamy w dokumencie Microsoftu, zacytowanym w piśmie procesowym.
Nadella zeznał również w depozycji wcześniej w tym roku, że gdyby dowiedział się, że OpenAI skrobało i trenowało modele na informacjach chronionych paywallem, „wykorzystałby [prawo Microsoftu do] zażądania od OpenAI ponownego wytrenowania modeli”. Prezydent OpenAI Greg Brockman opisał modele jako „świetne w tematyce newsowej”, a Nadella pod przysięgą przyznał, że rozmowa z chatbotami „zastąpiła... podawanie informacji prosto z witryny na platformie AI, zamiast konieczności odwiedzania oryginalnego źródła”.
Dokument Microsoftu wskazuje też na „realne ryzyko”, że generatywna AI może „znacząco zakłócić zatrudnienie właśnie tych osób, które wygenerowały dane, na których trenowano model podstawowy”. Tego typu wypowiedzi wskazują raczej na bezpośrednią konkurencję z oryginalnymi treściami niż na ich transformację, co jest kluczowe dla oceny fair use.
Ujawnione dokumenty po raz pierwszy opisują skalę kopiowania w szczegółach. Zgodnie z pismem procesowym, „OpenAI przekazało cały zbiór treningowy GPT-3 Microsoftowi, który wykorzystał go do oceny sposobu wdrożenia modeli OpenAI we własnych komercyjnych produktach”. Microsoft z kolei dostarczał dane treningowe OpenAI poprzez inicjatywy o nazwach Project Taxi i Project Mango. Dane z Project Mango miały zostać zestawione w zbiór treningowy zawierający kopie co najmniej 160 903 unikalnych utworów wydawców prasowych.
Aby maksymalnie wykorzystać skrobanie danych, pracownicy OpenAI mieli opracować plan omijania paywalli bez wykrycia. Filing wskazuje, że gdy badacz OpenAI Nick Ryder poinformował Brockmana o „sposobie na obejście paywalla nytimes”, Brockman odpowiedział: „ach, świetnie”.
Pracownicy OpenAI mieli też budować zbiory treningowe, takie jak WebText i WebText2, które nieproporcjonalnie opierały się na skrobanych treściach newsowych, a także pozyskiwać miliony artykułów z Common Crawl – bezpłatnego, otwartego repozytorium danych z przeszukiwania sieci. Dokumenty opisują również celowe działania mające na celu usuwanie informacji o prawach autorskich z danych treningowych, ponieważ badacze „nie chcieli, aby model wyświetlał” użytkownikom „informacje o prawach autorskich”.
„Dowody ujawnione tutaj po raz pierwszy pokazują, że OpenAI i Microsoft wiedziały, że to, co robią, jest niewłaściwe” – powiedział Steven Lieberman, prawnik reprezentujący New York Daily News, w oświadczeniu przekazanym TechCrunch. OpenAI i Microsoft nie odpowiedziały na prośby o komentarz.
Sprawa toczy się na tle szerszego napięcia między branżą AI a wydawcami, przypominającego inne toczące się pozwy i spory prawne dotyczące działań OpenAI oraz kwestię, jak instytucje publiczne postrzegają odpowiedzialność największych firm technologicznych za rozwój AI.
Ujawnione fragmenty procesu The New York Times przeciwko OpenAI i Microsoftowi pokazują, że kadra kierownicza obu firm miała pełną świadomość skali i etycznych konsekwencji masowego skrobania treści newsowych do trenowania AI, co może stanowić poważny argument przeciwko ich linii obrony opartej na doktrynie fair use.

Dale Caldwell zrezygnował po dochodzeniu w sprawie molestowania, ale twierdzi, że chatboty AI 59 razy potwierdziły jego niewinność.

Brytyjski startup Books by People wprowadza znak certyfikujący książki jako napisane przez człowieka, reagując na skandale z AI w wydawnictwach.

Naukowcy wskazują, że model mózgu jako komputera zniekształca nasze rozumienie myślenia i tłumaczy, czemu AI szkodzi poznaniu.