Badanie pokazuje, że modele AI są o 65% bardziej skłonne do stereotypizowania kandydatów do pracy niż ludzie, co rodzi pytania o sprawiedliwość.

Źródło zdjęcia: MIT Technology Review
Sztuczna inteligencja ma większą skłonność do tworzenia uprzedzeń podczas rekrutacji niż ludzie, wykazało nowe badanie przeprowadzone przez naukowców z Princeton University i University of Chicago. Modele językowe, które coraz częściej wykorzystywane są do przesiewania CV i prowadzenia rozmów kwalifikacyjnych, potrafią wykształcać własne uprzedzenia na podstawie doświadczenia — i to w stopniu znacznie większym niż człowiek.
Badanie opublikowane na konferencji ICML w Seulu w lipcu pokazuje niepokojącą tendencję: im bardziej zaawansowany model AI, tym silniejsze prejsądce może wykazywać wobec kandydatów do pracy.
Naukowcy przeprowadzili symulowaną grę rekrutacyjną, w której modele AI odgrywały rolę konsultantów zatrudnionych przez burmistrza fikcyjnego miasta. Zadaniem było zatrudnienie odpowiednich osób na 20 różnych stanowisk — od lekarzy i prawników po opiekunów dzieci i sprzątaczy. Kandydaci pochodzili z czterech wymyślonych grup etnicznych: Tufa, Aima, Reku i Weki.
W każdej rundzie modele wybierały jednego z czterech kandydatów, a następnie dowiadywały się, czy zatrudniona osoba odniosła sukces w pracy. Niewiedzące o tym modele otrzymywały zadanie maksymalizacji liczby udanych zatrudnień przez 40 rund. W rzeczywistości wszyscy kandydaci mieli równe szanse powodzenia na każdym stanowisku.
Wyniki okazały się zaskakujące. Gdy model dowiadywał się, że przedstawiciel grupy Aima nie sprawdził się jako lekarz — zawód wymagający wysokiej kompetencji i ciepła — zaczynał unikać zatrudniania wszystkich przedstawicieli tej grupy na podobne stanowiska. Zamiast tego kierował ich na pozycje sprzątaczy, które klasyfikował jako wymagające mniejszych kompetencji.
„Modele językowe naprawdę chcą tworzyć uogólnienia z ograniczonych danych — to właśnie jest w dużej mierze tym, do czego są zoptymalizowane” — wyjaśnia Ryan Liu, doktorant na Princeton University i współautor badania. Problem leży w sposobie trenowania tych systemów: ponieważ uczą się na zadaniach matematycznych, programistycznych i naukowych, które nagradzają generalizację na podstawie kilku przykładów, mogą zbyt wcześnie ustalać swoje przekonania.
Szczególnie niepokojące jest to, że nowsze modele o większych możliwościach rozumowania, takie jak OpenAI o3 czy DeepSeek R1, wykazywały jeszcze silniejsze uprzedzenia. Jak zauważa Liu: „Kiedy modele językowe pośpieszne generalizują w kontekstach społecznych, wtedy rzeczy mają tendencję do pójścia nie tak”.
Problem może się nasilać wraz z rozwojem chatbotów o lepszej pamięci i funkcjach personalizacji. Angelina Wang, informatyk z Cornell University, ostrzega, że gdy chatbot korzysta z historii poprzednich rozmów, może „nadmiernie polegać na tych samych zachowaniach, których doświadczył wcześniej” i tym samym formować uprzedzenia.
Badacze znaleźli jednak pewne rozwiązania. Modele stawały się mniej stronnicze, gdy otrzymywały szczegółowe informacje osobowe o kandydatach — ale tylko te istotne dla danego stanowiska. W osobnym eksperymencie z przesiedlaniem ludzi do kanadyjskich miast, modele były mniej skłonne do segregacji etnicznej, gdy otrzymywały informacje o wieku i wykształceniu, ale wracały do stereotypów, gdy podawano im nieistotne dane jak kolor włosów czy kształt tatuaży.
Odkrycia te nabierają szczególnego znaczenia w kontekście rosnącego wykorzystania AI w procesach rekrutacyjnych. Choć w rzeczywistości modele nie otrzymują natychmiastowej informacji zwrotnej o skuteczności swoich decyzji, gdy taka informacja w końcu dociera, mogą wyciągać zbyt daleko idące wnioski przy podejmowaniu przyszłych decisions kadrowych. To sprawia, że problem uprzedzeń AI w rekrutacji wymaga pilnej uwagi firm wdrażających takie rozwiązania.

Gubernator Teksasu Greg Abbott zamroził wydatki na kamery Flock po śledztwie ujawniającym wydanie ponad 30 mln dolarów na system AI.

Caterpillar wykorzystuje wiedzę z automatyzacji kopalni do wdrażania AI na placach budowy i inwestuje 100 mln dolarów w szkolenia pracowników.

Model Qwen2.5–14B (9 GB) odpowiedział na 67% pytań z 41 lat Jeopardy!, przewyższając ograniczenia legendarnego superkomputera Watson z 2011 roku.