Badanie na danych Upworthy pokazuje, że model LLM bez person lepiej przewiduje CTR niż panel syntetycznych person — persony wprowadzają szum, nie precyzję.

Źródło zdjęcia: arXiv.org
Nowe badanie podważa jedną z popularniejszych praktyk w branży marketingowej: wykorzystywanie dużych modeli językowych jako „syntetycznych person”, które mają symulować reakcje konkretnych grup odbiorców na treści reklamowe czy nagłówki. Autor pracy, Alexandre Cristovão Maiorano, sprawdził, czy taka symulacja rzeczywiście przewiduje realne zachowania czytelników — i doszedł do wniosku, który stawia pod znakiem zapytania sens całej metodologii person.
Punktem wyjścia była obserwacja, że modele językowe warunkowane profilem osobowym potrafią imitować odpowiedzi ludzkich próbek — co zachęciło marketerów do traktowania LLM jako „syntetycznych person” pozwalających przewidzieć reakcję publiczności na dany fragment tekstu, zanim jeszcze trafi on do świata rzeczywistego. Maiorano zdecydował się sprawdzić tę praktykę w warunkach sim-to-real, czyli porównując przewidywania modelu z rzeczywistym zachowaniem odbiorców.
Jako grunt pod porównanie posłużyło Upworthy Research Archive — zbiór tysięcy testów A/B nagłówków publikowanych na wspólnym, realnym ruchu, z zarejestrowanym CTR. To dane szczególnie wartościowe, bo pochodzą z rzeczywistych publikacji, a nie z syntetycznych symulacji czy ankiet.
Autor porównał dwa podejścia. Pierwsze to panel dziesięciu person, zbudowanych tak, by odzwierciedlać rzeczywistą demografię odbiorców Upworthy. Drugie — baseline zero-shot bez żadnych person, w którym model po prostu odpowiadał na pytanie, jak prawdopodobne jest, że „typowy czytelnik” kliknie dany nagłówek.
Wyniki okazały się sprzeczne z założeniem stojącym za całą koncepcją symulacji person. Baseline bez person uzyskał Kendall τ = 0,361 — efekt średniej wielkości — oraz trafność top-1 na poziomie 49,2%. Panel person wypadł znacznie słabiej: τ = 0,084 i trafność top-1 zaledwie 34,6%. Przedziały ufności dla obu metod nie pokrywają się, co potwierdza, że różnica nie jest przypadkowa.
Autor interpretuje ten rezultat w prosty sposób: zadanie modelowi pytania w sposób bezpośredni pozwala mu sięgnąć po dokładny „prior” na poziomie populacji — czyli ogólną, uśrednioną wiedzę o zachowaniach czytelników. Zmuszenie modelu do odgrywania konkretnych, wyimaginowanych person wprowadza natomiast dodatkowe zniekształcenie i szum, które pogarszają jakość przewidywań.
Efekt ten nie był jednorazowym artefaktem. Powtórzył się na trzech niezależnych podzbiorach danych z Upworthy, zachował ten samy kierunek na odrębnym zbiorze danych z innej domeny tematycznej — wiadomości — oraz okazał się odporny na zmiany seeda losowości, różne sformułowania promptów i wybór modelu. Badanie objęło trzy poziomy modeli Gemini oraz zupełnie inną rodzinę modeli, OpenAI gpt-4.1, gdzie różnica między podejściami z personami i bez nich pozostała istotna statystycznie w testach parowych.
Drugi kluczowy wniosek badania dotyczy samej metodologii testowania trafności predykcji. Maiorano zwraca uwagę, że wiarygodność danych referencyjnych to główny czynnik ograniczający wnioski, jakie można wyciągnąć z takich testów. Większość testów A/B w archiwum Upworthy nie miała statystycznie rozstrzygalnego zwycięzcy między wariantami nagłówków — a to oznacza, że trafność predykcji można wiarygodnie zmierzyć tylko na wąskim, wiarygodnym podzbiorze danych, liczącym w tym przypadku 399 przypadków.
To istotna przestroga metodologiczna dla całej branży badającej predykcyjność modeli LLM: bez solidnego, statystycznie rozstrzygalnego zbioru danych referencyjnych trudno mówić o rzetelnej walidacji jakiejkolwiek metody predykcyjnej — niezależnie od tego, czy wykorzystuje ona persony, czy nie.
Wszystkie wyniki liczbowe z badania można odtworzyć na podstawie publicznego pakietu replikacyjnego udostępnionego przez autora, co pozwala innym badaczom i praktykom zweryfikować metodologię i wyniki niezależnie.
Wniosek płynący z pracy jest jednoznaczny i zaskakujący: dla przewidywania zagregowanego zaangażowania odbiorców zwykły ranker LLM — bez żadnej maszynerii person — działa lepiej niż symulacja person. Jak podsumowuje autor, syntetyczne persony nie są jedynie słabym predyktorem — są gorsze niż całkowite ich niestosowanie.
Dla firm i agencji marketingowych, które inwestują w budowanie skomplikowanych paneli person opartych na LLM do testowania treści reklamowych przed publikacją, wynik ten sugeruje potrzebę ponownej oceny tej praktyki. Prostsze podejście — bezpośrednie zapytanie modelu o prawdopodobieństwo reakcji typowego odbiorcy — może dawać bardziej wiarygodne prognozy niż kosztowna i złożona symulacja wielu zróżnicowanych person.
Badanie Maiorano stanowi ważny sygnał ostrzegawczy dla rosnącej branży „syntetycznych badań rynku” opartych na modelach językowych: im więcej struktury i role-play wprowadza się do zapytań kierowanych do LLM, tym większe ryzyko, że model odejdzie od trafnego, opartego na danych priora i zacznie generować szum, a nie sygnał.

OpenAI wprowadza College Planner w ChatGPT for Teens – narzędzie do śledzenia terminów aplikacji i pomocy finansowej na studia.

Anthropic wprowadza Claude'a jako panel boczny w Dokumentach Google – redaguje tekst, tworzy tabele i działa równolegle z Gemini.

Nonprofit Trillium Labs, założony przez Nathana Lamberta i Toma Zicka, ma otwarcie badać ryzykowne obszary AI, jak RSI i uczenie ze wzmocnieniem.