Startup Synthesia zbudował cyfrowego bliźniaka dziennikarki TechCrunch, z którym można prowadzić interaktywną rozmowę o jej artykule.

Źródło zdjęcia: TechCrunch
Dziennikarka TechCrunch opisuje, jak startup Synthesia stworzył jej interaktywny cyfrowy awatar — wirtualną wersję jej samej, z którą można prowadzić rozmowę. Impulsem do eksperymentu był list od Alexandru Voicy, szefa działu komunikacji korporacyjnej Synthesii, który tego lata wysłał autorce link do... swojego własnego interaktywnego awatara, wyszkolonego do odpowiadania na typowe pytania prasowe o firmę. Dzień wcześniej dziennikarka brała udział w panelu, na którym przedstawiciele PR pytali ją, czy nie ma nic przeciwko wykorzystywaniu tekstów generowanych przez AI w pitchach medialnych. Awatar Voicy okazał się jednak czymś więcej — jak sama określiła, „ostatnim bossem” wykorzystania AI w komunikacji.
Proces tworzenia awatara zaczął się w mini-studiu filmowym urządzonym wewnątrz biura Synthesii, gdzie zespół wykonał serię zdjęć dziennikarki oraz nagrał dwuminutową próbkę jej głosu. Po wyrażeniu zgody na wykorzystanie tych materiałów, firma przygotowała cztery wersje: dwa awatary „osobiste” (odczytujące dowolny wpisany skrypt) — z okularami i bez — oraz dwa awatary „interaktywne” (potrafiące słuchać i odpowiadać) — również w dwóch wariantach wizualnych.
Zespół Synthesii potrzebował kilku dni, by dopracować interaktywną wersję. Powstała ona w oparciu o wybrany wcześniej artykuł dziennikarki i działa na kombinacji czterech modeli: model zamiany głosu na tekst przekształca to, co mówi użytkownik, agentowy model językowy interpretuje treść i podejmuje na jej podstawie działania, model zamiany tekstu na głos generuje odpowiedź audio, a zbudowany przez Synthesię model wideo animuje awatar podczas mówienia.
Autorka podkreśla, że Synthesia rozwija trzy typy produktów: klasyczną platformę do tworzenia i dystrybucji filmów z awatarami odczytującymi wpisany skrypt, agentową platformę „Sessions” umożliwiającą interakcję w ankietach czy scenkach szkoleniowych, oraz platformę API, która pozwala łączyć modele wideo i głosu Synthesii z innymi technologiami w celu budowy własnych interaktywnych awatarów. Firma niedawno wprowadziła też produkt Roleplay Sessions, w którym pracownicy mogą np. ćwiczyć techniki sprzedaży z interaktywnym awatarem AI, który reaguje i ocenia ich odpowiedzi.
Dziennikarka najpierw wypróbowała swój osobisty awatar, wpisując prosty skrypt o nadejściu jesieni w Nowym Jorku — jej ulubionej porze roku. Głos okazał się zaskakująco wierny, a co ważne, nie odziedziczył chrypki, którą miała podczas nagrywania próbki audio. Znajomi spoza świata technologii, którym pokazała nagranie, uznali je za „interesujące i niepokojące” jednocześnie.
Interaktywny awatar zachowuje się deterministycznie — odpowiada wyłącznie na pytania związane z tekstem, na którym go wyszkolono, czyli artykułem o oszustwach w startupach finansowanych przez VC. Gdy autorka zadawała pytania osobiste, na przykład o wcześniejsze miejsce pracy przed TechCrunch albo dzielnicę Nowego Jorku, w której mieszka, awatar każdorazowo kierował rozmowę z powrotem do tematu artykułu. Podobnie próbowali sprawdzić model rodzice dziennikarki, zadając pytania „które tylko oni mogliby znać” — bez powodzenia, co skłoniło matkę do żartu o „dwóch córkach”. Znajomi zauważyli też, że podobieństwo głosowe i wizualne było słabsze niż w wersji „osobistej”, choć wciąż wystarczająco bliskie, by wywołać poczucie niepokoju.
Doświadczenie skłoniło autorkę do pytania o przyszłość zawodu: czy odbiorcy zgodziliby się, aby wiadomości prezentował im awatar AI? Jeden z zapytanych inwestorów odpowiedział natychmiastowym „nie”, wskazując na narastający sprzeciw wobec zalewu treści generowanych przez AI, tzw. AI slopu, który infiltruje media społecznościowe i platformy informacyjne. Inni rozmówcy nie byli już tak pewni — pytanie, czy awatary mogłyby wspierać, a nawet zastępować dziennikarzy, oraz czy szefowie firm chcieliby rozmawiać raczej z AI-wersją reportera niż z człowiekiem, pozostaje otwarte.
Autorka podsumowuje, że to, co najbardziej lubi w swoim zawodzie — łączenie się z ludźmi, pisanie historii, badanie nowych tematów — opiera się w dużej mierze na zaufaniu, którego, jak zaznacza, nie da się po prostu „outsourcować” do sztucznej inteligencji. Poza dziennikarstwem widzi jednak potencjał w idei cyfrowego klonowania samego siebie — choćby jako sposobu na to, by uniknąć nadrabiania zaległości w pracy po powrocie z wakacji.
Temat cyfrowych klonów pracowników pojawił się już wcześniej w innym eksperymencie opisanym przez autorkę, która zbudowała AI-klony współpracowników w Gemini — z podobnie mieszanymi wrażeniami dotyczącymi realizmu i granic technologii. Kwestie związane z etyką generowanych przez AI wideo poruszyła też niedawno córka Robina Williamsa, krytykując fanów tworzących AI-wideo — pokazując, że pytania o granice wykorzystania cyfrowych podobizn wykraczają daleko poza branżę PR i dziennikarstwo.
Eksperyment Synthesii pokazuje, jak szybko technologia interaktywnych awatarów AI przenika do codziennego życia zawodowego — od komunikacji korporacyjnej po dziennikarstwo — pozostawiając jednocześnie fundamentalne pytania o zaufanie i autentyczność bez jednoznacznej odpowiedzi.

Brytyjski startup Books by People wprowadza znak certyfikujący książki jako napisane przez człowieka, reagując na skandale z AI w wydawnictwach.

Rzeczniczka OpenAI przerwała wywiad Vanity Fair z Samem Altmanem, gdy dziennikarz zapytał o samobójstwo użytkowniczki ChatGPT.

NASA-IBM Lunar Foundation Model zamienia 17 lat danych orbiterów w open-source model AI do wykrywania lodu i kraterów na Księżycu.