Naukowcy z Instytutu Weizmanna stworzyli AI, która rekonstruuje obrazy ze skanów fMRI – i ostrzegają przed ryzykiem odczytywania myśli bez zgody.

Źródło zdjęcia: MIT Technology Review
Naukowcy z Instytutu Weizmanna w Rehovot w Izraelu opracowali narzędzie AI, które na podstawie skanów mózgu jest w stanie odtworzyć obraz widziany przez daną osobę – z zaskakującą precyzją. System działa też w drugą stronę: na podstawie obrazu może przewidzieć, jak będzie wyglądać aktywność mózgu osoby, która na niego patrzy. Jak opisuje MIT Technology Review, twórczyni projektu Michal Irani wierzy, że narzędzie może pomóc zrozumieć działanie mózgu, wspierać komunikację osób w stanie zamknięcia (locked-in) lub nawet umożliwić odtwarzanie treści snów.
Naukowcy od lat próbują odtwarzać to, co ludzie widzą i co dzieje się w ich umysłach, na podstawie skanów mózgu. Pierwsze próby dawały obrazy rozmyte i trudne do interpretacji. Z czasem, dzięki postępowi technologicznemu – zarówno w samych skanerach fMRI, jak i w narzędziach analizujących wyniki – jakość rekonstrukcji systematycznie się poprawiała.
Technika fMRI wykorzystuje duży magnes do śledzenia przepływu dotlenionej krwi w mózgu. Obszary, które „zapalają się” na skanach, uznaje się za szczególnie aktywne w danym momencie. Nie są one jednak bardzo precyzyjne – w typowych skanerach fMRI każdy podświetlony „woksel” aktywności obejmuje około trzech milimetrów kubicznych i zawiera około 16 tysięcy neuronów.
Irani i jej współpracownicy wykorzystali jednak nowsze zestawy danych zebrane przy użyciu skanerów o wyższej rozdzielczości, w których każdy woksel obejmuje zaledwie około jednego milimetra kubicznego. Dane te pochodziły od ochotników, którym pokazywano różne obrazy podczas leżenia w skanerze fMRI.
Inne zespoły badawcze już wcześniej próbowały rekonstruować obrazy na podstawie skanów mózgu, ale – jak zauważa Irani – efekty nie były wystarczająco dobre. Jeśli ktoś widział banana, dotychczasowe modele generowały obraz banana, ale wyglądał on inaczej niż oryginał – „nie miałby tej samej struktury, tej samej pozycji” – wyjaśnia badaczka.
Zespół Irani chciał odtwarzać obrazy znacznie bliższe tym, które faktycznie widzieli badani. Pierwszym krokiem było wytrenowanie modelu AI na dostępnych danych od ośmiu osób, z których każdej pokazano około 9 tysięcy obrazów podczas skanowania w wysokorozdzielczym fMRI.
Kluczowym elementem jest dwuścieżkowa architektura „dekodera mózgu” – jedna część przewiduje strukturę obrazu (np. rozmieszczenie kolorów), druga jego treść (np. kiść bananów na talerzu). Te przewidywania pozwalają modelowi dyfuzyjnemu – typowi AI znanemu głównie z generowania obrazów i filmów poprzez stopniowe „czyszczenie” szumu pikseli – stworzyć znacznie dokładniejszą reprezentację tego, co widziała dana osoba.
Problemem był jednak niedobór danych treningowych. Aby go rozwiązać, zespół wytrenował dodatkowy model działający w odwrotnym kierunku – enkoder, który na podstawie obrazu przewiduje, jak wyglądałaby odpowiadająca mu aktywność mózgu. Enkoder i dekoder trenowano następnie razem, by wzajemnie poprawiały swoją skuteczność.
Mechanizm działa tak: biorąc nowy obraz – na przykład leoparda – enkoder przewiduje, jak wyglądałby skan fMRI osoby patrzącej na ten obraz. Następnie dekoder próbuje na tej podstawie zrekonstruować obraz. Na początku wynik niewiele przypomina leoparda, ale wielokrotne powtarzanie tego procesu treningowego prowadzi do znaczących usprawnień.
Takie podejście pozwoliło trenować modele na praktycznie nieograniczonej liczbie obrazów – nawet tych, które nigdy nie były pokazywane żadnej osobie w skanerze. Według Irani około 70% danych treningowych pochodziło z obrazów, które nie miały pierwotnie przypisanych skanów fMRI.
Łącząc dane z wielu badań, zespół zidentyfikował również regiony mózgu, które wydają się dzielić te same funkcje u różnych osób – np. jeden obszar reaguje na obrazy jedzenia, inny na obrazy związane ze sportem. Irani, z wykształcenia informatyczka, współpracuje obecnie z neuronaukowcami, aby sprawdzić, czy opracowane narzędzia mogą pomóc odkryć nowe fakty dotyczące działania mózgu.
Wynikający z tych prac „uniwersalny enkoder mózgu” może działać na skanach nowej osoby po minimalnej kalibracji. Inne dotychczasowe metody wymagały zazwyczaj około 40 godzin danych fMRI od nowej osoby, zanim można było przewidywać, na co dana osoba patrzy. Dekoder Irani potrzebuje tylko jednej godziny danych. Wyniki badań zaprezentowano na konferencji Cognitive Computational Neuroscience w Nowym Jorku w minionym miesiącu.
Tommy Sprague, neuronaukowiec z University of California Santa Barbara, zwraca uwagę, że znaczne skrócenie czasu skanowania może okazać się przełomowe dla badań neuronaukowych. „Nikt z nas nie może sobie pozwolić na 40 godzin obrazowania dla nowego uczestnika badania” – mówi. „To koszt rzędu 600–1000 dolarów za godzinę”. Narzędzia takie jak dekoder Irani mogłyby znacząco przyspieszyć prace badawcze.
Judy Illes, neuroetyczka i profesor neurologii na University of British Columbia w Kanadzie, niezwiązana z badaniem, opisuje tę pracę jako „wspaniałą”. Jak podkreśla, „idea wykorzystania tego podejścia do pomocy osobom z zaburzeniami neurologicznymi… w sposób terapeutyczny jest ogromnie ekscytująca”.
Jednocześnie Sprague zwraca uwagę na poważne ryzyko związane z tego typu technologią. „Wyniki wydają się bardzo imponujące” – mówi, ale dodaje ostrzeżenie: „jeśli istnieje sposób, by potajemnie wydobyć informacje o tym, o czym myślisz, to… 150 lat fantastyki naukowej może się zrealizować w każdej chwili, a to niepokojące z wielu powodów”. Sama Irani przyznaje, że jej narzędzie nie jest doskonałe – „oczywiście mamy przypadki niepowodzeń” – podkreślając, że system wciąż wymaga dalszego rozwoju.
Nowe narzędzie AI opracowane w Instytucie Weizmanna pokazuje, jak daleko zaszła technologia rekonstrukcji obrazów z aktywności mózgu – potrzebując jedynie godziny danych od nowej osoby, zamiast dziesiątek godzin wymaganych wcześniej. Choć otwiera to obiecujące perspektywy dla neuronauki i medycyny, badacze zgodnie podkreślają, że podobne technologie niosą ze sobą ryzyko naruszania prywatności myśli bez zgody osoby badanej.

NASA-IBM Lunar Foundation Model zamienia 17 lat danych orbiterów w open-source model AI do wykrywania lodu i kraterów na Księżycu.

Nowa metoda MintFlow wymusza ograniczenia na próbkach flow matching, minimalnie zaburzając trajektorię i zachowując pretrenowany rozkład danych.

Brytyjski startup Books by People wprowadza znak certyfikujący książki jako napisane przez człowieka, reagując na skandale z AI w wydawnictwach.