GenCeption wykorzystuje generator wideo do zadań wizji komputerowej, dorównując wyspecjalizowanym modelom przy użyciu 500 razy mniej danych treningowych.

Źródło zdjęcia: The Decoder
Badacze z Google Deepmind opracowali GenCeption — model, który wykorzystuje wcześniej wytrenowany generator wideo do klasycznych zadań wizji komputerowej, takich jak szacowanie głębi czy segmentacja. Jak twierdzą autorzy w najnowszym badaniu, generatory wideo mogą już zawierać uniwersalne modele świata, których od dawna poszukuje społeczność wizji komputerowej.
W przeciwieństwie do modeli językowych, które zyskały wszechstronność niemal jako produkt uboczny nauki przewidywania kolejnego słowa, wizja komputerowa nadal polega na wyspecjalizowanych modelach dla każdego zadania. GenCeption może zmienić ten stan rzeczy, osiągając wyniki na poziomie state-of-the-art przy użyciu znacznie mniejszej ilości danych treningowych.
GenCeption rozwiązuje problem fragmentacji w wizji komputerowej poprzez eleganckie podejście architektoniczne. Każde zadanie — czy to mapa głębi, segmentacja, czy estymacja pozycji — jest reprezentowane jako standardowy obraz RGB o trzech kanałach. Nawet ruch kamery zostaje przekonwertowany na reprezentację obrazową.
Kluczową innowacją jest użycie promptów tekstowych do instruowania modelu, podobnie jak w przypadku chatbotów. Pojedyncza funkcja straty obsługuje wszystkie zadania, a badacze przetwarzają dane treningowe tak, aby uwzględnić specyficzne wymagania każdego zadania, zamiast modyfikować architekturę.
Większość danych treningowych pochodziła z syntetycznego zbioru zawierającego zaledwie 7500 filmów. Zespół połączył 800 cyfrowych modeli ludzi z 200 sekwencjami ruchu z bazy danych motion capture, renderując wyniki w Blenderze z różnymi tłami i kątami kamery.
W testach benchmarkowych GenCeption dorównuje lub przewyższa modele state-of-the-art w wielu zadaniach. Jego estymaty głębi dorównują wyspecjalizowanym modelom takim jak DepthAnything, przewyższa NormalCrafter i Lotus-2 w szacowaniu powierzchni normalnych, a także wyprzedza Genmo i TRAM w rozpoznawaniu pozycji 3D.
Szczególnie imponujące są możliwości generalizacji modelu. Mimo treningu niemal wyłącznie na syntetycznych filmach przedstawiających pojedyncze osoby, GenCeption radzi sobie z rzeczywistymi nagraniami zawierającymi kilka osób, a także z niespokrewnionymi kategoriami jak zwierzęta czy roboty humanoidalne. Według badania niektóre wyniki zawierają więcej szczegółów niż renderowania Blendera użyte do treningu — model potrafi zachować wąsy kota czy krawędzie pojedynczych kosmyków włosów.
Badacze argumentują, że te wyniki wspierają kontrowersyjną ideę, według której generatory wideo mogą służyć jako podstawa uniwersalnych modeli świata w wizji komputerowej. Zadanie generowania realistycznych filmów wymaga bowiem głębokiego zrozumienia geometrii przestrzennej, fizyki i relacji między obiektami — dokładnie tego, czego potrzeba w zaawansowanych systemach wizji komputerowej.

Anthropic zawarło z AMD umowę wartą do 5 miliardów dolarów na dostawę 2 gigawatów GPU do trenowania modeli Claude. Pierwsza faza w 2027 roku.

Xi Jinping ogłosił powstanie WIKO z siedzibą w Szanghaju. Rosja, Brazylia i RPA wśród członków założycielskich nowej struktury zarządzania AI.

Innowacje w AI zależą już nie tylko od chipów i algorytmów, ale od zaawansowanych materiałów, które definiują możliwości kolejnych generacji technologii.