Alibaba udostępnia Wan3.0 – model generujący wideo do 30 sekund z tekstu, obrazów, PDF i prezentacji, z cenami od 0,05 dolara za sekundę.

Źródło zdjęcia: The Decoder
Alibaba udostępniło w wersji beta swój nowy model generowania wideo Wan3.0, który potrafi tworzyć materiały wideo trwające do 30 sekund na podstawie tekstu, obrazów, a nawet całych dokumentów. Jak informuje the-decoder.com, nowy model przyjmuje na wejściu nie tylko klasyczne prompty tekstowe, ale też pliki PDF, strony internetowe i prezentacje PowerPoint, zamieniając statyczne dane w dynamiczne wideo.
To druga taka premiera Alibaby w krótkim czasie i wyraźny sygnał, że chińska firma stawia coraz mocniej na generatywne wideo jako kolejny front rywalizacji AI, obok modeli tekstowych i multimodalnych.
Największą zmianą względem poprzedniej wersji jest podwojenie maksymalnej długości generowanego materiału – do 30 sekund. Alibaba podkreśla też funkcję automatycznego doboru długości wideo do treści promptu oraz możliwość rozszerzania już wygenerowanych klipów za pomocą dedykowanego narzędzia.
Model wyróżnia się szeroką obsługą wielu typów danych naraz. Jeden prompt może łączyć do dziesięciu obrazów, pięciu materiałów wideo i pięciu klipów audio. Co ciekawe, wejściem mogą być też pełnoprawne dokumenty – strony internetowe, pliki PDF czy prezentacje PowerPoint – które model przekształca w dynamiczne wideo.
Generowane przez AI wideo od dawna cierpi na problem tzw. „visual drift”, czyli postępującej utraty spójności wizualnej między kolejnymi klatkami – zwłaszcza w przypadku twarzy i interfejsów użytkownika. Według Alibaby, Wan3.0 ma to ograniczać poprzez lepsze zachowywanie zgodności z materiałem referencyjnym – postaciami, przedmiotami i układem przestrzennym scen.
Wan3.0 można wypróbować przez witrynę wan.video, platformę Alibaba Cloud Model Studio, a także za pomocą API na Qwen Cloud. Model oferowany jest w dwóch wariantach: Standard, obecnie objęty 30-procentową zniżką, oraz szybszy, ale droższy Prime.
Ceny są rozliczane za sekundę materiału i zależą od rozdzielczości. Wideo w 480p kosztuje 0,05 dolara za sekundę w wariancie Standard i 0,068 dolara w Prime, co przy pełnym 30-sekundowym klipie daje odpowiednio 1,50 dolara i 2,04 dolara. Rozdzielczość 720p wyceniono na 0,10 dolara (Standard) i 0,14 dolara (Prime) za sekundę – czyli 3,00 i 4,20 dolara za pełny klip. Najwyższa oferowana jakość, 1080p, kosztuje 0,20 dolara za sekundę w Standard i 0,28 dolara w Prime, co przy 30 sekundach oznacza 6,00 dolara lub 8,40 dolara.
Alibaba prezentuje Wan3.0 jako narzędzie o bardzo szerokim zastosowaniu. Firma wskazuje na przyspieszenie produkcji filmowej, generowanie krótkich seriali dramatycznych oraz materiałów pod media społecznościowe dla twórców treści. Przedsiębiorstwa mogłyby wykorzystywać model do przekształcania tekstu i obrazów w materiały marketingowe i szkoleniowe, a firmy technologiczne – do tworzenia realistycznych symulacji wideo służących szkoleniu pojazdów autonomicznych i systemów robotycznych.
Premiera Wan3.0 wpisuje się w szerszą strategię Alibaby, która intensywnie zwiększa wydatki na sztuczną inteligencję. Firma ogłosiła niedawno największą emisję akcji spółki notowanej w Hongkongu, mającą finansować dalszy rozwój AI, a w ostatnim raporcie kwartalnym poinformowała o 75-procentowym spadku zysku rok do roku – co tłumaczy wyraźnie wyższymi inwestycjami w sztuczną inteligencję. W ostatnich miesiącach o intensywnym rozwoju infrastruktury AI w Chinach pisaliśmy też w kontekście chińskiego boomu na AI w Mongolii Wewnętrznej, gdzie powstają centra danych zasilające ambicje takich firm jak Alibaba.
Wan3.0 to kolejny krok w wyścigu generatywnego wideo, w którym chińskie firmy, w tym Alibaba z rodziną modeli Qwen, chcą konkurować z zachodnimi rozwiązaniami oferując dłuższe klipy, szerszą obsługę formatów wejściowych i konkurencyjne ceny.

Nowe badanie pokazuje, że skille pomagają agentom AI głównie przez procedurę działania, nie wiedzę, a duże biblioteki utrudniają ich trafne wyszukanie.

Anthropic i inne firmy AI kupują i niszczą miliony książek po zeskanowaniu do treningu modeli. Anna's Archive apeluje o pomoc wolontariuszy.

Wyrok w sprawie Anthropicu i inne procesy sądowe pokazują, że legalność trenowania AI na książkach zależy od fair use i konkurencji rynkowej.