LAION opublikował Big Video Dataset — 10 mln godzin wideo z YouTube do badań nad multimodalną sztuczną inteligencją.

Źródło zdjęcia: The Decoder
LAION opublikowało Big Video Dataset (BVD) — jeden z największych otwartych zbiorów danych wideo przeznaczonych do badań nad sztuczną inteligencją. Zbiór powstał na bazie 1,3 miliarda adresów URL wideo znalezionych w CommonCrawl, z których zespół pobrał ostatecznie 80 milionów filmów o łącznym czasie trwania 10 milionów godzin.
Z tego materiału wyodrębniono 55 milionów klipów wraz z automatycznie wygenerowanymi opisami wideo i audio, a także 300 milionów pojedynczych kadrów (stopklatek). Większość filmów w zbiorze pochodzi z YouTube, a przeważająca część nagrań jest w języku angielskim.
BVD wyróżnia się przede wszystkim rozmiarem. Punktem wyjścia było 1,3 miliarda adresów URL do materiałów wideo zidentyfikowanych w CommonCrawl — publicznie dostępnym archiwum internetu wykorzystywanym często do trenowania dużych modeli językowych. Z tej olbrzymiej listy zespół LAION pobrał 80 milionów filmów, co dało łącznie 10 milionów godzin nagrań.
Na tej podstawie wygenerowano 55 milionów krótszych klipów, każdy opatrzony automatycznie wygenerowanym opisem tekstowym opisującym zarówno treść wizualną, jak i dźwiękową. Dodatkowo z materiału wyodrębniono 300 milionów pojedynczych zdjęć (stopklatek). Zgodnie z danymi opisanymi przez LAION, zdecydowana większość filmów pochodzi z serwisu YouTube, a dominującym językiem nagrań jest angielski.
Kluczowym elementem procesu przygotowania danych jest łączenie trzech modalności: obrazu, dźwięku i tekstu. Trenowanie modeli na tak połączonych danych pozwala im uczyć się, jaka treść wizualna odpowiada konkretnym opisom lub dźwiękom — czyli budować powiązania między tym, co widać na ekranie, co jest słyszalne, a jak to zjawisko opisano słownie.
Według opublikowanego przez LAION artykułu naukowego, modele trenowane na BVD radzą sobie lepiej niż porównywalne modele trenowane na popularnym zbiorze InternVid — różnica na standardowych benchmarkach przetwarzania wideo na tekst sięga do 2,1 punktu procentowego. To istotny wynik, ponieważ InternVid jest jednym z powszechnie wykorzystywanych zbiorów referencyjnych w badaniach nad rozumieniem wideo przez modele AI.
Sam mechanizm treningu, oparty na wzajemnym powiązaniu wideo, audio i tekstu, ma bezpośrednie znaczenie dla rozwoju modeli multimodalnych — takich, które mają analizować i generować treści wideo. Podobne wyzwania związane z rozumieniem i generowaniem materiału wideo pokazuje niedawna premiera Alibaba Wan3.0, która potwierdza, że jakość i skala zbiorów treningowych ma coraz większe znaczenie dla postępów w generatywnym AI wideo.
LAION podkreśla, że BVD jest udostępniony wyłącznie do celów badawczych, nie komercyjnych. Organizacja może w tym zakresie opierać się na wyroku Sądu Regionalnego w Hamburgu z 2024 roku, który dopuścił zbieranie treści chronionych prawem autorskim na potrzeby niekomercyjnych badań naukowych. Mimo tej podstawy prawnej LAION apeluje do użytkowników zbioru o respektowanie praw twórców oryginalnych materiałów.
Zarówno sam dataset, jak i kod służący do jego przygotowania są bezpłatnie dostępne dla społeczności naukowej. Taka otwartość wpisuje się w dotychczasową działalność LAION, znanej wcześniej z publikowania dużych zbiorów danych do trenowania modeli generujących obrazy.
Publikacja Big Video Dataset przez LAION stanowi jeden z największych jak dotąd otwartych zasobów wideo do badań nad AI, łączący dziesięć milionów godzin materiału z automatycznymi opisami wideo i audio. Choć dostępny wyłącznie do celów niekomercyjnych, zbiór może przyspieszyć rozwój modeli multimodalnych zdolnych rozumieć i generować treści wideo w oparciu o publicznie dostępny, choć w większości chroniony prawem autorskim, materiał internetowy.

Gubernator Teksasu Greg Abbott zamroził wydatki na kamery Flock po śledztwie ujawniającym wydanie ponad 30 mln dolarów na system AI.

Model Qwen2.5–14B (9 GB) odpowiedział na 67% pytań z 41 lat Jeopardy!, przewyższając ograniczenia legendarnego superkomputera Watson z 2011 roku.

Caterpillar wykorzystuje wiedzę z automatyzacji kopalni do wdrażania AI na placach budowy i inwestuje 100 mln dolarów w szkolenia pracowników.