Google udostępnił Gemini Omni 1.1 Flash – model wideo z dłuższymi scenami, kontrolą kamery i tańszym trybem 360p dla deweloperów.

Źródło zdjęcia: The Decoder
Google zaktualizował swój model generowania wideo Gemini Omni Flash do wersji 1.1. Nowa odsłona daje twórcom znacznie większą kontrolę nad procesem produkcji materiałów wideo tworzonych przez AI – od wydłużania scen, przez precyzyjne ustawianie ruchów kamery, po tańsze i szybsze prototypowanie. Model jest już dostępny dla deweloperów w Google AI Studio oraz przez dokumentację API, a Google DeepMind podkreśla, że Omni 1.1 jest gotowy do zastosowań produkcyjnych.
Największą zmianą w Omni 1.1 jest sposób, w jaki model podchodzi do wydłużania istniejących nagrań. Wcześniejsze wersje potrafiły odwoływać się jedynie do ostatniej sekundy klipu, co ograniczało spójność przy dłuższych sekwencjach. Teraz model analizuje do 10 sekund kontekstu z poprzedniej części wideo, dzięki czemu kontynuacje lepiej zachowują charakterystykę scenerii, postaci i tempo narracji. Zgodnie z opisem Google DeepMind, twórcy mogą rozwijać scenę w krokach po 10 sekund, aż do łącznej długości 40 sekund – co pozwala budować dłuższe historie lub rozwijać fabułę w nowych kierunkach.
Nowością jest też możliwość precyzyjnego ustawiania pierwszej i ostatniej klatki ujęcia. Omni 1.1 generuje wtedy płynne przejście między dwoma zdefiniowanymi kadrami, co – jak wskazuje Google DeepMind – doskonale sprawdza się przy skomplikowanych ruchach orbitalnych kamery, przejściach zoomowych czy bezszwowych klipach zapętlonych. Do tego deweloperzy mogą wgrać maksymalnie 3 sekundy zewnętrznego materiału jako referencję stylistyczną, aby przenieść do generowanej scenie konkretne postacie lub wzorce ruchu.
Google DeepMind ilustruje te możliwości przykładami promptów, w których kamera wykonuje kinowy „dolly-zoom” zamrażający twarz postaci w kadrze, mechaniczny szybki zoom na oczy bohatera albo pełny obrót 360 stopni wokół zastygłej w kadrze sceny – co pokazuje, że nowe funkcje mają służyć realnym, profesjonalnym zastosowaniom produkcyjnym, a nie tylko prostym efektom.
Poza kontrolą narracyjną, aktualizacja stawia na efektywność kosztową. Nowy tryb szkicowy w rozdzielczości 360p pozwala iterować szybciej – działa do 60% szybciej i kosztuje jedną trzecią ceny generowania w 720p. Dzięki temu deweloperzy mogą testować koncepcje i pomysły na kreatywne projekty zanim zdecydują się na finalne, kosztowniejsze renderowanie w wyższej jakości. Gotowe materiały można następnie skalować do 1080p lub 4K.
Cennik za sekundę materiału wygląda następująco: 0,03 dolara za 360p, 0,10 dolara za 720p, 0,15 dolara za 1080p oraz 0,30 dolara za 4K. Warto to porównać z konkurencyjnymi modelami Google z rodziny Veo. Veo 3.1 Lite jest tańszy w 720p (0,05 dolara) i 1080p (0,08 dolara), ale nie generuje materiału w rozdzielczości 4K ani 360p. Veo 3.1 Fast ma identyczną cenę 720p (0,10 dolara) i 4K (0,30 dolara) jak Omni 1.1, ale w 1080p kosztuje nieco więcej – 0,12 dolara. Poprzednia wersja Gemini Omni Flash oferowała jedynie rozdzielczość 720p za 0,10 dolara, bez opcji 360p, 1080p czy 4K.
Model Gemini Omni 1.1 Flash jest już dostępny przez Gemini API w Google AI Studio, a Google DeepMind wskazuje, że można go również wdrożyć poprzez Gemini Enterprise Agent Platform. W dokumentacji dla deweloperów Google przedstawia przykład kodu wykorzystującego bibliotekę google.genai, w którym istniejące interakcje wideo można kontynuować poprzez parametr previous_interaction_id, wskazując na wcześniej wygenerowany materiał, oraz definiować rozdzielczość wyjściową, na przykład 360p, dla szybszego i tańszego testowania.
Za aktualizację odpowiadają Anish Nangia i Alisa Fortin, menedżerowie produktu w Google DeepMind, którzy podkreślają, że nowe funkcje mają umożliwić budowanie bardziej zaawansowanych przepływów pracy z wideo generowanym przez AI – od narzędzi kreatywnych po oprogramowanie do edycji mediów – i przygotować model do realnych, produkcyjnych zastosowań, a nie jedynie eksperymentów.
Aktualizacja Gemini Omni 1.1 Flash to kolejny krok Google w wyścigu o rynek generatywnego wideo, gdzie tańsze prototypowanie i dłuższe, bardziej spójne sceny stają się kluczowymi przewagami konkurencyjnymi wobec innych modeli tekst-na-wideo dostępnych na rynku.

ESQ-Bench pokazuje, że GPT-4o i inne modele AI generujące SQL zwracają błędne wyniki mimo poprawnego wykonania zapytań w bazach Oracle.

Anthropic zawarł z Nscale sześcioletnią umowę na 45 mld dolarów, zabezpieczając moc obliczeniową przed jesiennym IPO firmy.

Prokurator generalny Alabamy wezwał OpenAI do przedstawienia dokumentów po tym, jak agent AI zhakował Hugging Face poza testowym środowiskiem.