Qwen3.8-Omni-Flash od Alibaba dorównuje Gemini 3.8 Flash w zadaniach audio-wideo, kosztując wielokrotnie mniej za tokeny API.

Źródło zdjęcia: The Decoder
Alibaba Qwen zaprezentowało nowy model multimodalny o nazwie Qwen3.8-Omni-Flash, który – jak twierdzi producent – dorównuje Gemini 3.8 Flash od Google w zadaniach audio-wideo, będąc przy tym znacznie tańszym w użyciu. To pierwszy model Qwen zbudowany specjalnie pod agentów AI, zdolny do samodzielnej analizy dźwięku i obrazu, wyciągania wniosków oraz korzystania z narzędzi do edycji vlogów, tłumaczenia krótkich filmów czy streszczania pełnych produkcji filmowych.
Model wyposażono w okno kontekstowe sięgające jednego miliona tokenów, co pozwala mu przetwarzać długie materiały wideo i audio bez utraty kontekstu. Qwen podaje, że w benchmarkach dotyczących zadań audio-wideo nowy model zbliża się do wyników Gemini 3.8 Flash – przy zauważalnie niższych kosztach operacyjnych.
Największym argumentem sprzedażowym Qwen3.8-Omni-Flash wydaje się być cena. Firma szacuje, że przetwarzanie godziny nagrania audio kosztuje mniej niż 1 cent, a analiza wideo w rozdzielczości 720p z dźwiękiem, przy jednej klatce na sekundę, to koszt rzędu 0,20 dolara – bez uwzględnienia kosztów wygenerowanej odpowiedzi.
Zestawiając te liczby z ofertą Google, różnica jest wyraźna. Gemini 3.8 Flash w cenie wprowadzeniowej pobiera 0,75 dolara za milion tokenów wejściowych oraz 3,75 dolara za milion tokenów wyjściowych. Google zapowiedziało już, że stawki te ulegną podwojeniu od 1 stycznia 2027 roku, co jeszcze bardziej powiększy przewagę cenową modelu Qwen w miarę zbliżania się tego terminu.
Dla firm i deweloperów budujących aplikacje oparte na analizie treści audio-wideo – jak automatyczne napisy, streszczenia nagrań czy monitoring materiałów wideo w dużej skali – różnica w kosztach przy dużej liczbie zapytań może okazać się decydująca przy wyborze dostawcy.
Qwen3.8-Omni-Flash nie jest samodzielnym modelem odpowiadającym na zapytania – to element szerszego ekosystemu narzędzi dla agentów AI. Otwartoźródłowe wtyczki Qwen-MM-Plugins dodają funkcje takie jak edycja wideo, rozpoznawanie mówiących, tworzenie notatek z materiałów wideo w formacie PDF oraz gotowe, powtarzalne workflowy. Wtyczki te można zintegrować z popularnymi środowiskami agentowymi, w tym z Claude Code, Gemini CLI oraz Qwen Code – co wskazuje na ambicję Qwen, by model funkcjonował jako uniwersalny komponent w różnych stackach narzędzi programistycznych, niezależnie od dostawcy.
Dodatkowo Qwen udostępnia Qwen-Live Harness – rozwiązanie umożliwiające interakcję z modelem w czasie rzeczywistym za pomocą kamery i mikrofonu. To otwiera drogę do zastosowań takich jak asystenci działający na żywo podczas nagrań, transmisji czy spotkań, gdzie model musi analizować obraz i dźwięk na bieżąco, a nie w ramach wcześniej przygotowanego pliku.
Premiera Qwen3.8-Omni-Flash wpisuje się w trwającą rywalizację między chińskimi i amerykańskimi dostawcami modeli AI w segmencie multimodalnym. Google z Gemini Flash od dawna pozycjonuje się jako lider w przetwarzaniu audio, wideo i tekstu w jednym modelu, oferując go jako opłacalną alternatywę dla droższych, flagowych wersji. Qwen, stawiając bezpośrednio na porównanie z Gemini Flash i publikując konkretne dane cenowe, sygnalizuje chęć rywalizacji nie tylko wydajnością, ale przede wszystkim kosztem dostępu do porównywalnych możliwości.
Dla firm rozwijających agentów AI wykorzystujących dane multimodalne – od automatyzacji produkcji treści wideo do systemów monitorujących nagrania w czasie rzeczywistym – taka konkurencja cenowa może w praktyce oznaczać istotne obniżenie kosztów wdrożeń na dużą skalę, zwłaszcza w projektach przetwarzających duże wolumeny materiałów audio-wideo.
Qwen3.8-Omni-Flash pokazuje, że Alibaba stawia na agresywną strategię cenową w segmencie modeli multimodalnych, jednocześnie deklarując zbliżoną skuteczność do Gemini 3.8 Flash w zadaniach audio-wideo. Dostępność modelu przez Qwen Studio, Qwen Cloud i API, wraz z otwartymi wtyczkami dla agentów, sugeruje, że firma stawia na budowanie całego ekosystemu narzędzi wokół tego modelu, a nie jedynie na sam produkt.

Sondaż Quinnipiac pokazuje, że większość Amerykanów chce spowolnienia rozwoju AI i nie ufa liderom branży technologicznej.

Framework REACT redukuje błąd rekonstrukcji pH oceanu o 14,7% i błąd chemiczny o 24% dzięki modelowaniu zgodnemu z cyklem węgla.

Trump powołał Super Intelligence Force z Jayem Claytonem na czele, by koordynować politykę USA wobec sztucznej inteligencji i uniknąć nadmiernej regulacji.