Alibaba udostępniła Qwen-Image-2.1 – otwarty model do obrazów z 7 mld parametrów, który ma pokonywać zamknięte rozwiązania konkurencji.

Źródło zdjęcia: The Decoder
Alibaba opublikowała nowy otwarty model do generowania i edycji obrazów — Qwen-Image-2.1. Jak podaje the-decoder.com, zespół Qwen twierdzi, że komponent odpowiedzialny za generowanie obrazów, mający zaledwie 7 miliardów parametrów, pokonuje większość zamkniętych modeli konkurencji we własnym benchmarku firmy. Niezależne testy dopiero mają zweryfikować te deklaracje.
Kluczowym argumentem marketingowym Alibaby jest liczba parametrów. Komponent generujący obrazy w Qwen-Image-2.1 liczy zaledwie 7 miliardów parametrów — znacząco mniej niż wiele konkurencyjnych systemów. Mimo to, według twierdzeń zespołu Qwen, model wypada lepiej niż większość zamkniętych modeli w benchmarku przygotowanym przez samą firmę. Warto podkreślić, że są to na razie deklaracje producenta — niezależne, zewnętrzne testy porównawcze wciąż nie zostały opublikowane, więc rzeczywista pozycja modelu na tle konkurencji pozostaje do potwierdzenia.
Istotne jest też to, że model nie wymaga profesjonalnej infrastruktury obliczeniowej. Qwen-Image-2.1 działa na kartach graficznych klasy konsumenckiej, takich jak Nvidia RTX 3090 — co znacząco obniża barierę wejścia dla twórców, badaczy i mniejszych firm chcących eksperymentować z generowaniem obrazów bez inwestowania w serwerowe GPU.
Qwen-Image-2.1 wprowadza kilka funkcji istotnych z praktycznego punktu widzenia. Model natywnie generuje i edytuje obrazy z przezroczystością (format RGBA), co pozwala użytkownikom izolować poszczególne obiekty na warstwie lub zmieniać tekst bez wpływu na resztę kompozycji.
Model obsługuje jednocześnie do dziesięciu obrazów referencyjnych. W praktyce oznacza to, że można na ich podstawie tworzyć grupowe portrety, wirtualne przymierzanie ubrań czy projekty wnętrz. Zespół Qwen zaprezentował przykład, w którym grupowy portret został złożony z indywidualnych zdjęć każdej z osób. Lokalne edycje obrazu można kierować za pomocą okręgów, masek lub odręcznych zaznaczeń, co daje użytkownikom precyzyjną kontrolę nad tym, która część obrazu ma zostać zmodyfikowana.
Z technicznego punktu widzenia Qwen podaje, że zmiany w architekturze modelu oraz ponowne wykorzystanie pamięci podręcznej KV (KV cache reuse) przyspieszają proces wnioskowania — szczególnie w scenariuszach wykorzystujących wiele obrazów referencyjnych jednocześnie. To rozwiązanie ma znaczenie praktyczne przy bardziej złożonych, wielowarstwowych operacjach edycyjnych, gdzie liczba obrazów wejściowych zwykle znacząco zwiększa czas przetwarzania.
Qwen-Image-2.1 jest już dostępny do pobrania na platformach Hugging Face, GitHub oraz Model Scope. Zainteresowani mogą też wypróbować model za pomocą demo udostępnionego na Hugging Face bez konieczności instalacji.
Model jest jednak objęty licencją badawczą, która wyklucza wykorzystanie komercyjne. Firmy chcące korzystać z Qwen-Image-2.1 w celach biznesowych muszą złożyć wniosek do zespołu Qwen o odrębną licencję. To ograniczenie jest typowe dla wielu otwartych modeli udostępnianych przez duże firmy technologiczne — pozwala na swobodne testy i badania, jednocześnie zachowując kontrolę nad komercyjnym wykorzystaniem technologii.
Premiera Qwen-Image-2.1 wpisuje się w szerszą strategię Alibaby, która w ostatnim czasie regularnie udostępnia w otwartym modelu kolejne narzędzia AI — od modeli językowych do systemów multimodalnych, takich jak Qwen3.8-Omni-Flash, konkurujących cenowo z rozwiązaniami dużych graczy jak Google.
Qwen-Image-2.1 pokazuje, że relatywnie niewielkie modele mogą, przynajmniej na papierze, konkurować z większymi zamkniętymi systemami generowania obrazów — pod warunkiem potwierdzenia deklarowanych wyników w niezależnych testach.

NASA-IBM Lunar Foundation Model zamienia 17 lat danych orbiterów w open-source model AI do wykrywania lodu i kraterów na Księżycu.

Anthropic wprowadza Claude'a jako panel boczny w Dokumentach Google – redaguje tekst, tworzy tabele i działa równolegle z Gemini.

Microsoft i Hugging Face udostępnili ThinkingBox — benchmark oceniający agentów AI na podstawie stanu bazy danych, nie treści odpowiedzi.