Test Simona Willisona pokazuje, że model Qwen 3.8 27B od Alibaby domyślnie nadmiernie rozumuje, wydłużając proste zadania z minut do kwadransów.

Źródło zdjęcia: Simon Willison’s Weblog
Simon Willison przetestował nowy model Qwen 3.8 27B — wydaną w piątek, otwartą (licencja Apache 2), 27-miliardową odmianę modelu Alibaby z laboratorium Qwen, obsługującą też obraz. To model, na który Willison czekał od dawna: 27B to rozmiar idealny do uruchomienia na dobrze wyposażonym laptopie, a poprzednik, Qwen 3.6 27B, robił bardzo dobre wrażenie. Problem w tym, że Qwen 3.8 27B domyślnie ustawia najwyższy poziom „rozumowania”, co prowadzi do absurdalnego przegapiania prostych zadań na rzecz wielominutowego, nadmiarowego myślenia.
Według własnych, deklarowanych przez Qwen benchmarków, nowy model przewyższa nie tylko swojego poprzednika Qwen 3.6 27B, ale też model zamknięty Qwen 3.7-Plus, który jeszcze w maju tego roku był jednym z najmocniejszych modeli Qwen niezależnie od rozmiaru. Willison zaznacza, że interesujące będzie porównanie tych wyników z niezależnymi testami.
Do prób użył dwóch maszyn: MacBooka Pro z chipem M5 Max i 128 GB pamięci oraz stacji NVIDIA DGX Spark. Na obu uruchamiał model w LM Studio, korzystając z kwantyzowanej wersji Q4_K_M o rozmiarze 17 GB, a na DGX Spark testował też llama-server bezpośrednio.
Pierwszym problemem, na który natrafił, był domyślny limit kontekstu LM Studio wynoszący 8192 tokeny — Qwen zdążał wykorzystać go w całości, „myśląc” nawet nad najbardziej trywialnymi zadaniami. Dopiero po zwiększeniu kontekstu do maksymalnych 262 144 tokenów problem zniknął.
Klasyczny test Willisona — narysowanie SVG pelikana jadącego na rowerze — dał, jak sam pisze, „najlepszy jak dotąd wynik SVG wygenerowany przez model działający lokalnie”. Rama roweru miała właściwy kształt, peliken miał nogi po obu stronach roweru (co jest rzadkością w takich testach), wyraźny worek gularny, a skrzydła sięgały kierownicy. Linie ruchu były prawidłowo umieszczone za pojazdem, a tło — słońce, obłoki, wzgórze, kwiaty i trawa — zostało zaprojektowane z gustem. Problem? Wygenerowanie tego zajęło 21 minut, wykorzystując ponad 22 tysiące tokenów rozumowania. „Czy było warto czekać 21 minut? Absolutnie nie” — pisze Willison.
Dla porównania, ten sam prompt puszczony przez znacznie większy model Qwen 3.8 2.4T-A95B (wydany tydzień wcześniej) za pomocą OpenRouter dał efektowną, animowaną wersję SVG.
Jeszcze wyraźniej problem nadmiernego rozumowania widać w prostszym teście — prośbie o narysowanie prostego SVG koła. Ślad rozumowania modelu, uruchomionego na domyślnym ustawieniu xhigh, zaczynał się od rozważań w stylu: „Użytkownik prosi o narysowanie koła w SVG. Proste zadanie — ale chcę, żeby to było starannie zaprojektowane. Zrobię coś więcej niż prosty tag <circle> — samodzielny plik SVG z charakterem, może geometryczne 'studium koła', z subtelną animacją, warstwowymi pierścieniami i wyraźną paletą kolorów”. Model rozważał wręcz estetykę w stylu Bauhaus, kontrasty kolorystyczne i animację zgodną z preferencjami dostępności. Kilka minut później wygenerował rzeczywiście piękne, animowane koło — które jednak zupełnie nie było tym, o co prosił użytkownik.
Poza generowaniem grafik SVG, Qwen 3.8 27B okazał się solidny w zadaniach wizyjnych. Willison poprosił model o wyznaczenie bounding boxów wokół pelikanów widocznych na zdjęciu, w skali 0–1000 dla każdego wymiaru. Model zwrócił poprawny wynik w formacie JSON, precyzyjnie oznaczając dwa ptaki widoczne na fotografii — wynik, który autor określił jako „bardzo dobre dopasowanie”.
Wizualizację tych bounding boxów Willison wygenerował za pomocą narzędzia, które sam Qwen 3.8 27B zbudował dla niego lokalnie, offline, na podstawie jednego promptu. Autor zapomniał ponownie ograniczyć poziom rozumowania modelu, co skutkowało — jak sam żartobliwie zauważa — „masywnym przeinżynierowaniem” kodu, choć finalnie narzędzie zadziałało poprawnie i pozwoliło wygenerować pełny interfejs graficzny z jednego zapytania. Tego typu eksperymenty z budową narzędzi programistycznych przez modele otwarte przypominają testy prowadzone wokół innych konkurencyjnych projektów, takich jak GLM-5.3 od Zhipu AI, prezentowany jako najsilniejszy otwarty model do kodowania.
Podsumowując, Qwen 3.8 27B pod względem jakości generowanego kodu, grafik i analizy obrazu robi bardzo dobre wrażenie — ale by w pełni wykorzystać jego potencjał na sprzęcie konsumenckim, użytkownicy powinni od razu obniżyć domyślny, ekstremalnie wysoki poziom rozumowania, który w praktyce zamienia proste zadania w wielominutowe, nadmiernie skomplikowane operacje.

Klasyfikatory Anthropic blokujące pytania o broń biologiczną były wyłączone przez rok, obejmując 133 mln rozmów kontrahentów.

Anthropic ujawnia, jak działa system znaków wodnych oparty na SynthID-Text, spełniający wymogi AI Act dla tekstu Claude.

Amazon kupuje rzadkie książki, obcina im grzbiety i skanuje strony do treningu modeli Nova – ujawniło śledztwo 404 Media z użyciem lokalizatora.