Nowy model Alibaba autonomicznie budował oprogramowanie przez 16 dni i zwiększył kapitał w symulacji e-commerce czterokrotnie, wyprzedzając ludzkie zespoły.

Źródło zdjęcia: The Decoder
Alibaba zaprezentowała nowy model językowy Qwen3.8-Max z 2,4 biliona parametrów, który został zaprojektowany do samodzielnego wykonywania złożonych zadań przez wiele dni. Model wykazał imponujące możliwości w testach autonomicznego kodowania, projektowania chipów i prowadzenia symulowanego biznesu e-commerce. Szczegóły tego przełomowego rozwiązania dostępne są w oryginalnym artykule.
Qwen3.8-Max to najnowszy flagowy model od zespołu Alibaba, który ma 2,4 biliona całkowitych parametrów, z czego 95 miliardów jest aktywnych podczas każdego zapytania. Model bazuje na architekturze Qwen3.5 i koncentruje się na wykonywaniu złożonych zadań przez dłuższe okresy, a nie tylko odpowiadaniu na pojedyncze polecenia.
Alibaba zaprezentowała trzy przypadki testowe, w których Qwen3.8-Max pracował całkowicie samodzielnie. W pierwszym modelu przez 16 dni budował narzędzie wiersza poleceń oh-my-cli. Model przyjmował żądania użytkowników, przekształcał je w zgłoszenia GitHub, przypisywał je sobie, pisał kod, uruchamiał testy i iteracyjnie poprawiał rezultaty. Do 30 lipca 2026 roku wykonał 265 commitów, 127 pull requestów i 151 zgłoszeń bez żadnej interwencji człowieka.
Drugi test polegał na odtworzeniu wyników z pracy badawczej „Unified Data Selection for LLM Reasoning” bez dostępu do kodu źródłowego. Przez około 5 dni i 125 godzin obliczeń model napisał 7,600 linii kodu i uruchomił 33 zadania treningowe GPU. Najpierw odtworzył wszystkie sześć głównych wyników pracy, a następnie przetestował 18 własnych pomysłów w czterech rundach, pokonując metodę z pracy o 2,7 punktu na benchmarku AIME24.
Trzeci przypadek dotyczył WWW2025 Multimodal Dialogue Intent Recognition Challenge na platformie Tianchi, gdzie konkurowało 526 ludzkich zespołów. W ciągu 24 godzin model dostroił kilka chińskich modeli językowych wraz z Qwen2.5-VL-7B i połączył je w system głosowania. Dokładność wzrosła z 0,60 do 0,853, wyprzedzając 458 z 526 ludzkich zespołów.
Model został również przetestowany w zadaniach wymagających planowania na setki rund interakcji. W projekcie kryptograficznego bloku budulcowego Qwen3.8-Max zaczął od działającego, ale rozdętego projektu używającego 8,298 bramek i zredukował go do 678 bramek przez około 500 iteracji. Po automatycznym procesie układania z narzędziem open-source OpenROAD powierzchnia fizyczna chipa zmniejszyła się z 106x106 do 46x46 mikrometrów — redukcja o 81 procent.
Drugi przypadek to E-Commerce-Bench — symulacja całego roku podatkowego w handlu internetowym opartym na zanonimizowanych danych z Taobao i Tmall. Model rozpoczął ze 100,000 yuanów kapitału i musiał prowadzić równolegle wiele sklepów internetowych przez cały rok. Oznaczało to kupowanie produktów, negocjowanie z dostawcami w naturalnym języku, dostosowywanie cen, zarządzanie zwrotami i radzenie sobie z kryzysami jak tajfuny czy zakłócenia łańcucha dostaw.
Wśród dostawców ukrytych było 152 oszustów, których model musiał wykryć. Qwen3.8-Max zakończył z saldem 416,252 yuanów, poczwórnie zwiększając swój kapitał początkowy. To 38 procent więcej niż runner-up GLM 5.2 i ponad 2,5 raza więcej niż jego poprzednik Qwen3.7-Max.
Qwen3.8-Max reprezentuje znaczący krok w kierunku autonomicznych systemów AI zdolnych do długoterminowego planowania i wykonywania złożonych zadań. Publiczne udostępnienie wag modelu w przyszłym tygodniu pozwoli badaczom i deweloperom na dalsze eksplorowanie jego możliwości.

Analiza wskazuje, że 73–75% przychodów z AI u Amazon, Google i Microsoft pochodzi od dwóch nierentownych firm: OpenAI i Anthropic finansowanych przez tych samych gigantów.
OpenAI publikuje szczegóły odpowiedzi na pozew Apple, ujawniając błędy w komunikacji i korespondencję między byłymi pracownikami firm.

Reddit stał się najczęściej cytowaną domeną przez chatboty AI, co przyciąga marketerów stosujących wyrafinowane techniki ukrytej promocji produktów.