ZGCM-1 to w pełni otwarty model 7B, który w matematyce i agentowym wyszukiwaniu dorównuje modelom dużo większym, jak Qwen3–235B-A22B.

Źródło zdjęcia: arXiv.org
ZGCM-1 to nowy, w pełni otwarty model podstawowy o 7 miliardach parametrów, wytrenowany od podstaw z myślą o ekstremalnej efektywności danych, systemu i algorytmów. Zespół 22 autorów opisuje w pracy opublikowanej 11 września 2026 roku podejście, które pozwala kompaktowemu modelowi konkurować z systemami wielokrotnie większymi w zadaniach matematycznych i agentowym wyszukiwaniu informacji.
Fundamentem projektu jest teza, że mały model nie jest w stanie pasywnie „zapamiętać” całego otwartego internetu tak jak robią to modele liczące setki miliardów parametrów. Zamiast tego może przełamać ograniczenia swojej pojemności parametrycznej, łącząc świadome „myślenie” wewnętrzne z aktywnym korzystaniem z zewnętrznych narzędzi.
Kluczowym elementem projektu ZGCM-1 jest współprojektowanie architektury i systemu treningowego (Architecture & System Co-design). Model łączy przeplatane, bramkowane okna przesuwne uwagi z pełną uwagą, co pozwala efektywnie obsługiwać bardzo długi kontekst bez proporcjonalnego wzrostu kosztów obliczeniowych. Do stabilizacji treningu zastosowano optymalizator FP8 Muon, który – jak podają autorzy – umożliwia trening w niskiej precyzji bez utraty stabilności numerycznej.
Drugim filarem jest Progressive Curriculum & MDP Mid-Training, czyli progresywny program nauczania powiązany z fazą pośrednią treningu. Kontekst modelu jest skalowany etapowo – od 16 tys., przez 64 tys., do 256 tys. tokenów. Równolegle zespół przeformułował ślady interakcji modelu z otoczeniem (interaction traces) w procesy decyzyjne Markowa (MDP), co pozwala traktować kolejne kroki „rozumowania” i korzystania z narzędzi jako sekwencję decyzji, a nie jedynie generowanie tekstu.
Zdaniem autorów to właśnie ta konstrukcja treningowa – a nie sama skala modelu – tłumaczy jego konkurencyjność wobec dużo większych systemów. W testach dotyczących trudnego rozumowania matematycznego oraz agentowego wyszukiwania ZGCM-1 pozostaje konkurencyjny wobec modeli frontier, w tym Qwen3–235B-A22B oraz GLM-5.1 – obu znacznie większych pod względem liczby parametrów. Na benchmarkach ogólnych model utrzymuje się na poziomie konkurencyjnym w ramach całej rodziny modeli klasy 7B.
Poza samą architekturą, praca opisuje zmianę w organizacji procesu badawczo-rozwojowego. Zespół stworzył tzw. AI-native R&D workflow – proces, w którym roje autonomicznych agentów (agent swarms) samodzielnie zarządzają operacjami klastra obliczeniowego, kuracją danych oraz szybką diagnostyczną ewaluacją modelu na kolejnych etapach treningu. To podejście ma bezpośredni wpływ na skalę korzyści z efektywności: autorzy raportują około 4,2-krotne przyspieszenie w relacji czasu do funkcji straty (time-to-loss) na etapie treningu wstępnego z kontekstem 16K, w porównaniu do standardowych podejść.
Znaczenie tego wyniku wykracza poza sam ZGCM-1 – sugeruje, że część przewagi dużych modeli komercyjnych może być nadrabiana nie przez zwiększanie liczby parametrów, lecz przez lepsze zaprojektowanie systemu treningowego, danych i procesu R&D. To wpisuje się w szerszy trend w branży, w którym mniejsze, otwarte modele – takie jak wcześniej opisywany przez AiFeed Occamy-1.0, otwarty model 35B do pracy z agentami – zaczynają rywalizować z zamkniętymi systemami frontier w konkretnych, wyspecjalizowanych zadaniach, zamiast dążyć do ogólnej dominacji na wszystkich frontach.
Model rozwija też zdolności typowe dla agentów wyszukujących informacje w sieci, co łączy go tematycznie z innymi otwartymi rozwiązaniami tego typu, jak opisywane wcześniej Iris-mini i Iris-pro – open-source agenty wyszukiwania.
W trakcie całego cyklu rozwoju modelu – od pre-treningu przez etap pośredni do post-treningu – zespół wyprowadził osiem konkretnych, empirycznych wniosków. Dotyczą one skalowania architektury, przycinania jakości danych w fazie fine-tuningu nadzorowanego (SFT quality pruning), generalizacji na długi kontekst oraz dynamiki współtreningu agentowego (agentic co-training dynamics). Autorzy nie ujawniają w abstrakcie szczegółowej treści każdego z tych wniosków, ale wskazują, że mają one bezpośrednie znaczenie praktyczne dla osób budujących podobne modele.
Najważniejszym elementem publikacji dla społeczności badawczej jest zakres otwartości projektu. Zespół udostępnił wagi modelu z etapów pre-treningu, treningu pośredniego i post-treningu, checkpointy pośrednie, kod treningowy, dane i receptury danych dla każdego etapu, a także logi z platformy Weights & Biases. Taki poziom transparentności jest rzadkością nawet wśród projektów określających się jako „open-source” i pozwala na pełną reprodukcję oraz analizę procesu, który doprowadził do finalnych wyników modelu.
ZGCM-1 pokazuje, że przy odpowiednio zaprojektowanej architekturze, systemie treningowym i procesie R&D wspieranym przez autonomiczne agenty, kompaktowy model 7B może konkurować z systemami rzędów wielkości większymi – przynajmniej w wyspecjalizowanych zadaniach matematycznych i agentowego wyszukiwania.

David Robinson, autor raportów bezpieczeństwa OpenAI, odchodzi z firmy i w eseju dla The Atlantic ostrzega o zepsutej kulturze branży AI.

OpenAI umieściło na GitHubie 372 wyniki matematyczne stworzone przez AI, dzieląc świat matematyki wobec tempa i formy ich publikacji.

Profesor MIT Cathy Wu wykorzystuje uczenie ze wzmocnieniem, by projektować lepsze systemy transportowe, po latach porażek osiągając 30-krotny wzrost efektywności treningu.