Zhipu AI publikuje GLM-5.3 – model kodujący z otwartymi wagami, który wykrył ponad 2400 podatności bezpieczeństwa w projektach open source.

Źródło zdjęcia: The Decoder
Zhipu AI opublikowało GLM-5.3 — nowy model, który chińska firma nazywa najsilniejszym obecnie dostępnym modelem programistycznym o otwartych wagach. Model bazuje na tej samej architekturze co poprzednik, GLM-5.2, a wszystkie zauważalne postępy pochodzą wyłącznie z rozszerzonego post-treningu, bez zmian w samej podstawie modelu. Według Zhipu największe skoki wydajności widać w zadaniach agentowych, czyli tam, gdzie model musi samodzielnie planować i wykonywać wieloetapowe działania.
Premiera GLM-5.3 wpisuje się w szerszy trend: chińskie i amerykańskie firmy coraz intensywniej konkurują o pozycję lidera w segmencie modeli kodujących, a otwarte wagi stają się jednym z głównych pól tej rywalizacji — podobny wyścig obserwowaliśmy niedawno przy premierze Deepseek V4 Pro, który również stawiał na agentowość i otwartość kodu.
Do tej pory obszarem, w którym topowe chińskie modele — takie jak Kimi czy Qwen — zauważalnie odstawały od amerykańskich modeli frontier, było cyberbezpieczeństwo. GLM-5.3 ma to zmienić. Zhipu wytrenowało model na danych i środowiskach zaprojektowanych specjalnie do wykrywania podatności w oprogramowaniu. Według Z.ai model „zaczął rozumować w wielu etapach eksploitacji, tworząc spójne plany kompletnych łańcuchów ataku”.
Efekty tej pracy są konkretne i policzalne: współpraca z zespołami bezpieczeństwa w Chinach zaowocowała wykryciem 2 436 podatności w 269 projektach, w tym w kodzie liczącym sobie nawet 40 lat. Wszystkie znalezione błędy zostały udokumentowane w publicznym rejestrze, co pozwala na weryfikację zgłoszonych ustaleń przez zewnętrzne zespoły.
GLM-5.3 jest już dostępny w ramach GLM Coding Plan i działa z popularnymi agentami kodującymi, w tym z ZCode, Claude Code oraz OpenCode. Zhipu zapowiada, że pełne wagi modelu trafią do otwartego dostępu w ciągu dwóch tygodni od premiery — po zakończeniu przeglądów bezpieczeństwa, co sugeruje ostrożność firmy przy publikacji modelu ze znaczącymi zdolnościami w zakresie wykrywania podatności.
Ten model rozwojowy — najpierw dostęp komercyjny, później otwarcie wag po dodatkowej weryfikacji — powtarza się w branży open-source AI i pojawiał się już wcześniej przy publikacjach modeli takich jak MAI Code 1.1 Flash od Microsoftu, który mierzył się z podobnymi wyzwaniami cenowymi i wydajnościowymi wobec konkurencji z Chin.
Rywalizacja o tytuł najsilniejszego otwartego modelu programistycznego nie ogranicza się do dużych firm. Na początku 2026 roku Nous Research, startup wspierany przez fundusz kryptowalutowy Paradigm, opublikował model NousCoder-14B, wytrenowany w cztery dni przy użyciu 48 procesorów graficznych Nvidia B200. Model, oparty na bazowym Qwen3–14B od Alibaby, osiągnął 67,87 proc. dokładności w benchmarku LiveCodeBench v6 — o 7,08 punktu procentowego więcej niż model bazowy.
Premiera NousCoder-14B nastąpiła w momencie, gdy Claude Code od Anthropic dominował dyskusje w sieciach społecznościowych dzięki entuzjastycznym relacjom deweloperów. Jaana Dogan, inżynierka Google odpowiedzialna za Gemini API, opisała w wirusowym poście na X, jak Claude Code odtworzył w godzinę system, który jej zespół budował rok. Nous Research postawił na inne podejście: zamiast efektownych demonstracji, firma opublikowała nie tylko wagi modelu, ale całe środowisko uczenia ze wzmocnieniem, zestaw benchmarków i infrastrukturę treningową (framework Atropos), umożliwiając innym badaczom pełną reprodukcję pracy.
Twórca modelu, Joe Li, badacz w Nous Research i byłem uczestnik zawodów programistycznych, porównał postęp modelu do swojej własnej drogi na platformie Codeforces — awans z poziomu ok. 1600–1750 do 2100–2200 punktów rankingowych zajął mu blisko dwa lata ćwiczeń między 14. a 16. rokiem życia, a model dokonał podobnego skoku w cztery dni. Zaznaczył jednak istotne zastrzeżenie: on sam rozwiązał ok. 1000 zadań w tym czasie, model potrzebował aż 24 000 — ludzie wciąż uczą się znacznie efektywniej z mniejszej liczby przykładów.
Li zwrócił też uwagę na zbliżający się problem niedoboru danych: liczba dostępnych w internecie weryfikowalnych zadań konkurencyjnego programowania jest tego samego rzędu wielkości co zbiór treningowy użyty do NousCoder-14B, co oznacza, że w tej dziedzinie zbliżamy się do granic dostępnych danych wysokiej jakości. Jako remedium wskazał generowanie danych syntetycznych oraz trenowanie modeli, które same tworzą rozwiązywalne zadania — na wzór technik samouczenia się (self-play) znanych z systemów grających w gry.
Dla polskich firm i deweloperów rozwój otwartych modeli kodujących, takich jak GLM-5.3, oznacza rosnącą liczbę alternatyw wobec komercyjnych rozwiązań amerykańskich, dostępnych do samodzielnego hostowania i integracji z lokalną infrastrukturą. Otwarcie wag modelu — planowane przez Zhipu za dwa tygodnie po premierze — może zainteresować zespoły R&D szukające narzędzi do audytów bezpieczeństwa kodu bez konieczności korzystania z zagranicznych API. Warto jednak pamiętać, że modele wykorzystywane do wykrywania podatności w systemach informatycznych mogą podlegać przepisom dotyczącym cyberbezpieczeństwa i ochrony infrastruktury krytycznej obowiązującym w UE, a rozwój takich narzędzi warto śledzić w kontekście unijnego AI Act, który różnicuje wymogi w zależności od zastosowania modelu.
Premiera GLM-5.3 potwierdza, że wyścig o dominację w segmencie otwartych modeli programistycznych trwa na wielu frontach naraz — od możliwości agentowych, przez cyberbezpieczeństwo, po samą filozofię otwartości kodu i danych treningowych.

Firma Joi AI zapłaciła 10 osobom po 2000 dolarów za miesięczne badanie masturbacji z AI, ale naukowcy krytykują jego metodologię i wnioski.

Replikacja badania nad α-FLOPs pokazuje, że liczba operacji FLOP-ów słabo szacuje realny czas wykonania na nowszym sprzęcie AI.

Microsoft wycofuje funkcję COPILOT() z Excela 14 września 2026, stawiając na boczny panel Copilot jako jedyny interfejs AI w arkuszach.