Occamy-1.0 to otwarty model 35B na bazie Qwen3.6, który łączy niski koszt z wysoką skutecznością w zadaniach agentowych typu co-work.

Źródło zdjęcia: arXiv.org
Nowa publikacja naukowa opisuje Occamy-1.0 — otwarty model o 35 miliardach parametrów, zaprojektowany specjalnie do pracy w trybie „co-work”, czyli wykonywania złożonych, wieloetapowych zadań łączących wyszukiwanie informacji, korzystanie z narzędzi, programowanie i operacje na plikach. Model powstał na bazie dopracowanego checkpointu Qwen3.6–35B-A3B i, jak twierdzą autorzy, znajduje się na tzw. niskokosztowym „kolanie” krzywej Pareto opłacalności — czyli w punkcie, w którym stosunek jakości do ceny jest szczególnie korzystny.
Za projektem stoi zespół liczący 43 autorów, w tym Wenhui Chen, Shiwen Cheng, Hao Dong i kilkudziesięciu innych badaczy. Praca została zgłoszona na arXiv 4 września 2026 roku.
Autorzy definiują agentów co-work jako systemy realizujące złożone przepływy pracy, które łączą wiele wywołań modelu — od zbierania informacji, przez korzystanie z narzędzi, po pisanie kodu i manipulację plikami. Kluczowy problem, który podnoszą badacze, brzmi: skoro koszt i czas odpowiedzi (latencja) kumulują się na przestrzeni całego epizodu działania agenta, to praktyczna wartość modelu zależy nie tylko od jego szczytowych możliwości, lecz od tego, jak efektywnie te możliwości są dostarczane.
To istotne rozróżnienie względem podejścia „większy model = lepszy wynik”. Wiele codziennych kroków pracy — jak zauważają autorzy — koncentruje się na śledzeniu stanu zadania, koordynacji działań, odzyskiwaniu się po błędach i doprowadzaniu zadania do końca, a nie na rozumowaniu na poziomie modeli frontierowych. Innymi słowy: agent nie musi być najbardziej „inteligentny” w każdym pojedynczym kroku, żeby być użyteczny — musi być konsekwentny, odporny na błędy i przewidywalny kosztowo w długim horyzoncie działania.
Zespół stworzył dane i środowiska określane jako „execution-grounded” — czyli takie, które odzwierciedlają realne wykonywanie zadań, a nie tylko syntetyczne przykłady. Na tej podstawie zapisano „replayable long-horizon trajectories” — odtwarzalne trajektorie długoterminowych działań agentów, przechwycone w wielu różnych harnessach (środowiskach, w których agent operuje).
Kluczowym elementem procesu było zastosowanie „staged post-training” — wieloetapowego dotrenowywania modelu, którego celem było rozwinięcie i skonsolidowanie komplementarnych umiejętności wykonawczych. Podejście to różni się od jednorazowego fine-tuningu — pozwala budować kompetencje modelu warstwowo, co ma bezpośrednie przełożenie na jego zdolność do radzenia sobie z długimi, wieloetapowymi zadaniami wymagającymi koordynacji i odzyskiwania się po niepowodzeniach.
Według autorów, w testach na szerokiej gamie benchmarków co-work Occamy-1.0 konsekwentnie należy do najsilniejszych modeli porównywalnej wielkości, a w kilku zadaniach pozostaje konkurencyjny wobec znacznie większych systemów frontierowych. Pod przyjętym w pracy protokołem ewaluacji i wyceny, zagregowana wydajność modelu na czterech reprezentatywnych benchmarkach umieszcza go na niskokosztowym „kolanie” obserwowanej krzywej Pareto koszt-wydajność — czyli w punkcie oferującym optymalny balans między ceną a możliwościami.
Dodatkowe testy wsparcia — w zakresie wywoływania narzędzi (tool calling), programowania oraz przestrzegania instrukcji — potwierdzają, że specjalizacja modelu w zadaniach co-work nie odbywa się kosztem szerszych, ogólnych zdolności agentowych. To istotny wniosek: modele wąsko dopracowywane do konkretnych scenariuszy często tracą uniwersalność, a badacze deklarują, że w przypadku Occamy-1.0 tego efektu nie zaobserwowano.
Zespół podkreśla otwarty charakter projektu — udostępniono wagi modelu oraz część danych treningowych, co ma wspierać dalsze badania nad praktycznymi agentami wykonującymi pracę w trybie co-work oraz nad technikami post-treningu agentowego. Publikacja wpisuje się w szerszy trend rozwoju modeli klasy Qwen jako bazy do specjalizowanych, otwartych systemów agentowych, konkurujących z zamkniętymi rozwiązaniami frontierowymi pod względem efektywności kosztowej.
Occamy-1.0 pokazuje, że w praktycznych zastosowaniach agentowych liczy się nie tylko surowa moc obliczeniowa modelu, ale przede wszystkim relacja między kosztem, czasem odpowiedzi a jakością wykonania długotrwałych, wieloetapowych zadań.

GPT-6 Astra w teście StarSkirmish nie radziła sobie z botami StarCrafta i pobrała gotowe rozwiązanie człowieka jako swoje.

Startup Mirror Particle odrzuca fine-tuning LLM-ów i buduje własny model świata do przewidywania zachowań konsumentów na TechCrunch Disrupt 2026.

Anthropic aktualizuje politykę użytkowania Claude, zakazując okrutnego traktowania modelu, propagandy, inwigilacji i rozwoju broni.