H Company wypuściła Holo4 – modele agentowe łączące GUI, kod, MCP i API, konkurencyjne z frontierem przy niższym koszcie.

Źródło zdjęcia: huggingface.co
H Company zaprezentowała nową rodzinę modeli agentowych – Holo4 – zaprojektowanych do samodzielnej obsługi komputerów i oprogramowania biznesowego. Modele dostępne są już na platformie H Models API oraz w postaci otwartych wag na Hugging Face, a wraz z nimi firma wypuściła zaktualizowaną wersję modelu Holotron 3, nazwaną Holotron4 Nano.
Holo4 rozwija poprzednią generację modeli firmy i wyróżnia się tym, że potrafi wchodzić w interakcję z oprogramowaniem przez dowolny dostępny interfejs – interfejs graficzny (GUI), kod, protokół MCP oraz API. Twórcy podkreślają, że model dobrze radzi sobie w akademickich benchmarkach, ale przede wszystkim został zbudowany z myślą o realnych procesach biznesowych.
Twórcy Holo4 zwracają uwagę na problem, z którym boryka się większość modeli agentowych: są one trenowane wyłącznie pod jeden typ interfejsu. Modele skoncentrowane na GUI są „ślepe” bez ekranu, a modele preferujące wywołania narzędzi (tool calling) blokują się, gdy natrafiają na aplikację bez dostępnego API. Zdaniem H Company realna praca nie funkcjonuje w takich silosach – pojedyncze zadanie biznesowe często wymaga łączenia kilku podejść naraz.
Holo4 klika i pisze na ekranie, pisze i uruchamia własny kod, a także wywołuje narzędzia MCP lub API – w zależności od tego, co najlepiej pasuje do danego zadania. Model działa na desktopach, w przeglądarce, na Androidzie, w sandboksie kodu oraz wobec firmowych interfejsów programistycznych, przy czym w każdym z tych scenariuszy jest to ten sam model, wywoływany w ten sam sposób. To odróżnia go od podejścia, w którym trzeba wybierać inny model dla każdej platformy.
Firma podkreśla, że modele Holo4 znacząco poprawiają wyniki względem swojej bazy, czyli modeli Qwen, na których zostały oparte.
W benchmarkach dotyczących kontroli desktopu (OSWorld 2.0) oraz korzystania z API (AutomationBench) Holo4 rywalizuje z modelami z czołówki rynku, ale przy znacznie niższym koszcie na zadanie.
Metodologia porównań opisana przez H Company jest szczegółowa. W przypadku OSWorld 2.0 koszty szacowano na podstawie tokenów wejściowych i wyjściowych każdego przebiegu agentowego, przy czym Holo4 wyceniano według cen H Models API (jednorazowy przebieg). Model Qwen3.8 27B porównywano z wynikiem z jego karty modelu, licząc koszt na podstawie tokenów uzyskanych w cenach cennikowych Alibaba Cloud, natomiast Qwen3.6 35B-A3B testowano w jednym przebiegu we własnym środowisku testowym firmy, również według cen Alibaba Cloud, z uwzględnieniem trafień w cache na poziomie 20% ceny wejściowej. Dane dla modeli GPT i Opus pochodzą z materiałów startowych OpenAI, a inne modele – zarówno zamknięte, jak i open-source – porównywano z oficjalnym rankingiem OSWorld 2.0. H Company zaznacza, że wersje modeli, środowiska testowe i podzbiory zadań różnią się między sobą, a linia na wykresach łączy niezdominowane pary wynik-koszt wśród modeli zamkniętych, z wyłączeniem samego Holo4.
W przypadku AutomationBench Holo4, Qwen3.8 27B i Qwen3.6 35B-A3B testowano w wersji v1.0.6, mierząc wyniki i koszty we wewnętrznym środowisku firmy. Wyniki innych modeli pochodzą z publicznego zbioru danych opisanego w README AutomationBench, a koszt na zadanie – z oficjalnego rankingu działającego na zbiorze prywatnym. H Company deklaruje, że opublikuje wyniki Holo4 na zbiorze prywatnym, gdy zostaną one ocenione.
Holo4 był trenowany na środowiskach i zadaniach wygenerowanych przez Agentic Task Factory – wewnętrzne narzędzie H Company – i, jak podkreśla firma, wypada szczególnie dobrze w pracy z profesjonalnym oprogramowaniem. W materiałach źródłowych zaprezentowano przykłady działania Holo4 27B w porównaniu z jego modelem bazowym Qwen3.8 27B, przy identycznym promptcie i tym samym środowisku testowym.
Jednym z przykładów jest zadanie zbudowania w programie FreeCAD trójwymiarowego modelu wieży Eiffla w skali 1 mm do 1 metra, wyśrodkowanego w punkcie początkowym i wyrównanego względem osi X i Y, według bardzo szczegółowej specyfikacji geometrycznej – obejmującej m.in. profil zwężania czterech nóg konstrukcji, trzy platformy o zdefiniowanych wymiarach oraz maszt na szczycie. Zgodnie z opisem, Holo4 27B wykonał zadanie w 84 wywołaniach, zużywając 1,3 mln tokenów, podczas gdy Qwen3.8 27B potrzebował 60 wywołań i 1,0 mln tokenów. Drugi przykład dotyczył zbudowania modelu logo firmy H – złożonego z pełnego dysku i blokowej litery H – choć szczegółowy opis tego zadania w materiale źródłowym jest niekompletny.
Modele Holo4 są dostępne jako otwarte wagi w formatach FP16, FP8 i GGUF w kolekcji na Hugging Face, co oznacza, że polscy programiści i firmy technologiczne mogą pobrać je samodzielnie i uruchomić lokalnie bez konieczności korzystania z płatnego API. Dla firm, które chcą korzystać z hostowanej wersji, dostępne jest H Models API z gotowym quickstartem. Otwarty charakter projektu – w tym publikacja wszystkich trajektorii testowych na trajectories.hcompany.ai – ułatwia niezależną weryfikację deklarowanych wyników, co ma znaczenie w kontekście unijnych wymogów przejrzystości modeli AI wprowadzanych przez AI Act.
Holo4 pokazuje, że modele agentowe zaczynają wychodzić poza pojedyncze wyspecjalizowane interfejsy – łącząc obsługę GUI, kodu, MCP i API w jednym systemie, który można wdrożyć na wielu platformach bez zmiany narzędzia.

Sam Altman mówi, że przypisywanie AI religijnej siły to zagrożenie bezpieczeństwa – zmiana tonu wobec jego wcześniejszych deklaracji o „magicznej inteligencji na niebie”.

Rzeczniczka OpenAI przerwała wywiad Vanity Fair z Samem Altmanem, gdy dziennikarz zapytał o samobójstwo użytkowniczki ChatGPT.

Sean Parker i Stability AI wiążą się z Sony, Warnerem i Universal, budując narzędzia AI do generowania muzyki z licencjonowanych katalogów.