LiquidAI udostępnia otwarte modele decyzyjne d1–3B i d1-omni-600M dla edge AI, wpisując się w rosnący trend modeli decyzyjnych w branży.

Źródło zdjęcia: huggingface.co
LiquidAI ogłosiła dziś wydanie dwóch otwartych modeli decyzyjnych z rodziny d1: d1–3B oraz eksperymentalnego d1-omni-600M. To nowa generacja modeli stworzonych nie do generowania tekstu, a do podejmowania szybkich, ustrukturyzowanych decyzji – w jednym przebiegu obliczeniowym, bez generowania tokenów. Premiera wpisuje się w szerszy trend branżowy: modele decyzyjne zyskują popularność jako alternatywa dla kosztownych dużych modeli językowych w zadaniach klasyfikacyjnych, co potwierdzają równoległe doniesienia o nowym modelu moderacji treści firmy Musubi oraz raporcie NVIDIA o rosnącej roli otwartych modeli w telekomunikacji.
Modele d1–3B i d1-omni-600M bazują na Liquid Foundation Models (LFM) od LiquidAI, ale – w odróżnieniu od modeli generatywnych – nie produkują kolejnych tokenów, lecz zwracają odpowiedź w jednym przebiegu w przód. Obie konstrukcje wyrastają z zupełnie różnych szkieletów. d1–3B został wytrenowany na bazie LFM2.5-VL-3B, najnowszego modelu wizyjno-językowego (VLM) typu decoder-only, przyjmującego tekst i obrazy. Z kolei d1-omni-600M opiera się na LFM2.5-Encoder-350M – dwukierunkowym enkoderze, do którego dodano enkodery wizji i audio, dzięki czemu model przyjmuje tekst z obrazem lub tekst z audio. LiquidAI zaznacza, że ten drugi model jest obecnie we wczesnej fazie badawczej i będzie dalej rozwijany.
Zespół przetestował oba modele na siedmiu publicznych zbiorach danych obejmujących rozumienie tekstu, wykrywanie toksyczności, klasyfikację intencji, pytania medyczne i rozumienie wielojęzyczne (m.in. SQuAD 2.0, Civil Comments, MASSIVE intent, PubMedQA, BoolQ, XNLI, PAWS-X). d1–3B uzyskał średni wynik 82,9 – najwyższy w tabeli porównawczej, przewyższający model Decider 4B (81,1). d1-omni-600M osiągnął 78,4 punktu, pokonując Decider 2B (77,1) przy zaledwie jednej czwartej liczby parametrów. LiquidAI potwierdza, że d1–3B zachowuje zdolności wizyjne swojego poprzednika LFM2.5-VL-3B, a d1-omni-600M obsługuje wszystkie trzy modalności, choć firma nie publikuje jeszcze wyników dla zadań wizyjnych czy audio – wskazując, że benchmarki audio dla modeli decyzyjnych to wciąż otwarty problem badawczy.
Testy prędkości, przeprowadzone we współpracy z NVIDIA na platformach RTX 4090, Jetson AGX Thor, Jetson AGX Orin 64 GB i Jetson Orin Nano, pokazują, że d1–3B odpowiada na jedno pytanie w czasie poniżej 50 ms na każdym z testowanych urządzeń edge, a przetworzenie trzech pytań zajmuje jedynie 1,3 razy więcej czasu niż jednego (na AGX Thor: wzrost z 16 ms do 20 ms). Na GPU model odpowiada na pytanie w mniej niż 10 ms i przetwarza obraz 384 px w mniej niż 18 ms – zarówno na RTX 4090, jak i na AMD MI325X, gdzie przy 64 spakowanych stanach model osiąga przepustowość 1106 odpowiedzi na sekundę.
LiquidAI udostępnia modele z otwartymi wagami, wymagając biblioteki transformers w wersji co najmniej 5.14 oraz flagi trust_remote_code=True. Firma rekomenduje sięganie po d1–3B, gdy liczy się najwyższa jakość decyzji, a po d1-omni-600M, gdy kluczowy jest minimalny rozmiar modelu.
Premiera LiquidAI wpisuje się w szybko rosnącą kategorię tzw. decision models, czyli modeli, które zamiast generować swobodny tekst, zwracają z góry zdefiniowane wyniki – oceny prawdopodobieństwa lub proste osądy binarne. Jak zauważa TechCrunch, trend ten nabrał rozpędu po wrześniowej premierze modelu Jev firmy TypeSafe AI, po której szybko pojawiły się konkurencyjne rozwiązania OpenAI i Amazon. Ograniczenie wyjścia modelu do zestawu predefiniowanych opcji pozwala działać szybciej i taniej niż klasyczne duże modele językowe, zachowując jednocześnie elastyczność architektury transformerowej.
Przykładem praktycznego zastosowania tej technologii jest ogłoszony we wtorek przez firmę Musubi model PolicyLM-1.7B – lekki, open-source model decyzyjny przeznaczony do moderacji treści w czasie rzeczywistym. Jego zadaniem jest przyjęcie polityki treści napisanej po prostu w naturalnym języku i zastosowanie jej do wiadomości w czasie poniżej 50 milisekund, bez konieczności dodatkowego treningu przy każdej zmianie zasad. Filip Jankovic, współzałożyciel i chief AI officer Musubi, podkreśla: „Zespoły produktowe chcą po prostu lepiej rozumieć, co dzieje się na ich platformie, zwłaszcza gdy ilość treści rośnie wykładniczo. Możliwość oznaczania tego wszystkiego w skalowalny i konfigurowalny sposób jest niezwykle użyteczna”. Jankovic zaznacza też, że jego zainteresowanie modelami decyzyjnymi sięga 2024 roku i projektu GLiNER, poprzedzając tym samym premierę Jev – ale firma nie unika porównań, wprost reklamując PolicyLM-1.7B jako model „tego samego rodzaju co Jev, ale wytrenowany specjalnie do moderacji treści, który można uruchomić samodzielnie”. TechCrunch zwraca uwagę, że pierwszym zastosowaniem modeli decyzyjnych było ograniczanie niewłaściwych zachowań agentów AI – naturalnym rozwinięciem tej idei jest teraz monitorowanie zachowań ludzi.
Zjawisko otwartości, widoczne w premierze LiquidAI, znajduje potwierdzenie w danych z zupełnie innego sektora. Według najnowszego raportu NVIDIA „State of AI in Telecommunications”, 89% respondentów deklaruje, że otwarte modele i otwarte oprogramowanie są istotnym elementem strategii AI ich firmy. NVIDIA wskazuje pięć powodów tej zmiany: niższy koszt dostępu do zaawansowanej inteligencji (zgodnie z niezależnym rankingiem Artificial Analysis Intelligence Index v4.3.2), możliwość dostosowania modeli do specyfiki operatora, większa kontrola i przejrzystość działania modeli, elastyczne wdrażanie w chmurze publicznej, infrastrukturze prywatnej i na edge, a także możliwość świadczenia lokalnie dostosowanych usług AI klientom biznesowym i instytucjonalnym.
Rodzina modeli NVIDIA Nemotron ma zapewniać wydajność na poziomie modeli frontierowych, zoptymalizowaną pod agentowe przepływy pracy oraz zastosowania głosowe. SoftBank Corp., jak mówi Rajeev Koodli, senior vice president SB Telecom America, wykorzystuje otwarte modele Nemotron do budowy własnego SoftBank Large Telecom Model, łącząc globalny postęp fundacji otwartych z wieloletnią wiedzą operacyjną firmy. NVIDIA ogłosiła też model Nemotron 3 Large Telco Model o 30 miliardach parametrów, dostrojony przez firmę AdaptKey na otwartych zbiorach danych telekomunikacyjnych. Z kolei Andy Markus, chief data and AI officer AT&T, podkreśla, że „przyszłość AI nie polega na wyborze jednego modelu, lecz na inteligentnym dopasowaniu każdego zadania do odpowiedniej kombinacji wydajności, kosztu i kontroli” – a otwarte modele są do tego niezbędne. Indonezyjski operator Indosat Ooredoo Hutchison, przez usta Chiraga Sukhadii, wskazuje jeszcze inny wymiar otwartości: możliwość zbudowania AI rozumiejącego lokalny język i kulturę za pomocą rodziny modeli Sahabat-AI.
Premiera d1–3B i d1-omni-600M od LiquidAI pokazuje, że modele decyzyjne – szybkie, multimodalne i zdolne do działania na urządzeniach edge – stają się osobną, dynamicznie rozwijaną kategorią AI, obok klasycznych dużych modeli językowych. Równoległe doniesienia o modelu PolicyLM-1.7B firmy Musubi i rosnącym udziale otwartych modeli w strategiach telekomów potwierdzają, że trend otwartości i specjalizacji w AI nabiera tempa na wielu frontach jednocześnie.

Trump powołał Super Intelligence Force z Jayem Claytonem na czele, by koordynować politykę USA wobec sztucznej inteligencji i uniknąć nadmiernej regulacji.

Nowa metoda MintFlow wymusza ograniczenia na próbkach flow matching, minimalnie zaburzając trajektorię i zachowując pretrenowany rozkład danych.

Badanie Highwire: 78% menedżerów używa AI do ocen pracowników, ale tylko 16% podwładnych wie o tym wpływie.