PrismML skompresował model AI z 54 GB do 3,9 GB zachowując 90% wydajności. Apple testuje technologię, która może zrewolucjonizować lokalne AI.

Źródło zdjęcia: The Decoder
PrismML wypuściła Bonsai 27B — model sztucznej inteligencji o 27 miliardach parametrów, który może działać bezpośrednio na iPhone'ie. Firma twierdzi, że model zachowuje pełne możliwości rozumowania i agentowe mimo drastycznej kompresji. Apple podobno testuje tę technologię w ramach rozmów z PrismML.
Model został opracowany przez zespół badaczy z Caltech i bazuje na Qwen3.6–27B firmy Alibaba. PrismML przekonuje, że współczesne aplikacje AI coraz częściej wymagają potężnych modeli działających lokalnie na urządzeniu.
PrismML rozwiązuje kluczowy problem nowoczesnych aplikacji AI. Jak wyjaśnia firma, agent AI może wykonać setki wywołań modelu w sekwencji, gdzie każde niesie ze sobą kontekst i przekazuje wyniki do następnego kroku. W chmurze oznacza to rosnące koszty za każdy token, opóźnienia sieciowe oraz konieczność wysyłania prywatnych danych poza urządzenie.
Działanie na urządzeniu redukuje krańcowe koszty tych pętli do zera i zachowuje dane użytkownika lokalnie. PrismML postrzega to jako podstawę dla ciągle działających agentów, asystentów offline i systemów hybrydowych, gdzie proste zadania pozostają na urządzeniu, a tylko najtrudsze są wysyłane do zaawansowanych modeli w chmurze.
Tradycyjnie model o tej wielkości zajmuje około 54 GB miejsca, a nawet ze standardową kompresją wymaga około 18 GB. PrismML oferuje dwie znacznie mniejsze wersje: jakościową o rozmiarze około 5,9 GB przeznaczoną na laptopy oraz kompaktową 3,9 GB mieszczącą się w ograniczonej pamięci iPhone'a 17 Pro Max.
Zamiast przechowywać każdą wagę sieci neuronowej jako 16 bitów, PrismML używa tylko jednego lub nieco poniżej dwóch bitów. W najbardziej agresywnej wersji każda waga ma tylko dwa stany, w nieco większej — trzy. Takie podejście jest stosowane w całym modelu językowym.
Według własnej oceny PrismML na 15 benchmarkach większa wersja zachowuje 95% wydajności oryginalnego modelu, mniejsza — 90%. Matematyka i kodowanie pozostały „praktycznie nienaruszone”. Większe spadki pojawiły się przy bardziej agresywnej kompresji, szczególnie w rozumieniu obrazów, podążaniu za instrukcjami i używaniu narzędzi przez agenty.
Według raportu CNBC, PrismML już prowadzi rozmowy z Apple o technologii kompresji stojącej za Bonsai. CEO PrismML Babak Hassibi potwierdził, że Apple i inne firmy testują modele pod kątem szybkości, zużycia energii i wydajności. Rozmowy są „bardzo wczesne”, ale „sprawy rozwijają się dobrze”.
Licencjonowana technologia kompresji byłaby ważna dla Apple, którego własne modele do tej pory pozostają w tyle za konkurencją w benchmarkach. Na WWDC 2026 Apple zaprezentował odnowioną Siri opartą na modelach fundamentowych opracowanych z Google przy użyciu technologii Gemini. Najpotężniejszy model działający na urządzeniu wymaga już iPhone'a z co najmniej 12 GB RAM, a złożone zapytania działają na procesorach Nvidia w chmurze Apple.
Firma została założona przy wsparciu Khosla Ventures, Cerberus i Google, a Samsung kontynuuje jej wsparcie. PrismML planuje następnie zastosować swoją technologię kompresji do serii modeli Gemma Google, której mniejsze wersje już działają na smartfonach.

Alibaba wypuściła Qwen 3.8, pierwszy multimodalny model z ponad bilionem parametrów. Otwarte wagi mają zakłócić strategię Moonshot AI przed planowanym IPO.

Naukowcy opracowali technikę testującą, czy modele AI rzeczywiście opierają rozumowanie na przesłankach, wykrywając przypadki prawidłowych odpowiedzi z błędnym uzasadnieniem.

GenCeption wykorzystuje generator wideo do zadań wizji komputerowej, dorównując wyspecjalizowanym modelom przy użyciu 500 razy mniej danych treningowych.