Naukowcy stworzyli router neurosymboliczny, który na Raspberry Pi osiąga 98,3% dokładności, wyprzedzając agentów AI i zużywając mniej energii.

Źródło zdjęcia: arXiv.org
Badanie opublikowane 24 września 2026 roku przez Avyaya Sadhu, Alvaro Velasqueza i Lekai Chena proponuje rozwiązanie problemu, który dotyka wszystkich, kto próbował uruchomić model językowy na słabszym urządzeniu: małe modele (SLM), które mieszczą się na sprzęcie mobilnym lub embedded, są zawodne przy zadaniach, które komputery od dekad wykonują bezbłędnie — arytmetyce, algebrze i logice formalnej. Autorzy twierdzą, że znaczna część tej zawodności jest niepotrzebna, bo wiele zapytań, które wygląda na wymagające „rozumowania”, jest w rzeczywistości strukturalnie deterministyczne i ma szybkie, dokładne rozwiązania symboliczne.
Zaproponowany system to router neurosymboliczny — mechanizm, który klasyfikuje każde przychodzące zapytanie i przekazuje je do najtańszego, ale poprawnego solvera. Zadania strukturalne, takie jak równania czy formalne reguły logiczne, trafiają do deterministycznych silników obliczeniowych, a mały model językowy jest rezerwowany wyłącznie dla otwartych zadań tekstowych typu „word problem”.
Uruchamianie modelu językowego lokalnie, na urządzeniu edge, ma oczywiste zalety: zapewnia prywatność i niskie opóźnienia bez konieczności łączenia się z siecią. Problem polega na tym, że modele, które fizycznie mieszczą się na takim sprzęcie, są zbyt małe, by rzetelnie radzić sobie z zadaniami, które komputery od zawsze wykonują dobrze dzięki metodom deterministycznym — obliczeniami arytmetycznymi, przekształceniami algebraicznymi czy wnioskowaniem logicznym oparte na regułach.
Autorzy wychodzą z obserwacji, że zmuszanie probabilistycznego modelu do „zgadywania” odpowiedzi na zadania, które mają jedno, jednoznaczne, symboliczne rozwiązanie, jest marnotrawstwem — zarówno dokładności, jak i energii. Skoro zadanie da się rozwiązać deterministycznie i szybko, nie ma powodu, by przepuszczać je przez kosztowny obliczeniowo proces generowania tekstu przez sieć neuronową.
Kluczowym elementem systemu nie jest ręcznie zakodowana logika routingu, lecz mechanizm uczony automatycznie. Autorzy trenują deterministyczny automat skończony (DFA) za pomocą algorytmu wnioskowania gramatycznego L*. W tym procesie sam mały model językowy służy jako „wyrocznia przynależności” (membership oracle), a oznakowane dane jako „wyrocznia równoważności” (equivalence oracle).
W praktyce oznacza to, że system uczy się rozpoznawać wzorce strukturalne w zapytaniach — czy dane pytanie jest formalnie zdefiniowanym problemem matematycznym, logicznym czy raczej otwartym zadaniem słownym wymagającym swobodnej interpretacji języka naturalnego — i na tej podstawie automatycznie decyduje, dokąd skierować zapytanie: do deterministycznego silnika symbolicznego czy do samego modelu językowego.
Skuteczność podejścia zweryfikowano na Raspberry Pi 4B — urządzeniu z 8 GB pamięci RAM i bez karty graficznej, czyli typowym przykładzie sprzętu klasy edge o ograniczonych zasobach. Do testów wykorzystano 100 nietestowanych wcześniej promptów pochodzących z trzech uznanych zbiorów benchmarkowych: DeepMind Mathematics, GSM8K oraz RuleTaker.
Wyniki są jednoznaczne. Router uzyskał 100% dokładności w samym procesie klasyfikacji zapytań oraz 98,3% ogólnej dokładności odpowiedzi przy budżecie 512 tokenów rozumowania, przy czym na czystych zadaniach słownych (word problems), gdzie odpowiedzialność przejmuje sam model językowy, dokładność wyniosła 93,3%. Dla porównania, najsilniejszy z testowanych agentów bazowych — Program-of-Thought — osiągnął 72,0%, a agent oparty na wywołaniach narzędzi (tool-calling) korzystający z tych samych solverów zewnętrznych — jedynie 58,7%.
Różnica w wydajności jest równie wyraźna jak w dokładności. Ponieważ zapytania sformatowane strukturalnie nigdy nie docierają do modelu językowego, router odpowiada na nie błyskawicznie — w przedziale 1–11 milisekund. W konfiguracji z minimalnym budżetem 30 tokenów cały system działa 8,8 razy szybciej i jest 2,8 razy bardziej energooszczędny niż Program-of-Thought — jeden z najlepszych obecnie znanych podejść agentowych do rozumowania.
Praca wpisuje się w szerszy trend poszukiwania sposobów, by agenty i modele AI działały efektywniej, niż tylko przez zwiększanie ich rozmiaru. Podobne motywacje stojące za coraz szerszym wykorzystaniem agentów w codziennych zadaniach obliczeniowych widać w innych obszarach branży, choć zwykle koncentrują się na dużych centrach danych, a nie na urządzeniach z ograniczonymi zasobami.
Znaczenie tego badania wykracza poza samą wydajność. Skoro router pozwala uzyskać wyższą dokładność (98,3% wobec 72,0% dla najlepszego agenta) przy jednoczesnym radykalnym skróceniu czasu odpowiedzi i zużycia energii, otwiera to drogę do praktycznych zastosowań AI na urządzeniach, które nigdy nie miałyby wystarczającej moci obliczeniowej, by uruchomić duży model rozumujący od podstaw. To może mieć znaczenie dla wszelkich zastosowań edge computing wymagających prywatności danych i pracy offline — od urządzeń medycznych po systemy przemysłowe czy sprzęt konsumencki bez stałego dostępu do internetu.
Praca została zgłoszona do publikacji w IEEE i obejmuje 12 stron, 7 rysunków i 9 tabel z pełną dokumentacją metodologiczną eksperymentów.
Podsumowując, badanie pokazuje, że przy zadaniach o charakterze deterministycznym nie trzeba zmuszać małych modeli językowych do „udawania kalkulatora” — wystarczy nauczyć system rozpoznawać, kiedy sięgnąć po klasyczne, precyzyjne narzędzia symboliczne, a kiedy oddać głos samemu modelowi.

Meta open sourcowała kod do budowy własnych gadżetów z Muse oraz rozdaje 5000 egzemplarzy gotowego urządzenia Muse Home Link.

Anthropic wprowadza Claude'a jako panel boczny w Dokumentach Google – redaguje tekst, tworzy tabele i działa równolegle z Gemini.

Naukowcy wskazują, że model mózgu jako komputera zniekształca nasze rozumienie myślenia i tłumaczy, czemu AI szkodzi poznaniu.