Badacze opracowali EntropyMoE — architekturę wykorzystującą entropię fragmentów do inteligentnego kierowania obliczeń w modelach językowych na poziomie bajtów.

Źródło zdjęcia: arXiv.org
Badacze opracowali EntropyMoE — nową architekturę Mixture-of-Experts zaprojektowaną specjalnie dla modeli językowych pracujących na poziomie bajtów, bez tradycyjnych tokenizatorów. Innowacyjne rozwiązanie wykorzystuje entropię fragmentów danych jako sygnał do inteligentnego kierowania obliczeń między ekspertami, co pozwala na bardziej efektywne przetwarzanie różnorodnych typów treści. Szczegóły badania zostały opublikowane w artykule naukowym na arXiv.
Ostatnie modele językowe na poziomie bajtów uczynili modelowanie bez tokenizatorów coraz bardziej konkurencyjnym poprzez grupowanie bajtów w dynamicznie dobierane fragmenty. Jednak istniejące architektury fragmentów bajtowych nadal stosują te same gęste obliczenia feed-forward dla każdego fragmentu. To jednolite podejście obliczeniowe nie potrafi dostosować pojemności modelu do zmian w semantyce i granularności fragmentów.
EntropyMoE odpowiada na to ograniczenie, wprowadzając architekturę Mixture-of-Experts specjalnie zaprojektowaną dla dynamicznych fragmentów bajtowych. System zastępuje gęste moduły feed-forward w globalnym transformerze fragmentów warstwami ekspertów Top-K.
Kluczową innowacją EntropyMoE jest wykorzystanie entropii fragmentów jako bezpośredniego sygnału do wyboru ekspertów. Router wybiera ekspertów bezpośrednio na podstawie entropii fragmentu, używając tego samego sygnału granularności, który leży u podstaw konstrukcji dynamicznych fragmentów do organizacji rzadkich obliczeń.
Entropia fragmentu i długość wspólnie definiują przestrzeń cech regulującą specjalizację ekspertów. To podejście pozwala systemowi na lepsze dostosowanie do różnorodności semantycznej i strukturalnej przetwarzanych danych, gdzie fragmenty o różnej entropii mogą wymagać różnych typów przetwarzania.
Przeprowadzone eksperymenty wykazały, że EntropyMoE osiąga najniższą wartość bits-per-byte wśród dopasowanych modeli bazowych — zarówno gęstych, jak i rzadkich — przy jednoczesnym utrzymaniu porównywalnej dokładności w zadaniach downstream. Te rezultaty ustanawiają entropię fragmentów jako skuteczną współrzędną kierowania dla rzadkich obliczeń warunkowych.
Wyniki te rozszerzają także modelowanie Mixture-of-Experts poza reprezentacje oparte na tokenizatorach, otwierając nowe możliwości dla bardziej efektywnych architektur modelowania języka na poziomie bajtów.
Badanie potwierdza potencjał wykorzystania właściwości statystycznych danych jako przewodnika dla efektywnego rozdziału zasobów obliczeniowych w zaawansowanych modelach językowych.
Dicio to darmowy, otwartoźródłowy asystent głosowy na Androida, który działa lokalnie i rozwiązuje problemy Gemini z połączeniami bez użycia rąk.

Anthropic generuje 65% wydatków na Vercel AI Gateway przy 30% udziału w tokenach – koszt na token jest 4,4 raza wyższy niż u konkurencji.

Deepseek wypuszcza mocniejszy model V4-Pro, otwiera kod agenta Harness i podnosi ceny API przed planowanym IPO.