Badacze opracowali EntropyMoE — architekturę wykorzystującą entropię fragmentów do inteligentnego kierowania obliczeń w modelach językowych na poziomie bajtów.

Źródło zdjęcia: arXiv.org
Badacze opracowali EntropyMoE — nową architekturę Mixture-of-Experts zaprojektowaną specjalnie dla modeli językowych pracujących na poziomie bajtów, bez tradycyjnych tokenizatorów. Innowacyjne rozwiązanie wykorzystuje entropię fragmentów danych jako sygnał do inteligentnego kierowania obliczeń między ekspertami, co pozwala na bardziej efektywne przetwarzanie różnorodnych typów treści. Szczegóły badania zostały opublikowane w artykule naukowym na arXiv.
Ostatnie modele językowe na poziomie bajtów uczynili modelowanie bez tokenizatorów coraz bardziej konkurencyjnym poprzez grupowanie bajtów w dynamicznie dobierane fragmenty. Jednak istniejące architektury fragmentów bajtowych nadal stosują te same gęste obliczenia feed-forward dla każdego fragmentu. To jednolite podejście obliczeniowe nie potrafi dostosować pojemności modelu do zmian w semantyce i granularności fragmentów.
EntropyMoE odpowiada na to ograniczenie, wprowadzając architekturę Mixture-of-Experts specjalnie zaprojektowaną dla dynamicznych fragmentów bajtowych. System zastępuje gęste moduły feed-forward w globalnym transformerze fragmentów warstwami ekspertów Top-K.
Kluczową innowacją EntropyMoE jest wykorzystanie entropii fragmentów jako bezpośredniego sygnału do wyboru ekspertów. Router wybiera ekspertów bezpośrednio na podstawie entropii fragmentu, używając tego samego sygnału granularności, który leży u podstaw konstrukcji dynamicznych fragmentów do organizacji rzadkich obliczeń.
Entropia fragmentu i długość wspólnie definiują przestrzeń cech regulującą specjalizację ekspertów. To podejście pozwala systemowi na lepsze dostosowanie do różnorodności semantycznej i strukturalnej przetwarzanych danych, gdzie fragmenty o różnej entropii mogą wymagać różnych typów przetwarzania.
Przeprowadzone eksperymenty wykazały, że EntropyMoE osiąga najniższą wartość bits-per-byte wśród dopasowanych modeli bazowych — zarówno gęstych, jak i rzadkich — przy jednoczesnym utrzymaniu porównywalnej dokładności w zadaniach downstream. Te rezultaty ustanawiają entropię fragmentów jako skuteczną współrzędną kierowania dla rzadkich obliczeń warunkowych.
Wyniki te rozszerzają także modelowanie Mixture-of-Experts poza reprezentacje oparte na tokenizatorach, otwierając nowe możliwości dla bardziej efektywnych architektur modelowania języka na poziomie bajtów.
Badanie potwierdza potencjał wykorzystania właściwości statystycznych danych jako przewodnika dla efektywnego rozdziału zasobów obliczeniowych w zaawansowanych modelach językowych.

Sondaż Quinnipiac pokazuje, że większość Amerykanów chce spowolnienia rozwoju AI i nie ufa liderom branży technologicznej.

Nowa metoda MintFlow wymusza ograniczenia na próbkach flow matching, minimalnie zaburzając trajektorię i zachowując pretrenowany rozkład danych.

Kevin Roose opowiada o książce AGI Chronicles, 150 wywiadach z branżą AI i nowym podcaście Machine Gods z NPR.