Attention-Aware Routing łączy routing i uwagę w modelach MoE, poprawiając wynik GSM8K o 3,37 pp na modelu OLMoE.

Źródło zdjęcia: arXiv.org
Nowe badanie opublikowane na arXiv 17 września 2026 roku proponuje mechanizm, który zmienia sposób, w jaki modele typu Mixture-of-Experts (MoE) decydują, który „ekspert” powinien przetworzyć dany token. Zespół badaczy – Despoina Kosmopoulou, Anastasios Tsetsilas, Efthymios Georgiou, Giannis Karamanolakis, Swastik Roy i Alexandros Potamianos – przedstawił technikę nazwaną Attention-Aware Routing (AAR), która wzbogaca router modelu o informacje pochodzące z wag uwagi, a nie tylko ze stanu skrytego tokena.
W klasycznych architekturach MoE router wybiera i waży ekspertów na podstawie wektora skrytego danego tokena – podejście, które, jak zauważają autorzy, wykorzystuje ograniczoną informację kontekstową. AAR rozszerza ten mechanizm o cechy czasowe i spektralne wyodrębnione z przesuwanego okna wag uwagi, traktując je jako niezależne od stanu skrytego podsumowanie kontekstowego „stanu” modelu.
Centralnym odkryciem pracy jest to, że routing i uwaga tworzą sprzężony obwód (coupled circuit). Autorzy wykazali, że zmiana decyzji routingu na warstwie l nie pozostaje izolowana – przenosi się poprzez strumień resztkowy transformera i wpływa na rozkład uwagi na warstwie l+1, w szczególności wzmacniając zjawisko „attention sinks”, czyli tokenów, na których model koncentruje nieproporcjonalnie dużą część uwagi. To ważne z metodologicznego punktu widzenia: pokazuje, że zmiana jednego elementu architektury (routingu) może reshapować zachowanie innego (mechanizmu uwagi) bez żadnej bezpośredniej interwencji w ten drugi element.
Aby wyizolować wpływ samego routingu, badacze utrzymali cały bazowy model transformera w stanie zamrożonym i trenowali wyłącznie parametry odpowiedzialne za routing. Taki eksperymentalny rygor pozwolił im przypisać obserwowane zmiany wyłącznie decyzjom o przypisywaniu tokenów do ekspertów, a nie ogólnemu douczaniu modelu.
Poza czystym wzrostem dokładności na GSM8K – benchmarku testującym matematyczne rozumowanie na poziomie szkoły podstawowej – autorzy zaobserwowali dodatkowy efekt behawioralny. AAR redukuje tzw. długą, rozjeżdżającą się generację (long diverging generation), czyli sytuacje, w których model produkuje nadmiernie długie, błędne ciągi odpowiedzi. Konkretnie: błędne odpowiedzi generowane przez model z AAR są krótsze niż w wariancie bazowym, natomiast długość poprawnych odpowiedzi pozostaje niezmieniona. To sugeruje, że lepszy routing pomaga modelowi „szybciej” rozpoznać, kiedy dana ścieżka rozumowania prowadzi do błędu, ograniczając niepotrzebne rozwlekanie generacji.
Jednym z najbardziej praktycznych wniosków badania jest silna zależność efektywności AAR od głębokości warstwy, na której technika jest zastosowana. Autorzy pokazują, że stosowanie AAR jednakowo na wszystkich warstwach sieci może pogarszać zdolność modelu do faktycznego wyszukiwania informacji (factual retrieval). Jednocześnie korzyści dla matematycznego rozumowania utrzymują się, gdy AAR wprowadza się głębiej w architekturze modelu.
To odkrycie ujawnia napięcie między wyszukiwaniem a rozumowaniem (retrieval-reasoning tension) rozłożone na różnych głębokościach sieci. Innymi słowy, informacje przenoszone przez wagi uwagi na wczesnych warstwach mogą być istotne dla operacji przypominania faktów, podczas gdy na głębszych warstwach ta sama informacja lepiej wspiera złożone łańcuchy rozumowania. Autorzy proponują wykorzystanie tej właściwości jako kontrolowanej sondy (controlled probe) – selektywne, warstwowe stosowanie AAR może służyć badaczom jako narzędzie diagnostyczne do mapowania, jaka informacja istotna dla routingu jest przenoszona przez mechanizm uwagi na różnych poziomach głębokości modelu.
Attention-Aware Routing pokazuje, że wykorzystanie sygnału z wag uwagi – zamiast poprzestania na samym stanie skrytym tokena – może realnie poprawić routing w modelach Mixture-of-Experts, przy czym efekt jest silnie zależny od głębokości warstwy i wykrywa nieoczekiwane sprzężenie między routingiem a mechanizmem uwagi w architekturze transformera.

Microsoft AI wypuściło modele transkrypcji i syntezy mowy dla agentów głosowych — niskie opóźnienia, 60 języków i klonowanie głosu z kilku sekund nagrania.

Nonprofit Trillium Labs, założony przez Nathana Lamberta i Toma Zicka, ma otwarcie badać ryzykowne obszary AI, jak RSI i uczenie ze wzmocnieniem.

Capcom zapowiada integrację AI w procesie tworzenia gier na silniku RE Engine, deklarując jednocześnie brak AI-generowanych zasobów w produktach.