RBS-Attention rozwiązuje problem mean dilution i przyspiesza prefill w długim kontekście LLM nawet 20,65x na GPU H100, zachowując jakość modelu.

Źródło zdjęcia: arXiv.org
RBS-Attention, nowa metoda opisana w pracy zgłoszonej na arXiv 17 września 2026 roku przez Chuxu Song, Jiuqi Wei i Zhencan Peng, ma rozwiązać jeden z najbardziej kosztownych etapów wnioskowania w dużych modelach językowych obsługujących długi kontekst — tzw. prefill, czyli fazę, w której model przetwarza cały prompt przed wygenerowaniem pierwszego tokenu odpowiedzi. Autorzy proponują technikę, którą można zastosować bez ponownego trenowania modelu, a która pozwala znacząco przyspieszyć tę fazę przy zachowaniu wysokiej jakości odpowiedzi.
Standardowa uwaga własna (self-attention) w transformerach ma złożoność kwadratową względem długości sekwencji, co przy kontekstach liczonych w setkach tysięcy tokenów sprawia, że sama faza prefill — przetworzenie promptu przed rozpoczęciem generacji — staje się dominującym kosztem obliczeniowym całego wnioskowania. Jednym z rozwiązań stosowanych dotychczas jest sparse block selection, czyli wybieranie tylko fragmentu bloków tokenów zamiast przetwarzania wszystkiego w sposób gęsty. Problem, jaki wskazują autorzy, polega na tym, że gdy relewancję bloku ocenia się na podstawie jego centroidu (czyli uśrednionego wektora reprezentującego cały blok), pojedynczy bardzo istotny token może zostać „zgubiony” wśród wielu mniej istotnych tokenów w tym samym bloku. Autorzy nazywają to zjawisko mean dilution — rozmyciem sygnału przez uśrednianie.
Aby temu przeciwdziałać, RBS-Attention wprowadza dwie komplementarne gałęzie selekcji. Pierwsza, bazowa (centroid base branch), działa klasycznie — ocenia przeciętną relewancję bloku. Druga, ratunkowa (rescue branch), wykorzystuje maksymalny promień bloku kluczy oraz jego rozkład zależny od promptu, warstwy i głowy uwagi (head), aby wychwycić bloki narażone na niedoszacowanie właśnie z powodu mean dilution. Obie gałęzie są niezależnie poddawane thresholdowaniu (ustalaniu progu odcięcia), a ich maski są następnie łączone. Takie podejście pozwala kontrolować udział bloków „ratunkowych” bez rezygnowania z regularnej, blokowo-rzadkiej egzekucji FlashAttention — a więc bez utraty korzyści sprzętowych, jakie daje ta popularna implementacja mechanizmu uwagi.
Testy przeprowadzono na kartach graficznych Nvidia H100. Na modelu Qwen3–30B-A3B-Instruct-2507-FP8 przy kontekście 128K tokenów RBS-Attention osiąga 20,65-krotne przyspieszenie samodzielnych obliczeń uwagi w fazie prefill, 11,92-krotne przyspieszenie uwagi w prefill w środowisku vLLM oraz 5,97-krotne przyspieszenie całościowego czasu do pierwszego tokenu (end-to-end time-to-first-token). To istotny wynik, ponieważ TTFT jest kluczową metryką odczuwaną przez użytkowników końcowych — decyduje o tym, jak szybko po wysłaniu długiego promptu model zaczyna generować odpowiedź.
Pod względem jakości autorzy przetestowali metodę na gęstym modelu Qwen3–32B, uzyskując wynik 88,65 w benchmarku RULER, w porównaniu do 89,52 dla klasycznej uwagi gęstej — różnica poniżej jednego punktu przy wielokrotnym przyspieszeniu obliczeń. Dodatkowe testy jakościowe przeprowadzono na benchmarkach LongBench-v2, InfiniteBench oraz Video-MME, co pozwoliło ocenić metodę w różnych scenariuszach długiego kontekstu, w tym multimodalnych (Video-MME dotyczy wideo).
Praca zawiera również eksperymenty pomocnicze, które mają na celu głębsze zrozumienie działania RBS-Attention. Autorzy mierzą rzeczywisty poziom retencji (retention) informacji, porównują różne selektory bloków przy dopasowanej gęstości (matched density) — czyli sprawdzają, jak metoda wypada na tle alternatyw przy tej samej liczbie przetwarzanych bloków — a także charakteryzują wpływ rozmiaru bloku, wartości progu (threshold) oraz zużycia pamięci na końcowe wyniki. Te szczegółowe analizy mają pokazać, że dobór parametrów w RBS-Attention nie jest przypadkowy, a wynika z systematycznego zrozumienia, kiedy i dlaczego dochodzi do mean dilution.
Całość wyników prowadzi autorów do wniosku, że podejście oparte na adaptacyjnym promieniu i dwugałęziowej selekcji (radius-adaptive dual-branch selection) stanowi efektywną strategię radzenia sobie z kosztownym prefillem w modelach obsługujących bardzo długi kontekst — problem, który staje się coraz bardziej palący wraz z rosnącymi oknami kontekstowymi w komercyjnych i otwartych modelach językowych.
RBS-Attention łączy więc dwa cele, które dotychczas często stały w sprzeczności: drastyczne przyspieszenie obliczeń w fazie prefill oraz zachowanie jakości modelu bliskiej klasycznej, gęstej uwadze — bez potrzeby dodatkowego trenowania.

Natura wprowadza smart ring Interface za 99 dolarów, łączący dostęp do agentów AI jak ChatGPT i Claude z monitorowaniem zdrowia użytkownika.

Nvidia zwiększyła cenę siedmioletniego Shield TV Pro z 199,99 do 299,99 dolara, winiąc za podwyżkę rosnące koszty komponentów napędzane boomem AI.

Rzeczniczka OpenAI przerwała wywiad Vanity Fair z Samem Altmanem, gdy dziennikarz zapytał o samobójstwo użytkowniczki ChatGPT.