Google przekształcił Gemma 4 w szybszy model dyfuzyjny, używając zaledwie 10% pierwotnego budżetu tokenów i osiągając 1500 tokenów na sekundę.

Źródło zdjęcia: The Decoder
Google DeepMind udowodniło, że nie trzeba trenować modelu dyfuzyjnego tekstu od zera. Zespół przekształcił istniejący model Gemma 4 w DiffusionGemma, używając zaledwie 10% pierwotnego budżetu tokenów treningowych. Szczegóły tego procesu opisuje nowy raport techniczny.
W przeciwieństwie do standardowych modeli językowych, które generują tekst token po tokenie, DiffusionGemma przetwarza bloki 256 tokenów równolegle, podobnie jak modele generujące obrazy wydobywają obraz z szumu. Na akceleratorze Nvidia H100 model osiąga około 1500 tokenów na sekundę.
Google zastosowało dwuetapowy proces treningowy, który równoważy jakość i szybkość. W pierwszej fazie model uczy się rekonstruować zaszumione bloki tekstu z danych przykładowych. Następnie następuje połączona faza uczenia ze wzmocnieniem i destylacji samplera, którą Google nazywa SD·RL.
Według raportu, to połączone podejście podnosi jakość w benchmarkach rozumowania średnio o dziesięć punktów, jednocześnie prawie czterokrotnie zwiększając liczbę tokenów na krok obliczeniowy. Jako efekt uboczny, odpowiedzi DiffusionGemma są około 50% krótsze, co dodatkowo zwiększa szybkość.
Standardowe modele językowe muszą zdecydować o pierwszej cyfrze odpowiedzi, zanim przeanalizują całe rozumowanie. W problemie matematycznym z raportu Gemma 4 zaczyna odpowiedź od „-1”, zdaje sobie sprawę podczas wyprowadzania, że „-25” jest poprawne, i dodaje korektę na końcu. DiffusionGemma rozwija odpowiedź i rozumowanie równolegle, więc może naprawić błędy przed finalizacją wyniku.
Rozwiązywanie Sudoku działa na tej samej zasadzie, ponieważ każdy wpis zależy od wpisów, które pojawiają się później. Strukturalne wyniki jak JSON czy naprawy kodu kończą się po zaledwie dwóch do trzech krokach rafinacji, ponieważ dane wejściowe już określają większość tokenów.
Absolutna wydajność pozostaje niższa niż w modelu bazowym. Google wskazuje kilka przyczyn tego stanu. DiffusionGemma nie był trenowany jako model dyfuzyjny od początku, ale został przekształcony po fakcie. Kolejna faza treningowa była stosunkowo krótka, a drugi etap, SD·RL, priorytetowo traktował szybkość nad szczytową jakością.
Model czasami utyka w pętlach powtórzeń, produkując pojedyncze słowa wielokrotnie z rzędu. To artefakt agresywnie zredukowanych kroków obliczeniowych. Przewaga w szybkości utrzymuje się głównie w scenariuszach jednego użytkownika — gdy około 32 równoczesnych żądań trafia do modelu, standardowe modele językowe dorównują przepustowością.
Google wyraźnie nazywa DiffusionGemma modelem eksperymentalnym i twierdzi, że wydanie ma na celu przyspieszenie badań nad dyfuzją tekstu, dając społeczności podstawę do specjalistycznych, zasobooszczędnych adaptacji. Model jest już wykorzystywany przez startup Interfaze do wielojęzycznego rozpoznawania mowy oraz w projekcie badawczym nad interaktywnym generowaniem raportów radiologicznych.

Replikacja badania nad α-FLOPs pokazuje, że liczba operacji FLOP-ów słabo szacuje realny czas wykonania na nowszym sprzęcie AI.

Klasyfikatory Anthropic blokujące pytania o broń biologiczną były wyłączone przez rok, obejmując 133 mln rozmów kontrahentów.

Meta AI trafia na komputery Mac z funkcją udostępniania ekranu, dyktowaniem oraz integracją z Google Workspace, Instagramem i Facebookiem.