Google przekształcił Gemma 4 w szybszy model dyfuzyjny, używając zaledwie 10% pierwotnego budżetu tokenów i osiągając 1500 tokenów na sekundę.

Źródło zdjęcia: The Decoder
Google DeepMind udowodniło, że nie trzeba trenować modelu dyfuzyjnego tekstu od zera. Zespół przekształcił istniejący model Gemma 4 w DiffusionGemma, używając zaledwie 10% pierwotnego budżetu tokenów treningowych. Szczegóły tego procesu opisuje nowy raport techniczny.
W przeciwieństwie do standardowych modeli językowych, które generują tekst token po tokenie, DiffusionGemma przetwarza bloki 256 tokenów równolegle, podobnie jak modele generujące obrazy wydobywają obraz z szumu. Na akceleratorze Nvidia H100 model osiąga około 1500 tokenów na sekundę.
Google zastosowało dwuetapowy proces treningowy, który równoważy jakość i szybkość. W pierwszej fazie model uczy się rekonstruować zaszumione bloki tekstu z danych przykładowych. Następnie następuje połączona faza uczenia ze wzmocnieniem i destylacji samplera, którą Google nazywa SD·RL.
Według raportu, to połączone podejście podnosi jakość w benchmarkach rozumowania średnio o dziesięć punktów, jednocześnie prawie czterokrotnie zwiększając liczbę tokenów na krok obliczeniowy. Jako efekt uboczny, odpowiedzi DiffusionGemma są około 50% krótsze, co dodatkowo zwiększa szybkość.
Standardowe modele językowe muszą zdecydować o pierwszej cyfrze odpowiedzi, zanim przeanalizują całe rozumowanie. W problemie matematycznym z raportu Gemma 4 zaczyna odpowiedź od „-1”, zdaje sobie sprawę podczas wyprowadzania, że „-25” jest poprawne, i dodaje korektę na końcu. DiffusionGemma rozwija odpowiedź i rozumowanie równolegle, więc może naprawić błędy przed finalizacją wyniku.
Rozwiązywanie Sudoku działa na tej samej zasadzie, ponieważ każdy wpis zależy od wpisów, które pojawiają się później. Strukturalne wyniki jak JSON czy naprawy kodu kończą się po zaledwie dwóch do trzech krokach rafinacji, ponieważ dane wejściowe już określają większość tokenów.
Absolutna wydajność pozostaje niższa niż w modelu bazowym. Google wskazuje kilka przyczyn tego stanu. DiffusionGemma nie był trenowany jako model dyfuzyjny od początku, ale został przekształcony po fakcie. Kolejna faza treningowa była stosunkowo krótka, a drugi etap, SD·RL, priorytetowo traktował szybkość nad szczytową jakością.
Model czasami utyka w pętlach powtórzeń, produkując pojedyncze słowa wielokrotnie z rzędu. To artefakt agresywnie zredukowanych kroków obliczeniowych. Przewaga w szybkości utrzymuje się głównie w scenariuszach jednego użytkownika — gdy około 32 równoczesnych żądań trafia do modelu, standardowe modele językowe dorównują przepustowością.
Google wyraźnie nazywa DiffusionGemma modelem eksperymentalnym i twierdzi, że wydanie ma na celu przyspieszenie badań nad dyfuzją tekstu, dając społeczności podstawę do specjalistycznych, zasobooszczędnych adaptacji. Model jest już wykorzystywany przez startup Interfaze do wielojęzycznego rozpoznawania mowy oraz w projekcie badawczym nad interaktywnym generowaniem raportów radiologicznych.

Startup Mirror Particle odrzuca fine-tuning LLM-ów i buduje własny model świata do przewidywania zachowań konsumentów na TechCrunch Disrupt 2026.

Naukowcy przedstawili wyjaśnialny framework do semantycznej interpretacji nagłówków tabel i oceny jakości danych na potrzeby grafów wiedzy.

Badacze DeepMind proponują „Artificial Symbiotic Intelligence” – sieć ludzi i agentów AI zamiast pojedynczej superinteligencji napędzającej singularity.