Nowa metoda GAD-RL adaptacyjnie reguluje nadzór nauczyciela w treningu modeli OCR, poprawiając wierność transkrypcji na benchmarkach CHAOS-Bench i OmniDocBench.

Źródło zdjęcia: arXiv.org
Nowa metoda GAD-RL ma rozwiązać problem „upiększania” tekstu przez modele wizyjno-językowe podczas rozpoznawania znaków (OCR) — zjawisko, w którym systemy AI zamiast wiernie odczytywać nietypowy tekst ze zdjęcia, zamieniają go na bardziej „sensowne” językowo wersje, co psuje dokładność transkrypcji. Zespół badaczy: Baode Wang, Zuming Huang, Kexuan Ren, Jun Huang i Wei Chu opublikował 29 września 2026 roku pracę opisującą technikę, która adaptacyjnie reguluje nadzór nauczyciela podczas treningu modelu, zamiast stosować go ze stałą siłą niezależnie od postępów ucznia.
W klasycznym podejściu do post-treningu modeli OCR stosuje się kombinację dwóch sygnałów: nagród na poziomie całej sekwencji (task reward) oraz lokalnych wskazówek od „nauczyciela” — modelu referencyjnego, który podaje modelowi uczonemu (studentowi) wzorcowe tokeny do naśladowania. Autorzy pracy zauważają, że te dwa źródła sygnału są komplementarne, ale problem polega na tym, że wskazówki od tego samego, zamrożonego nauczyciela nie pozostają równie przydatne, gdy student robi postępy.
Analiza offline przeprowadzona przez zespół pokazała, że nadzór z fiksowanego nauczyciela staje się z czasem coraz mniej korzystny — zarówno gdy porównuje się różne punkty kontrolne w trakcie treningu, jak i gdy porównuje się grupy odpowiedzi różniące się poziomem nagrody za zadanie. Innymi słowy: im lepszy staje się model, tym mniej wartościowe (a czasem wręcz szkodliwe) stają się wskazówki nauczyciela, który sam się nie zmienia.
To właśnie ta obserwacja stała się punktem wyjścia dla metody GAD-RL (Gated and Attenuated on-policy Distillation), która adaptacyjnie reguluje siłę nadzoru nauczyciela podczas wspólnego post-treningu, w zależności od aktualnych wyników studenta i lokalnych rozkładów odpowiedzi. Zamrożony nauczyciel w tym układzie warunkuje swoje wskazówki na referencyjnych transkrypcjach oraz na prefiksach generowanych już przez samego studenta.
Mechanizm działania opiera się na dwóch filtrach:
Dodatkowo metoda waży tzw. forward KL divergence (miarę rozbieżności między rozkładami prawdopodobieństw nauczyciela i studenta) według prawdopodobieństwa, jakie student przypisuje tokenowi Top-1 wskazanemu przez nauczyciela. Dzięki temu lokalne, pomocnicze aktualizacje wag są łagodzone w sytuacjach, gdy wsparcie studenta dla kandydującego tokenu jest niskie — co ma zapobiegać forsowaniu modelu w stronę wyborów, których sam nie uznaje za prawdopodobne.
Skuteczność podejścia zespół zweryfikował na modelu Qwen3.5–2B. GAD-RL osiągnął 59,92% Micro Recall na benchmarku CHAOS-Bench — teście zaprojektowanym do oceny wierności transkrypcji w warunkach anomalnych lub nietypowych danych tekstowych. To wynik lepszy o 8,45 punktu procentowego od standardowej metody GRPO oraz o 4,43 punktu procentowego od wariantu GRPO+OPD ze stałą wagą destylacji. Na drugim benchmarku, OmniDocBench v1.6, model z GAD-RL uzyskał ogólny wynik 91,18.
Wyniki te wskazują, że dynamiczne, zależne od postępów ucznia regulowanie siły nadzoru nauczyciela może istotnie zwiększać wierność transkrypcji w modelach OCR opartych na architekturach wizyjno-językowych — bez konieczności trenowania osobnego, aktualizowanego nauczyciela dla każdego etapu treningu. Problem „upiększania” tekstu przez AI jest szczególnie istotny w zastosowaniach, w których dokładność odczytu ma krytyczne znaczenie, np. przy digitalizacji dokumentów historycznych, formularzy urzędowych czy danych zawierających nietypowe, ale realne błędy i anomalie w oryginalnym tekście.
Praca pokazuje, że w treningu modeli łączących nagrody sekwencyjne z destylacją od nauczyciela statyczny, niezmienny schemat nadzoru może z czasem stać się przeszkodą, a nie wsparciem — a adaptacyjne, zależne od jakości bieżących odpowiedzi podejście pozwala wyciągnąć z obu sygnałów więcej korzyści przy mniejszym ryzyku degradacji wierności wyjścia modelu.

Anthropic wprowadza Claude Haiku 5.5 z cenami niższymi nawet o 90% i dużym skokiem wydajności, ale niezależne testy ujawniają wysokie zużycie tokenów.

OpenAI wprowadza College Planner w ChatGPT for Teens – narzędzie do śledzenia terminów aplikacji i pomocy finansowej na studia.

Fizyk z Harvardu zbudował BootLoops — open-source'owe narzędzie, które pozwala Claude wykonywać precyzyjne obliczenia naukowe w 18 dziedzinach.