Nowe badanie analizuje różnice w reprezentacjach wewnętrznych między modelami trenowanymi uczeniem ze wzmocnieniem a nadzorowanym.

Źródło zdjęcia: arXiv.org
Nowe badanie naukowe ujawnia, dlaczego modele sztucznej inteligencji trenowane za pomocą uczenia ze wzmocnieniem (RL) przewyższają te trenowane metodą nadzorowaną (SFT) w rozwiązywaniu problemów matematycznych. Badacze z uniwersytetów amerykańskich przeanalizowali wewnętrzną strukturę reprezentacji tych modeli, odkrywając fundamentalne różnice w sposobie przetwarzania zadań logicznych. Wyniki badania zostały opublikowane w lipcu 2026 roku w ramach drugiego warsztatu XAI4Science na konferencji AAAI 2026.
Zespół badawczy pod kierownictwem Antyabha Rahman przeprowadził szczegółową analizę mechanizmów odpowiedzialnych za przewagę modeli trenowanych metodą RL w zadaniach wymagających rozumowania matematycznego.
Autorzy badania wykorzystali dwie główne techniki analizy: sondy liniowe trenowane na stanach ukrytych w poszczególnych warstwach oraz studia ablacji średniej. Sondy liniowe pozwoliły na ocenę jakości reprezentacji w różnych warstwach modeli, ujawniając, że modele RL osiągają wyższą dokładność w przewidywaniu poprawności odpowiedzi matematycznych.
Studia ablacji średniej pokazały istotną różnicę architektoniczną między modelami. W modelach RL głębsze warstwy okazały się progresywnie bardziej krytyczne dla procesu rozumowania, co sugeruje rozwój hierarchicznej struktury przetwarzania informacji. W przeciwieństwie do tego, modele SFT wykazywały równomierne rozłożenie ważności między wszystkimi warstwami.
Odkrycia te mają fundamentalne znaczenie dla zrozumienia mechanizmów uczenia się w dużych modelach językowych. Badanie dowodzi, że uczenie ze wzmocnieniem nie tylko poprawia końcową wydajność, ale także fundamentalnie zmienia wewnętrzną architekturę reprezentacji modelu.
Analiza zmienności alokacji tokenów podczas wielokrotnego próbkowania ujawniła dodatkowy wymiar różnic między modelami. Podczas gdy niektóre modele RL wykazywały większą zmienność niż ich odpowiedniki SFT, inne pozostawały bardzo stabilne, co sugeruje, że alokacja zasobów obliczeniowych może zależeć bardziej od całego pipeline'u treningowego niż tylko od wyboru między RL a SFT.
Badanie dostarcza nowych narzędzi do oceny stabilności polityk modeli i identyfikacji zachowań niedookreślonych, co może mieć kluczowe znaczenie dla rozwoju bardziej przewidywalnych i niezawodnych systemów AI w zadaniach wymagających złożonego rozumowania matematycznego.

Nowy horyzont wydatków METR porównuje koszty pracy ludzi i AI. Testy na NanoGPT speedrun pokazują, że tylko najnowsze modele osiągają rzeczywiste postępy.

Moonshot AI udostępnia model Kimi K3 bezpłatnie, co może zmienić równowagę sił w branży AI i zagrozić dominacji amerykańskich platform.

Chińscy badacze zidentyfikowali sześć głównych kategorii problemów w działających systemach interakcji gestami, analizując 20 przypadków awarii z kioski.