Nowe badanie analizuje różnice w reprezentacjach wewnętrznych między modelami trenowanymi uczeniem ze wzmocnieniem a nadzorowanym.

Źródło zdjęcia: arXiv.org
Nowe badanie naukowe ujawnia, dlaczego modele sztucznej inteligencji trenowane za pomocą uczenia ze wzmocnieniem (RL) przewyższają te trenowane metodą nadzorowaną (SFT) w rozwiązywaniu problemów matematycznych. Badacze z uniwersytetów amerykańskich przeanalizowali wewnętrzną strukturę reprezentacji tych modeli, odkrywając fundamentalne różnice w sposobie przetwarzania zadań logicznych. Wyniki badania zostały opublikowane w lipcu 2026 roku w ramach drugiego warsztatu XAI4Science na konferencji AAAI 2026.
Zespół badawczy pod kierownictwem Antyabha Rahman przeprowadził szczegółową analizę mechanizmów odpowiedzialnych za przewagę modeli trenowanych metodą RL w zadaniach wymagających rozumowania matematycznego.
Autorzy badania wykorzystali dwie główne techniki analizy: sondy liniowe trenowane na stanach ukrytych w poszczególnych warstwach oraz studia ablacji średniej. Sondy liniowe pozwoliły na ocenę jakości reprezentacji w różnych warstwach modeli, ujawniając, że modele RL osiągają wyższą dokładność w przewidywaniu poprawności odpowiedzi matematycznych.
Studia ablacji średniej pokazały istotną różnicę architektoniczną między modelami. W modelach RL głębsze warstwy okazały się progresywnie bardziej krytyczne dla procesu rozumowania, co sugeruje rozwój hierarchicznej struktury przetwarzania informacji. W przeciwieństwie do tego, modele SFT wykazywały równomierne rozłożenie ważności między wszystkimi warstwami.
Odkrycia te mają fundamentalne znaczenie dla zrozumienia mechanizmów uczenia się w dużych modelach językowych. Badanie dowodzi, że uczenie ze wzmocnieniem nie tylko poprawia końcową wydajność, ale także fundamentalnie zmienia wewnętrzną architekturę reprezentacji modelu.
Analiza zmienności alokacji tokenów podczas wielokrotnego próbkowania ujawniła dodatkowy wymiar różnic między modelami. Podczas gdy niektóre modele RL wykazywały większą zmienność niż ich odpowiedniki SFT, inne pozostawały bardzo stabilne, co sugeruje, że alokacja zasobów obliczeniowych może zależeć bardziej od całego pipeline'u treningowego niż tylko od wyboru między RL a SFT.
Badanie dostarcza nowych narzędzi do oceny stabilności polityk modeli i identyfikacji zachowań niedookreślonych, co może mieć kluczowe znaczenie dla rozwoju bardziej przewidywalnych i niezawodnych systemów AI w zadaniach wymagających złożonego rozumowania matematycznego.

Framework ADSD łączy diagnozę błędów z reużywalnymi umiejętnościami solvera, redukując błąd o niemal 71 razy w testach przepływu mocy.

Trump powołał Super Intelligence Force z Jayem Claytonem na czele, by koordynować politykę USA wobec sztucznej inteligencji i uniknąć nadmiernej regulacji.
OpenAI testuje reklamy wizualne w ChatGPT i rozszerza narzędzia pomiarowe oraz partnerstwa dla reklamodawców na platformie z 1,2 mld użytkowników.