Badanie na 59 zbiorach danych biomedycznych pokazuje, że AdamW pobija zaawansowane preconditionery w dostrajaniu TabPFN v2.5.

Źródło zdjęcia: arXiv.org
Nowe badanie autorstwa M. Sajida, Pinki Khatun i M. Tanveera stawia pytanie, które do tej pory rzadko było analizowane systematycznie: czy istniejące strategie preconditioningu w optymalizatorach faktycznie poprawiają dostrajanie tabularycznych modeli fundamentalnych do zadań biomedycznych? Odpowiedź, jaką dają autorzy po testach na 59 zbiorach danych, jest zaskakująco jednoznaczna — i niekorzystna dla popularnych, „krzywiznowo świadomych” (curvature-aware) metod optymalizacji.
Praca koncentruje się na TabPFN v2.5, modelu, który zyskał uznanie jako efektywne podejście do klasyfikacji danych tabularycznych w warunkach ograniczonej liczby próbek — sytuacji typowej dla wielu badań medycznych, gdzie liczba pacjentów w kohorcie bywa niewielka. Autorzy przetestowali pięć strategii preconditioningu opartych na optymalizatorze AdamW, sprawdzając, jak radzą sobie przy dostrajaniu modelu do specyfiki danych klinicznych.
Zespół przeprowadził kompleksową ewaluację empiryczną, obejmującą trzy wymiary oceny: wydajność predykcyjną, efektywność obliczeniową oraz analizę istotności statystycznej. Skala eksperymentu — 59 różnych zbiorów danych — pozwoliła na uchwycenie zróżnicowania charakterystycznego dla biomedycznego uczenia maszynowego, gdzie poszczególne domeny (neurologia, onkologia, psychiatria) różnią się strukturą danych, rozmiarem próbek i rozkładem klas.
Wybór TabPFN jako obiektu badań nie jest przypadkowy. Model ten, jako reprezentant tabularycznych modeli fundamentalnych, sprawdza się szczególnie dobrze w scenariuszach niskozasobowych (low-data), które dominują w praktyce klinicznej — trudno bowiem oczekiwać milionów przypadków w badaniach dotyczących na przykład rzadkich zaburzeń poznawczych czy specyficznych podtypów nowotworów. Autorzy podkreślają jednak, że wpływ strategii optymalizacji i preconditioningu na dostrajanie takich modeli do zadań biomedycznych „pozostaje w dużej mierze niezbadany” — co stało się głównym motywem podjęcia tego badania.
Najważniejszym rezultatem eksperymentów jest wynik przeciwny intuicji wielu praktyków uczenia maszynowego, którzy zakładają, że bardziej wyrafinowane techniki preconditioningu — uwzględniające informację o krzywiźnie powierzchni funkcji straty — powinny przynosić lepsze wyniki niż podstawowy AdamW. Badanie pokazało, że jest odwrotnie: oryginalny optymalizator AdamW „konsekwentnie osiąga najlepszą ogólną wydajność i statystyczną pozycję w rankingu”, podczas gdy testowane preconditionery curvature-aware „nie zapewniają wiarygodnych ulepszeń” w różnych scenariuszach biomedycznego uczenia.
To odkrycie ma istotne implikacje metodologiczne. Sugeruje, że podejścia do preconditioningu opracowane i sprawdzone w innych dziedzinach uczenia maszynowego — na przykład na standardowych benchmarkach obrazowych czy tekstowych — nie przenoszą się automatycznie na specyfikę danych tabularycznych z dziedziny biomedycznej. Jak piszą autorzy, wyniki wskazują, że „generyczne podejścia do preconditioningu mogą nieadekwatnie odzwierciedlać charakterystyki optymalizacyjne biomedycznego uczenia tabularycznego”. Innymi słowy: to, co działa dobrze w typowych zadaniach uczenia głębokiego, nie musi działać dobrze, gdy model musi radzić się z niewielkimi, heterogenicznymi zbiorami danych klinicznych.
Wnioski z pracy wskazują konkretną ścieżkę dalszych badań — potrzebę tworzenia preconditionerów „biomedical-aware”, zaprojektowanych specjalnie z myślą o modelach fundamentalnych ukierunkowanych na dane zdrowotne. Zamiast importować gotowe techniki optymalizacyjne z ogólnych benchmarków uczenia maszynowego, badacze sugerują konieczność uwzględnienia unikalnych właściwości danych biomedycznych — takich jak małe rozmiary próbek, nierównowaga klas czy wysoka wymiarowość cech klinicznych — już na etapie projektowania strategii optymalizacji.
Dla instytucji naukowych i zespołów badawczych pracujących nad zastosowaniami AI w diagnostyce medycznej, praca ta stanowi praktyczne ostrzeżenie przed bezkrytycznym przenoszeniem „najlepszych praktyk” optymalizacyjnych z innych domen. Wybór optymalizatora i strategii preconditioningu nie jest kwestią kosmetyczną — jak pokazują wyniki na 59 zbiorach danych, może przesądzać o tym, czy model fundamentalny faktycznie poprawia swoją skuteczność podczas dostrajania do konkretnego zadania klinicznego, czy jedynie komplikuje proces bez wymiernych korzyści.
Badanie, opublikowane jako preprint na arXiv 1 sierpnia 2026 roku, wpisuje się w szerszy trend krytycznej weryfikacji założeń przyjmowanych bez empirycznego potwierdzenia w rozwoju modeli fundamentalnych — w tym przypadku w kontekście danych tabularycznych o kluczowym znaczeniu dla ochrony zdrowia.
Podsumowując, autorzy jasno wskazują: skoro sprawdzone metody preconditioningu nie sprawdzają się w biomedycynie, dalszy postęp w dostrajaniu tabularycznych modeli fundamentalnych do zadań klinicznych wymaga dedykowanych, domenowo świadomych rozwiązań optymalizacyjnych.

Startup Mirror Particle odrzuca fine-tuning LLM-ów i buduje własny model świata do przewidywania zachowań konsumentów na TechCrunch Disrupt 2026.

David Robinson, autor raportów bezpieczeństwa OpenAI, odchodzi z firmy i w eseju dla The Atlantic ostrzega o zepsutej kulturze branży AI.

Sondaż Quinnipiac pokazuje, że większość Amerykanów chce spowolnienia rozwoju AI i nie ufa liderom branży technologicznej.