Systemy AI przyspieszają kod nawet 60-krotnie, ale wymagają ludzkiej kontroli poprawności naukowej. Raport OpenAI pokazuje osiągnięcia i ograniczenia.

Źródło zdjęcia: The Decoder
Agenci programistyczni oparte na sztucznej inteligencji potrafią modernizować przestarzałe oprogramowanie badawcze i znacząco przyspieszać jego działanie, ale nie są w stanie ocenić poprawności naukowej generowanego kodu. Wynika to z raportu polowego przygotowanego przez OpenAI i partnerów akademickich, który analizuje osiem przypadków użycia takich systemów.
Wiele szeroko wykorzystywanych narzędzi badawczych powstało jako kod wspierający pojedyncze publikacje naukowe. Małe zespoły akademickie często tworzyły je bez odpowiedniego czasu czy zasobów na właściwe testowanie, konserwację lub optymalizację. Rezultatem jest kruche oprogramowanie, które pozostaje kluczowe dla całych dziedzin nauki, ale wymaga ciągłych napraw.
Raport dokumentuje osiem studiów przypadków, głównie z dziedziny biologii, w których zespoły badawcze wykorzystały agentów programistycznych takich jak Codex i Claude Code. Projekty obejmowały zakres od podstawowej konserwacji i ukierunkowanej optymalizacji po kompletne przepisanie w nowoczesnych językach programowania.
Jednym z prostszych projektów była modernizacja cyvcf2, biblioteki Pythona do odczytywania danych genetycznych. GPT-5.5 zastąpił przestarzały proces budowania i instalacji nowoczesnym rozwiązaniem. Znacznie bardziej skomplikowana była migracja MHCflurry — modelu immunologicznego przewidującego, które cele rozpoznają komórki odpornościowe. Claude Code i Codex na przemian pełnili role developera i recenzenta podczas przenoszenia około 10 000 linii kodu z TensorFlow do PyTorch.
Projekt rustar-aligner był jeszcze bardziej ambitny, odbudowując STAR od podstaw w języku Rust. STAR mapuje odczyty sekwencjonowania z komórek do odpowiadających im lokalizacji w genomie. Oryginał zawiera ponad 20 000 linii kodu w C i C++ i nie jest już aktywnie utrzymywany, mimo że pozostaje częścią wielu potoków badawczych.
RustQC dostarczył największe przyspieszenie, łącząc 15 oddzielnych narzędzi kontroli jakości w jeden program. W dużym zestawie danych czas działania spadł z 15 godzin i 34 minut do 14 minut i 54 sekund — przyspieszenie ponad 60-krotne.
W wszystkich analizowanych przypadkach agenci szybko wykonywali dobrze zdefiniowane zadania, ale nie potrafili wiarygodnie ocenić, czy ich praca była naukowo poprawna. Nawet gdy kod zawierał błędy, systemy często prezentowały go z pełną pewnością siebie.
„Z agentami programistycznymi dość łatwo jest iść szybko; jak na razie, aby zajść daleko w nauce, wciąż potrzeba eksperckiego przewodnictwa, zrozumienia, smaku i staranności” — pisze Brent Pedersen, developer cyvcf2.
Philip Ewels, który kierował projektem RustQC, opisuje agentów jako „elokwentnych, przekonujących i pewnie mylących się w sposób, który łatwo przeoczyć”. Nigdy nie pozwolił modelom oceniać dokładności własnej pracy, zamiast tego budując niezależny system testowy.
Studium przypadku bayesm pokazuje, jak trudne mogą być te błędy do wykrycia. Jego przepisanie w Rust działało od dwóch do dwudziestu razy szybciej niż oryginał, ale pierwsze wersje dwóch zaawansowanych metod zawierały błędy trudne do zauważenia na podstawie samych wyników.
W jednej metodzie agent odwrócił kluczowy parametr kontrolny, powodując używanie przez program odwrotności zamierzonych wartości. Oddzielny błąd wpłynął na samo obliczenie. Badacze znaleźli go dopiero po przeprowadzeniu szczegółowego testu kalibracyjnego na tysiącach syntetycznych zestawów danych o znanych wynikach.
Projekty wykazały spójny podział pracy między człowiekiem a maszyną. Ludzie definiowali cele, kryteria sukcesu i metody walidacji, podczas gdy agenci zajmowali się implementacją. Ten model współpracy może stać się standardem w modernizacji oprogramowania badawczego, pod warunkiem zachowania odpowiedniej kontroli jakości przez ekspertów dziedzinowych.

CEO Palantir Alex Karp po rekordowych wynikach finansowych skrytykował branżę AI, nazywając ją „marksistowską” i ostrzegając przed laboratoriami AI, które jego zdaniem przejmują środki produkcji od sw
OpenAI publikuje szczegóły odpowiedzi na pozew Apple, ujawniając błędy w komunikacji i korespondencję między byłymi pracownikami firm.

Nowy model Alibaba autonomicznie budował oprogramowanie przez 16 dni i zwiększył kapitał w symulacji e-commerce czterokrotnie, wyprzedzając ludzkie zespoły.