45 artykułów z tym tagiem
Eksperyment na Uniwersytecie Bocconi pokazuje, że GPT-4o poprawia oceny studentów, ale system oceniania nagradza konwencjonalność, nie naukę.
Google DeepMind rozbudował Co-Scientist do systemu, który steruje sprzętem laboratoryjnym i pisze prace naukowe, redukując fabrykację wyników do 4%.
EduRiskX łączy transformery z logiką F-Logic, wykrywając zagrożonych studentów już w 9. tygodniu semestru z dokładnością 0,900.
ESQ-Bench pokazuje, że GPT-4o i inne modele AI generujące SQL zwracają błędne wyniki mimo poprawnego wykonania zapytań w bazach Oracle.
Badanie MIT Media Lab pokazuje paradoks zależności od AI: chatboty pomagają wykrywać fake newsy, ale osłabiają tę umiejętność bez ich wsparcia.
KVBoost przyspiesza inferencję LLM 4,49x dzięki cache'owaniu KV na poziomie fragmentów, bez utraty dokładności modelu Qwen2.5–3B.
Badanie opisuje SDAD – ramę procesową łączącą precyzyjne specyfikacje z agentową syntezą kodu i weryfikacją pod nadzorem człowieka.
Nowe badanie ekonomiczne pokazuje, że AI w nauce zwiększa koszt alternatywny czasu badaczy, prowadząc częściej do gorszych, a nie lepszych publikacji.
Naukowcy z MIT wykazali, że przy dużych zbiorach danych treningowych nie da się jednoznacznie przypisać wygenerowanego obrazu do konkretnego dzieła.
Praca pozycyjna proponuje Transition Complexity Profile (TCP) – metrykę mierzącą trudność przewidywania przejść w grach dla modeli AI i RL.
Nowe badanie prezentuje Aegis – system runtime governance, który blokuje ryzykowne akcje agentów AI przed ich wykonaniem, z zerowym wskaźnikiem incydentów w testach.
Badanie MIT CSAIL pokazuje, że przy dużych zbiorach danych pojedynczy obraz treningowy przestaje wpływać na wynik generatora AI — to zjawisko attribution decay.