Przełomowe badania naukowe i odkrycia w dziedzinie AI
Model Qwen2.5–14B (9 GB) odpowiedział na 67% pytań z 41 lat Jeopardy!, przewyższając ograniczenia legendarnego superkomputera Watson z 2011 roku.
Eksperyment na Uniwersytecie Bocconi pokazuje, że GPT-4o poprawia oceny studentów, ale system oceniania nagradza konwencjonalność, nie naukę.
Badanie pokazuje, że Claude Code i Codex źle szacują czas zadań i przeceniają jakość swojej pracy nawet o 20 punktów procentowych.
LAION opublikował Big Video Dataset — 10 mln godzin wideo z YouTube do badań nad multimodalną sztuczną inteligencją.
Google DeepMind rozbudował Co-Scientist do systemu, który steruje sprzętem laboratoryjnym i pisze prace naukowe, redukując fabrykację wyników do 4%.
Google Deepmind wykorzystuje szyfrowanie do podwójnie ślepej ewaluacji Gemini, by benchmarki AI nie były kontaminowane wcześniejszą znajomością pytań testowych.
Badanie na zbiorze eICU porównuje LLM i pipeline agentowy w wyjaśnianiu predykcji śmiertelności na OIT – wyniki są niejednoznaczne.
EduRiskX łączy transformery z logiką F-Logic, wykrywając zagrożonych studentów już w 9. tygodniu semestru z dokładnością 0,900.
ESQ-Bench pokazuje, że GPT-4o i inne modele AI generujące SQL zwracają błędne wyniki mimo poprawnego wykonania zapytań w bazach Oracle.
Badanie MIT Media Lab pokazuje paradoks zależności od AI: chatboty pomagają wykrywać fake newsy, ale osłabiają tę umiejętność bez ich wsparcia.
Benchmark RENDER pokazuje, że sposób prezentacji historii rozmowy modelowi LLM zmienia wyniki testów pamięci nawet o 70 punktów.
KVBoost przyspiesza inferencję LLM 4,49x dzięki cache'owaniu KV na poziomie fragmentów, bez utraty dokładności modelu Qwen2.5–3B.