30 artykułów z tym tagiem
Model Qwen2.5–14B (9 GB) odpowiedział na 67% pytań z 41 lat Jeopardy!, przewyższając ograniczenia legendarnego superkomputera Watson z 2011 roku.
Badanie pokazuje, że Claude Code i Codex źle szacują czas zadań i przeceniają jakość swojej pracy nawet o 20 punktów procentowych.
LAION opublikował Big Video Dataset — 10 mln godzin wideo z YouTube do badań nad multimodalną sztuczną inteligencją.
Raport Thomson Reuters: 91% profesjonalistów uważa, że ich firma nie osiąga wartości z AI. Kluczem jest walka z 'tool blast' i mocne use case'y.
Praca w JAMA twierdzi, że samodzielna AI przewyższy lekarzy do 2030 roku. AMA i eksperci medyczni ostro polemizują z tą prognozą.
Badanie na zbiorze eICU porównuje LLM i pipeline agentowy w wyjaśnianiu predykcji śmiertelności na OIT – wyniki są niejednoznaczne.
Benchmark RENDER pokazuje, że sposób prezentacji historii rozmowy modelowi LLM zmienia wyniki testów pamięci nawet o 70 punktów.
Nowe badanie pokazuje, że skille pomagają agentom AI głównie przez procedurę działania, nie wiedzę, a duże biblioteki utrudniają ich trafne wyszukanie.
Nowe badanie pokazuje, że modele świata ignorujące ludzkie przekonania i intencje przewidują błędne działania – framework MWM podnosi wynik F1 z 63,3 do 87,9 punktu.
System GxP-Agent koduje procesy regulacyjne jako grafy DAG, osiągając 100% zgodności w programowaniu danych badań klinicznych, gdzie pojedyncze LLM zawodzą całkowicie.
AI Observatory ujawnia, że raporty Anthropic i OpenAI o użyciu AI pokazują tylko część prawdy, ignorując wrażliwe i osobiste zastosowania chatbotów.
Nowa metoda RubricForge redukuje fałszywe zaliczenia nieudanych działań agentów AI, kluczowy problem oceny systemów bez dostępu do nagrody środowiska.