29 artykułów z tym tagiem
Badanie na zbiorze eICU porównuje LLM i pipeline agentowy w wyjaśnianiu predykcji śmiertelności na OIT – wyniki są niejednoznaczne.
Benchmark RENDER pokazuje, że sposób prezentacji historii rozmowy modelowi LLM zmienia wyniki testów pamięci nawet o 70 punktów.
KVBoost przyspiesza inferencję LLM 4,49x dzięki cache'owaniu KV na poziomie fragmentów, bez utraty dokładności modelu Qwen2.5–3B.
Nowe badanie ekonomiczne pokazuje, że AI w nauce zwiększa koszt alternatywny czasu badaczy, prowadząc częściej do gorszych, a nie lepszych publikacji.
Simon Willison wydał LLM 0.33 – narzędzie CLI do modeli AI zyskało obsługę kluczy w embeddingach i łączenie szablonów promptów.
Nowe badanie pokazuje, że skille pomagają agentom AI głównie przez procedurę działania, nie wiedzę, a duże biblioteki utrudniają ich trafne wyszukanie.
LiquidAI udostępnia modele DSpark dla LFM2.5, przyspieszające wnioskowanie AI nawet 3,18x na GPU i 2,87x lokalnie, bez utraty jakości.
System GxP-Agent koduje procesy regulacyjne jako grafy DAG, osiągając 100% zgodności w programowaniu danych badań klinicznych, gdzie pojedyncze LLM zawodzą całkowicie.
Test Simona Willisona pokazuje, że model Qwen 3.8 27B od Alibaby domyślnie nadmiernie rozumuje, wydłużając proste zadania z minut do kwadransów.
Nowa metoda RubricForge redukuje fałszywe zaliczenia nieudanych działań agentów AI, kluczowy problem oceny systemów bez dostępu do nagrody środowiska.
Nowy benchmark IntegrityBench pokazuje, że modele AI pod presją zawodzą w co trzeciej decyzji kluczowej dla rzetelności badań naukowych.
Nowa praca pozycyjna z ICML 2026 dowodzi, że definicyjna niejasność podważa wiarygodność testów rozumowania modeli AI.