52 artykuły z tym tagiem
Model Qwen2.5–14B (9 GB) odpowiedział na 67% pytań z 41 lat Jeopardy!, przewyższając ograniczenia legendarnego superkomputera Watson z 2011 roku.
Badanie na zbiorze eICU porównuje LLM i pipeline agentowy w wyjaśnianiu predykcji śmiertelności na OIT – wyniki są niejednoznaczne.
ESQ-Bench pokazuje, że GPT-4o i inne modele AI generujące SQL zwracają błędne wyniki mimo poprawnego wykonania zapytań w bazach Oracle.
Benchmark RENDER pokazuje, że sposób prezentacji historii rozmowy modelowi LLM zmienia wyniki testów pamięci nawet o 70 punktów.
Tajemniczy model Ox Alpha wywołał falę spekulacji o autorstwie – podejrzenia padają na chińskie GLM i model MAI Microsoftu.
Badanie opisuje SDAD – ramę procesową łączącą precyzyjne specyfikacje z agentową syntezą kodu i weryfikacją pod nadzorem człowieka.
Nowe badanie ekonomiczne pokazuje, że AI w nauce zwiększa koszt alternatywny czasu badaczy, prowadząc częściej do gorszych, a nie lepszych publikacji.
Dane OpenRouter pokazują, że zużycie tokenów przez agentów AI wzrosło 14-krotnie od lutego 2026, wyprzedzając wzrost zużycia przez ludzi.
Simon Willison wydał LLM 0.33 – narzędzie CLI do modeli AI zyskało obsługę kluczy w embeddingach i łączenie szablonów promptów.
Nowe badanie pokazuje, że modele świata ignorujące ludzkie przekonania i intencje przewidują błędne działania – framework MWM podnosi wynik F1 z 63,3 do 87,9 punktu.
Ponad milion użytkowników LinkedIn kliknęło przycisk oznaczający posty jako AI slop, a wyświetlenia takich treści spadły o 40 procent.
Anthropic i inne firmy AI kupują i niszczą miliony książek po zeskanowaniu do treningu modeli. Anna's Archive apeluje o pomoc wolontariuszy.