27 artykułów z tym tagiem
Model Qwen2.5–14B (9 GB) odpowiedział na 67% pytań z 41 lat Jeopardy!, przewyższając ograniczenia legendarnego superkomputera Watson z 2011 roku.
Google DeepMind rozbudował Co-Scientist do systemu, który steruje sprzętem laboratoryjnym i pisze prace naukowe, redukując fabrykację wyników do 4%.
Google Deepmind wykorzystuje szyfrowanie do podwójnie ślepej ewaluacji Gemini, by benchmarki AI nie były kontaminowane wcześniejszą znajomością pytań testowych.
ESQ-Bench pokazuje, że GPT-4o i inne modele AI generujące SQL zwracają błędne wyniki mimo poprawnego wykonania zapytań w bazach Oracle.
Benchmark RENDER pokazuje, że sposób prezentacji historii rozmowy modelowi LLM zmienia wyniki testów pamięci nawet o 70 punktów.
Nowe badanie pokazuje, że modele świata ignorujące ludzkie przekonania i intencje przewidują błędne działania – framework MWM podnosi wynik F1 z 63,3 do 87,9 punktu.
Praca pozycyjna proponuje Transition Complexity Profile (TCP) – metrykę mierzącą trudność przewidywania przejść w grach dla modeli AI i RL.
Qwen 3.8 27B osiąga 52 punkty w Artificial Analysis Intelligence Index, dorównując GPT-5.6 Luna mimo dużo mniejszej liczby parametrów.
Nowa metoda RubricForge redukuje fałszywe zaliczenia nieudanych działań agentów AI, kluczowy problem oceny systemów bez dostępu do nagrody środowiska.
Nowy benchmark IntegrityBench pokazuje, że modele AI pod presją zawodzą w co trzeciej decyzji kluczowej dla rzetelności badań naukowych.
Nowa praca pozycyjna z ICML 2026 dowodzi, że definicyjna niejasność podważa wiarygodność testów rozumowania modeli AI.
Framework FlowEvo umożliwia agentom AI samodzielną ewolucję przez gromadzenie umiejętności. Osiąga 82,8% skuteczności przy dwukrotnie mniejszych kosztach.