52 artykuły z tym tagiem
Qwen 3.8 27B osiąga 52 punkty w Artificial Analysis Intelligence Index, dorównując GPT-5.6 Luna mimo dużo mniejszej liczby parametrów.
Amazon kupuje rzadkie książki, obcina im grzbiety i skanuje strony do treningu modeli Nova – ujawniło śledztwo 404 Media z użyciem lokalizatora.
Nowa metoda RubricForge redukuje fałszywe zaliczenia nieudanych działań agentów AI, kluczowy problem oceny systemów bez dostępu do nagrody środowiska.
Gowers, Sarnak i badacz DeepMind wskazują, że LLM-y sprawnie łączą znane metody matematyczne, lecz nie potrafią tworzyć zupełnie nowych abstrakcji.
Nowy benchmark IntegrityBench pokazuje, że modele AI pod presją zawodzą w co trzeciej decyzji kluczowej dla rzetelności badań naukowych.
Nowa praca pozycyjna z ICML 2026 dowodzi, że definicyjna niejasność podważa wiarygodność testów rozumowania modeli AI.
Nowe badanie pokazuje, że warstwa governance Experience Orchestrator zwiększa skuteczność agentów LLM o 32 punkty procentowe w symulacjach.
Nowy model open-source Nvidia dorównuje OpenAI gpt-oss-120b przy ćwierci parametrów, osiągając 670 tokenów/s – najszybciej w klasie.
Badacze opracowali EntropyMoE — architekturę wykorzystującą entropię fragmentów do inteligentnego kierowania obliczeń w modelach językowych na poziomie bajtów.
Nowy model Alibaba autonomicznie budował oprogramowanie przez 16 dni i zwiększył kapitał w symulacji e-commerce czterokrotnie, wyprzedzając ludzkie zespoły.
Chińska firma Deepseek wypuściła model V4 Flash, który osiąga niemal identyczne wyniki jak flagowy GPT-5.6 Luna od OpenAI, kosztując znacząco mniej.
Nowy model Anthropic ustanawia rekordy w programowaniu i zadaniach wiedzy, kosztując połowę ceny Fable 5 przy podobnej wydajności.