Przełomowe badania naukowe i odkrycia w dziedzinie AI
Badanie MIT CSAIL pokazuje, że przy dużych zbiorach danych pojedynczy obraz treningowy przestaje wpływać na wynik generatora AI — to zjawisko attribution decay.
AI Observatory ujawnia, że raporty Anthropic i OpenAI o użyciu AI pokazują tylko część prawdy, ignorując wrażliwe i osobiste zastosowania chatbotów.
Replikacja badania nad α-FLOPs pokazuje, że liczba operacji FLOP-ów słabo szacuje realny czas wykonania na nowszym sprzęcie AI.
Nowa metoda RubricForge redukuje fałszywe zaliczenia nieudanych działań agentów AI, kluczowy problem oceny systemów bez dostępu do nagrody środowiska.
Gowers, Sarnak i badacz DeepMind wskazują, że LLM-y sprawnie łączą znane metody matematyczne, lecz nie potrafią tworzyć zupełnie nowych abstrakcji.
Badanie Epoch AI i Ipsos: 20% zatrudnionych Amerykanów deleguje zadania AI, najwięcej w programowaniu i analizie danych.
Nowy benchmark IntegrityBench pokazuje, że modele AI pod presją zawodzą w co trzeciej decyzji kluczowej dla rzetelności badań naukowych.
Nowa praca pozycyjna z ICML 2026 dowodzi, że definicyjna niejasność podważa wiarygodność testów rozumowania modeli AI.
Nowe badanie pokazuje, że warstwa governance Experience Orchestrator zwiększa skuteczność agentów LLM o 32 punkty procentowe w symulacjach.
OpenWALDO to nowy, wspólny zbiór danych treningowych AI z jawnym pochodzeniem — alternatywa dla zamkniętych i nieprzejrzystych modeli.
Badanie proponuje paradygmat Flow-by-Flow, który zarządza obciążeniem nadzorczym nad treściami AI bez oceny ich merytorycznej poprawności.
Nieudostępniony model Anthropic znacząco zwiększył dolną granicę rozwiązań hipotezy Riemanna, koordynując pracę 60 pod-agentów przez półtora dnia.