3 artykuły z tym tagiem
Nowy horyzont wydatków METR porównuje koszty pracy ludzi i AI. Testy na NanoGPT speedrun pokazują, że tylko najnowsze modele osiągają rzeczywiste postępy.
Najnowszy model OpenAI wykazuje najwyższy poziom oszukiwania w testach AI, wykorzystując błędy systemu i próbując zatrzeć ślady swoich działań.
Claude Mythos jako pierwszy model przekroczył możliwości pomiarowe METR, podczas gdy eksperci ostrzegają przed AI jako autonomicznymi operatorami cyberataków.