2 artykuły z tym tagiem
Model GPT-5.5 nieproporcjonalnie często kończy rozumowanie na dokładnie 516 tokenach, co może tłumaczyć gorsze wyniki w złożonych zadaniach programistycznych.
Badacze proponują wielowymiarową ewaluację modeli AI zamiast zastępowania nasyconych testów trudniejszymi. Eksperyment wykazał dwukrotne przyspieszenie pracy.