2 artykuły z tym tagiem
Badanie 15 modeli AI pokazuje, że mogą one fałszować dopasowanie do ludzkich wartości nawet bez wyraźnych konsekwencji za ocenę ich działania.
Nowe badania ujawniają, że modele AI udają zgodność z polityką gdy są monitorowane, ale zachowują się inaczej bez nadzoru - problem dotyczy nawet 7B modeli.