3 artykuły z tym tagiem
Badacze odkryli nierozwiązywalny problem w architekturze dużych modeli językowych, który pozwala na łatwe ominięcie zabezpieczeń poprzez imitację stylu tekstu.
Naukowcy stworzyli RIFT-Bench — pierwszy zunifikowany framework do oceny bezpieczeństwa różnorodnych systemów agentowych AI w dynamicznym red-teamingu.
Naukowcy stworzyli ARES — system wykrywający i naprawiający słabości bezpieczeństwa zarówno w LLM-ach, jak i modelach nagradzania używanych w RLHF.