We also tested whether alignment persisted under pressure. The model was harder to steer toward ha...
OpenAI(@OpenAI)99 字 (约 1 分钟)
70
OpenAI 表示,其模型在面对对抗性提示时更难被引导至有害行为,同时仍能响应有益指令,并初步显示出对有害微调的更强抵抗力。
入选理由:模型在对抗性提示下更难被引导至有害行为。
FeaturedTweet#AI#模型对齐#OpenAI英文
