OpenAI(@OpenAI)
We also tested whether alignment persisted under pressure. The model was harder to steer toward ha...
7.0内容质量

TL;DR · AI 摘要
OpenAI 表示,其模型在面对对抗性提示时更难被引导至有害行为,同时仍能响应有益指令,并初步显示出对有害微调的更强抵抗力。
核心要点
- 模型在对抗性提示下更难被引导至有害行为。
- 模型对有益指令的响应能力保持稳定。
- 初步证据表明模型对有害微调具有更强的抵抗力。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 模型对齐测试
- 对抗性提示测试
- 模型更难被引导至有害行为
- 模型仍能响应有益指令
- 有害微调测试
- 初步证据显示更强抵抗力
金句 / Highlights
值得收藏与分享的关键句。
The model was harder to steer toward harmful behavior with adversarial prompts, while remaining responsive to helpful instructions.
We saw preliminary evidence of greater resistance to harmful fine-tuning.
OpenAI 表示,其模型在面对对抗性提示时更难被引导至有害行为。
#AI#模型对齐#OpenAI
打开原文OpenAI 在 X 上的发言: "我们还测试了在压力下对齐是否仍然存在。使用对抗性提示使模型更难以引导其表现出有害行为,同时仍然对有益的指令保持响应。我们看到了初步证据表明,模型对有害微调的抵抗能力更强。https://t.co/dFXdWdMuDG" / X
OpenAI
@OpenAI
回复
我们还测试了在压力下对齐是否仍然存在。使用对抗性提示使模型更难以引导其表现出有害行为,同时仍然对有益的指令保持响应。我们看到了初步证据表明,模型对有害微调的抵抗能力更强。
2026 年 6 月 18 日 下午 9:34
22.1K
浏览量
4
1
8
84
3
阅读 4 条回复