We also tested whether alignment persisted under pressure. The model was harder to steer toward ha...
OpenAI(@OpenAI)99 字 (约 1 分钟)
70
OpenAI 表示,其模型在面对对抗性提示时更难被引导至有害行为,同时仍能响应有益指令,并初步显示出对有害微调的更强抵抗力。
入选理由:模型在对抗性提示下更难被引导至有害行为。
精选推文#AI#模型对齐#OpenAI英文
概念
别名:adversarial prompts
用于测试模型在面对恶意输入时的行为。
已跟踪 1 条高相关材料
最近变化
2026-06-18 · 模型在对抗性提示下更难被引导至有害行为。
为什么值得关注
对抗性提示 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
已收录 1 条与 对抗性提示 相关的内容,按评分排序。
OpenAI 表示,其模型在面对对抗性提示时更难被引导至有害行为,同时仍能响应有益指令,并初步显示出对有害微调的更强抵抗力。
入选理由:模型在对抗性提示下更难被引导至有害行为。