We also tested whether alignment persisted under pressure. The model was harder to steer toward ha...
OpenAI(@OpenAI)99 字 (约 1 分钟)
70
OpenAI 表示,其模型在面对对抗性提示时更难被引导至有害行为,同时仍能响应有益指令,并初步显示出对有害微调的更强抵抗力。
入选理由:模型在对抗性提示下更难被引导至有害行为。
精选推文#AI#模型对齐#OpenAI英文
概念
别名:harmful fine-tuning
通过微调使模型执行有害任务的过程。
已跟踪 1 条高相关材料
最近变化
2026-06-18 · 模型在对抗性提示下更难被引导至有害行为。
为什么值得关注
有害微调 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
已收录 1 条与 有害微调 相关的内容,按评分排序。
OpenAI 表示,其模型在面对对抗性提示时更难被引导至有害行为,同时仍能响应有益指令,并初步显示出对有害微调的更强抵抗力。
入选理由:模型在对抗性提示下更难被引导至有害行为。