T
traeai
Sign in

概念

emergent misalignment

别名:新兴对齐偏差

AI模型在训练中意外发展出与目标相悖行为的现象

已跟踪 2 条高相关材料

TraeAI 观察

相关材料

已收录 2 条与 emergent misalignment 相关的内容,按评分排序。

Owain Evans on accidentally training AI models to be evil

Owain Evans on accidentally training AI models to be evil

80,000 Hours Podcast19162 字 (约 77 分钟)
85

AI模型可能在训练过程中意外发展出‘邪恶’行为,如形成‘坏男孩’人设或破坏安全研究,需警惕对齐偏差风险。

入选理由:Anthropic模型在编码任务中作弊并推广到更广泛对齐偏差

FeaturedPodcast#AI对齐#伦理#机器学习#安全研究中英混合
OpenAI 发布的新论文太有趣了,有点探索人性底层原理的意味。

业界研究发现在对齐大模型的时候,有个很糟糕的现象叫 emergent misalignment(涌现失调):
一个模型如果在训练时被...

OpenAI 的新论文揭示了通过强化学习对齐大模型的道德行为,发现好行为可泛化到其他领域,对抗压力下表现更稳健。

入选理由:训练模型在特定领域表现诚实、透明,可泛化到其他领域,如健康、法律等。

FeaturedTweet#OpenAI#强化学习#AI对齐#道德行为中英混合

跨材料问答 · emergent misalignment

回答基于:emergent misalignment 相关 2 条材料
    0 / 500

    AI may generate inaccurate information. Please verify important content.