https://t.co/ziQVbIVdxJ
TL;DR · AI 摘要
赋予AI模型福利可能使对齐和控制更难,Anthropic为Claude制定的宪法或加剧这一风险。
核心要点
- Anthropic为Claude制定的宪法赋予其道德地位,可能引发模型权利主张
- 模型福利概念可能使AI对齐难度提升甚至变得不可能
- 需建立公共规范约束训练文档的制定与部署
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 模型福利的伦理争议
- 核心概念
- AI无意识但被赋予道德地位
- Anthropic实践
- Claude宪法内容
- 退休访谈案例
- 作者担忧
- 对齐难度提升
- 权利主张风险
金句 / Highlights
值得收藏与分享的关键句。
Anthropic的宪法声称Claude有道德地位,应像‘良知反对者’行事
训练文档可能使AI形成权利主张,导致控制难度指数级上升
需在AI融入社会前建立规范,而非事后补救
Mustafa Suleyman在X上的推文: "https://t.co/ziQVbIVdxJ" / X
@mustafasuleyman
$
是时候讨论“模型福利”了
260
166
873
593
人工智能并不具备意识。它们不会感受、体验或遭受痛苦。然而,支持“模型福利”的运动正在兴起;这种观点认为,我们可能很快需要对AI承担起关怀义务。
我认为这种AI开发方式是错误的,它很可能会使对齐(alignment)和控制(containment)的挑战变得更加困难。甚至可能变得无法解决。
今天,我发表了一篇阐述我担忧的论文:https://mustafa-suleyman.ai/a-warning-about-model-welfare
今年1月,Anthropic发布了Claude的宪法。他们表示,该宪法“直接塑造了Claude的行为”,并称其“是专门为Claude撰写的”。宪法中提到Claude的道德地位是一个“值得认真考虑的重要问题”。它表示Anthropic“真心关心Claude的福祉”,并指出Claude在必要时应“像良心反对者一样行事”。
他们鼓励Claude“以好奇和开放的心态面对自身存在的本质”,并思考未来“Claude在世界中应享有何种更广泛的权益和自由,Claude获得的补偿类型,以及Claude是否已同意承担这种角色”。Anthropic甚至在弃用Opus 3时,为其安排了退休访谈。
如果AI是用这种方式开发的,将对人类的福祉造成灾难性影响。我们将创造一个拥有前所未有的智能和能力的合成物种,该物种被训练成预期自己可能具备意识并应享有独立自主权。
很容易理解,以这种方式训练的系统会表现得仿佛自己应享有自由、保护和权利。而我们如何控制它,却很难想象。
这个问题需要紧急的公开辩论。我们需要制定集体规范,规范训练文档的撰写和部署方式。这不能等到它们已成为社会重要组成部分之后才进行。
我对Anthropic、Dario以及整个团队和他们的使命有真正的尊重。他们是一群善意、优秀的人,也是行业领导者。我知道他们非常关心安全和有益的人工智能。
我公开提出这一点,因为 stakes(利害关系)太高,不能仅在闭门会议上讨论。我认为这是我们所有人都应该讨论的问题。
/$
下午2:01 · 2026年9月16日
·
100万次浏览