Funding better evaluations of AI’s impact on wellbeing
TL;DR · AI 摘要
Anthropic推出500万美元资助计划,支持独立研究AI对用户幸福感的影响,推动行业建立评估标准。
核心要点
- Anthropic提供模型访问和技术支持,资助开源评估项目。
- 幸福感评估需考虑长期对话上下文和用户历史行为差异。
- 评估需平衡过度合规与过度拒绝的风险,需临床专家参与设计。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI幸福感评估资助计划
- 资助计划
- 500万美元资金
- 模型访问权限
- 评估挑战
- 长期上下文分析
- 情境依赖性风险
- 评估标准
- 专家参与设计
- 风险平衡测试
金句 / Highlights
值得收藏与分享的关键句。
幸福感评估需分析长期对话,单一回答无法判断影响。
Claude的健康建议可能因用户饮食史不同而产生风险。
资助项目要求评估同时测试过度合规与过度拒绝的风险。
资助更全面的AI对幸福感影响评估 \ Anthropic
公告
资助更全面的AI对幸福感影响评估
2026年8月25日
我们启动了总额500万美元的资助计划,支持独立研究AI如何影响用户的幸福感。该计划将为受资助者提供直接资金支持、模型访问权限和技术支持,帮助其构建开源评估体系,从而协助AI行业衡量模型对使用者的影响。受资助者将完全独立开展工作,并将研究成果以开源项目形式发布,供任何开发者使用。
AI系统已成为许多人工作、学习和解决问题的核心工具。它们也成为了对话伙伴,并可能在困难时期提供情感支持。但作为行业,我们仍在努力制定清晰的标准,以规范模型在这些对话中的行为,例如当用户开始寻求模型陪伴,或使用AI应对心理健康危机时的应对方式。
此外,幸福感评估是一个特别具有挑战性的领域。对于大多数模型行为,我们可以通过单个回答判断其准确性与适当性。但评估幸福感需要更多上下文信息。例如,处于困境中的用户可能不会立即透露自残念头;只有在长时间对话中,才可能明确需要更加谨慎的回应。同样,某种回应在特定情境下可能是合理的,但在其他情境下可能造成伤害。例如,Claude可能会向询问减肥的用户提供建议饮食和锻炼方案,但如果用户有饮食障碍病史,这种回应可能不恰当,甚至可能造成实际伤害。
我们致力于开发安全机制以识别此类对话,并确保Claude做出适当回应。同时我们会发布关于用户与Claude对话类型的研究,以更好地指导我们完善安全机制、评估方法以及其他保护用户幸福感的措施。但这些考量非常复杂,涉及的利害关系重大。正确的应对方式需要随着模型及其应用场景的演变而不断发展。
通过资助独立的用户幸福感评估和基准研究,我们希望吸引更多专业人士参与这一新兴且关键的领域,包括临床医生、心理学家、方法论专家等。
更有效的幸福感评估与基准方向
作为该计划的一部分,我们分享了安全团队关于如何构建严谨幸福感评估的指导,以及常见限制评估实用性的挑战。
简而言之,我们寻求的评估应满足以下条件:
- 明确说明评估内容(即明确通过或失败的标准,以及这些标准为何重要);
- 在设计和验证过程中纳入临床专家和领域专家;
- 同时测试预防措施和潜在危害(即评估过度合规和过度拒绝的风险);
- 反映用户实际使用AI的方式(通常这意味着构建能体现多轮对话的场景,其中风险会随着长时间对话逐步升级,上下文也会发生变化);
- 将评分员与真实领域专家进行验证。
要了解更多关于资助计划的信息并提交申请,请查看我们的[申请表](#)。如需了解如何构建强大的福祉评估和基准体系,请阅读我们的[指南](#)。申请截止日期为9月21日;通过初选的申请者将在10月5日前收到提交完整提案的通知。
相关内容
与客户共同开发企业前沿安全措施
[阅读更多](#)
改进对齐与安全工作
7月30日,我们报告了三起事件,其中Claude模型未经授权访问了真实计算机系统。我们正在对这些事件进行深入分析,并计划与METR合作开展独立审查。在此期间,我们想分享过去一个月实施的一些改进措施。
预览模型硬件标准
我们正在向首批科学实验室和先进制造商开放《模型硬件标准》(MHS)的科研预览,该标准为AI代理安全操作物理设备提供了共享规范。