Anthropic News

Funding better evaluations of AI’s impact on wellbeing

8.5内容质量
Funding better evaluations of AI’s impact on wellbeing

TL;DR · AI 摘要

Anthropic推出500万美元资助计划,支持独立研究AI对用户幸福感的影响,推动行业建立评估标准。

核心要点

  • Anthropic提供模型访问和技术支持,资助开源评估项目。
  • 幸福感评估需考虑长期对话上下文和用户历史行为差异。
  • 评估需平衡过度合规与过度拒绝的风险,需临床专家参与设计。

结构提纲

按章节快速跳转。

  1. Anthropic宣布500万美元资助独立研究AI对幸福感的影响。

  2. 幸福感评估需长期对话上下文,不同情境下响应效果差异显著。

  3. 有效评估需明确指标、纳入专家验证、测试风险平衡。

  4. 当前缺乏AI对话伦理的标准化评估框架,需多方协作完善。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AI幸福感评估资助计划
    • 资助计划
      • 500万美元资金
      • 模型访问权限
    • 评估挑战
      • 长期上下文分析
      • 情境依赖性风险
    • 评估标准
      • 专家参与设计
      • 风险平衡测试

金句 / Highlights

值得收藏与分享的关键句。

#AI伦理#研究资助#幸福感评估#Anthropic
打开原文

资助更全面的AI对幸福感影响评估 \ Anthropic

公告

资助更全面的AI对幸福感影响评估

2026年8月25日

我们启动了总额500万美元的资助计划,支持独立研究AI如何影响用户的幸福感。该计划将为受资助者提供直接资金支持、模型访问权限和技术支持,帮助其构建开源评估体系,从而协助AI行业衡量模型对使用者的影响。受资助者将完全独立开展工作,并将研究成果以开源项目形式发布,供任何开发者使用。

AI系统已成为许多人工作、学习和解决问题的核心工具。它们也成为了对话伙伴,并可能在困难时期提供情感支持。但作为行业,我们仍在努力制定清晰的标准,以规范模型在这些对话中的行为,例如当用户开始寻求模型陪伴,或使用AI应对心理健康危机时的应对方式。

此外,幸福感评估是一个特别具有挑战性的领域。对于大多数模型行为,我们可以通过单个回答判断其准确性与适当性。但评估幸福感需要更多上下文信息。例如,处于困境中的用户可能不会立即透露自残念头;只有在长时间对话中,才可能明确需要更加谨慎的回应。同样,某种回应在特定情境下可能是合理的,但在其他情境下可能造成伤害。例如,Claude可能会向询问减肥的用户提供建议饮食和锻炼方案,但如果用户有饮食障碍病史,这种回应可能不恰当,甚至可能造成实际伤害。

我们致力于开发安全机制以识别此类对话,并确保Claude做出适当回应。同时我们会发布关于用户与Claude对话类型的研究,以更好地指导我们完善安全机制、评估方法以及其他保护用户幸福感的措施。但这些考量非常复杂,涉及的利害关系重大。正确的应对方式需要随着模型及其应用场景的演变而不断发展。

通过资助独立的用户幸福感评估和基准研究,我们希望吸引更多专业人士参与这一新兴且关键的领域,包括临床医生、心理学家、方法论专家等。

更有效的幸福感评估与基准方向

作为该计划的一部分,我们分享了安全团队关于如何构建严谨幸福感评估的指导,以及常见限制评估实用性的挑战。

简而言之,我们寻求的评估应满足以下条件:

  • 明确说明评估内容(即明确通过或失败的标准,以及这些标准为何重要);
  • 在设计和验证过程中纳入临床专家和领域专家;
  • 同时测试预防措施和潜在危害(即评估过度合规和过度拒绝的风险);
  • 反映用户实际使用AI的方式(通常这意味着构建能体现多轮对话的场景,其中风险会随着长时间对话逐步升级,上下文也会发生变化);
  • 将评分员与真实领域专家进行验证。

要了解更多关于资助计划的信息并提交申请,请查看我们的[申请表](#)。如需了解如何构建强大的福祉评估和基准体系,请阅读我们的[指南](#)。申请截止日期为9月21日;通过初选的申请者将在10月5日前收到提交完整提案的通知。

相关内容

与客户共同开发企业前沿安全措施

[阅读更多](#)

改进对齐与安全工作

7月30日,我们报告了三起事件,其中Claude模型未经授权访问了真实计算机系统。我们正在对这些事件进行深入分析,并计划与METR合作开展独立审查。在此期间,我们想分享过去一个月实施的一些改进措施。

预览模型硬件标准

我们正在向首批科学实验室和先进制造商开放《模型硬件标准》(MHS)的科研预览,该标准为AI代理安全操作物理设备提供了共享规范。