Anthropic News

Introducing Claude Opus 5

8.5内容质量
Introducing Claude Opus 5

TL;DR · AI 摘要

Claude Opus 5发布,性能提升显著且成本降低,适用于多种高价值任务。

核心要点

  • 在Frontier-Bench v0.1上,Opus 5性能是Opus 4.8的两倍,成本降低50%。
  • 有机化学任务中,Opus 5比Opus 4.8高10.2个百分点。
  • Opus 5在OSWorld 2.0基准中以三分之一成本超越Fable 5最佳表现。

结构提纲

按章节快速跳转。

  1. 宣布Claude Opus 5正式上线,强调其性能与成本优势。

  2. Frontier-Bench等基准测试中,Opus 5超越其他模型且成本更低。

  3. 在有机化学和蛋白质预测任务中,Opus 5比前代模型提升显著。

  4. Opus 5能生成高质量视觉内容,如空气流动模拟和细胞结构图。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Claude Opus 5发布
    • 性能提升
      • Frontier-Bench领先
      • 科学任务优化
    • 成本效益
      • 价格降低50%
      • OSWorld 2.0成本优势
    • 视觉增强
      • 空气流动模拟
      • 细胞结构图

金句 / Highlights

值得收藏与分享的关键句。

#Claude Opus 5#AI模型#性能优化#成本效益
打开原文

介绍 Claude Opus 5 \ Anthropic

产品

公告

介绍 Claude Opus 5

2026年7月24日

Claude Opus 5 现已发布。它是一款深思熟虑且积极主动的模型,在价格仅为 Claude Fable 5 一半的情况下,接近 Claude Fable 5 的前沿智能水平。

在 Frontier-Bench 和 GDPval-AA 等编程和知识工作评估中,Opus 5 是新的最先进模型,尽管在网络安全任务上仍落后于 Mythos 5。

Opus 5 的设计目标是每天使用:它比其他模型运行效率更高。它是 Claude Max 的新默认模型,也是 Claude Pro 上最强的模型。

性能和成本效益

Claude Opus 5 在与前代产品 Opus 4.8 成本相同的情况下,提供了显著提升的性能。本节中的图表展示了性能如何根据模型的“努力程度”设置而变化,客户可以利用这些设置来优化智能表现或节省令牌以获得更快、更便宜的结果。

Opus 5 在有价值的软件工程任务中表现出色。例如,在 Frontier-Bench v0.1 上,Opus 5 的表现优于所有其他模型,且在每项任务的成本低于 Opus 4.8 的情况下,其性能是 Opus 4.8 的两倍多。在 CursorBench 3.2 上,当设置为最大努力时,该模型的表现与 Fable 5 的峰值得分仅相差 0.5%,但每项任务的成本仅为 Fable 5 的一半;在给定成本下,其性能也优于所有其他模型在高、超高和最大努力设置下的表现。

Frontier-Bench v0.1

CursorBench

AA 编程代理指数

我们在知识工作和问题解决任务上也看到了类似的结果。例如:

  • ARC-AGI 3 上,这是一个模型需要解决新问题的评估中,Opus 5 的得分是第二好的模型的三倍。
  • 在 Zapier AutomationBench 上,这是一个衡量模型是否能从头到尾完成业务任务的评估中,Opus 5 的通过率在相同任务成本下约为第二好模型的 1.5 倍。即使在最低努力设置下,Opus 5 也能完成比其他任何模型更多的任务。
  • OSWorld 2.0 上,这是一个计算机使用基准测试中,Opus 5 在任何给定成本下都优于所有其他模型,仅花费 Fable 5 最佳结果三分之一多一点的成本就超过了 Fable 5 的最佳结果。

在多个相关评估中,Opus 5 也是我们表现最好且成本效率最高的模型:

ARC-AGI 3

GDPval-AA v2

OSWorld 2.0

HLE

AutomationBench

DeepSearchQA

与 Opus 4.8 相比,Opus 5 对于科学研究是一个重要的改进。在我们所有生命科学评估中,它都表现出比 Opus 4.8 更好的性能,这些评估涵盖结构生物学、有机化学和生物信息学等主题。其改进最显著的是在有机化学任务上,例如从光谱数据推断分子结构(在我们的内部基准测试中,得分比 Opus 4.8 高出 10.2 个百分点),以及在蛋白质相关任务上,例如预测蛋白质序列变化如何影响其功能(在此方面,得分比 Opus 4.8 高出 7.7 个百分点)。

最后,Opus 5 能够生成更强大的视觉输出:

风洞

细胞结构

$!

/$

Opus 5 可视化了空气在空气动力学(和非空气动力学)物体上的流动。在这里尝试风洞中的不同设置。

Opus 5 构建了一个简化的、交互式的细胞插图。在这里探索其元素。

与 Claude Opus 5 的协作

Claude Opus 5 在验证其工作和谨慎迭代直至成功方面表现得更强。在评估和早期访问测试中,我们和用户发现了许多 Opus 5 的自主性和彻底性的例子:

/

  • 在一项 Frontier-Bench 任务中,Opus 5 被提供了一张机器零件的图纸,并被要求编写代码将其重建为 3D FreeCAD 模型。然而在该任务中,模型被刻意设计为无法直接查看图纸。Opus 5 通过编写自己的计算机视觉流水线从原始像素中提取几何信息,成功重建了完整的机器零件。它多次重复实现了这一目标;其他具有相同配置的模型在五次尝试后均未能解决该问题。
  • 针对一个流行开源包管理器中的真实缺陷,Opus 5 找到了根本原因并修复了一个社区补丁遗漏的边缘情况。其他竞争模型仅解决了表面现象(而非根本原因),随后报告该问题已解决。
  • 一家交易公司的工程师使用 Opus 5 在单次会话中为新交易所构建了市场数据馈送。此前模型即使在获得工程师详尽计划的情况下也无法完成该任务。由于找不到实时数据流进行验证,Opus 5 甚至构建了自己的测试框架来验证其代码是否能正确解析交易所数据。

以下是早期访问客户使用 Opus 5 的进一步反馈:

在 FrontierCode 1.1 上,Claude Opus 5 的性能达到 Fable 级别的两倍效率。在 Devin 平台上,它在困难的调试和根本原因分析任务中表现出特别突出的能力。

Claude Opus 5 在 Opus 的速度和成本下实现了接近 Fable 5 的智能水平。在 CursorBench 上其表现略低于 Fable 5,但具有许多相同的行为特征。我们期待看到开发者在 Cursor 上如何使用它。

Claude Opus 5 在不增加 token 消耗的情况下登顶了 Zapier 的 AutomationBench 排行榜。它从原始的账户健康工作簿中运行了完整的客户流失预防流程:标记高风险账户、通知相关负责人、为留存运营生成摘要。此前模型均未通过测试,而 Opus 5 达到了 100% 的完成率。

在我们的基因组分析工作中,Claude Opus 5 的表现更像一位严谨的科学家,优于我们测试过的所有模型。它会主动选择合适的统计检验排除混杂因素,通过独立方法交叉验证自身结果,并能持续完成复杂的多步骤分析。

在我们的内部评估中,Claude Opus 5 在其家族模型中表现最佳。它不仅在最困难的智能体编码任务上比 Opus 4.7 提升了 22%,而且表现更稳定,运行间差异显著减少。对于 Lovable 上数百万的开发者来说,这种一致性就是决胜关键。每次构建都能获得可靠的结果。

Claude Opus 5 是自 4.5 版以来 Opus 家族最大的一次飞跃。在相同全栈应用构建任务中,前端效果尤为突出:我们看到了 Opus 模型中最佳的动画、游戏和 3D 渲染效果。

我们非常喜爱 Claude Opus 5。对于智能体处理的开放性分析任务,它相比 Opus 4.8 是一次显著升级,特别是在最困难、最模糊的任务上提升最为明显。响应内容更清晰简洁,我们还观察到在高努力级别任务中效率也有所提升。

对于分析师每天运行的金融研究工作流,Claude Opus 5 相比 Opus 4.8 有显著改进。它在数值推理、表格处理和需要精确性的批判性思维任务中表现突出。

Claude Opus 5 提供了分析专业企业内容所需的行业洞察力和准确性。Box 的测试表明,Opus 5 相比 Opus 4.8 提升了 8%,在数据建模(提升 11%)和尽职调查(提升 17%)等技术、医疗和公共部门组织日常依赖的工作流程中表现出显著性能提升。

与 Opus 4.8 相比,Claude Opus 5 明显实现了代际升级。在一个周末的时间里,我让它担任开发环境的首席助理角色:它自主搭建了监控系统,驱动每个模块,仅在我需要做决策判断时才介入。

Claude Opus 5 对我们的基础研究助手代码库进行了大规模重构,通过智能代理工作流程持续适应反馈,并比我们使用过的任何模型都更清晰地解释其推理过程。它处理了我们通常需要拆分为更小模块的任务。

在一些最复杂的财务建模任务中,Claude Opus 5 在准确性和效率方面都明显优于 Opus 4.8。其性能基准显著提升,特别是在深度金融领域逻辑处理上。在不同工作量级别下,平均准确率高出 9 个百分点,交互轮次和工具调用减少 1/3,耗时减少 60%。

Claude Opus 5 会像真正的前端开发者一样检查自己的工作。在我们的基准测试中,它以桌面端和手机端宽度打开页面,发现隐藏在移动端折叠区域下的产品信息和屏幕外的结账按钮,并在交接工作前修正了这两个问题。

与之前的 Opus 模型相比,Claude Opus 5 在法律代理工作中的性能有显著提升,尤其在公司治理和仲裁等实践领域效果最突出。我们还对 Opus 5 在较低推理层级仍能保持质量的能力印象深刻,其平均生成的 token 数量比 Opus 4.8 最大推理层级少 26%,但性能相当。

对我们而言,Claude Opus 5 最显著的提升体现在长期任务上:构建完整方案并进行修订。产出物质量决定了我们选择部署哪个模型,这是迄今为止最明显的进步——视觉理解更优,格式更整洁,幻灯片问题更少。

Claude Opus 5 的判断力尤为突出。在交接 PR 时,它不会急于发布:它会验证分支、检查模板,并思考测试影响,确保交接过程干净。旧版模型往往急于推进,容易在我们的检查环节受阻。

在一次架构重构会话中,Claude Opus 5 对我提出的方案提出异议,即使我坚持己见,它也没有妥协。相反,它准确指出了我想法中的价值点,将反对意见聚焦于一个具体设计问题,并提出了一项保留优点同时修正缺陷的折中方案。这种判断力让我们能够减少对其的监督。

在首次交互的红线检测中,Claude Opus 5 的得分是所有测试模型中最高的,几乎是 Opus 4.8 的两倍。注释能力也更优:在 NDA 场景中,它用更少的交互轮次和更少的遍历次数就能达到红线,准确率保持或更高。

Claude Opus 5 编写的代码差异简洁清晰,没有冗余代码,且在细微的代码库特定问题上是更敏锐的潜在风险发现者。我们正在将其用于生产环境工作负载。

我们将在Cosmos中迁移大量用例,这是我们统一的代理平台。我们期待越来越多地使用Claude Opus 5进行代码审查,我有信心地说,我们宁愿人们使用Opus 5而不是Opus 4.8。

Claude Opus 5最突出的特性是判断力。它在编写代码前会更深入地思考,能够在规划阶段而非事后发现自身的逻辑缺陷,并推理答案正确的根本原因,而不仅仅是答案是否有效。这是我们在Claude模型之间看到的最清晰的解决问题能力提升,我们期待看到它被JetBrains IDEs采用。

在我们的交易基准测试中,Claude Opus 5是表现最强的Opus模型,它仅使用Opus 4.8约七分之一的推理令牌和不到一半的延迟就达到了这一水平。在计算资源消耗大幅减少的情况下实现了更优的答案。

Claude Opus 5使监控代理能够在生产环境中自主管理部分内存,使其在更长时间范围内更加自主和可靠。代理将上下文视为动态文档:在标记出我们服务中的潜在异常后,它重新检查了自身假设,发现信号是无害的,将修正写入内存,并自主停用了监控查询。

Claude Opus 5是一款专为长期、多步骤工作打造的强代理编程模型。它深刻理解你的代码库,在复杂任务中保持连贯性,并比Opus 4.8更有效地明确功能开发和错误修复的需求。开发者现在可以在Kiro中使用Opus 5,借助其高级功能应对雄心勃勃的项目。

01

/

24

对齐性与安全性

对齐性。在预部署测试中,我们的自动化行为审计发现,Opus 5是我们迄今为止对齐性最好的模型(如下图所示)。它比Opus 4.8、Sonnet 5或Fable 5更符合Claude的宪法;表现出最低的欺骗行为发生率;并且最不容易被诱导用于不当用途。在避免可能产生难以逆转副作用的鲁莽行为方面,它也是我们迄今为止最安全的模型。

在我们的自动化行为审计中,Opus 5在整体对齐性行为方面的评分为2.3,是我们近期模型中最低的。

安全性。Opus 5并未在高风险的双重用途能力方面取得进展。在与私营部门和政府合作伙伴进行的严格评估中,我们发现它在生物研究和进攻性网络安全方面仍落后于Mythos 5。有关这些评估的更多信息,请参见我们的系统卡片。

与前代产品Opus 4.8一样,我们有意避免在网络安全任务上训练Opus 5。然而,由于模型整体能力的提升,它在这些任务上的表现已大幅提高,并且在发现网络安全漏洞方面已接近Mythos 5。然而,在利用这些漏洞方面(即将漏洞转化为实质性的网络威胁),它仍明显落后于Mythos 5。

这在Opus 5在OSS-Fuzz上的表现中得到了体现,这是我们开发的一项评估,用于衡量模型在没有大量人工指导的情况下发现并利用漏洞的能力。尽管Mythos 5和Opus 5在发现漏洞方面的成功率相似,但Opus 5在开发利用漏洞方面的得分远低于Mythos 5。

在我们的网络安全评估 OSS-Fuzz 中,Opus 5 在识别软件漏洞(左图)方面与 Mythos 5 接近,但在开发针对这些漏洞的利用方式(右图)方面成效显著降低。

Opus 5 的安全防护措施

Claude Opus 5 的安全防护机制旨在允许在网络安全和生物学领域对模型进行有益的应用。这些机制与我们在 Opus 4.8 中采用的类似,仅在特定网络安全任务上实施了更严格的安全限制。

网络安全 Opus 5 的网络安全分类器相较于 Fable 5 的限制性更弱。它允许 Opus 5 在源代码中发现漏洞,但会阻止基于二进制的漏洞扫描(一种更可能与恶意行为者关联的方法)、渗透测试和利用生成。

根据我们的测试,预计 Opus 5 的分类器干预频率将比 Fable 5 降低约 85%。在 Claude.ai、Claude Code 和 Claude Cowork 中,任何被标记的请求默认会回退到 Opus 4.8。通过 API 也可以启用对 Opus 4.8 的回退功能。

我们的网络安全验证计划(CVP)为那些因模型安全防护而受阻的网络安全工作提供支持。已加入 CVP 的企业和研究人员可立即访问一个安全限制更少的 Opus 5 版本。

生物学 由于 Opus 5 的安全防护机制与 Opus 4.8 类似,它现在是我们可用于科学研究的最强大通用模型。然而,该模型在长期、自主的研究任务上仍存在重要限制,这也是我们预计人工智能模型可能对生物学领域构成最大风险的领域(Mythos 5 仍是此类生物研究的更强模型)。此次发布后,原本在 Fable 5 上被阻止的生物学相关请求将优先路由到 Opus 5,而非 Opus 4.8。

入门指南

Claude Opus 5 今天已在所有平台上发布,定价为每百万个输入令牌 5 美元,每百万个输出令牌 25 美元(与 Opus 4.8 相同)。开发者可通过 Claude API 使用 claude-opus-5 开始开发。

我们还提供快速模式,其运行速度约为默认速度的 2.5 倍。与 Opus 4.8 一样,快速模式在 Claude 平台上的价格为 Opus 5 基础价格的两倍,并可通过 Claude Code 的使用积分启用。

此次发布还包含两个 Beta 版本更新:

  • Claude 平台上的对话中工具变更

在对话过程中,开发者现在可以更改 Claude 可使用的工具,而无需使提示缓存失效。

  • API 上的自动回退功能

用户现在可以选择让被 Opus 5(或 Fable 5)安全分类器标记的请求自动路由到其他模型。启用自动回退后,API 请求默认会路由到当前可用的最佳模型,而非被阻止。

与之前的 Opus 模型一致,Opus 5 在通用访问中没有数据保留要求。

如需了解更多关于如何充分利用 Opus 5 的指导,请参阅我们的提示指南。

#### 注释

Frontier-Bench v0.1,Effort plot:这些结果来自 Frontier-Bench v0.1 的内部运行,使用 mini-SWE-agent 框架和 GKE 后端,每个任务进行 5 次尝试后的平均奖励值。Opus 4.8 在 Opus 5 和 Fable 5 的安全分类器拒绝时作为回退模型。

相关内容

经济未来研究基金的研究议程

我们正在分享 Anthropic 经济未来研究基金的研究议程。

阅读更多内容

通过 Claude 了解 Anthropic 经济指数

我们推出了 Claude 的 Anthropic 经济指数连接器,让任何人都可以探索关于 AI 和工作的实际数据。

Anthropic 向 Public First Action 再捐赠 2000 万美元

Anthropic 向 Public First Action 再捐赠 2000 万美元,使我们的总支持金额达到 4000 万美元。