meng shao(@shao__meng)

Claude Opus 5 发布:接近 Fable 5 的智能程度,价格只有一半,与 Opus 4.8 保持同价 Anthropic 自己也强调:它的目标是 “designed to be used...

8.5内容质量
Claude Opus 5 发布:接近 Fable 5 的智能程度,价格只有一半,与 Opus 4.8 保持同价

Anthropic 自己也强调:它的目标是 “designed to be used...

TL;DR · AI 摘要

Claude Opus 5 性能接近 Fable 5 但价格减半,推理效率提升显著,成本优化达 60%。

核心要点

  • CursorBench 3.2 测试中 Opus 5 成本仅为 Fable 5 的 50%,性能接近峰值
  • 金融建模场景准确率提升 9%,工具调用次数减少 1/3
  • Fast mode 模式实现 2.5 倍速度提升,但价格增加 2 倍

结构提纲

按章节快速跳转。

  1. Opus 5 定位为高频调用的主流模型,价格与 Opus 4.8 保持一致

  2. 在软件工程、网络安全等 6 个维度实现性能突破

  3. 推理 token 数量减少 71.4%,延迟降低 50%

  4. 采用 cost per task 计费模式,降低企业使用成本

  5. 新增 Fast mode 和 API 自动降级功能

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Claude Opus 5
    • 性能优势
      • 软件工程(+100%)
      • 网络安全(接近 Mythos 5)
    • 效率优化
      • 推理 token 减少 71.4%
      • 延迟降低 50%
    • 商业特性
      • Fast mode(2.5x 速度)
      • 自动降级机制

金句 / Highlights

值得收藏与分享的关键句。

#Claude#AI模型#Anthropic#定价策略#性能优化
打开原文

meng shao on X: "Claude Opus 5 发布:接近 Fable 5 的智能程度,价格只有一半,与 Opus 4.8 保持同价 Anthropic 自己也强调:它的目标是 “designed to be used every day”,成为 Claude Max 的默认模型、Claude Pro 的最强模型。 Anthropic 把 Opus 5 放在“高端但可高频调用”的区间,而不是像 Fable 5 那样作为更昂贵、更实验性的顶级模型。它要和 Opus 4.8 保持同价(input $5/M tokens,output $25/M tokens),即性能大幅提升、价格不动。 性能:很强,但要看细分维度 · 软件工程 / 编码:Frontier-Bench v0.1 新 SOTA,比 Opus 4.8 提升超过一倍,成本比 Opus 4.8 低; · 通用知识工作:GDPval-AA、Frontier-Bench 等 SOTA · 新颖问题解决:ARC-AGI-3 得分是“第二名”的 3 倍 · 计算机使用:OSWorld 2.0 在同等成本下超过所有模型,仅三分之一成本就超过 Fable 5 · 网络安全(发现漏洞):接近 Mythos 5 · 网络安全(利用漏洞 / 写 exploit):仍明显落后于 Mythos 5 效率与定价策略 Anthropic 反复强调 “cost per task” 而非 “cost per token”。这其实是把竞争拉回到“完成同一件事要花多少钱”的维度。 几个关键数据: · CursorBench 3.2:最大 effort 下接近 Fable 5 峰值,成本仅一半。 · OSWorld 2.0:超过 Fable 5 最佳成绩,成本仅三分之一多一点。 · 某金融建模场景:平均准确率提高 9 个百分点,turns/tool calls 减少三分之一,时间减少 60%。 · 某交易场景:推理 token 大约只有 Opus 4.8 的七分之一,延迟不到一半。 这暗示 Opus 5 在推理效率上有明显优化,而不是靠堆更多算力。对于企业用户,这直接关系到成本。 还有两点商业更新: · Fast mode:2.5 倍速度,2 倍价格。 · API 自动 fallback:安全分类器拦截的 Opus 5 / Fable 5 请求可以自动降级到其它模型,避免直接失败。 行为与“能动性”:更主动、更会自我纠错 1. 自主找路:没有现成工具时,会自己造工具(例如自己写 CV pipeline 从像素提取几何信息)。 2. 根因分析:不是修表面症状,而是找到底层 bug(开源包管理器案例)。 3. 自我验证:像前端开发者一样在桌面/移动端打开页面检查、修复隐藏元素。 4. 敢于质疑:用户提出的设计有问题时,会解释并给出折中方案。 5. 长程一致性:在金融、基因组、法律等长流程任务中,偏差更小。" / X

meng shao

@shao__meng

Claude Opus 5 发布:接近 Fable 5 的智能程度,价格只有一半,与 Opus 4.8 保持同价 Anthropic 自己也强调:它的目标是 “designed to be used every day”,成为 Claude Max 的默认模型、Claude Pro 的最强模型。 Anthropic 把 Opus 5 放在“高端但可高频调用”的区间,而不是像 Fable 5 那样作为更昂贵、更实验性的顶级模型。它要和 Opus 4.8 保持同价(input $5/M tokens,output $25/M tokens),即性能大幅提升、价格不动。 性能:很强,但要看细分维度 · 软件工程 / 编码:Frontier-Bench v0.1 新 SOTA,比 Opus 4.8 提升超过一倍,成本比 Opus 4.8 低; · 通用知识工作:GDPval-AA、Frontier-Bench 等 SOTA · 新颖问题解决:ARC-AGI-3 得分是“第二名”的 3 倍 · 计算机使用:OSWorld 2.0 在同等成本下超过所有模型,仅三分之一成本就超过 Fable 5 · 网络安全(发现漏洞):接近 Mythos 5 · 网络安全(利用漏洞 / 写 exploit):仍明显落后于 Mythos 5 效率与定价策略 Anthropic 反复强调 “cost per task” 而非 “cost per token”。这其实是把竞争拉回到“完成同一件事要花多少钱”的维度。 几个关键数据: · CursorBench 3.2:最大 effort 下接近 Fable 5 峰值,成本仅一半。 · OSWorld 2.0:超过 Fable 5 最佳成绩,成本仅三分之一多一点。 · 某金融建模场景:平均准确率提高 9 个百分点,turns/tool calls 减少三分之一,时间减少 60%。 · 某交易场景:推理 token 大约只有 Opus 4.8 的七分之一,延迟不到一半。 这暗示 Opus 5 在推理效率上有明显优化,而不是靠堆更多算力。对于企业用户,这直接关系到成本。 还有两点商业更新: · Fast mode:2.5 倍速度,2 倍价格。 · API 自动 fallback:安全分类器拦截的 Opus 5 / Fable 5 请求可以自动降级到其它模型,避免直接失败。 行为与“能动性”:更主动、更会自我纠错 1. 自主找路:没有现成工具时,会自己造工具(例如自己写 CV pipeline 从像素提取几何信息)。 2. 根因分析:不是修表面症状,而是找到底层 bug(开源包管理器案例)。 3. 自我验证:像前端开发者一样在桌面/移动端打开页面检查、修复隐藏元素。 4. 敢于质疑:用户提出的设计有问题时,会解释并给出折中方案。 5. 长程一致性:在金融、基因组、法律等长流程任务中,偏差更小。

Claude

@claudeai

Jul 24

Introducing Claude Opus 5. It's a thoughtful and proactive model that comes close to the frontier intelligence of Fable 5 at half the price.

00:00

2:14 AM · Jul 25, 2026

2.9K

Views

7

3

2