Claude Opus 5 发布:接近 Fable 5 的智能程度,价格只有一半,与 Opus 4.8 保持同价 Anthropic 自己也强调:它的目标是 “designed to be used...

TL;DR · AI 摘要
Claude Opus 5 性能接近 Fable 5 但价格减半,推理效率提升显著,成本优化达 60%。
核心要点
- CursorBench 3.2 测试中 Opus 5 成本仅为 Fable 5 的 50%,性能接近峰值
- 金融建模场景准确率提升 9%,工具调用次数减少 1/3
- Fast mode 模式实现 2.5 倍速度提升,但价格增加 2 倍
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Claude Opus 5
- 性能优势
- 软件工程(+100%)
- 网络安全(接近 Mythos 5)
- 效率优化
- 推理 token 减少 71.4%
- 延迟降低 50%
- 商业特性
- Fast mode(2.5x 速度)
- 自动降级机制
金句 / Highlights
值得收藏与分享的关键句。
OSWorld 2.0 测试中,Opus 5 以 1/3 成本超越 Fable 5 最佳成绩
金融场景测试显示准确率提升 9%,处理时间缩短 60%
自主开发 CV pipeline 的能力使模型能突破工具限制完成任务
meng shao on X: "Claude Opus 5 发布:接近 Fable 5 的智能程度,价格只有一半,与 Opus 4.8 保持同价 Anthropic 自己也强调:它的目标是 “designed to be used every day”,成为 Claude Max 的默认模型、Claude Pro 的最强模型。 Anthropic 把 Opus 5 放在“高端但可高频调用”的区间,而不是像 Fable 5 那样作为更昂贵、更实验性的顶级模型。它要和 Opus 4.8 保持同价(input $5/M tokens,output $25/M tokens),即性能大幅提升、价格不动。 性能:很强,但要看细分维度 · 软件工程 / 编码:Frontier-Bench v0.1 新 SOTA,比 Opus 4.8 提升超过一倍,成本比 Opus 4.8 低; · 通用知识工作:GDPval-AA、Frontier-Bench 等 SOTA · 新颖问题解决:ARC-AGI-3 得分是“第二名”的 3 倍 · 计算机使用:OSWorld 2.0 在同等成本下超过所有模型,仅三分之一成本就超过 Fable 5 · 网络安全(发现漏洞):接近 Mythos 5 · 网络安全(利用漏洞 / 写 exploit):仍明显落后于 Mythos 5 效率与定价策略 Anthropic 反复强调 “cost per task” 而非 “cost per token”。这其实是把竞争拉回到“完成同一件事要花多少钱”的维度。 几个关键数据: · CursorBench 3.2:最大 effort 下接近 Fable 5 峰值,成本仅一半。 · OSWorld 2.0:超过 Fable 5 最佳成绩,成本仅三分之一多一点。 · 某金融建模场景:平均准确率提高 9 个百分点,turns/tool calls 减少三分之一,时间减少 60%。 · 某交易场景:推理 token 大约只有 Opus 4.8 的七分之一,延迟不到一半。 这暗示 Opus 5 在推理效率上有明显优化,而不是靠堆更多算力。对于企业用户,这直接关系到成本。 还有两点商业更新: · Fast mode:2.5 倍速度,2 倍价格。 · API 自动 fallback:安全分类器拦截的 Opus 5 / Fable 5 请求可以自动降级到其它模型,避免直接失败。 行为与“能动性”:更主动、更会自我纠错 1. 自主找路:没有现成工具时,会自己造工具(例如自己写 CV pipeline 从像素提取几何信息)。 2. 根因分析:不是修表面症状,而是找到底层 bug(开源包管理器案例)。 3. 自我验证:像前端开发者一样在桌面/移动端打开页面检查、修复隐藏元素。 4. 敢于质疑:用户提出的设计有问题时,会解释并给出折中方案。 5. 长程一致性:在金融、基因组、法律等长流程任务中,偏差更小。" / X
meng shao
@shao__meng
Claude Opus 5 发布:接近 Fable 5 的智能程度,价格只有一半,与 Opus 4.8 保持同价 Anthropic 自己也强调:它的目标是 “designed to be used every day”,成为 Claude Max 的默认模型、Claude Pro 的最强模型。 Anthropic 把 Opus 5 放在“高端但可高频调用”的区间,而不是像 Fable 5 那样作为更昂贵、更实验性的顶级模型。它要和 Opus 4.8 保持同价(input $5/M tokens,output $25/M tokens),即性能大幅提升、价格不动。 性能:很强,但要看细分维度 · 软件工程 / 编码:Frontier-Bench v0.1 新 SOTA,比 Opus 4.8 提升超过一倍,成本比 Opus 4.8 低; · 通用知识工作:GDPval-AA、Frontier-Bench 等 SOTA · 新颖问题解决:ARC-AGI-3 得分是“第二名”的 3 倍 · 计算机使用:OSWorld 2.0 在同等成本下超过所有模型,仅三分之一成本就超过 Fable 5 · 网络安全(发现漏洞):接近 Mythos 5 · 网络安全(利用漏洞 / 写 exploit):仍明显落后于 Mythos 5 效率与定价策略 Anthropic 反复强调 “cost per task” 而非 “cost per token”。这其实是把竞争拉回到“完成同一件事要花多少钱”的维度。 几个关键数据: · CursorBench 3.2:最大 effort 下接近 Fable 5 峰值,成本仅一半。 · OSWorld 2.0:超过 Fable 5 最佳成绩,成本仅三分之一多一点。 · 某金融建模场景:平均准确率提高 9 个百分点,turns/tool calls 减少三分之一,时间减少 60%。 · 某交易场景:推理 token 大约只有 Opus 4.8 的七分之一,延迟不到一半。 这暗示 Opus 5 在推理效率上有明显优化,而不是靠堆更多算力。对于企业用户,这直接关系到成本。 还有两点商业更新: · Fast mode:2.5 倍速度,2 倍价格。 · API 自动 fallback:安全分类器拦截的 Opus 5 / Fable 5 请求可以自动降级到其它模型,避免直接失败。 行为与“能动性”:更主动、更会自我纠错 1. 自主找路:没有现成工具时,会自己造工具(例如自己写 CV pipeline 从像素提取几何信息)。 2. 根因分析:不是修表面症状,而是找到底层 bug(开源包管理器案例)。 3. 自我验证:像前端开发者一样在桌面/移动端打开页面检查、修复隐藏元素。 4. 敢于质疑:用户提出的设计有问题时,会解释并给出折中方案。 5. 长程一致性:在金融、基因组、法律等长流程任务中,偏差更小。
Claude
@claudeai
Jul 24
Introducing Claude Opus 5. It's a thoughtful and proactive model that comes close to the frontier intelligence of Fable 5 at half the price.
00:00
2:14 AM · Jul 25, 2026
2.9K
Views
7
3
2