Claude Opus 4.8: "a modest but tangible improvement"

TL;DR · AI 摘要
Claude Opus 4.8 提升了模型的诚实性,减少错误率,并引入了中会话系统消息功能。
核心要点
- Claude Opus 4.8 的错误率比前代降低约 4 倍。
- 新增中会话系统消息功能,允许动态更新指令而不重置系统提示。
- 最低可缓存提示长度从 4,096 降至 1,024 tokens,优化性能与成本。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Claude Opus 4.8
金句 / Highlights
值得收藏与分享的关键句。
Claude Opus 4.8 is around four times less likely than its predecessor to allow flaws in code it has written to pass unremarked.
Claude Opus 4.8 accepts `role: "system"` messages immediately after a user turn in the `messages` array.
The minimum cacheable prompt length on Claude Opus 4.8 is 1,024 tokens, lower than on Claude Opus 4.7.
2026年5月28日
Anthropic 今天发布了 Claude Opus 4.8。我最喜欢的是发布说明中的这段话:
用户会发现 Opus 4.8 是对其前代产品的适度但显著的改进。还有更多的工作要做:我们正在开发和发布功能与 Opus 类似但成本更低的模型。
看到一家 AI 实验室诚实地将发布描述为对前代模型的小幅增量改进,真是令人耳目一新!
诚实似乎是这次发布的一个主题。以下是我从公告中找到的另一段最喜欢的内容:
Opus 4.8 最显著的改进之一是它的 _诚实性_。我们训练所有模型保持诚实——例如,避免做出无法支持的断言。然而,AI 模型的一个普遍问题是,它们有时会过早下结论,自信地声称在证据不足的情况下取得了进展。早期测试者报告称,Opus 4.8 更有可能指出其工作中的不确定性,并且更少做出没有依据的断言。这一点在 我们的评估 中得到了验证,结果显示 Opus 4.8 比其前代产品允许代码缺陷未被注意的可能性低了大约四倍。
链接的系统卡片中还包括以下内容:
Claude Opus 4.8 在所有六个模型的基准测试中错误率最低——这是对事实幻觉最直接的衡量标准。它主要通过在不确定的问题上选择不回答,而不是通过回答更多问题正确来实现这一点。
#### 模型特性#
与 4.7 相比,变化不大。
其价格与 Opus 4.5/4.6/4.7 相同——每百万输入 $5,每百万输出 $25。“快速模式”的价格是普通模式的两倍,这比他们之前的模型有显著降低——4.6/4.7 的快速模式价格仍为 $30/$150。需要注意的是,快速模式 仅对参与研究预览的组织开放,“请联系您的客户经理以请求访问”。
可靠知识截止日期和训练数据截止日期均为 2026 年 1 月,与 4.7 相同。
上下文窗口仍然是 1,000,000 个 token,最大输出为 128,000 个 token。
关于 Claude Opus 4.8 的新特性 文档中有一些更有趣的细节。以下是我注意到的内容:
对话中的系统消息。Claude Opus 4.8 接受在
messages数组中用户回合后立即插入role: "system"消息(受 放置规则 的限制)。这允许您在长时间对话的后期追加更新的指令,而无需重述完整的系统提示,从而保留早期回合的 提示缓存 命中率,并减少代理循环的输入成本。
另请参阅 Anthropic Python SDK 的 此更新。能够在对话中途调整系统提示听起来非常强大。我曾担心这与我自己的 LLM 库 提供的抽象不兼容,该库期望每场对话只有一个系统提示……但事实证明,我最近的 重新设计 应该可以很好地处理这个问题 just fine。
更低的提示缓存最小值。Claude Opus 4.8 的可缓存提示最小长度为 1,024 个 token,低于 Claude Opus 4.7。
我检查过,4.7 的最小值 是 4,096。
#### 还有一些鹈鹕#
以下是所有五个思考级别的 骑自行车的鹈鹕:low、medium、high、xhigh 和 max:
这次我使用了 LLM CLI 运行它们,将日志导出为 Markdown,然后让 Claude Opus 4.8 为我构建 了一个 HTML 工具,可以将 Markdown 中的 svg 代码块渲染为页面上的 SVG。
(后来我让 Codex 中的 GPT-5.5 xhigh 更新了这段代码,以消除任何 XSS 漏洞。我确信 Claude 如果我要求的话也能做到,但目前 GPT-5.5 是我的代码安全毯。)
max 级别的结果显然最好,但它确实用了 25 输入、17,167 输出 token,总成本为 43 美分!