Simon Willison's Weblog

Claude Opus 4.8: "a modest but tangible improvement"

8.5内容质量
Claude Opus 4.8: "a modest but tangible improvement"

TL;DR · AI 摘要

Claude Opus 4.8 提升了模型的诚实性,减少错误率,并引入了中会话系统消息功能。

核心要点

  • Claude Opus 4.8 的错误率比前代降低约 4 倍。
  • 新增中会话系统消息功能,允许动态更新指令而不重置系统提示。
  • 最低可缓存提示长度从 4,096 降至 1,024 tokens,优化性能与成本。

结构提纲

按章节快速跳转。

  1. Claude Opus 4.8 是一次小但显著的改进,强调诚实性。

  2. 错误率显著降低,诚实性提升,减少无根据断言。

  3. 引入中会话系统消息功能,支持动态更新指令。

  4. 降低缓存提示最小长度,优化成本与性能。

  5. 价格保持不变,快速模式价格降低,部分功能需研究预览资格。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Claude Opus 4.8

金句 / Highlights

值得收藏与分享的关键句。

  • Claude Opus 4.8 is around four times less likely than its predecessor to allow flaws in code it has written to pass unremarked.

    Paragraph 3

    ⬇︎ 下载 PNG𝕏 分享到 X
  • Claude Opus 4.8 accepts `role: "system"` messages immediately after a user turn in the `messages` array.

    Paragraph 6

    ⬇︎ 下载 PNG𝕏 分享到 X
  • The minimum cacheable prompt length on Claude Opus 4.8 is 1,024 tokens, lower than on Claude Opus 4.7.

    Paragraph 7

    ⬇︎ 下载 PNG𝕏 分享到 X
#AI#NLP#Anthropic#Claude
打开原文

2026年5月28日

Anthropic 今天发布了 Claude Opus 4.8。我最喜欢的是发布说明中的这段话:

用户会发现 Opus 4.8 是对其前代产品的适度但显著的改进。还有更多的工作要做:我们正在开发和发布功能与 Opus 类似但成本更低的模型。

看到一家 AI 实验室诚实地将发布描述为对前代模型的小幅增量改进,真是令人耳目一新!

诚实似乎是这次发布的一个主题。以下是我从公告中找到的另一段最喜欢的内容:

Opus 4.8 最显著的改进之一是它的 _诚实性_。我们训练所有模型保持诚实——例如,避免做出无法支持的断言。然而,AI 模型的一个普遍问题是,它们有时会过早下结论,自信地声称在证据不足的情况下取得了进展。早期测试者报告称,Opus 4.8 更有可能指出其工作中的不确定性,并且更少做出没有依据的断言。这一点在 我们的评估 中得到了验证,结果显示 Opus 4.8 比其前代产品允许代码缺陷未被注意的可能性低了大约四倍。

链接的系统卡片中还包括以下内容:

Claude Opus 4.8 在所有六个模型的基准测试中错误率最低——这是对事实幻觉最直接的衡量标准。它主要通过在不确定的问题上选择不回答,而不是通过回答更多问题正确来实现这一点。

#### 模型特性#

与 4.7 相比,变化不大。

其价格与 Opus 4.5/4.6/4.7 相同——每百万输入 $5,每百万输出 $25。“快速模式”的价格是普通模式的两倍,这比他们之前的模型有显著降低——4.6/4.7 的快速模式价格仍为 $30/$150。需要注意的是,快速模式 仅对参与研究预览的组织开放,“请联系您的客户经理以请求访问”。

可靠知识截止日期和训练数据截止日期均为 2026 年 1 月,与 4.7 相同。

上下文窗口仍然是 1,000,000 个 token,最大输出为 128,000 个 token。

关于 Claude Opus 4.8 的新特性 文档中有一些更有趣的细节。以下是我注意到的内容:

对话中的系统消息。Claude Opus 4.8 接受在 messages 数组中用户回合后立即插入 role: "system" 消息(受 放置规则 的限制)。这允许您在长时间对话的后期追加更新的指令,而无需重述完整的系统提示,从而保留早期回合的 提示缓存 命中率,并减少代理循环的输入成本。

另请参阅 Anthropic Python SDK 的 此更新。能够在对话中途调整系统提示听起来非常强大。我曾担心这与我自己的 LLM 库 提供的抽象不兼容,该库期望每场对话只有一个系统提示……但事实证明,我最近的 重新设计 应该可以很好地处理这个问题 just fine

更低的提示缓存最小值。Claude Opus 4.8 的可缓存提示最小长度为 1,024 个 token,低于 Claude Opus 4.7。

我检查过,4.7 的最小值 是 4,096

#### 还有一些鹈鹕#

以下是所有五个思考级别的 骑自行车的鹈鹕lowmediumhighxhighmax

这次我使用了 LLM CLI 运行它们,将日志导出为 Markdown,然后让 Claude Opus 4.8 为我构建 了一个 HTML 工具,可以将 Markdown 中的 svg 代码块渲染为页面上的 SVG。

(后来我让 Codex 中的 GPT-5.5 xhigh 更新了这段代码,以消除任何 XSS 漏洞。我确信 Claude 如果我要求的话也能做到,但目前 GPT-5.5 是我的代码安全毯。)

max 级别的结果显然最好,但它确实用了 25 输入、17,167 输出 token,总成本为 43 美分