Latent Space

[AINews] Claude Haiku 5.5 — better than GPT-6 Luna at the same pricing

8.5内容质量

TL;DR · AI 摘要

Anthropic发布的Claude Haiku 5.5在性能和定价上优于OpenAI的GPT-6 Luna,适合高性价比需求的场景。

核心要点

  • Claude Haiku 5.5在Artificial Analysis Intelligence Index得分43,比前代提升26分。
  • 与GPT-6 Luna同价位,但运行成本降低75%。
  • 新增分层定价和SDK更新,支持高并发任务处理。

结构提纲

按章节快速跳转。

  1. 介绍Claude Haiku 5.5发布的背景及与GPT-6 Luna的对比。

  2. Claude Haiku 5.5在Artificial Analysis Intelligence Index得分43,较前代提升26分。

  3. 与GPT-6 Luna同价位,但运行成本降低75%。

  4. Prompt长度和缓存读取费用根据使用量分层计价。

  5. 新增SDK支持浏览器和计算机工具集,简化开发流程。

  6. 适用于高并发任务如数据库查询和摘要生成。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Claude Haiku 5.5发布与对比
    • 性能提升
      • Artificial Analysis Index得分43
    • 定价策略
      • 同价位GPT-6 Luna
      • 运行成本降低75%
    • 新功能
      • 分层定价模型
      • SDK工具集集成

金句 / Highlights

值得收藏与分享的关键句。

#Claude Haiku 5.5#GPT-6 Luna#AI模型#定价策略
打开原文

[AINews] Claude Haiku 5.5 — 与GPT-6 Luna同价位表现更优

AINews:工作日精选

小模型的胜利

2026年10月8日

∙

付费

自Anthropic发布Haiku 4.5已过去约一年时间,随着Sonnet、Opus和Fable相继升级至5.5版本,Haiku系列似乎被逐渐遗忘,尤其是OpenAI同时推出Luna 6和Astra、Sol 6的背景下。

现在,Haiku 5.5终于回归,这次更新令人期待。更多详情请参见下文摘要。

人工分析

@

ArtificialAnlys

Anthropic发布了Claude Haiku 5.5,在人工分析智能指数中获得43分,较去年Haiku版本提升26分。Haiku 5.5是首个支持Anthropic自定义设置和自适应推理的Haiku模型,Anthropic还推出了分层...

2026年10月7日 下午7:12

·

152K

浏览量

回复

转发

1.67K

点赞

2026年10月6日-10月7日AI新闻。我们检查了12个子版块、544个Twitter账号,未发现更多Discord信息。AINews网站可搜索所有过往内容。提醒:AINews现已成为Latent Space的一部分,您可选择是否接收邮件通知!

AI Twitter回顾

头条新闻:Anthropic发布Claude Haiku 5.5

事件回顾

Anthropic发布了Claude Haiku 5.5,这是该系列约一年来的首次重大更新。其定价与OpenAI的GPT-6 Luna持平,且同日Anthropic对Sonnet 5.5和订阅计划进行了降价调整。

  • 发布前信号。@scaling01在正式宣布前发帖“祝Haiku 5.5发布快乐”。@kimmonismus称该模型已出现在Claude Code更新中,并预测“Luna定价”。他提前在官方帖文前发布了定价信息(@kimmonismus),并在模型上线时确认(@kimmonismus)。
  • 官方发布。@claudeai和@AnthropicAI称其为“我们发布过的最便宜、最快、功能最强的小模型”,平均运行成本较Haiku 4.5降低约75%。
  • 可用性及适用场景。该模型现已在Claude平台和Claude Code(@ClaudeDevs)上线。Anthropic将其定位为与Opus 5.5或Sonnet 5.5配合使用的子代理,适用于需要高吞吐量且对成本敏感的场景,如摘要生成、数据压缩和数据库查询。@mikeyk描述这种分工为“Opus负责深度思考,Haiku处理高吞吐量任务”。
  • 分层定价(@ClaudeDevs):提示长度/每百万个标记的输入/输出 缓存读取/每百万个标记 低于10万标记 $0.10 / $0.50 $0.01 高于10万标记 $0.50 / $2.50 $0.05
  • Sonnet 5.5降价。缓存读取价格从每百万个标记$0.20降至$0.10。Anthropic表示这使Sonnet 5.5在大多数长期或代理式任务中成本降低约20%(@claudeai)。
  • 订阅用户API积分。Claude平台每月API积分现包含Max 5x($100)、Max 20x($200)和Team(最高$500,共享池)。这些积分适用于所有模型(包括Haiku 5.5)及第三方工具(@ClaudeDevs)。
  • 同日SDK更新。计算机使用和浏览器使用工具集现已集成到Python和TypeScript Claude SDK中。SDK运行操作循环并从browser_use、Browserbase、E2B或Daytona向驱动程序发送点击和按键操作,开发者无需再自行编写该循环(@ClaudeDevs,快速入门)。
  • 首日合作伙伴发布:Cursor:@cursor_ai 声称在较短请求上效率是 Haiku 4.5 的 1/10,并发布了 CursorBench 对比结果(@cursor_ai)。GitHub Copilot 在 VS Code 中:@code 报告称其“在许多编码任务上与 Claude Sonnet 5 的表现相当,但使用的 token 数量和步骤更少”。Devin:@cognition 报告称在 FrontierCode 1.1 上得分为 58.4%,领先于 Sonnet 5,每任务成本约为后者的 1/8,并建议在 Opus 5.5 主导的 Fusion 模式下将其作为“副手”。Arena:新增至 Agent Arena、Code Arena WebDev、Text、Document 和 Vision,评分待公布(@arena)。OpenDocRouter:同日新增(详情见下文)。

独立评估:人工分析

@ArtificialAnlys 发布了最详细的第三方数据(每项评估分解,对比页面)。

  • 智能指数:最大努力下为 43,较前代 Haiku 提升 26 分。略微领先于 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38)。与 Kimi K3(44)相当,后者为 2.8T 参数的开源权重模型。最大努力下落后于 Claude Sonnet 5.5(56)13 分。
  • 新增控制功能。这是首款支持 Anthropic 努力设置和自适应思考的 Haiku。
  • token 使用是主要限制因素。最大努力下每项任务输出 token 数量约为 162k,是 GPT-6 Luna 最大努力下的 3 倍(约 50k)。从 xhigh 级别提升至最大级别,token 数量增加约 1.8 倍,得分仅提升 2 分。在同等得分下仍更冗长:Haiku 5.5 高努力下以约 55k token 得分 38,而 Luna 最大努力下以约 50k token 得分 38。低努力设置下差距进一步扩大。
  • 成本数据为临时估算。Artificial Analysis 尚未建模超过 10 万 token 的 5 倍价格阶梯。每任务成本数据将随后公布。
  • AA-Briefcase(私有代理知识工作评估):1578 Elo。该成绩领先于 Kimi K3 和 GLM-5.3,与 Muse Spark 1.3 最大努力下的表现相当。
  • Terminal-Bench 4.0:33%,较 Haiku 4.5 的 0% 有显著提升。与 GLM-5.3 Flash 水平相当,领先于 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)。
  • 知识与幻觉(AA-Omniscience):模型准确率/幻觉率Haiku 5.5 36%/40%Gemini 3.8 Flash 55%/55%GPT-6 Luna 44%/77%。Haiku 准确率较低部分源于其更倾向于承认自身知识不足。
  • AutomationBench-AA:35%,低于 Luna、Gemini 3.8 Flash 和 GLM-5.3 Flash 的 53–60%。预发布阶段的安全漏洞导致模型过度拒绝。Anthropic 正在修复,Artificial Analysis 将重新评估并预计得分会上升。
  • 规格:上下文长度提升至 1M token(Haiku 4.5 为 200k)。支持文本和图像输入,文本输出。5 分钟缓存写入成本为每 1M token 0.125 美元(超过 10 万 token 时为 0.625 美元)。

其他基准测试声明(主要来自厂商或二手信息)

  • @ShayneRedford 总结了 Anthropic 报告的性能提升:OSWorld(计算机使用):15% → 72%。TerminalBench:0% → 39%。这与 Artificial Analysis 在 TerminalBench 4.0 上独立测试的 33% 相差异。知识工作和推理任务提升 10–50%。在大多数基准上优于 Luna。1M 上下文长度,最大输出 token 数量约 12k。
  • @alexalbert__(Anthropic)强调 Haiku 4.5 于 2025 年 10 月 15 日发布,因此对比跨度不足一年。
  • @TheRundownAI 报告称其在“多种基准测试中优于 GPT-6 Luna”。
  • 文档解析(独立测试,ParseBench):@LoganMarkewich:整体接近 Luna,表格处理稍好,图表理解稍差。@jerryjliu0:每千页约 1.2 美元。在价格下表格处理和阅读顺序表现良好,图表、语义格式和边界框处理较弱。
  • 零散案例:@simonw 编写了定价说明并进行了“骑自行车的pelican”测试。他表示这比成本是其10倍的Haiku 4.5“好太多了”(对比)。@AI_Screening 表示Haiku 5.5在Three.js斑马模拟中“击败”了Luna(单次提示,非系统性测试)。

观点与反应

看涨观点

  • @kimmonismus:“比GPT-6-Luna好很多,接近Sonnet 5.5……价格便宜且智能。”
  • @theo 喜欢分级定价策略:在10万token以下收取五分之一价格“让模型用途更加清晰”。他还注意到Anthropic模型在“成本/智能图表中位于最左侧”(@theo),并在直播中报道了此次发布(@theo)。
  • @draecomino:“Haiku在最大努力下表现得像前沿模型。”
  • @kipperrii 认为如今小而便宜的模型更重要,因为它们能“完成大量实用任务”。
  • @scaling01(“非常便宜”)及后续评论(@scaling01):“5.5模型看起来不错。”
  • @NotTomBrown(“小巧但强大”)和@edwinarbus(均来自Anthropic阵营)发布了庆祝性评论。

竞争定位

  • 发布被广泛解读为针对OpenAI的GPT-6 Luna:“GPT 6 Luna再见了”(@dejavucoder)、“是时候击败Luna了”(@scaling01)。
  • @kimmonismus 将Sonnet缓存读取削减解读为Anthropic对OpenAI施压。在API信用额度方面,他补充道:“OpenAI:轮到你们了”(@kimmonismus)。
  • @teortaxesTex 表示Anthropic现在拥有“所有实验室中最深的产品阵容”(Haiku/Sonnet/Opus/Fable加上Mythos),而OpenAI仅有Luna/Sol/Astra。但他仍认为Anthropic“对产品关注度更少”,这被他解读为2026年期间公司拥有的宽松度。
  • ThursdAI的@altryne 质疑中间层级:“当Opus价格高昂时Sonnet才有意义。”该节目计划报道Haiku 5.5(@thursdai_pod)。

注意事项(主要来自数据而非激烈批评者)

  • 标题价格可能夸大实际节省。大量token使用(最大努力下约为Luna的3倍)抵消了部分每token折扣。超过10万token的提示需支付5倍费用,这对长上下文代理循环影响显著。这两个因素很可能解释了Cursor的“短请求便宜10倍”与Anthropic的“平均便宜75%”的差异。
  • 事实回忆能力弱于Gemini 3.8 Flash和Luna。
  • 过度拒绝的bug目前降低了自动化评分。
  • 尚未进行基准测试:Arena评分尚未公布,独立任务成本数据需等待分级定价支持。

背景

  • 自2025年10月起,Haiku 4.5一直是Anthropic的小模型。此后,OpenAI的GPT-6 Luna、Gemini 3.8 Flash、GLM-5.3 Flash和DeepSeek V4.1 Flash在低成本端展开竞争。
  • Haiku 5.5的价格与Luna完全一致。新增了努力控制和1M上下文。
  • 它明确定位为多模型代理框架中的廉价工作模块:Claude Code子代理、Devin Fusion、Copilot子代理,以及压缩或摘要步骤。
  • Anthropic将其与Sonnet缓存读取削减和订阅API信用额度组合,形成针对代理经济的协同推进。这一举措正值更广泛的token账单讨论(见下文@theo)。

其他新闻

OpenAI的722篇数学手稿:规模、效率与影响

使用7天免费试用继续阅读

订阅Latent.Space以继续阅读本文并获得7天免费访问完整文章存档的权限。

开始试用

已是付费订阅者?

上一篇