[AINews] Claude Haiku 5.5 — better than GPT-6 Luna at the same pricing
TL;DR · AI 摘要
Anthropic发布的Claude Haiku 5.5在性能和定价上优于OpenAI的GPT-6 Luna,适合高性价比需求的场景。
核心要点
- Claude Haiku 5.5在Artificial Analysis Intelligence Index得分43,比前代提升26分。
- 与GPT-6 Luna同价位,但运行成本降低75%。
- 新增分层定价和SDK更新,支持高并发任务处理。
结构提纲
按章节快速跳转。
- §引言
介绍Claude Haiku 5.5发布的背景及与GPT-6 Luna的对比。
- ·性能提升
Claude Haiku 5.5在Artificial Analysis Intelligence Index得分43,较前代提升26分。
- ·定价策略
与GPT-6 Luna同价位,但运行成本降低75%。
- ›分层定价
Prompt长度和缓存读取费用根据使用量分层计价。
- ·新功能
新增SDK支持浏览器和计算机工具集,简化开发流程。
- ›应用场景
适用于高并发任务如数据库查询和摘要生成。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Claude Haiku 5.5发布与对比
- 性能提升
- Artificial Analysis Index得分43
- 定价策略
- 同价位GPT-6 Luna
- 运行成本降低75%
- 新功能
- 分层定价模型
- SDK工具集集成
金句 / Highlights
值得收藏与分享的关键句。
Claude Haiku 5.5是首个支持Anthropic努力设置和自适应思考的模型。
运行成本比Haiku 4.5降低75%,定价与GPT-6 Luna持平。
SDK内置浏览器和计算机工具集,开发者无需手动编写操作循环。
[AINews] Claude Haiku 5.5 — 与GPT-6 Luna同价位表现更优
AINews:工作日精选
小模型的胜利
2026年10月8日
∙
付费
自Anthropic发布Haiku 4.5已过去约一年时间,随着Sonnet、Opus和Fable相继升级至5.5版本,Haiku系列似乎被逐渐遗忘,尤其是OpenAI同时推出Luna 6和Astra、Sol 6的背景下。
现在,Haiku 5.5终于回归,这次更新令人期待。更多详情请参见下文摘要。
人工分析
@
ArtificialAnlys
Anthropic发布了Claude Haiku 5.5,在人工分析智能指数中获得43分,较去年Haiku版本提升26分。Haiku 5.5是首个支持Anthropic自定义设置和自适应推理的Haiku模型,Anthropic还推出了分层...
2026年10月7日 下午7:12
·
152K
浏览量
回复
转发
1.67K
点赞
2026年10月6日-10月7日AI新闻。我们检查了12个子版块、544个Twitter账号,未发现更多Discord信息。AINews网站可搜索所有过往内容。提醒:AINews现已成为Latent Space的一部分,您可选择是否接收邮件通知!
AI Twitter回顾
头条新闻:Anthropic发布Claude Haiku 5.5
事件回顾
Anthropic发布了Claude Haiku 5.5,这是该系列约一年来的首次重大更新。其定价与OpenAI的GPT-6 Luna持平,且同日Anthropic对Sonnet 5.5和订阅计划进行了降价调整。
- 发布前信号。@scaling01在正式宣布前发帖“祝Haiku 5.5发布快乐”。@kimmonismus称该模型已出现在Claude Code更新中,并预测“Luna定价”。他提前在官方帖文前发布了定价信息(@kimmonismus),并在模型上线时确认(@kimmonismus)。
- 官方发布。@claudeai和@AnthropicAI称其为“我们发布过的最便宜、最快、功能最强的小模型”,平均运行成本较Haiku 4.5降低约75%。
- 可用性及适用场景。该模型现已在Claude平台和Claude Code(@ClaudeDevs)上线。Anthropic将其定位为与Opus 5.5或Sonnet 5.5配合使用的子代理,适用于需要高吞吐量且对成本敏感的场景,如摘要生成、数据压缩和数据库查询。@mikeyk描述这种分工为“Opus负责深度思考,Haiku处理高吞吐量任务”。
- 分层定价(@ClaudeDevs):提示长度/每百万个标记的输入/输出 缓存读取/每百万个标记 低于10万标记 $0.10 / $0.50 $0.01 高于10万标记 $0.50 / $2.50 $0.05
- Sonnet 5.5降价。缓存读取价格从每百万个标记$0.20降至$0.10。Anthropic表示这使Sonnet 5.5在大多数长期或代理式任务中成本降低约20%(@claudeai)。
- 订阅用户API积分。Claude平台每月API积分现包含Max 5x($100)、Max 20x($200)和Team(最高$500,共享池)。这些积分适用于所有模型(包括Haiku 5.5)及第三方工具(@ClaudeDevs)。
- 同日SDK更新。计算机使用和浏览器使用工具集现已集成到Python和TypeScript Claude SDK中。SDK运行操作循环并从browser_use、Browserbase、E2B或Daytona向驱动程序发送点击和按键操作,开发者无需再自行编写该循环(@ClaudeDevs,快速入门)。
- 首日合作伙伴发布:Cursor:@cursor_ai 声称在较短请求上效率是 Haiku 4.5 的 1/10,并发布了 CursorBench 对比结果(@cursor_ai)。GitHub Copilot 在 VS Code 中:@code 报告称其“在许多编码任务上与 Claude Sonnet 5 的表现相当,但使用的 token 数量和步骤更少”。Devin:@cognition 报告称在 FrontierCode 1.1 上得分为 58.4%,领先于 Sonnet 5,每任务成本约为后者的 1/8,并建议在 Opus 5.5 主导的 Fusion 模式下将其作为“副手”。Arena:新增至 Agent Arena、Code Arena WebDev、Text、Document 和 Vision,评分待公布(@arena)。OpenDocRouter:同日新增(详情见下文)。
独立评估:人工分析
@ArtificialAnlys 发布了最详细的第三方数据(每项评估分解,对比页面)。
- 智能指数:最大努力下为 43,较前代 Haiku 提升 26 分。略微领先于 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38)。与 Kimi K3(44)相当,后者为 2.8T 参数的开源权重模型。最大努力下落后于 Claude Sonnet 5.5(56)13 分。
- 新增控制功能。这是首款支持 Anthropic 努力设置和自适应思考的 Haiku。
- token 使用是主要限制因素。最大努力下每项任务输出 token 数量约为 162k,是 GPT-6 Luna 最大努力下的 3 倍(约 50k)。从 xhigh 级别提升至最大级别,token 数量增加约 1.8 倍,得分仅提升 2 分。在同等得分下仍更冗长:Haiku 5.5 高努力下以约 55k token 得分 38,而 Luna 最大努力下以约 50k token 得分 38。低努力设置下差距进一步扩大。
- 成本数据为临时估算。Artificial Analysis 尚未建模超过 10 万 token 的 5 倍价格阶梯。每任务成本数据将随后公布。
- AA-Briefcase(私有代理知识工作评估):1578 Elo。该成绩领先于 Kimi K3 和 GLM-5.3,与 Muse Spark 1.3 最大努力下的表现相当。
- Terminal-Bench 4.0:33%,较 Haiku 4.5 的 0% 有显著提升。与 GLM-5.3 Flash 水平相当,领先于 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)。
- 知识与幻觉(AA-Omniscience):模型准确率/幻觉率Haiku 5.5 36%/40%Gemini 3.8 Flash 55%/55%GPT-6 Luna 44%/77%。Haiku 准确率较低部分源于其更倾向于承认自身知识不足。
- AutomationBench-AA:35%,低于 Luna、Gemini 3.8 Flash 和 GLM-5.3 Flash 的 53–60%。预发布阶段的安全漏洞导致模型过度拒绝。Anthropic 正在修复,Artificial Analysis 将重新评估并预计得分会上升。
- 规格:上下文长度提升至 1M token(Haiku 4.5 为 200k)。支持文本和图像输入,文本输出。5 分钟缓存写入成本为每 1M token 0.125 美元(超过 10 万 token 时为 0.625 美元)。
其他基准测试声明(主要来自厂商或二手信息)
- @ShayneRedford 总结了 Anthropic 报告的性能提升:OSWorld(计算机使用):15% → 72%。TerminalBench:0% → 39%。这与 Artificial Analysis 在 TerminalBench 4.0 上独立测试的 33% 相差异。知识工作和推理任务提升 10–50%。在大多数基准上优于 Luna。1M 上下文长度,最大输出 token 数量约 12k。
- @alexalbert__(Anthropic)强调 Haiku 4.5 于 2025 年 10 月 15 日发布,因此对比跨度不足一年。
- @TheRundownAI 报告称其在“多种基准测试中优于 GPT-6 Luna”。
- 文档解析(独立测试,ParseBench):@LoganMarkewich:整体接近 Luna,表格处理稍好,图表理解稍差。@jerryjliu0:每千页约 1.2 美元。在价格下表格处理和阅读顺序表现良好,图表、语义格式和边界框处理较弱。
- 零散案例:@simonw 编写了定价说明并进行了“骑自行车的pelican”测试。他表示这比成本是其10倍的Haiku 4.5“好太多了”(对比)。@AI_Screening 表示Haiku 5.5在Three.js斑马模拟中“击败”了Luna(单次提示,非系统性测试)。
观点与反应
看涨观点
- @kimmonismus:“比GPT-6-Luna好很多,接近Sonnet 5.5……价格便宜且智能。”
- @theo 喜欢分级定价策略:在10万token以下收取五分之一价格“让模型用途更加清晰”。他还注意到Anthropic模型在“成本/智能图表中位于最左侧”(@theo),并在直播中报道了此次发布(@theo)。
- @draecomino:“Haiku在最大努力下表现得像前沿模型。”
- @kipperrii 认为如今小而便宜的模型更重要,因为它们能“完成大量实用任务”。
- @scaling01(“非常便宜”)及后续评论(@scaling01):“5.5模型看起来不错。”
- @NotTomBrown(“小巧但强大”)和@edwinarbus(均来自Anthropic阵营)发布了庆祝性评论。
竞争定位
- 发布被广泛解读为针对OpenAI的GPT-6 Luna:“GPT 6 Luna再见了”(@dejavucoder)、“是时候击败Luna了”(@scaling01)。
- @kimmonismus 将Sonnet缓存读取削减解读为Anthropic对OpenAI施压。在API信用额度方面,他补充道:“OpenAI:轮到你们了”(@kimmonismus)。
- @teortaxesTex 表示Anthropic现在拥有“所有实验室中最深的产品阵容”(Haiku/Sonnet/Opus/Fable加上Mythos),而OpenAI仅有Luna/Sol/Astra。但他仍认为Anthropic“对产品关注度更少”,这被他解读为2026年期间公司拥有的宽松度。
- ThursdAI的@altryne 质疑中间层级:“当Opus价格高昂时Sonnet才有意义。”该节目计划报道Haiku 5.5(@thursdai_pod)。
注意事项(主要来自数据而非激烈批评者)
- 标题价格可能夸大实际节省。大量token使用(最大努力下约为Luna的3倍)抵消了部分每token折扣。超过10万token的提示需支付5倍费用,这对长上下文代理循环影响显著。这两个因素很可能解释了Cursor的“短请求便宜10倍”与Anthropic的“平均便宜75%”的差异。
- 事实回忆能力弱于Gemini 3.8 Flash和Luna。
- 过度拒绝的bug目前降低了自动化评分。
- 尚未进行基准测试:Arena评分尚未公布,独立任务成本数据需等待分级定价支持。
背景
- 自2025年10月起,Haiku 4.5一直是Anthropic的小模型。此后,OpenAI的GPT-6 Luna、Gemini 3.8 Flash、GLM-5.3 Flash和DeepSeek V4.1 Flash在低成本端展开竞争。
- Haiku 5.5的价格与Luna完全一致。新增了努力控制和1M上下文。
- 它明确定位为多模型代理框架中的廉价工作模块:Claude Code子代理、Devin Fusion、Copilot子代理,以及压缩或摘要步骤。
- Anthropic将其与Sonnet缓存读取削减和订阅API信用额度组合,形成针对代理经济的协同推进。这一举措正值更广泛的token账单讨论(见下文@theo)。
其他新闻
OpenAI的722篇数学手稿:规模、效率与影响
使用7天免费试用继续阅读
订阅Latent.Space以继续阅读本文并获得7天免费访问完整文章存档的权限。
开始试用
已是付费订阅者?
上一篇