[AINews] Codex 崛起,Claude 计量程序化使用
![[AINews] Codex 崛起,Claude 计量程序化使用](/api/img-proxy?url=https%3A%2F%2Fsubstackcdn.com%2Fimage%2Ffetch%2F%24s_!uqHa!%2Cw_1456%2Cc_limit%2Cf_auto%2Cq_auto%3Agood%2Cfl_progressive%3Asteep%2Fhttps%253A%252F%252Fsubstack-post-media.s3.amazonaws.com%252Fpublic%252Fimages%252F1f3bb92f-f1bd-4329-9b9c-64c681eec378_1290x874.png)
TL;DR · AI 摘要
GPT-5.5发布后,Codex因更宽松的使用限制和强大性能在工程师中崛起,而Anthropic对Claude实行按订阅额度等值API积分的新计费模式,引发开发者对“程序化使用”成本上升的争议。
核心要点
- Codex因GPT-5.5性能提升及免费代理工具支持,在AI工程师中使用率显著上升。
- Anthropic新政策使Claude订阅用户每月获得与订阅金额等值的API积分,但被视为变相涨价。
- OpenAI同期推出企业版切换功能,凸显两大模型在商业化路径上的差异化竞争。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Codex vs Claude 生态竞争
- Codex崛起
- GPT-5.5高性能
- 开源代理支持
- 宽松使用政策
- Claude新政
- 订阅即API积分
- 取消历史折扣
- 区分使用场景
- 商业策略对比
- Anthropic收紧控制
- OpenAI推企业版
金句 / Highlights
值得收藏与分享的关键句。
每支付1美元订阅费,即可获得1美元等值的Claude API积分,用于程序化调用。
此前估计Claude API享受70%-90%的价格补贴,此次调整被开发者视为‘地毯抽离’。
Codex作为挑战者正以更宽松的政策吸引开发者,形成与Anthropic的鲜明对比。
自GPT 5.5发布以来的三周里,情况就像两个城市一样两极分化;尽管财务人员对Anthropic的增长和CFO的期待充满热情,预计其将在今年十月上市,但AI工程师群体中关于Codex的正面情绪却有所上升,这可能是由于GPT 5.5模型表现优异(在某些情况下甚至达到神话级)、Codex Everywhere的推出以及今天专栏所提到的第三点——更慷慨的限制额度。

Claude定价变动的消息传递得相当不错,但它并不是人们想要听到的内容:现在每个Claude订阅都会获得等同于Claude订阅计划金额的API令牌月度信用额度。因此,如果你支付了200美元,你将同时获得一个Claude订阅及其在Anthropic自有工具如Claude.ai和Claude Code上的使用限制(“交互式使用”),以及200美元的API信用额度用于在其他地方使用Claude,包括claude-p、OpenClaw和其他工具(“程序化使用”)。
如果一开始就是这样的话,这会被视为一个非常不错的交易:

然而,由于历史上的补贴/定价优势(估计折扣在70%-90%之间),人们将其视为一种“割韭菜”的行为——尽管有一个官方政策比针对OpenClaw、OpenCode和其他不太受欢迎的工具的有选择性打击要好一些。

这些头条新闻与OpenAI企业版促销在同一日发布,这是一个令人难以置信的巧合:

最终,我们建议不要过分解读任何一方的波动——两家实验室都做得很好,这些都是未来编程领域发明者们在摸索最佳定价策略时发生的正常价格调整。Anthropic起初更为宽松,但现在随着Claude Code品牌和声望的建立,它将最优惠的价格放在自家工具上,并对其他一切进行计量,而Codex作为挑战者则更加宽松。
或许硬件就是未来的决定因素,也许这只是为期六个月的“春分”周期的一部分:
2026年5月12日至5月13日的AI新闻。我们检查了12个Subreddit,544个Twitter列表,没有发现其他Discord。AINews网站允许您搜索所有过去的问题。请注意,AINews现在是Latent Space的一部分:AINews网站。您可以订阅/取消订阅邮件频率!
代理基础设施、工具集和开发者平台
- Cline, LangChain, Notion, and Cursor all pushed deeper into agent platform territory: Cline open-sourced a rebuilt Cline SDK and refreshed CLI with a TUI, agent teams, scheduled jobs, and connectors, positioning its harness as a reusable substrate for custom coding agents. LangChain shipped a large batch of agent lifecycle infrastructure at Interrupt: LangSmith Engine, SmithDB, Sandboxes, Managed Deep Agents, LLM Gateway, Context Hub, and Deep Agents 0.6. The most technically notable piece is SmithDB, a purpose-built observability database for nested, long-running traces with large payloads, reportedly yielding 12–15× faster access on key workloads; the team says it is built atop Apache DataFusion and Vortex. In parallel, Notion’s External Agents API lets third-party agents such as Claude, Codex, Cursor, Decagon, Warp, and Devin operate directly inside Notion as a shared, reviewable context layer rather than another silo. Cursor expanded cloud agents with fully configured development environments including cloned repos, dependencies, version history, rollback, scoped egress, and isolated secrets.
- Agent用户体验越来越注重长期状态、流式处理和编排,而不是聊天: 几个发布都朝着同样的设计方向发展。Duet Agent提出了一种用于持续运行数周或数月的任务的状态机框架,包括父代理和子代理的协调以及内存代替了压缩。LangChain的开源更新增加了流式类型投影、检查点存储、代码解释器、框架配置和模型特定调优,所有这些都旨在比简单的令牌提供更丰富的代理事件流。Tabracadabra从自动补全转向任何文本框中的上下文感知助手,而VS Code引入了代理窗口和更好的多项目任务审查。这些发布背后的架构信息表明,生产代理越来越多需要持久执行、可检视的中间状态和工具原生用户界面表面,而不是无状态的提示/响应循环。
模型训练、架构和数据效率
- 预训练效率和架构实验一直是最强的研究主线: Nous Research的Token Superposition Training修改了预训练早期阶段,使模型在读取/预测连续的令牌袋后再恢复标准的下一个令牌预测;他们报告在相同浮点运算次数下,速度提高了2-3倍,且没有影响推理时的架构变化,验证了从2.7亿到30亿和10B-11B混合微调的密度。Jonas Geiping等人认为基于消息/聊天的训练过于限制代理只能在一个流中工作,并发布了一个声称具有更低延迟、更清晰的关注点分离和更易理解的并行推理/工具使用的多流LLM论文,相关论文和代码链接在此。δ-mem提出了一种外部在线关联记忆附加到冻结的全注意力骨干之上,据报道,一个8×8状态可以提高平均分数1.10倍,并且击败非δ-mem基线1.15倍,在内存密集型基准上获得更大的收益。
- 训练后/压缩和数据整理也产生了显著成果: NVIDIA的Star Elastic声称一次训练可以生成推理模型大小的家族,成本仅为预训练家族的360倍,并且优于最先进的压缩方法7倍。Datology的VLM工作,由Siddharth Joshi和Pratyush Maini强调,仅通过数据整理就可以产生重大跨模态收益:20个公开VLM基准测试中增加了11.7分,与InternVL3.5-2B相比大约高出10分,训练成本约为17倍,并且在3.3倍更低的响应浮点运算次数下接近前沿的4B性能。在开放数据方面,Percy Liang表示,接下来的Marin运行已经在其混合中包含了1800亿个令牌,仍在寻求更多的预训练、中期训练和SFT数据,并分享了一个配套的令牌查看器在这里。
- 模型构建的同时,开放评估和数据集工作也在成熟: Kevin Li的SWE-ZERO-12M轨迹数据集被定位为最大的开放代理轨迹数据集:1120亿个令牌,1200万个轨迹,12.2万个PR,3000个仓库,16种语言。Victor Mustar指出llama-eval是迈向更可比较的llama.cpp社区评估的一个步骤。与此同时,Steve Rabinovich和Sayash Kapoor认为,可信的代理评估需要日志分析,而不是仅基于结果的指标,因为更强的代理会暴露隐藏的基准bug和奖励劫持路径。
- Anthropic vs OpenAI竞争围绕企业分销和开发者锁定加强: Andrew Curran引用的数据显示,Anthropic占企业在4月的34.4%,而OpenAI占32.3%,这是企业采用方面首次出现明显领先变化;[The Rundown]([https://x.com/TheRundownAI/status/2054588969044627906])重申了相同数据。与此同时,Anthropic改变了其经济计划:ClaudeDevs宣布,付费Claude计划将获得一个专门用于在Agent SDK、
claude -p、GitHub Actions以及第三方SDK应用程序中的程序化使用的每月信用额度。这立即被高级用户视为对订阅补贴式抓取的重大限制,并受到Theo、Jeremy Howard、Matt Pocock和Omar Sanseviero的批评。Anthropic通过一个单独的措施部分缓解了这种负面反应,在截至7月13日的7月内,将Claude Code每周限额提高了50%。这一变动叠加了此前宣布的2倍5小时限制增加。
- OpenAI以Codex企业激励措施迅速回应: OpenAI Devs和Sam Altman向企业客户提供了下一个月免费使用Codex的机会,如果他们在接下来的30天内切换到Codex。OpenAI还发布了更多技术平台细节,包括一篇关于Windows沙盒设计的文章,描述了结合本地用户、防火墙规则、ACLs、写入受限令牌、DPAPI和辅助可执行文件所需的组合,以安全地运行具有本地文件系统/工具访问权限的编码代理。现在竞争动态看起来更像是“补贴+工作流控制+抓取兼容性”。
- 企业采用越来越与运行时/安全性保证挂钩: Perplexity描述了一个硬件隔离的沙盒架构,具有VPC级别的分离、短暂的代理令牌扫描以及在代理行动之前扫描外部内容。Aravind Srinivas将此视为Perplexity成为企业知识/研究平台的基础。更广泛的模式:代理供应商不再仅销售智能;他们正在出售受限制的执行环境。
自主科学、网络安全和机器人学
- 递归自我提升从概念转变为创业集群: 最大的单一元主题是Recursive的成立,旨在构建能够自动化科学并安全地自我改进的AI。来自Richard Socher、Josh Tobin、Dominik Schmidt、Jenny Zhang和Shengran Hu的推文表明,该团队来自开放性、AI科学家和研究自动化工作。在相邻的工作中,Adaption的AutoScientist旨在在外围实验室之外自动化完整的训练/研究循环,Sarah Hooker认为大多数模型训练失败主要是由于研究循环的脆弱性,而不是单纯的计算稀缺性。
- 网络安全评估继续加深: 英国AI安全研究所表示前沿模型完成网络安全任务所需时间每几个月翻一番,并且最近的模型正在打破先前的趋势。Anthropic/Glasswing的Logan Graham表示,Claude Mythos预览版是第一个解决AI安全研究所所有端到端网络安全范围的模型,包括冷却塔,也是唯一一个通过该机构的2.5M令牌上限完成每个任务的模型。XBOW据说实现了“令牌对令牌前所未有的精确度”,合作伙伴使用据说在几周内发现了数千个高/关键漏洞。独立评论来自scaling01,声称较新的Mythos版本在预览基准上完成了6/10次网络安全范围测试,而预览版基线则完成了3/10次。
- 机器人领域得到了一个具体的长期部署演示: Figure的Brett Adcock直播了使用Helix-02进行全8小时自主班次的人形机器人在包裹分拣上的运行情况,随后提供了更多细节,这些机器人从摄像头像素推理,操作与人类相当(约3秒/包裹),在设备上进行推理,作为网络舰队协调运作,当电量低时自动交换,并在需要时自我诊断/切换到维护模式此处。这是对多机器人、长时间、无人类干预的编排的更清晰公开演示,而不是一个简短的基准剪辑。
- Claude Code Pricing and Limits: @ClaudeDevs on 50% Higher Weekly Limits, @ClaudeDevs on Programmatic Credits, and the ensuing developer backlash from @theo made pricing policy the day's most consequential developer story.
- Codex Enterprise Push: @sama Offering Two Free Months of Codex Usage for Switchers and @OpenAIDevs' Enterprise Call-to-Action signaled an unusually direct go-to-market counterpunch.
- Figure’s 8-Hour Humanoid Shift: @adcock_brett's Livestream Post drew enormous attention and is one of the few viral posts in the set with clear technical substance.
- Cline SDK Launch: @cline's SDK Release was one of the highest-engagement genuinely technical launches, reflecting demand for open coding-agent harnesses.
- Token Superposition Training: @NousResearch's TST Post stood out as a rare pretraining-method tweet that broke through widely, likely because the claim—2–3× Training Speedup Without Changing Inference-Time Architecture—is concrete and economically important.