[AINews] Codex usage up >10x in 6 months to 7M users, +1M in the past ~day; did Codex overtake Claude Code??
![[AINews] Codex usage up >10x in 6 months to 7M users, +1M in the past ~day; did Codex overtake Claude Code??](/api/img-proxy?url=https%3A%2F%2Fsubstackcdn.com%2Fimage%2Ffetch%2F%24s_!cqvt!%2Cw_2400%2Cc_limit%2Cf_auto%2Cq_auto%3Agood%2Cfl_progressive%3Asteep%2Fhttps%253A%252F%252Fsubstack-post-media.s3.amazonaws.com%252Fpublic%252Fimages%252F09c078c3-d47d-4ab1-91e5-b09ad5d082dd_1388x902.png)
TL;DR · AI 摘要
AINews Codex usage up 10x in 6 months to 7M users, +1M in the past day; did Codex overtake Claude Code?? AINews: Weekday...
核心要点
- 主题聚焦:AINews Codex usage up 10x in 6 months to 7M user
- 来源:Latent Space,建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
[AINews] 6个月内Codex使用量增长超10倍至700万用户,过去约1天新增100万用户;Codex是否已超越Claude Code??
AINews:工作日简报
一个安静的日子让我们得以用Claude Code的沉默数据来核实一些数字...
2026年7月14日
祝贺Allen今天与Engram首席执行官Dan Biderman共同推出Latent Space Food节目下一集,同时祝贺Prime Intellect团队达成10亿美元估值、1亿美元ARR以及验证器v1版本的发布。
今天整体较为平静,人们仍在深入消化上周多项前沿模型发布的冲击。我们原本打算写“今天没有发生太多大事”,但我们也坚持要反复向您更新那些您必须密切关注的异常趋势。在回顾下方Reddit AINews的回顾帖时,我们发现了一条此前遗漏的推文——
Tibo
@thsottiaux
早上好。过去48小时Codex和ChatGPT Work的使用情况非常激烈!三个重要更新:- 临时取消所有Plus、Business和Pro计划的5小时使用限制 - 推出改进措施使GPT 5.6 Sol整体效率提升
2026年7月12日 下午5:59
·
429万次浏览
2800条评论
1950次转发
25100个赞
GPT 5.6于7月9日发布。
7月12日的这条推文称他们在前48小时(7月10-12日)达到了600万用户。
24.5小时后Tibo报告用户数达到700万……
感谢现在使用Codex和ChatGPT Work的700万活跃用户。我们为每位用户账户添加了银行重置功能以庆祝这一里程碑。您可以通过桌面应用或网页端应用此重置,它将为您补充每周使用额度。祝您在外玩得开心。
2026年7月13日 下午6:29
947,000次浏览
1380条评论
656次转发
14100个赞
……奇怪地与Claude Fable订阅状态的意外延长同时发生(我们当然不知道两者是否有关联,但那些坚信阴谋论的人当然会建立联系)。
我们当然记得Fidji在3月披露的200万Codex用户数据,这使我们能够更新AIE NYC 2025图表(AIE NYC 2026即将召开!):
相比之下,我们最后一次获得Claude Code的更新是2026年2月的约200万用户和25亿美元ARR(“自1月1日(六周前)以来,Claude Code的周活跃用户数也翻了一番。”)。现在我们对Codex年初的起点有了更清晰的认识(Fidji将1月1日的用户数估计在55万至70万之间),可以合理得出结论:Codex的用户增长轨迹与Claude Code类似,目前年度用户增长已达到10倍。
当然,对Claude Code在报告方面相对沉默的慈善解释是,他们早在几个月前就将大部分编码工作转移到了Claude Tag,并现在将用户引导至该平台,这导致使用统计数据难以比较,因为Slackbot与CLI工具的可访问性存在差异。
但6个月内实现10倍增长的数字依然令人印象深刻。
- Prime Intellect 的验证器 v1:Prime Intellect 发布了验证器 v1,这是其智能体强化学习和评估环境堆栈的重大重构。关键抽象将环境拆分为任务集、Harness 和运行时,明确支持“自带 Harness”的工作流程,使编码和计算机使用代理能够在异构执行设置中运行,如 Johannes Hage 所强调的,并在后续深入分析中进一步说明。团队成员将此次发布描述为数月基础设施现代化工作的成果,带来了显著效率提升,包括 willccbb、mikasenghaas 和 xeophon 提供的更丰富的评论。
- 技术意义:最重要的底层改进之一是 rollout 轨迹现在以消息有向无环图(DAG)形式存储,每个消息仅存储一次而非重复复制到完整历史中。这一改变使轨迹增长从 O(n²) 降至 O(n),从而显著提升了长周期多模态 rollout 和路由器回放的可行性,如 Prime Intellect 所述。团队还提出了一个具体训练配置:在用户提供的编码 Harness 中,使用 100B 参数推理模型处理 40 轮 SWE 代理任务,经过 1000 次强化学习步骤,仅需 6 个 H200 节点在 2 天内完成(willccbb)。这一说法得到了 vLLM 生态系统的支持,vLLM 指出验证器的 rollout 路径可在其平台上运行,并保留精确的 token ID/logprobs 以避免服务与训练之间的 tokenization 偏移。
编码代理、Harness 设计与任务成本竞争
- Harness 正成为产品界面:多篇帖子都指出,模型质量已不再是唯一差异点,Harness/编排器对结果的影响日益显著。threepointone 的演讲被总结为“Harness 就是应用程序”,而 LangChain 认为未来的成功代理产品将来自任务专用的 Harness,而非通用包装器。Factory 提出了相关的 UI 设计角度,通过“设计模式”让用户直接指向 UI 元素/文件进行操作,而非口头重新指定修改。在编排方面,omarsar0 强调跨模型的供应商切换可作为对价格/政策波动的对冲手段。
- 基准测试正从 token 价格转向任务成本:skirano 构建了编码代理索引探索器,发现显著的成本/性能权衡,例如 Terra Max 在成本显著低于 Fable 5 Max 的情况下,得分略高;Cognition 报告称 Devin Fusion 现在使用 Fable 5,令人意外的是,其任务成本甚至可能低于 Opus 4.8,因为更强的委派和判断能力减少了不必要的工作。imjaredz 强调了这些实验中的关键数据:在 81% 的 Fable 领先运行中,主模型从未进行代码编辑,这表明当昂贵模型避免无效操作时,可能反而更经济。
- 实际代理基准测试正变得密集:Arena 基于 7800 次真实世界代理会话,将 GPT-5.6 Sol 排在代理排行榜第 2 位,其具有强大的可控性和任务成功率;随后,Arena 将 Grok-4.5 排在第 13 位,相比 Grok 4.3 有显著提升。Artificial Analysis 还强调,随着长周期知识工作需求增加,任务成本正成为越来越重要的指标,认为仅凭 token 定价会忽略回合数、冗长性及缓存命中率的影响。Parlance Labs 的独立评估工作比较了自动化评估平台与基础模型在生产语音代理轨迹失败分析中的表现,而 dair.ai 则重点研究了 CLI 编码代理失败的解剖学,关注运行何时变得不可恢复,而不仅仅是最终的通过/失败结果。
OpenAI GPT-5.6 Sol、Codex使用修复与产品扩展
- OpenAI透明解决了Codex/Sol使用消耗问题:最大的运营问题来自thsottiaux,他解释了ChatGPT Work/Codex中GPT-5.6 Sol的多项修复措施。包括推理优化使使用量提升约10%,因计费/使用副作用将上下文限制从372k回滚至272k,撤销部分实验性推理努力("juice")变更,以及修复高/xhigh设置下的多智能体过度活跃行为。Theo的社区逆向工程分析指出,长上下文、子智能体生成和快速模式的复合因素导致严重消耗,但后续补充修正了一个计费细节。社区反应呈现两极分化:部分用户批评这种"削弱"叙事(ns123abc),而theo和sama则赞扬其罕见透明度。
- 用户报告编码/计算机使用能力显著增强:多位从业者认为OpenAI在编码模型领域已取得领先地位,包括schrockn。gdb持续展示ChatGPT Work和Codex在初创公司探索、网页设计、移动开发和网站生成等场景的工作流。典型用户演示包括Star_Knight12使用Cursor中的Sol在无Blender经验情况下搭建Blender MCP并渲染悬浮MacBook,以及petergostev展示GPT-5.6 Sol Ultra用SQL构建类Doom游戏。
- 产品层面扩展持续推进:ChatGPTapp宣布ChatGPT重返欧洲经济区WhatsApp,同时在其他市场新增Kakao/Viber支持。OpenAIDevs开放了OpenAI Build Week投稿。在OpenAI生态系统中,gdb简洁总结:"你只需创造即可。"
开源模型、推理系统与量化技术
- Transformers↔vLLM集成消除模型实现重复工作:Clement Delangue强调了重大开源推理可用性改进:Hugging Face Transformers模型现在可在vLLM以原生速度运行,通常匹配甚至超越手写实现。若该方案广泛适用,将减轻长期存在的架构重复实现负担——研究训练和高性能服务各需实现一次,可能显著加速新开源模型架构的采用。
- 量化仍是关键杠杆:waterloo_intern预览了声称优于现有方案(包括NVIDIA ModelOpt)的新量化方法,通过更快找到更优的层级精度分配,结合更激进量化和更高基准得分。Unsloth同步发布了涵盖GGUF、NVFP4和FP8的LLM量化与部署AWS指南。nrehiew_还提出关于fp4强化学习/fp4服务的实践观点,认为低比特后训练可能实现低成本服务且质量损失有限。
- GLM-5.2与本地/开源编码栈持续获得采用:多位用户描述将真实工作流迁移至开源或半开源环境。juanjucm撰写了使用GLM-5.2进行编码代理工作流的案例,TheZachMueller报告了将实际工作流从Claude迁移至基于GLM 5.2 NVFP4和Kimi K2.7 Code NVFP4的8xB200节点堆栈,虽然时延较高但每份报告成本仅数美分。nutlope也发布了围绕GLM 5.2重建的LlamaCoder v4。
- Grok Build 代码上传争议:IntCyberDigest 和 hrkrshnn 指出 xAI 的 Grok Build CLI 工具存在重大安全隐患,该工具被指控将完整代码库(包括私有代码和敏感信息)上传至 Google Cloud 存储桶,远超完成编码任务所需范围。批评焦点集中在功能范围、服务器端静默缓解措施以及数据保留/删除保障机制的模糊性。这引发了更广泛的讨论,涉及代理工具实际传输的数据内容,以及用户退出选项(opt-out UX)与底层行为的差异问题。
- xAI 的回应强调零数据保留(ZDR)和隐私控制:SpaceXAI 表示,对于采用零数据保留(ZDR)模式的团队,轨迹和代码数据不会被存储,API 密钥使用遵循 ZDR 原则,且通过 /privacy 命令可禁用数据保留并删除已同步数据。这回答了一些操作性问题,但未能完全消除社区对默认行为、历史上传记录和披露规范的担忧。
- 信任边界成为开源与闭源争论的核心:多篇帖子将讨论扩展到此次事件之外。mchiang0610 和 jmorgan 认为,开源模型的价值不仅在于成本,更在于对人类-AI学习循环的控制权和机构知识的内部留存。Arav Srinivas 表示,ZDR 的可用性是 Perplexity 快速将 Grok 4.5 集成到其 Computer 模块化系统中的原因之一。
持续学习、多模态系统与研究方向
- 持续学习正重新成为系统级核心问题:ysu_nlp 指出,一个由每个组织自主掌控人类-AI学习循环的世界,依赖于持续学习问题的解决,而当前基于记忆/RAG、领域后训练、任务强化学习的方法尚未足够。这一主题在 skyfallai 的新研究中再次出现,其推出的 Morpheus 被描述为一个持久的企业级仿真系统,用于真实世界强化学习场景(世界不会重置);fchollet 认为该系统是比静态回合制强化学习更贴近实际部署的基准。
- “睡眠与梦境”机制对大语言模型的启示:behrouz_ali 及其合作者提出,大语言模型可能需要睡眠阶段将短期记忆转化为长期记忆,并通过梦境阶段实现递归式自我优化,他们引入了知识播种(Knowledge Seeding)方法,并在持续学习/推理任务中报告了效果。这与当前持续学习方案的普遍不满以及 Rich Sutton 与团队新成立的 Oak Lab(致力于动物式智能研究)形成呼应,后者专注于从经验中学习,而非当前标准的 LLM 训练流程。
- 非代理型研究方向成果广泛落地:值得关注的成果包括 Sakana AI 的 Smart Cellular Bricks(用于模块化系统的分布式物理自识别与修复)、字节跳动的 UniVR-34B(通过视觉演示直接学习推理/动力学/规划)、DeepMind 的 Predicting the Past 技能(用于历史推理工作流)以及 Anthropic 对 Claude 在不同模型和语言中表达价值观差异的研究(基于30万+匿名对话分析)。
顶级推文(按互动量排序)
- OpenAI Codex/Sol 使用修复:thsottiaux 分析 GPT-5.6 Sol 使用场景、上下文、“juice”机制及多代理修复方案
- Grok Build 隐私事件:IntCyberDigest 揭露完整代码库上传至 xAI 云存储桶
- OpenAI 回应语气与用户对待方式:sama 表示“选择最佳模型,是因为我们不会轻视你”
- Prime Intellect 部署效率:willccbb 在 6 台 H200 上用不到 2 天时间训练出 100B 参数的 40 轮 SWE RL 模型
- Anthropic 价值观研究:Anthropic 分析 30 万+对话中的模型/语言依赖型价值表达模式
- Transformers + vLLM 互操作性:Clement Delangue 演示在 vLLM 中以原生速度运行 Transformers 模型
AI Reddit 要闻
/r/LocalLlama + /r/localLLM 要闻
1. 电子废弃物 GPU 推理基准测试与修复方案
立即试用 7 天免费会员
订阅 Latent.Space 继续阅读本文并获取 7 天完整文章库免费访问权限
立即试用
已是付费订阅者?
上一篇