GPT-5.5 Codex reasoning-token clustering may be leading to degraded performance
TL;DR · AI 摘要
GPT-5.5 Codex reasoning-token clustering at 516/1034/1552 may be leading to degraded performance on complex tasks · Issu...
核心要点
- 主题聚焦:GPT-5.5 Codex reasoning-token clustering may be
- 来源:Hacker News Best,建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
GPT-5.5 Codex 推理标记聚类在 516/1034/1552 可能导致复杂任务性能下降 · Issue #30364 · openai/codex · GitHub
哦不!
加载时发生错误。请重新加载此页面。
openai
/
codex
公共
- 通知 您必须登录才能更改通知设置
- 分叉 14.2k
- 星标 95.6k
$
GPT-5.5 Codex 推理标记聚类在 516/1034/1552 可能导致复杂任务性能下降 #30364
$!
新建问题
/$
复制链接
打开
GPT-5.5 Codex 推理标记聚类在 516/1034/1552 可能导致复杂任务性能下降
#30364
标签
bug
某些功能无法正常工作
model-behavior
与模型行为相关的议题
rate-limits
与速率限制、配额和标记使用报告相关的议题
描述
vguptaa45
于 2026 年 6 月 27 日创建
问题正文操作
概述
我在 Codex token_count 元数据中发现了一个聚合模式:gpt-5.5 的响应在 reasoning_output_tokens = 516 处异常集中,且在 1034 和 1552 附近出现固定边界峰值。
这似乎与特定模型相关,并且与整体推理标记强度降低相吻合,这可能有助于解释复杂/高风险 Codex 任务性能下降的现象。
这与 #29353 相关,该问题报告了任务级别的复现现象:gpt-5.5 在推理标记数恰好为 516 时返回错误答案。此问题增加了 2 月至 6 月窗口期内的聚合证据。
我并未声称这证明了隐藏的思维链截断。更具体的主张是:Codex 运维数据表明存在 GPT-5.5 特有的固定标记聚类异常,该现象与阈值推理预算行为一致。
环境
- 产品:Codex
- 最相关模型:gpt-5.5
- 数据来源:Codex token_count 元数据
- 分析时间窗口:2026 年 2 月 1 日至 2026 年 6 月 27 日 UTC
- 相关问题:Codex 桌面端 #29353 中 gpt-5.5 在 xhigh 模式下有时会因推理输出标记数为 516 而提前终止并返回错误最终答案
证据
指标
数值
分析的响应级标记记录
390,195
代表的会话数
865
精确匹配
reasoning_output_tokens = 516事件数
3,363
GPT-5.5 占所有响应比例
19.3%
GPT-5.5 占精确 516 事件比例
82.0%
GPT-5.5 精确 516 / >=516 比例
44.0%
非 GPT-5.5 精确 516 / >=516 比例
1.3%
模型级结果:
模型
响应记录数
精确 516 / >=516
gpt-5.575,401
gpt-5.425,214
19.8%
gpt-5.2247,575
0.34%
gpt-5.3-codex13,333
0.0%
gpt-5.3-codex-spark26,179
每月精确 516 聚集显著增加:
月份
2026 年 2 月
0.11%
2026 年 3 月
2.45%
2026 年 4 月
4.25%
2026 年 5 月
53.30%
2026 年 6 月
35.84%
与此同时,整体推理标记强度下降:
平均推理标记数
P90 推理标记数
268.1
772
256.8
723
228.7
669
106.9
344
168.5
515
为何令人怀疑
异常现象并非单纯的总体推理标记使用增加。从 2-4 月到 5-6 月,平均和 P90 推理标记强度下降,而精确 516 聚集却显著上升。
聚类现象在不同模型间分布也不均匀。gpt-5.5 仅占 19.3% 的响应,却占 82.0% 的精确 516 事件。其精确 516 / >=516 比率约为非 GPT-5.5 基线的 33.6 倍。
固定值也值得注意:516、1034 和 1552 看起来更像是重复的阈值边界,而非自然变化的推理标记分布。
预期行为
复杂 Codex 任务的推理标记计数应随任务复杂度自然变化,不应在某个模型系列中过度集中在确切的固定值上。
实际行为
gpt-5.5 的响应在 516 个推理标记处大量聚集,并在 1034 和 1552 附近出现相关峰值。这种模式在其他多个模型中明显较弱或完全缺失。
问题
Codex 团队能否调查 gpt-5.5 是否存在导致响应在 516/1034/1552 推理标记附近终止的推理预算、路由、截断、回退或调度器行为?
如果这是预期行为,了解确切的 516 是否表示正常停止点、预算上限、降级层级或其他内部阈值将很有帮助。
有用的内部验证检查:
- 按模型查询 token_count 事件与 reasoning_output_tokens 的关联性
- 对比 0、516、1034 和 1552 的确切值计数
- 按模型和日期计算 count(reasoning_output_tokens = 516) / count(reasoning_output_tokens >= 516)
- 对比 gpt-5.5 与 gpt-5.2、gpt-5.4 和 Codex 特定变体
- 在 GPT-5.2 和 GPT-5.5 上重放匹配的复杂任务并进行质量评估,尤其要区分确切 516 响应与长推理响应
当前无法查看反应
元数据
负责人
无人分配
标签
无
类型
无类型
字段
未为无类型的议题配置字段
项目
无项目
里程碑
无里程碑
关系
暂无
开发
无分支或拉取请求
问题操作
- 在 GitHub Copilot 应用中打开