Hacker News Best

GPT-5.5 Codex reasoning-token clustering may be leading to degraded performance

6.9内容质量

TL;DR · AI 摘要

GPT-5.5 Codex reasoning-token clustering at 516/1034/1552 may be leading to degraded performance on complex tasks · Issu...

核心要点

  • 主题聚焦:GPT-5.5 Codex reasoning-token clustering may be
  • 来源:Hacker News Best,建议结合原文判断细节。
  • AI 分析暂不可用,本条为保底评分与摘要。
#AI#编程#前端#产品#开源
打开原文

GPT-5.5 Codex 推理标记聚类在 516/1034/1552 可能导致复杂任务性能下降 · Issue #30364 · openai/codex · GitHub

哦不!

加载时发生错误。请重新加载此页面。

openai

/

codex

公共

  • 通知 您必须登录才能更改通知设置
  • 分叉 14.2k
  • 星标 95.6k

$

GPT-5.5 Codex 推理标记聚类在 516/1034/1552 可能导致复杂任务性能下降 #30364

$!

新建问题

/$

复制链接

打开

GPT-5.5 Codex 推理标记聚类在 516/1034/1552 可能导致复杂任务性能下降

#30364

标签

bug

某些功能无法正常工作

model-behavior

与模型行为相关的议题

rate-limits

与速率限制、配额和标记使用报告相关的议题

描述

vguptaa45

于 2026 年 6 月 27 日创建

问题正文操作

概述

我在 Codex token_count 元数据中发现了一个聚合模式:gpt-5.5 的响应在 reasoning_output_tokens = 516 处异常集中,且在 1034 和 1552 附近出现固定边界峰值。

这似乎与特定模型相关,并且与整体推理标记强度降低相吻合,这可能有助于解释复杂/高风险 Codex 任务性能下降的现象。

这与 #29353 相关,该问题报告了任务级别的复现现象:gpt-5.5 在推理标记数恰好为 516 时返回错误答案。此问题增加了 2 月至 6 月窗口期内的聚合证据。

我并未声称这证明了隐藏的思维链截断。更具体的主张是:Codex 运维数据表明存在 GPT-5.5 特有的固定标记聚类异常,该现象与阈值推理预算行为一致。

环境

  • 产品:Codex
  • 最相关模型:gpt-5.5
  • 数据来源:Codex token_count 元数据
  • 分析时间窗口:2026 年 2 月 1 日至 2026 年 6 月 27 日 UTC
  • 相关问题:Codex 桌面端 #29353 中 gpt-5.5 在 xhigh 模式下有时会因推理输出标记数为 516 而提前终止并返回错误最终答案

证据

指标

数值

分析的响应级标记记录

390,195

代表的会话数

865

精确匹配

code
reasoning_output_tokens = 516

事件数

3,363

GPT-5.5 占所有响应比例

19.3%

GPT-5.5 占精确 516 事件比例

82.0%

GPT-5.5 精确 516 / >=516 比例

44.0%

非 GPT-5.5 精确 516 / >=516 比例

1.3%

模型级结果:

模型

响应记录数

精确 516 / >=516

code
gpt-5.5

75,401

code
gpt-5.4

25,214

19.8%

code
gpt-5.2

247,575

0.34%

code
gpt-5.3-codex

13,333

0.0%

code
gpt-5.3-codex-spark

26,179

每月精确 516 聚集显著增加:

月份

2026 年 2 月

0.11%

2026 年 3 月

2.45%

2026 年 4 月

4.25%

2026 年 5 月

53.30%

2026 年 6 月

35.84%

与此同时,整体推理标记强度下降:

平均推理标记数

P90 推理标记数

268.1

772

256.8

723

228.7

669

106.9

344

168.5

515

为何令人怀疑

异常现象并非单纯的总体推理标记使用增加。从 2-4 月到 5-6 月,平均和 P90 推理标记强度下降,而精确 516 聚集却显著上升。

聚类现象在不同模型间分布也不均匀。gpt-5.5 仅占 19.3% 的响应,却占 82.0% 的精确 516 事件。其精确 516 / >=516 比率约为非 GPT-5.5 基线的 33.6 倍。

固定值也值得注意:516、1034 和 1552 看起来更像是重复的阈值边界,而非自然变化的推理标记分布。

预期行为

复杂 Codex 任务的推理标记计数应随任务复杂度自然变化,不应在某个模型系列中过度集中在确切的固定值上。

实际行为

gpt-5.5 的响应在 516 个推理标记处大量聚集,并在 1034 和 1552 附近出现相关峰值。这种模式在其他多个模型中明显较弱或完全缺失。

问题

Codex 团队能否调查 gpt-5.5 是否存在导致响应在 516/1034/1552 推理标记附近终止的推理预算、路由、截断、回退或调度器行为?

如果这是预期行为,了解确切的 516 是否表示正常停止点、预算上限、降级层级或其他内部阈值将很有帮助。

有用的内部验证检查:

  • 按模型查询 token_count 事件与 reasoning_output_tokens 的关联性
  • 对比 0、516、1034 和 1552 的确切值计数
  • 按模型和日期计算 count(reasoning_output_tokens = 516) / count(reasoning_output_tokens >= 516)
  • 对比 gpt-5.5 与 gpt-5.2、gpt-5.4 和 Codex 特定变体
  • 在 GPT-5.2 和 GPT-5.5 上重放匹配的复杂任务并进行质量评估,尤其要区分确切 516 响应与长推理响应

当前无法查看反应

元数据

负责人

无人分配

标签

类型

无类型

字段

未为无类型的议题配置字段

项目

无项目

里程碑

无里程碑

关系

暂无

开发

无分支或拉取请求

问题操作

  • 在 GitHub Copilot 应用中打开