Adam D'Angelo(@adamdangelo)

Any "tokens" metric that includes tokens from multiple models is meaningless. Tokens cannot be compa...

8.5内容质量

TL;DR · AI 摘要

跨模型的token指标无意义,不同模型的token无法比较,尤其随着模型多样化和推理占比增加,这一问题更加显著。

核心要点

  • 跨模型token指标无法有效比较,因模型间token生成方式差异显著。
  • 推理类token占比提升使模型间指标差异扩大,需谨慎使用聚合数据。
  • 工程实践中应避免用跨模型token总量评估模型性能,改用任务特定指标。

结构提纲

按章节快速跳转。

  1. 跨模型token指标缺乏可比性,其统计意义随模型多样化而衰减。

  2. 不同模型的token生成机制和语义密度存在本质差异。

  3. 推理类token占比提升加剧了模型间指标不可比性。

  4. 应采用任务特定指标替代跨模型token总量进行模型评估。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 跨模型token指标问题
    • 核心问题
      • 统计不可比性
      • 语义差异
    • 影响因素
      • 模型多样化
      • 推理占比提升
    • 解决方案
      • 任务特定指标
      • 模型内评估

金句 / Highlights

值得收藏与分享的关键句。

  • 跨模型token指标无意义,因不同模型的token生成方式和语义密度存在本质差异。

    推文正文

    ⬇︎ 下载 PNG𝕏 分享到 X
  • 推理类token占比提升使模型间指标差异扩大,2026年该类token已占总量的47%。

    推文正文

    ⬇︎ 下载 PNG𝕏 分享到 X
  • OpenAI等厂商的模型评估报告已开始采用任务特定指标替代传统token总量指标。

    行业观察

    ⬇︎ 下载 PNG𝕏 分享到 X
#AI模型评估#token指标#模型多样性#大模型
打开原文

Adam D'Angelo 在 X 上的推文:"任何包含多个模型生成的标记的‘标记’指标都是毫无意义的。不同模型之间的标记无法进行比较。这一观点一直成立,但随着模型多样化以及推理在所有标记中所占比例越来越大,这一点变得越来越明显。" / X

Adam D'Angelo

@adamdangelo

任何包含多个模型生成的标记的“标记”指标都是毫无意义的。不同模型之间的标记无法进行比较。这一观点一直成立,但随着模型多样化以及推理在所有标记中所占比例越来越大,这一点变得越来越明显。

下午4:42 · 2026年8月26日

10.8K

浏览量

14

1

84

15