The JetBrains Blog

Does Speaking to Agents Like Cavemen Really Save 65% of Tokens? We Test

8.5内容质量

TL;DR · AI 摘要

JetBrains实测Caveman技能仅节省8.5% token,远低于宣传的65%。测试显示该技能对代码类输出压缩效果有限,仅影响叙述部分。

核心要点

  • Caveman技能实际节省8.5% token,而非宣传的65%
  • 测试使用SkillsBench基准套件和Harbor 0.17测试框架
  • 代码类输出压缩效果有限,仅影响叙述部分

结构提纲

按章节快速跳转。

  1. JetBrains对Caveman技能的token节省效果进行实证测试。

  2. Caveman技能声称可节省65% token但未验证实际效果。

  3. 使用Harbor 0.17SkillsBench进行双臂对比测试。

  4. 实际token节省仅为8.5%,与宣传数据相差悬殊。

  5. 三轮测试显示节省比例稳定在8.5%左右。

  6. 技能对代码类输出压缩效果有限,仅影响叙述部分。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Caveman技能测试效果
    • 测试方法
      • Harbor 0.17框架
      • SkillsBench基准
    • 核心发现
      • 实际节省8.5%
      • 代码输出不受影响
    • 影响范围
      • 仅压缩叙述部分
      • 工具调用保持原样

金句 / Highlights

值得收藏与分享的关键句。

#JetBrains#AI代理#Caveman技能#token优化#测试方法
打开原文

用原始人方式与AI代理对话节省65%的标记。我们进行了测试。

JetBrains AI

通过JetBrains产品中的AI功能增强您的工具

关注

  • 关注:
  • RSS RSS

查看更多

智能代理AI

AI

AI助手

用原始人方式与代理对话真的能节省65%的标记吗?我们进行了测试

Denis Shiryaev

标记压缩能力的配对A/B基准测试

原始人

Claude Code上运行,基于

SkillsBench

:它确实能节省标记吗?是否会影响AI代理输出质量?

宣称节省:65%。实际测量节省:8.5%。

在真实代理任务中强制激活该技能时的输出标记节省情况。这是理论上限,而非常规结果。

我们为何进行此测试

JetBrains正在投入越来越多资源对代码代理相关工具进行严格测试,其中一项技能引起我们的注意:"原始人"。其宣传语用独特方式表达:

该技能让代理像原始人一样说话。为何要用大量标记,少量即可奏效?填充内容消失。代码和命令保持字节精确。每次回复节省65%输出标记。永久有效。支持30+代理。众多GitHub星标。

我们的思考:

宣称效果容易实现,验证却成本高昂。代理不是聊天窗口。代理输出主要是工具调用、文件编辑和代码:该技能承诺不会触碰这些内容。因此我们测量了README未涉及的两个关键指标:多步骤代理任务的实际节省效果,以及强制压缩代理思考过程是否影响任务结果。

实验设置

工具链

Harbor 0.17:Docker沙箱测试,任务级验证器,配对运行。

代理

Claude Code 2.1.200,无头模式,

code
bypassPermissions

.

模型

code
claude-sonnet-5

,推理力度

code
low

(

code
--effort low

).

基准测试

SkillsBench (

code
benchflow/skillsbench

):87个任务中的86个。每个任务通过自身测试在0-1分范围内自动评分,1分表示解决任务,允许部分得分。

对照组A

code
no-skill

:标准Claude Code。

实验组B

code
with-skill-forced

:通过Harbor

code
--skill

安装Caveman并添加一行强制激活指令:"使用原始人模式..."

配对设置

相同任务、相同模型、相同设置、相同预算;排除任务在两组中均被排除。

实验规模

3次运行,约240次计费测试,总费用约106美元。

"强制"的重要性:Caveman需要用户激活。它会在"原始人模式"或"简洁表达"等短语触发。我们在每次回复中强制激活,这意味着以下所有数据都是该技能的最佳表现。在常规使用中,当代理需要自主决定是否激活时,实际节省效果只能等于或低于此处测得的约10%上限。

发现1:实际节省约8.5%,而非65%

宣传的节省效果来自聊天风格的文本回答。代理输出有所不同:代码、差异、工具调用和精确错误字符串主导标记流,Caveman正确地将这些内容原样保留。只有工具调用之间的叙述部分被压缩,且这部分内容本身并不多。

强制Caveman组在三次运行中的输出标记节省情况。首次小规模运行中引人注目的-29.5%未能复现;在大规模测试中节省效果收敛至-8.5%(82个配对任务中输出标记从592k降至542k)。宣称的-65%节省效果远超图表范围。

发现2:未检测到质量下降

我们真正关心的问题:让代理简洁表达是否会影响效果?在完整测试的82个配对任务中,答案是否定的:两组在统计学上无显著差异。

每项任务的配对结果,完整运行。对18个非平局项进行符号检验:p = 0.82,与任何显著差异相差甚远。基线组的平均任务得分为0.326,技能组为0.311,在0-1量表上存在-0.015的差距。

各组平均任务得分。随着样本量增加,早期令人担忧的差距逐渐缩小:这是噪声的规律,而非真实效应。在两个组中,单个任务在重复尝试时会自由地在通过和失败之间切换。

风格迁移本身完全按照设计运行:强制组的转录文本明显具有原始人风格,而代码工件保持不变且正常。

发现3:成本节约是真实存在的但脆弱

成本与约8.5%的token节约保持一致,因此技能组理论上应比基线组便宜约10%。按任务计算确实如此。但在我们完整运行的原始数据中,技能组反而比基线组贵11.6%:40.60美元 vs. 36.39美元。整个结果倒置完全来自单次试验:技能组的一个依赖项审计任务在长上下文定价层级(200k)中暴涨,产生8.29美元费用,而基线组仅0.33美元。在之前的运行中,同一任务在基线组产生了3.25美元的异常值。这是任务本身的属性,而非技能的特性。

结果

安全、对风格诚实、对节省成本的宣传过度。强制启用后,原始人风格可靠地改变了代理的表达方式,而不会对代理生成内容造成可测量的损害:82个配对任务,符号检验p = 0.82。但在实际代理工作中,它最多只能减少约8.5%的输出token和约10%的成本,因为主导代理会话的token是代码和工具调用,而技能组刻意保留了这些内容。宣传的65%节省属于聊天式问答,而非代码代理。

建议:如果你喜欢这个功能就使用它。它很有趣,且在质量上没有可测量的损失。但不要指望在日常代理任务上获得巨大的节省效果:个位数百分比是现实的上限。

  • 质量:未检测到退化:8项任务更好,10项更差,64项平局;平均任务得分在0-1量表上相差0.015(p = 0.82)。
  • Token:强制启用时输出token减少8.5%,这意味着这是上限;自动触发使用节省更少甚至没有节省。
  • 成本:预期减少约10%,但常被单次试验的方差抵消。
  • 方法论附加:我们最初的10项任务运行显示了-30%的token节省。随着样本量增加,这种效果消失。永远不要相信k=1的评估。

想测试下一个技能?在评论中留下名字。字数足够少。我们进行测试。

运行详情:Harbor 0.17;claude-sonnet-5(推理努力程度低);SkillsBench 86/87任务;约240次试验;总支出约106美元。

  • 分享
  • Facebook
  • Twitter
  • LinkedIn

上一篇博客

GitHub Copilot现在成为JetBrains IDEs中的集成代理