Does Speaking to Agents Like Cavemen Really Save 65% of Tokens? We Test
TL;DR · AI 摘要
JetBrains实测Caveman技能仅节省8.5% token,远低于宣传的65%。测试显示该技能对代码类输出压缩效果有限,仅影响叙述部分。
核心要点
- Caveman技能实际节省8.5% token,而非宣传的65%
- 测试使用SkillsBench基准套件和Harbor 0.17测试框架
- 代码类输出压缩效果有限,仅影响叙述部分
结构提纲
按章节快速跳转。
- §引言
JetBrains对Caveman技能的token节省效果进行实证测试。
- ·测试背景
Caveman技能声称可节省65% token但未验证实际效果。
- ›测试设置
使用Harbor 0.17和SkillsBench进行双臂对比测试。
- ·发现1
实际token节省仅为8.5%,与宣传数据相差悬殊。
- ›数据对比
三轮测试显示节省比例稳定在8.5%左右。
- ·结论
技能对代码类输出压缩效果有限,仅影响叙述部分。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Caveman技能测试效果
- 测试方法
- Harbor 0.17框架
- SkillsBench基准
- 核心发现
- 实际节省8.5%
- 代码输出不受影响
- 影响范围
- 仅压缩叙述部分
- 工具调用保持原样
金句 / Highlights
值得收藏与分享的关键句。
Advertised saving: 65%. Measured saving: 8.5%.
Only the narration between tool calls gets compressed
Forced activation achieves best-case scenario of 8.5% saving
用原始人方式与AI代理对话节省65%的标记。我们进行了测试。
JetBrains AI
通过JetBrains产品中的AI功能增强您的工具
关注
- 关注:
- RSS RSS
查看更多
智能代理AI
AI
AI助手
用原始人方式与代理对话真的能节省65%的标记吗?我们进行了测试
Denis Shiryaev
标记压缩能力的配对A/B基准测试
原始人
在Claude Code上运行,基于
SkillsBench
:它确实能节省标记吗?是否会影响AI代理输出质量?
宣称节省:65%。实际测量节省:8.5%。
在真实代理任务中强制激活该技能时的输出标记节省情况。这是理论上限,而非常规结果。
我们为何进行此测试
JetBrains正在投入越来越多资源对代码代理相关工具进行严格测试,其中一项技能引起我们的注意:"原始人"。其宣传语用独特方式表达:
该技能让代理像原始人一样说话。为何要用大量标记,少量即可奏效?填充内容消失。代码和命令保持字节精确。每次回复节省65%输出标记。永久有效。支持30+代理。众多GitHub星标。
我们的思考:
宣称效果容易实现,验证却成本高昂。代理不是聊天窗口。代理输出主要是工具调用、文件编辑和代码:该技能承诺不会触碰这些内容。因此我们测量了README未涉及的两个关键指标:多步骤代理任务的实际节省效果,以及强制压缩代理思考过程是否影响任务结果。
实验设置
工具链
Harbor 0.17:Docker沙箱测试,任务级验证器,配对运行。
代理
Claude Code 2.1.200,无头模式,
bypassPermissions.
模型
claude-sonnet-5,推理力度
low(
--effort low).
基准测试
SkillsBench (
benchflow/skillsbench):87个任务中的86个。每个任务通过自身测试在0-1分范围内自动评分,1分表示解决任务,允许部分得分。
对照组A
no-skill:标准Claude Code。
实验组B
with-skill-forced:通过Harbor
--skill安装Caveman并添加一行强制激活指令:"使用原始人模式..."
配对设置
相同任务、相同模型、相同设置、相同预算;排除任务在两组中均被排除。
实验规模
3次运行,约240次计费测试,总费用约106美元。
"强制"的重要性:Caveman需要用户激活。它会在"原始人模式"或"简洁表达"等短语触发。我们在每次回复中强制激活,这意味着以下所有数据都是该技能的最佳表现。在常规使用中,当代理需要自主决定是否激活时,实际节省效果只能等于或低于此处测得的约10%上限。
发现1:实际节省约8.5%,而非65%
宣传的节省效果来自聊天风格的文本回答。代理输出有所不同:代码、差异、工具调用和精确错误字符串主导标记流,Caveman正确地将这些内容原样保留。只有工具调用之间的叙述部分被压缩,且这部分内容本身并不多。
强制Caveman组在三次运行中的输出标记节省情况。首次小规模运行中引人注目的-29.5%未能复现;在大规模测试中节省效果收敛至-8.5%(82个配对任务中输出标记从592k降至542k)。宣称的-65%节省效果远超图表范围。
发现2:未检测到质量下降
我们真正关心的问题:让代理简洁表达是否会影响效果?在完整测试的82个配对任务中,答案是否定的:两组在统计学上无显著差异。
每项任务的配对结果,完整运行。对18个非平局项进行符号检验:p = 0.82,与任何显著差异相差甚远。基线组的平均任务得分为0.326,技能组为0.311,在0-1量表上存在-0.015的差距。
各组平均任务得分。随着样本量增加,早期令人担忧的差距逐渐缩小:这是噪声的规律,而非真实效应。在两个组中,单个任务在重复尝试时会自由地在通过和失败之间切换。
风格迁移本身完全按照设计运行:强制组的转录文本明显具有原始人风格,而代码工件保持不变且正常。
发现3:成本节约是真实存在的但脆弱
成本与约8.5%的token节约保持一致,因此技能组理论上应比基线组便宜约10%。按任务计算确实如此。但在我们完整运行的原始数据中,技能组反而比基线组贵11.6%:40.60美元 vs. 36.39美元。整个结果倒置完全来自单次试验:技能组的一个依赖项审计任务在长上下文定价层级(200k)中暴涨,产生8.29美元费用,而基线组仅0.33美元。在之前的运行中,同一任务在基线组产生了3.25美元的异常值。这是任务本身的属性,而非技能的特性。
结果
安全、对风格诚实、对节省成本的宣传过度。强制启用后,原始人风格可靠地改变了代理的表达方式,而不会对代理生成内容造成可测量的损害:82个配对任务,符号检验p = 0.82。但在实际代理工作中,它最多只能减少约8.5%的输出token和约10%的成本,因为主导代理会话的token是代码和工具调用,而技能组刻意保留了这些内容。宣传的65%节省属于聊天式问答,而非代码代理。
建议:如果你喜欢这个功能就使用它。它很有趣,且在质量上没有可测量的损失。但不要指望在日常代理任务上获得巨大的节省效果:个位数百分比是现实的上限。
- 质量:未检测到退化:8项任务更好,10项更差,64项平局;平均任务得分在0-1量表上相差0.015(p = 0.82)。
- Token:强制启用时输出token减少8.5%,这意味着这是上限;自动触发使用节省更少甚至没有节省。
- 成本:预期减少约10%,但常被单次试验的方差抵消。
- 方法论附加:我们最初的10项任务运行显示了-30%的token节省。随着样本量增加,这种效果消失。永远不要相信k=1的评估。
想测试下一个技能?在评论中留下名字。字数足够少。我们进行测试。
运行详情:Harbor 0.17;claude-sonnet-5(推理努力程度低);SkillsBench 86/87任务;约240次试验;总支出约106美元。
- 分享
上一篇博客
GitHub Copilot现在成为JetBrains IDEs中的集成代理