Guide to AI Tokenomics: Eleven Principles for Token Efficient Software Engineering
TL;DR · AI 摘要
Google Cloud提出AI编码助手的11条token优化原则,通过模型选择、技能封装、分治策略等方法提升效率。
核心要点
- 使用默认Gemini 3.5 Flash模型,根据任务复杂度动态调整模型规模。
- 通过SKILL.md文件封装可复用技能,减少重复提示。
- 分治策略结合长上下文会话生成执行计划,提升效率。
结构提纲
按章节快速跳转。
- §引言
优化token消耗是保持AI编码助手效率和准确性的关键。
建议从Gemini 3.5 Flash默认模型开始,根据任务复杂度动态调整模型规模。
通过SKILL.md文件封装可复用技能,避免重复解释工作流程。
将输出密集任务委托给子代理,仅需整合最终结果。
- ·验证左移
早期自动化测试可减少后期昂贵的验证循环。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI Tokenomics原则
- 模型选择
- 默认Gemini 3.5 Flash
- 动态调整模型规模
- 技能封装
- SKILL.md文件
- 自动化触发
- 分治策略
- 子代理委托
- 执行计划生成
金句 / Highlights
值得收藏与分享的关键句。
使用默认模型并根据任务复杂度动态调整模型规模,可平衡性能与成本。
SKILL.md文件封装技能可使提示保持简洁,避免上下文膨胀。
分治策略结合长上下文会话生成执行计划,可提升低token会话效率。
AI 代币经济学指南:面向高效软件工程的十一条原则 | Google Cloud 博客
开发者与实践者
AI 代币经济学指南:面向高效软件工程的十一条原则
2026年7月18日
##### Alex "Sandu" Astrum
开发者关系,Antigravity
##### Luke Schlangen
Google Cloud 开发者倡导者
优化代币消耗是保持AI编码助手快速和准确的关键。你可能不再编写每一行代码,但现在你负责指导这些编码助手专注于从每个代币中获取最大价值。上下文膨胀会增加延迟,导致模型忘记指令或产生幻觉,这也会产生成本并使人类注意力偏离真正重要的问题。结构化习惯有助于你维持快速、精准且高效的反馈循环。
1. 从平衡模型开始
当不确定时,从默认的Gemini 3.5 Flash(中等推理能力)开始。随着任务推进逐步评估复杂度。如果任务失败、似乎需要过多跳转步骤或需要复杂设计,则升级到更大模型或更高推理能力。
2. 从一开始就使用技能
避免在每个提示中解释工作流程、测试规则或环境。通过询问他人、查找在线资源或使用SKILL.md文件和脚本打包可复用技能。代理会自动触发这些技能,保持提示简洁,避免不必要的在线文档搜索或本地代码和环境检查。
3. 使用脚本和CLI工具实现自动化
对于格式化多个文件或提取日志数据等重复性任务,让代理创建简单的本地工具。使用官方CLI工具进行设置、代码检查和测试。在编写代码前运行只读命令研究代码库,避免冗长的试错循环。
4. 将输出密集型任务委派给子代理
将深度研究或前后端工作分离等输出密集型任务委派给子代理。一旦子代理完成工作,你只需整合最终结果,而非完整过程轨迹。
5. 分而治之
David Rensin撰写的《大象、金鱼与软件工程的新黄金时代》解释了如何利用高推理能力、长上下文会话("大象")生成详细执行计划("金鱼")。在干净的低代币会话中执行该计划。经常通过提交或制品检查进度,以便在上下文填满时从干净状态重新开始。
6. 尽早进行验证
尽早自动化测试。在进行UI测试前运行本地构建和单元/功能测试。让代理在交接前立即在浏览器中执行耗资昂贵的冒烟测试。将昂贵的验证循环保留到里程碑的最后阶段。
7. 迷路时及时撤销
如果代理偏离轨道且你知道修复方法,请在轨迹线程中使用撤销按钮或还原文件。不要在损坏状态上堆砌纠正提示,这会污染上下文。
8. 明确指定上下文
明确具体而非微观管理。一个有少量拼写错误的清晰指令,优于语法准确但范围宽泛的请求。同样,直接指向你关心的精确文件、部分或错误(附有明显的// SHOULD BE X, NOT Y, FIX THIS注释),比让代理在10k日志中进行开放式搜索更有效。尽可能使用内联注释,让代理明确知道你希望修复的位置。
9. 对规则进行迭代
如果你持续修正代理的行为,请更新 AGENTS.md 中的全局规则或编辑技能。应修改指令而非反复提示代理,以确保更改持久生效。
10. 避免失控循环
扫描项目寻找待处理工作的监督循环可以发现优化点,但很容易消耗完你的全部令牌预算。如果必须运行循环,请设置严格限制和停止条件。高自主性需要更严密的防护机制和更完善的评估体系。不要让代理在循环中轮询状态,应采用事件驱动的唤醒机制。
11. 每个新主题都应开启新会话
如果继续讨论同一主题,使用相同对话可以让代理复用现有上下文。但如果切换主题,请开启新对话。当代理仅加载所需上下文时,能用更少令牌提供更精准的回答。
优先级与资源分配
令牌资源并非取之不尽。每个大语言模型调用背后都有实际的物理机器在运行,为你生成输出。请优先推进你最关注的项目和功能。
令牌优化的本质是引导AI的注意力。通过分层策略,既能保持开发效率,又能确保输出质量,同时实现资源最优配置。希望这11条原则能启发你在AI会话中找到引导与自动化之间的最佳平衡点。
Posted in
- 开发者与实践者