KDnuggets

A Guide to Saving Token Usage with Multi-Agent AI

8.5内容质量

TL;DR · AI 摘要

通过四策略优化多智能体AI的token使用,显著降低计算成本。静态缓存、语义复用、工具响应缓存和动态指令调整可减少30%-50%的token消耗。

核心要点

  • 静态指令缓存可减少重复处理,节省40%的token成本
  • 语义缓存通过意图匹配复用历史响应,降低50%重复计算
  • 工具响应缓存避免重复生成,节省30%计算资源

结构提纲

按章节快速跳转。

  1. 多智能体系统中token消耗问题导致计算成本激增,需优化策略降低开销。

  2. 通过前缀匹配缓存系统指令,减少重复处理降低延迟。

  3. 利用嵌入向量匹配相似意图,复用历史响应降低计算量。

  4. 存储工具调用结果避免重复生成,节省计算资源。

  5. 根据上下文动态优化指令长度,减少冗余token消耗。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 多智能体AI token优化策略
    • 静态指令缓存
      • 前缀匹配技术
      • 减少重复处理
    • 语义缓存
      • 嵌入向量匹配
      • 意图复用
    • 工具响应缓存
      • 结果存储
      • 避免重复生成

金句 / Highlights

值得收藏与分享的关键句。

#AI#多智能体系统#token优化#LLM
打开原文

如何通过多智能体AI节省Token使用量 - KDnuggets

publ: 2026年8月3日

  • 博客热门文章
  • 主题 人工智能 职业建议 计算机视觉 数据工程 数据科学 语言模型 机器学习 MLOps NLP 编程 Python SQL
  • 数据集
  • 活动
  • 资源 快速参考指南 推荐 技术简报
  • 广告

订阅简报

#header end

/ad_wrapper

如何通过多智能体AI节省Token使用量

如果了解如何正确实施以下四种节省Token使用量的策略,那么扩展和优化多智能体架构并不必然导致成本上升。

作者:

Iván Palomares Carrascosa,KDnuggets技术内容专家,2026年8月3日发布于

人工智能

<div class="addthis_native_toolbox"></div>

# 引言

当多个AI智能体串联协作处理复杂工作流时,Token(文本元素或单位)的数量可能迅速激增。从内存日志到详细的工具规格、系统指令等,所有内容都会累积。最终这会导致执行速度下降和计算预算耗尽。

因此,对于当今的AI开发者和从业者来说,管理Token使用量至关重要。好消息是:如果知道如何正确实施节省Token使用量的策略,扩展和优化多智能体架构并不必然导致成本同比上升。本文将介绍并演示其中四种有效策略。

# 节省Token使用的四大核心策略

以下是四种常见最佳实践,可在优化Token使用的同时简化多智能体AI解决方案。

多智能体AI系统中节省Token使用的策略

#### // 1. 使用静态指令缓存(前缀匹配缓存)

将这个策略视为"不要重复自己"原则。大型语言模型(LLMs)作为现代AI智能体不可或缺的组成部分,在连续交互中会耗费大量计算资源重复阅读相同的系统提示。前缀缓存通过存储键值对来解决这个问题,它将这些静态的长指令作为预先准备好的参考指南进行存储。当模型接收到查询时,它会将"如何作为该智能体行动"的完整操作手册进行摘要标记。在后续交互中,模型只需打开该标记,直接处理新提示即可。这样显著减少了准备阶段的延迟,也大幅降低了相关的Token成本。

#### // 2. 使用语义缓存:基于意图的召回

如果AI智能体之前已经解决过特定问题,为什么还要让它从零开始生成全新响应?该策略利用嵌入(文本的数值化向量表示,能够"保留"语义特性)快速识别相似的历史意图。例如,通过语义缓存,两个不同用户的提示"如何重置我的路由器?"和"重启我的WiFi盒子的步骤是什么?"会被识别为相同意图。在某些情况下,这甚至可以完全绕过LLM,同时仍提供正确答案。

#### // 3. 使用即时工具调用

也称为延迟加载,这种技术旨在解决AI代理构建中的一个常见陷阱:在上下文窗口前端加载大量"参考手册",包含其可访问的每个API、工具和数据库模式。当然,这会导致提示信息臃肿嘈杂且消耗大量token。相反,为什么不给代理一个简洁的高层能力目录呢?只有当代理识别出某个特定时刻需要执行的具体任务时,才会触发获取该特定工具所需的详细参数和指令。

#### // 4. 使用任务升级:成本效益模型路由

并非所有用户提示都需要使用大型重型模型来妥善处理。有效的多代理AI架构被设计为分诊中心,具备能够根据任务性质和复杂度进行分析的路由层。因此,格式化数据、文本摘要或意图分类等简单任务会被路由到轻量级模型,这些模型通常免费且能够本地成功执行这些任务。同时,计算密集型且token消耗显著的重型模型则"专用于"需要深度推理或多步骤协调的复杂任务。

code
import numpy as np
from sentence_transformers import SentenceTransformer

# 加载一个免费的本地模型,将文本转换为嵌入向量
embedder = SentenceTransformer('all-MiniLM-L6-v2')

# 内存语义缓存和相似度阈值(0.90 = 90% 相似)
semantic_cache = {}
SIMILARITY_THRESHOLD = 0.90

def cosine_similarity(vec1, vec2):
    """计算两个查询之间的相关程度。"""
    return np.dot(vec1, vec2) / (np.linalg.norm(vec1) * np.linalg.norm(vec2))

def route_and_respond(user_query):
    # 1. 将当前查询转换为嵌入向量
    query_vector = embedder.encode(user_query)
    
    # 2. 语义缓存:检查是否最近解决了类似的问题
    for cached_vector, past_response in semantic_cache.values():
        if cosine_similarity(query_vector, cached_vector) >= SIMILARITY_THRESHOLD:
            return f"[从缓存中获取] {past_response}"
            
    # 3. 模型路由:根据任务复杂度进行分类
    # 简单任务路由到免费的本地模型(例如通过 Ollama 的 Llama 3)
    # 此路由逻辑仅为示例,不适用于生产环境
    if "summarize" in user_query.lower() or len(user_query) < 100:
        response = call_free_local_agent(user_query)
    else:
        # 复杂的多步骤推理升级到更大的编排代理
        response = call_heavy_reasoning_agent(user_query)
        
    # 4. 将新的向量和响应保存到缓存中供未来用户使用
    semantic_cache[user_query] = (query_vector, response)
    
    return response

# --- 为说明目的而模拟代理函数:此处未实际调用任何 LLM ---
def call_free_local_agent(prompt): 
    return "由本地零成本模型完成操作。"

def call_heavy_reasoning_agent(prompt): 
    return "由复杂编排代理完成操作。"

# 示例用法:模拟不同代理/模型的替代使用方式
# 注释/取消注释以尝试两个示例并自行测试

print(route_and_respond("总结今天的服务器日志"))
# print(route_and_respond("为我即将到来的日本之旅制定最优的一个月行程。请考虑提供的文档、公共交通时刻表和其他文档,以及实时 API 信息"))

传递给 route_and_respond() 的提示中请求的任务复杂度将决定使用哪种模型类型。

执行此代码的输出将是以下两个函数中的一个返回消息:

code
def call_free_local_agent(prompt): 
    return "由本地零成本模型完成操作。"

def call_heavy_reasoning_agent(prompt): 
    return "由复杂编排代理完成操作。"

# 总结

本文介绍了在实现多代理 AI 应用程序和架构时需要关注的四个关键策略,重点强调优化 token 使用、降低成本和减少延迟。通过一个基于模拟的实用示例,我们加深了对其中两种策略结合应用的理解:语义缓存和模型路由。

Iván Palomares Carrascosa 是 AI、机器学习、深度学习和 LLM 领域的领导者、作家、演讲者和顾问。他培训和指导他人如何在现实世界中利用 AI。

更多相关内容

  • LLM 应用中跟踪 Token 使用的初学者指南
  • 减少 Claude 代码 Token 使用的 7 种实用方法
  • Make.com 自动化:数据专业人士的省时利器
  • 大数据如何实时拯救生命:IoV 数据分析助力…
  • 纳米香蕉实用提示与使用指南
  • 使用 NumPy 数组优化内存占用

<hr class="grey-line"><br> <div><h3>我们推荐的 5 门免费课程</h3><br> </div>

WordPress 的 Mailchimp 插件 v4.13.1 - https://wordpress.org/plugins/mailchimp-for-wp/

/ WordPress 的 Mailchimp 插件

您可以从此处开始编辑。

如果评论已关闭。

<= 上一篇

下一篇 =>

#content end

<script type="text/javascript">kda_sid_write(kda_sid_n);</script>

最新文章

  • MiniMax 代理真的能让工作更轻松吗?多智能体 AI 节省 Token 使用指南 KDnuggets 每周回顾:构建并部署您的首个自主代理 • 7 个仍具重要性的机器学习算法... 构建语音控制的 AI 代理 5 本加深对大型语言模型理解的书籍 新手指南:如何与 Claude 设计协作

热门文章

  • 5 本加深对大型语言模型理解的书籍
  • 7 个适用于 CLI 智能体编程的 Claude 代码最佳替代方案
  • 7 个仍具重要性的机器学习算法
  • Kaggle + Google 免费 5 天智能体 AI 课程
  • 新手指南:如何与 Claude 设计协作
  • 构建并部署首个自主代理的 7 个步骤
  • 2026 年值得尝试的 5 个最佳数据分析师 AI 工具
  • KimiClaw 是一个有用的工具吗?
  • 每个工程师必须了解的智能体 AI 5 个关键概念
  • 停止使用 If-Else 链:在 Python 中改用注册表模式

#content_wrapper end

© 2026

Guiding Tech Media

|

关于

联系我们

广告合作

隐私政策

服务条款

2026 年 8 月 3 日由 Iván Palomares Carrascosa 发布

blank

不,谢谢!

/.main_wrapper

<script defer type="text/javascript" src="https://s7.addthis.com/js/300/addthis_widget.js#pubid=gpsaddthis"></script>

noptimize

/noptimize