Microsoft Azure Blog

The Economics of Agent Optimization: From pilots to measurable returns

8.5内容质量

TL;DR · AI 摘要

企业需从AI试点转向可衡量的回报,通过成本管理和优化策略实现财务纪律,Microsoft Foundry提供托管投资系统优化成本。

核心要点

  • 71%的业务领袖计划增加AI预算,但需财务纪律确保投资回报
  • 代理复杂性使单次用户请求可能触发多次模型调用
  • Microsoft Foundry通过托管投资系统实现AI成本精细化管理

结构提纲

按章节快速跳转。

  1. AI投资从可行性验证转向财务回报验证,71%企业计划增加AI预算但面临成本控制挑战

  2. 模型选择非唯一成本因素,代理架构设计直接影响请求次数和资源消耗

  3. 单次用户请求可能触发多次模型调用,工作流程设计决定成本效率

  4. 通过成本可见性、代理优化和投资回报分析实现AI成本精细化管理

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AI成本优化策略
    • 成本构成分析
      • 模型选择
      • 代理架构
    • 优化方法
      • 成本可见性
      • 工作流程设计
      • 投资回报分析
    • 实施平台
      • Microsoft Foundry

金句 / Highlights

值得收藏与分享的关键句。

#AI#成本管理#Microsoft Foundry#企业应用#预算优化
打开原文

_本文是系列文章代理优化的经济学的第一部分,该系列将分享策略、能力和实证案例,帮助您优化代理成本,并在Microsoft Foundry上将AI作为托管投资系统运行。_

  • * *

大多数企业的AI讨论已从白板转移到预算审查。两年前的问题是AI是否能运作,而如今领导者提出的问题更加尖锐且令人不适:它是否实现了自我回报?

目前处于生产阶段的团队(包括超过10万正在基于Microsoft Foundry构建的组织)已使这个问题变得紧迫。标记已成为新的技术支出单位,而财务纪律(而非模型选择)决定了有前景的试点能否扩展。资金已经开始流动:在一项由微软委托IDC进行的针对4000多名企业领导者的研究中,71%的人表示计划增加AI预算,资金来源包括IT和非IT部门。预算在增长,问题是财务纪律是否同步提升。

71%的企业领导者计划增加AI预算

2025年IDC调查

领先团队并未寻找更便宜的模型。他们停止将AI作为一系列单次试点运行,而是开始将其作为托管投资系统运行:每个请求根据任务进行调整,每个代理在运行时持续改进,每笔支出都有明确的界限和记录。这种从购买智能到管理智能的转变才是关键所在。本系列文章将探讨该系统的运作原理,并解释为什么Microsoft Foundry专为运行此类系统而构建。

了解您的AI成本和支出

在管理AI支出之前,您需要理解其产生的原因。成本不仅由所选模型决定,还受到围绕该模型构建的应用或代理的影响。

每个请求都包含输入标记(如系统提示、对话历史、工具定义和检索内容),以及模型生成的输出标记。由于模型是无状态的,每次请求都需要发送完整上下文。即使用户仅提出一个简单的后续问题,成本也可能随时间推移而增加。

代理引入了另一层复杂性。代理可能评估多个选项、重试操作或调用多个工具后才生成响应,而非遵循单一路径。单个用户请求可能触发多次模型调用,使工作流设计的重要性不亚于模型选择。

提升团队间的AI成本可见性

当AI支出表现为单一汇总数字时,管理难度较大。团队需要按应用、代理、工作流和模型了解成本构成,以识别使用驱动因素并发现优化机会。

缺乏这种级别的归因分析,将难以解释成本、优先改进事项或衡量优化工作的效果。

控制和优化支出

可见性本身并不足够。AI工作负载可以快速扩展,短时间内可能出现的意外行为会导致消耗激增。组织需要能够帮助在成本成为意外之前管理支出的控制措施。

优化也不仅仅是选择成本较低的模型。大多数AI工作负载包含具有不同需求的请求混合。更好的结果来自于将请求匹配到合适的模型,减少不必要的上下文,限制不需要的工具使用,并改进代理工作流程以提高效率。

为什么微软是AI FinOps的平台

FinOps最初是将财务责任引入可变云支出的学科,一种共享的操作模型,将工程、财务和产品团队置于同一组数据上。AI的FinOps归结为四个承诺:

  1. 使AI支出可预测以获得资金支持
  2. 设计上高效
  3. 在规模上优化
  4. 在价值上得到验证

微软的答案是针对AI FinOps的单一、第一方方法,贯穿整个生命周期——规划、构建、管理和衡量。成本可见性和控制功能已内置到团队日常使用的工具中:在Microsoft Foundry和GitHub上构建和运行代理,Microsoft Cost Management用于分配和回收费用,Azure定价提供基于承诺的节省优惠,以及Azure API管理作为计量和管理AI流量的网关。Microsoft Agent 365将同样的方法扩展到租户——通过统一的管理平台,将微软和第三方平台的代理成本管理整合在一起,实现预算上限、部门回收费用和支出政策的集中管理。它们共同为组织提供了任何单一工具都无法实现的东西:从第一个提示到董事会层面的ROI数字,覆盖整个AI资产的全面、一流的成本管理。

Foundry是该方法具体化的体现,因为这是代理运行和优化的地方。它通过一个闭环将AI作为托管投资系统运行:在运行时优化每个请求,在时间上优化每个代理工作流程,并持续管理支出

AI成本优化始于可见性

托管投资系统在三个不同速度层级上做出决策。您可以在请求运行时即时优化请求,在数天或数周内通过学习有效方法优化代理工作流程,并通过持续治理支出(配备永不休眠的限制和预算)进行管理。Foundry专为实现这三方面而构建。每个决策层级都对应一组独特的Foundry功能,下图展示了它们如何协同配合。

| 决策类型 | Foundry为您提供的能力 | | --- | --- | | 运行时优化请求 _合理调整每次调用规模,确保简单任务不会产生前沿模型的高昂费用_ | * Microsoft Foundry模型路由器根据成本、质量及平衡模式分配每个提示,防止简单请求产生前沿模型费用。* 部署和定价选项将工作负载匹配至对应的成本和延迟需求,覆盖全球部署、数据区域部署、区域部署,以及标准模式、优先模式、预置吞吐量模式和批量处理模式。* 提示和语义缓存复用重复上下文而非重复计算。* 微调功能让小型微调模型在特定任务上匹配大型模型表现,降低每token费用并缩短提示长度。* Microsoft IQ构建了覆盖人员工作方式、企业运营、机构知识和网络的共享企业智能层。在该层中,Foundry IQ为代理提供可复用的、具备权限意识的知识库,并通过代理检索机制仅选择最相关上下文,提升事实依据准确性同时减少冗余输入token。 | | 长期优化工作流程 _随着代理学习有效方法,逐步降低每个代理的成本_ | * 代理优化器通过您的评估器测试提示、模型、工具和技能,推广最佳配置方案,通常可在更小、更便宜的模型上保持质量。* 工具箱仅发送请求所需的工具而非全部定义。* 记忆系统(过程记忆、用户记忆和会话记忆)在对话轮次间传递上下文而无需重复发送完整历史记录。 | | 持续治理支出 _设置永不失效的限制和预算,防止任何代理产生失控费用_ | * Azure API Management的AI网关可作为独立AI网关层部署在Foundry端点前,为已采用Azure API Management的团队提供token速率限制、配额和缓存功能。我们正在推进更无缝集成的AI网关功能。* Foundry平台内预算与执行控制即将上线,将支出限制和执行机制原生集成到Foundry中,更贴近代理运行环境。* Foundry当前提供模型级和部署级成本报告,Azure成本管理作为预算、告警和计费成本的系统记录。更精细的归因分析(细化到单个代理和会话层级)正在规划中。 |

Agent 365将治理范围扩展至租户层级,通过支出政策、预算上限和部门级费用分摊,统一管理微软和第三方代理的跨平台成本。

您可通过我们的新一期Microsoft Mechanics视频《Token经济学》实时观看运行时杠杆机制的运作。

AI领导者应提出的四个问题

如果您从本文只带走一个信息,请将这四个问题纳入下一次AI或预算审查。每个问题在Foundry中都有明确答案。如果您今天无法回答其中一个问题,这正是您应该开始的地方。

  1. 我们是否清楚自己在为哪些服务付费?

支出应按模型、代理和工作流进行可视化,而不是隐藏在单一发票条目中。Foundry 的计量和追踪功能使成本来源更易于理解。

  1. 我们是否为每个请求支付了合理费用?

大多数请求不需要前沿模型。模型路由器、部署和定价选项、缓存、微调以及 Foundry IQ 可帮助将每个请求匹配到其所需的相应能力。

  1. 我们的代理是否运行高效?

随着工作流效率提升,代理成本应逐步降低。Foundry Agent ServiceFoundry 工具箱 中的代理优化器和内存功能可减少不必要的令牌使用并提升执行质量。

  1. 当使用量激增时,我们的限制是否仍然有效?

快速增长的使用量需要稳定的控制机制。目前,许多团队会在 AI 端点前部署 Azure API Management,以在 AI 网关层实施令牌速率限制和配额。未来,我们将在 Foundry 内置预算和执行机制,以及通过 Agent 365 实现的租户级控制中持续推进。

第一个问题涉及理解 AI 支出。接下来的三个问题则是本系列文章将深入探讨的领域:将请求匹配到合适的模型、提升代理效率、以及通过治理控制实现规模化成本管理。

入门指南

本系列文章将在未来几周持续更新,深入探讨每个后续主题:如何在运行时优化请求、如何构建高效使用令牌的代理、以及如何在扩展过程中治理支出。每篇文章都将结合思路与 Foundry 的实际功能进行说明。

您无需等待即可开始。该框架背后的功能已在 Microsoft Foundry 上线:

请持续关注本系列后续内容,并在下一次评审中提出这四个问题。