A scorecard for the AI age
TL;DR · AI 摘要
OpenAI提出‘每美元有用智能’指标,评估AI投资价值需关注任务完成质量、成本、可靠性及价值增长。
核心要点
- 评估AI价值应关注‘有用智能每美元’指标,而非单纯计算每token成本。
- AI完成复杂任务时,需综合考虑计算成本与任务完成效率的平衡。
- 企业应从具体工作流程出发,定义‘完成’标准以量化AI贡献。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI投资价值评估
- 核心指标
- 有用智能每美元
- 评估维度
- 任务完成质量
- 成本结构
- 可靠性
- 价值增长
- 应用场景
- 客服
- 工程
- 法律
- 财务
金句 / Highlights
值得收藏与分享的关键句。
AI任务成本需综合考虑计算资源和任务完成效率的平衡。
企业应从具体工作流程定义‘完成’标准,例如客服团队以‘客户问题解决’为终点。
复杂任务可能需要更多计算,但能提升整体效率,降低单位价值成本。
我从各地CFO那里听到的问题很简单:我们如何从AI投入中获取更多价值?
多年来,市场通过采用率衡量软件成功:购买的席位数、活跃用户数、续订的许可证数。理解AI的价值需要更强大的衡量标准:完成的工作量。
CFO和其他业务领导者面临的最基本经济问题是:AI完成的工作价值增长速度是否快于其生产成本的增长速度。
回答这个问题需要比单纯关注每令牌成本等指标更深入的分析。成本较低的模型可能拥有更便宜的令牌,但要获得良好结果可能需要更多尝试、更多时间或更多人工审核。能力更强的模型虽然令牌成本更高,但可能一次就能完成任务。关键在于衡量成功产出的总成本,并将其与产出的价值进行对比。
AI时代终极评估表可以看作是"每美元产生的有用智能"。这个指标回答了四个关键问题:
- AI是否完成了有价值的工作?
- 每项成功任务的成本是多少?
- 人们能否依赖结果?
- 随着使用量增加,每美元AI投入是否产生更多价值?
1. 完成多少有用工作?
从工作本身开始。
AI帮助解决了多少客户问题?帮助部署了多少代码变更?审查了多少合同?为人们节省了多少时间?在关键时刻提供正确上下文使多少决策得到改善?
当令牌转化为人们可用的工作时才创造价值。随着模型能力提升,它们可以承担更长更复杂的任务:维持上下文、多步骤推理、跨工具协作,并在过程中动态适应。
最佳起点是选择一个工作流程。定义"完成"的含义,并在工作发生的具体系统中衡量这个结果。
对于支持团队来说,"完成"可能意味着解决客户问题。对于工程团队,可能是通过测试的代码变更。对于法律团队,可能是按时准确审查的合同。
考虑一个正在准备预测审查的财务团队。大量工作在最终决策前完成:找到最新预测、将数据导入Excel或表格、识别变更、核对工作表、重建幻灯片,并确保所有数据完美匹配。
ChatGPT可以承担这些过程中的大部分工作,让团队有更多时间专注于关键问题:发生了什么变化?为什么?接下来应该怎么做?
这就是每美元产生的有用智能的实际体现。更多工作得以更快完成,同时人们将更多时间用于应用判断力、创造力和专业知识。
- 计入完成工作的全部成本。
- 统计达到所需质量标准的任务数量。
- 将总成本除以成功任务的数量。
这就是为什么每 token 最低价格并不总是能带来每结果最低成本。如果前沿模型在一次尝试中就给出正确答案,从而减少重试、延迟、审核和总计算量,它可能即使在常规请求中也能提供最佳价值。
分层模型家族为客户提供更多优化这个公式的途径。上周发布的 GPT‑5.6 有三个层级:Sol 是我们的旗舰型号;Terra 在性能和成本之间取得平衡;Luna 是我们速度最快且最经济的模型。
这些层级提供了有用的起点。最终,完整任务的经济性应决定合适的模型。客户可能使用 Luna 来处理快速、高吞吐量的工作流,使用 Terra 处理需要更深度的任务,或在需要更强推理能力以更少尝试获得最佳结果时使用 Sol。
我们训练 GPT‑5.6 以从每个 token 中获取更多有用的工作。在人工分析编码代理指数上,GPT‑5.6 Sol 在最大推理设置下创造了新的最先进水平,同时使用的输出 token 数量比另一款领先模型减少了 54%。下图展示了对比情况。
_DeepSWE v1.1__: 长期工程任务;GPT‑5.6 Sol 达到 72.7% 的新高,高于 Claude Fable 5 的 69.9%,且预估 API 成本降低了 36.2%。_
在整个 GPT‑5.6 家族中,目标是一致的:每美元完成更多成功的工作。更高的效率使现有任务更经济实惠。更强的能力则使全新类型的工作成为可能。
每次新模型迭代都应同时提升这个公式的两个方面。客户应能完成更有价值的工作,同时每项任务的完成成本持续下降。
3. AI 多少时候能正确完成工作?
第三个衡量标准是可靠性。
AI 的采用通常分阶段深化。首先,AI 帮助起草内容。然后,它能在工具和数据之间找到上下文并进行推理。随着时间推移,它开始采取行动、处理异常情况并完成工作流,人们在需要时提供判断和控制。
每一步都创造更多价值,也对系统提出更高要求。
可靠性具有直接的经济价值。当结果准确、来源清晰、保持一致且适当升级时,人们花更少时间进行审核、修正和重复工作。成功任务成本更低,组织也更有信心在更重要的工作流中使用 AI。
团队可以通过跟踪三个结果来具体化这一目标:
- 可直接使用:结果在交付时已达到质量标准。
- 需要修正:结果需要再次尝试或人工编辑。
- 需要升级:需要人工介入完成工作。
这些指标比模型准确性本身能讲述更丰富的故事。它们显示 AI 是否真正减少了完成项目所需的工作量。
可靠性还需要明确的边界。在 AI 从起草内容转向采取行动之前,组织应定义:
- 系统可以访问的数据。
- 系统可以使用或更改的系统。
- 何时需要人工审核或批准某个操作。
安全、安全、隐私和控制为更深入的使用奠定基础。人们需要了解系统的行为方式、数据如何被处理,以及其操作如何被监管。
ChatGPT Work 基于 ChatGPT Enterprise 的安全、隐私、合规性和工作空间管理基础构建。这使组织能够在保持适当监督的同时,为 AI 提供更多上下文和访问更有价值的工作流程。
能力赢得首次使用,可靠性使 AI 成为工作方式的一部分。
4. 每增加一个 AI 美元,是否能买到更多的工作量?
最后一个问题是规模扩大后经济效益是否会提升。
企业可以通过长期跟踪相同的工作流程来衡量这一点。记录达到质量标准的任务数量、完成它们的总成本以及每个成功任务的成本。如果完成的工作量增长速度超过总成本,同时质量保持或提升,那么每个 AI 美元都在创造更多价值。
计算能力是这个等式的核心。
计算能力驱动研究和 AI 完成的每个任务。它影响产品质量、速度、可靠性、可用性和成本。训练计算构建未来能力,推理计算今天交付实用工作。两者都应转化为更好的客户结果。
更优秀的模型、更高效的推理、专用硬件、更高的利用率、更智能的路由和更强的产品设计都能提升计算的回报率。每一代基础设施都有助于训练更强大的模型。更好的算法、硬件和软件随后能更高效地服务这些模型。
客户以人性化的方式体验这些改进:更准确的答案、更快的结果、更少的修正、更可靠的产品,以及更低的所需工作成本。
收益会不断累积。更优秀的基础设施加速研究,研究产生更强大高效的模型,更优秀的模型提升产品,更优秀的产品推动采用率、学习和收入增长。这种增长支持对下一代研究、计算、部署和安全的持续投资。
OpenAI 通过一个共享的智能平台将这些要素整合在一起。人们通过 ChatGPT 和 ChatGPT Work 使用它,开发者通过 Codex 和 API 与它构建应用,企业将其部署到工作发生的地方。
当某一层级得到改进时,每个产品和客户都能受益。
人工智能时代的评分表
综合这四个指标,我们可以判断每美元的实用智能是否在提升。
实用工作告诉我们 AI 产出什么。每个成功任务的成本告诉我们实现结果需要什么。可靠性告诉我们人们能自信使用的工有多少。规模价值告诉我们每美元和每个计算单元是否随时间推移完成更多工作。
目标是让 AI 帮助人们完成更有意义的工作,做出更好的决策,并将更多时间投入到需要人类独特判断力和创造力的工作部分。
我们的任务是通过每一代产品让这个等式变得更好:更强大的模型、更快更可靠的成果,以及更低的客户所需工作成本。
这就是 AI 如何随着时间推移为更多人和组织创造更多价值的方式。