Together AI Blog

Open, convenient and predictable: Introducing Provisioned Throughput

6.9内容质量

TL;DR · AI 摘要

Open, convenient and predictable: Introducing Provisioned Throughput Summary We're excited to introduce Provisioned Thro...

核心要点

  • 主题聚焦:Open, convenient and predictable: Introducing Pr
  • 来源:Together AI Blog,建议结合原文判断细节。
  • AI 分析暂不可用,本条为保底评分与摘要。
#AI#编程#后端#云计算#产品
打开原文

开放、便捷且可预测:推出预置吞吐量

摘要

我们很激动地推出预置吞吐量,这是一种面向前沿开放模型的预留推理容量服务,采用基于令牌的定价模式,并提供99%的正常运行时间服务等级协议(SLA)。

开放权重模型已成为任何希望拥有丰富AI未来的企业不可或缺的要素。但历史上,企业若想使用开放权重模型,只能在便捷但尽力而为的无服务器服务与强大但可调节的专用推理之间做出选择。预置吞吐量是一种新型推理形式,为客户提供了一种替代方案:在保证容量和服务可用性SLA的前提下,以令牌价格享受经过预优化模型的简易性。与Claude Opus 4.8的目录价格相比,成本最高可降低90%。

即日起,预置吞吐量已面向MiniMax M3和GLM-5.2开放,覆盖北美、EMEA地区及更多区域,且需签订至少一个月的最低合同期限。

推理支出已成为董事会关注的专项预算条目。

在不远的将来,每个知识工作者都将拥有多个代理为其工作,但企业却难以在不产生天文数字推理预算的情况下实现这一目标。要取得成功,企业需要使用覆盖帕累托前沿的多种模型,使任务难度与模型质量(及成本)相匹配。开放权重模型在这一前沿中所占比例正变得越来越大。

随着企业转向多模型、多接口的架构,开放模型正在为越来越多的日常代理提供动力,涵盖编程、金融、营销和工作流程自动化等领域。

已切换至开放模型的企业报告称,与专有替代方案相比,其推理成本降低了6至20倍。从我们自身的数据来看,九个月内,通过Together AI API的令牌量从300亿增长到每月超过400万亿。这些流量中相当大的一部分曾依赖封闭式API运行。

缺失的关键:值得信赖的令牌容量

丰富的AI不仅需要帕累托前沿的开放模型,还需要让人安心的保障:承诺的容量、可预测(且可影响)的定价,以及客户可依赖的服务等级协议(SLA)。在此之前,开放模型市场只提供两种选择,但都无法满足这些需求。无服务器推理大多是尽力而为:适合开发,但难以应对生产工作负载的不确定性。专用推理(即专用GPU)能提供保证并完全控制服务环境,但许多团队不愿管理完全可配置推理平台的复杂性。他们希望有一个简单的API背后是可靠的模型提供商,而不是GPU小时计算、容量规划和需要配置的服务堆栈。

团队真正需要的是简单的解决方案:与封闭模型提供商已有的基于令牌的容量协议相同,但指向前沿开放模型。这就是我们打造的产品。

推出预置吞吐量

与Together AI的无服务器推理采用“按使用量付费”模式并附带尽力而为的SLA不同,预置吞吐量采用“按保证容量付费”模式,并附带正常运行时间SLA。

预置吞吐量单位(PTUs)按需购买。每个PTU代表固定的容量切片:为运行的模型提供每分钟一定数量令牌的保证速率,专属于您,按每PTU每分钟0.05美元计费。预置吞吐量可应对流量波动;输入令牌、缓存输入令牌和输出令牌以不同方式消耗PTUs,使您能根据流量模式优化成本。无需计算GPU小时数,也无需管理基础设施。预置吞吐量、专用推理和无服务器推理的推理API完全一致。

预置吞吐量今日已支持MiniMax M3和GLM-5.2模型,后续将扩展更多模型。我们目前在北美、欧洲、中东和非洲地区均有可用容量,最低合约期限为一个月,承诺使用量越高折扣力度越大。

"我们的模型专为严苛的生产工作负载设计,Together AI的预置吞吐量为团队提供了一种可靠运行模型的方式,满足这些工作负载所需的可靠性要求。当团队将流量从封闭API迁移时,Together AI的基础设施使他们能够以可构建业务的承诺规模采用M3模型。这正是我们希望为模型提供的访问方式。"

——MiniMax全球业务总裁Linda Sheng

经济性

一个PTU涵盖三种流量类型:输入令牌、缓存输入令牌和输出令牌,每种类型以不同速率消耗您的容量。在MiniMax M3上,一个PTU每分钟可处理138,840个输入令牌、694,200个缓存输入令牌、23,140个输出令牌,或这三者的任意组合。

PTUs在输入、缓存输入和输出令牌中被消耗。

实际工作负载具有不同特征。输出密集型流量消耗容量的速度比缓存效率高的流量更快,但流量特征不会改变SLA。它只会影响您消耗容量的速度。

在满负荷运行时,MiniMax M3上的一个PTU相当于每百万个输入令牌约0.36美元,每百万个输出令牌约2.16美元,而Claude Opus 4.8的定价分别为5美元和25美元。在三个代表性生产场景中:

前沿开源模型在性能上已大幅缩小与封闭模型的差距,同时在实际工作负载中的成本降低了90%。

这些是估算值。实际PTU使用量将根据您的流量特征有所不同。请使用定价计算器进行测算。

适用场景

无服务器架构是快速构建开源模型应用的首选方式。预置吞吐量适用于需要保证的标准化开源模型生产工作负载。如果您需要微调或定制模型,并希望对服务环境有深度控制,专用推理是更合适的选择。

如果您正在运行专有API上的生产流量,而前沿开源模型可以处理该流量,迁移路径现已完成:具备前沿质量的模型、可规划的基于令牌的定价,以及客户可依赖的可靠性保障,成本最高可降低90%。

→ 使用定价计算器估算您的PTUs → 与我们的团队联系 → 阅读文档