The production platform for open-weight AI inference
TL;DR · AI 摘要
Together AI推出的新推理平台使用户能高效部署和管理开放权重模型,兼顾控制、成本与性能。
核心要点
- 开放权重模型成本仅为封闭模型的几分之一,但质量相当。
- 平台支持canary、blue-green等部署策略,确保生产环境稳定性。
- Together AI每月处理400万亿token,验证平台的高吞吐能力。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 开放权重AI推理平台
- 核心功能
- 多部署策略
- 实时流量测试
- 自动扩缩容
- 技术优势
- 成本效益
- 质量对标封闭模型
- 专有IP集成
- 平台整合
- 前沿研究
- 工程优化
- 持续更新
金句 / Highlights
值得收藏与分享的关键句。
开放权重模型现在在质量上与封闭模型相当,但运行成本仅为后者的一小部分。
Together AI每月处理400万亿token,验证了平台的高吞吐能力。
平台整合了最新研究,实现前沿性能和效率,减少用户重复验证工作。
开放权重AI推理的生产平台
概述
我们对推理平台进行了重大更新,让您无需构建自己的技术栈即可完全掌控性能、成本和质量。模型可在数分钟内上线,所有部署从一开始即具备生产级标准:通过单一稳定端点运行多个部署,通过金丝雀发布、蓝绿部署和滚动更新安全地推送变更,并在达到阈值时自动回滚;通过A/B测试和影子测试在真实流量中进行测试;跨一个或多个区域自动扩展。
我们还宣布开放定制训练的封闭测试版,包括全权重和LoRA强化学习以及监督微调,提供可直接部署到生产的检查点。申请参与定制训练测试版。
立即启动您的首个端点。
参加8月6日的网络研讨会深入了解。
开放权重模型现在在质量上已与封闭模型相当,运行成本仅为后者的一小部分,并且可以完全根据您的任务进行定制。这种组合使它们成为构建严肃AI产品和代理的团队的基础。但采用开放权重模型的战略动机仍然是能够行使控制权。与封闭替代方案不同,开放权重模型使团队能够控制性能、质量和功能。许多商业AI应用已采用多数开放权重端点策略,以完全掌控用户体验。许多企业利用这种控制能力,将宝贵的专有知识产权整合到模型中,而无需冒险暴露给第三方。
尽管开放权重模型用户希望对性能、功能和质量拥有最大控制权,但很少有团队希望每周都要测试自己能否正确地在量化级别、并行方案、引擎参数和草稿模型架构等矩阵中做出决策(仅举几例)。同时,实现最佳质量和性能的前沿技术也在迅速发展。在快速变化的AI领域,没有人有时间或兴趣停下来阅读关于推理内部原理的百科全书式琐事或大量研究论文——即使是运行世界上最成功模型和代理的团队也是如此。
Dedicated Model Inference结合了我们每月处理超过400万亿token的经验,提供一个推理平台,能够:
- 让用户完全掌控模型、性能、成本、质量和功能
- 避免从零开始构建每个推理技术栈和端点管理层所导致的时间浪费、资金浪费和意外停机
- 持续整合最新经过验证的研究,实现前沿水平的性能、质量和效率
此次更新将我们的研究、模型优化和平台工程团队的进展整合为一项服务,旨在为企业提供更简单、更可靠、更高效的方式来运行开放权重、授权封闭权重和微调模型。
要实现控制与简洁性的结合,需要将推理视为不仅仅是通过API托管模型。您运行的精度、部署的硬件、使用的服务配置以及扩展和路由流量的方式,都会对性能、可靠性和成本产生实质性影响。
我们构建这个平台的初衷是让从实验到生产的过程无需更换平台或重新构建部署。即使在测试和迭代阶段,生产就绪能力也已融入平台基础架构。这意味着您可以安全地发布新版本,使用真实流量测试变更,模拟生产请求,跨部署路由流量,根据需求进行扩展,并在出现意外问题时回滚。
Decagon 的 Max Lu 这样描述这一转变:
Together 已经将语音相关的延迟优化到了理想水平。他们新的推理平台改变的是我们发布下一个模型版本的方式:我们可以将微调后的模型以金丝雀发布的方式部署到一小部分实时流量中,并在关键指标出现回归时自动回滚。我们将从“快速推理”转变为“每周都能安全迭代的快速推理”。
这正是我们最终想要实现的目标:不仅提供快速高效的推理能力,还要具备在不引入不必要的风险前提下持续优化服务能力的能力。您可以从 Together 已经优化的路径开始,随着工作负载变得越来越专业化,逐步获得更多控制权。这一原则贯穿整个平台——从模型的引入和配置方式,到模型的扩展、变更测试、性能观察以及新版本的生产部署。
选择您想要部署的模型
您可以从 Together 的模型平台部署模型,也可以上传自己的开源权重模型或微调模型。支持从 Hugging Face、S3 或本地机器上传完整的模型权重或适配器。
平台设计支持模型的完整生命周期,从早期的微调阶段到最终承担生产流量的版本。
选择模型的运行方式
模型本身只是部署的一部分。硬件类型、量化、张量并行、推测解码和推理引擎都会影响工作负载的性能和经济性。
您无需成为所有这些选择的专家就能获得良好效果。Together 的部署配置文件封装了我们研究和工程团队已经测试和优化的配置,您可以直接使用经过验证的方案,而无需从零开始搭建。当您需要更多控制权时,这些选项依然可用。您可以从不同的硬件和优化配置中选择,并随着时间推移决定是优先优化延迟、吞吐量,还是两者的平衡。
减少模型启动等待时间
模型规模越大,启动时间越长,因为需要将数百GB的权重移动到位。我们重建了模型缓存和分发层,使这些权重可以在整个集群中共享,并在部署需要之前主动预热。在内部测试中,这一改进使多个前沿模型的预热启动速度提升了约4倍。
| 模型规模 | 代表性模型 | 平均部署时间 | |---------|------------|--------------| | 小型模型 | Qwen 2.5 7B, Qwen 3.5 9B, Llama 3.1 8B | ~2–5 分钟 | | 中型模型 | GPT-OSS 20B, Qwen 3.6 27B, Qwen 3.5 35B | ~3–7 分钟 | | 大型模型 | Llama 3.3 70B, Qwen 3 235B | ~4–12 分钟 | | 前沿规模 MoE 模型 | Kimi K2.7, MiniMax M3, GLM 5.2 | ~7–14 分钟 |
控制部署的扩展位置和方式
选择模型运行的位置,可以通过将其固定到特定区域或保持部署灵活性来实现。你还可以定义部署如何响应流量变化。
不同工作负载对需求的信号各不相同,因此自动扩展不应仅限于单一通用指标。平台会提供合理的默认配置,同时允许你根据飞行中请求数、GPU利用率、首个令牌生成时间、延迟、解码速度或吞吐量进行扩展,当工作负载需要更具体的指标时可灵活选择。
在部署演进过程中保持端点稳定
推理端点不再需要映射到单一静态部署。你可以创建多个部署,它们共享相同的端点,但可以使用不同的模型权重、硬件或服务配置。
这使你能够在不强制应用程序更改调用模型方式的情况下,更改端点背后运行的内容。即使部署持续演进,端点本身仍能保持稳定——从而更轻松地进行测试、推出和替换模型或配置,而无需重构应用层。
安全地将更改引入生产环境
通过金丝雀发布、蓝绿部署或滚动更新,可以逐步引入新的模型版本和配置。
平台会处理流量迁移和部署生命周期,同时让你控制更改推进的速度以及何时停止或回滚。你无需自行构建发布机制,即可获得所需的生产环境控制能力。
在不危及用户的情况下测试真实流量
使用A/B测试将部分流量路由到不同部署,直接比较它们的行为。使用影子流量将生产请求镜像到新部署,而不会影响返回给用户的响应。
这使得你可以使用实际流量来评估新的权重、配置和硬件,而不是仅依赖离线基准测试或合成测试。
监测当前状况
新平台为你提供一个可连接到任意可观测性工具的组织级可抓取Prometheus端点,可用于构建仪表板、设置告警、监控发布健康状况、比较A/B测试变体,并将影子流量与生产流量进行对比。
我们还更新了产品内的分析体验,使部署健康状况、流量、性能和扩展行为在Together中更易于理解。
加入我们的强化学习beta版
除了推理平台,我们还启动了定制训练的封闭beta版,包括全权重和LoRA强化学习以及高级监督微调。你可以通过Python SDK和细粒度原语配置训练,并在专用资源上并行运行多个LoRA实验。定制训练将实验直接连接到生产环境。当检查点准备就绪时,你可以直接部署到推理部署中,无需在训练和推理之间进行单独交接,也无需重新构建设置即可从同一平台上的训练后实验过渡到生产评估。封闭beta版期间访问权限有限。
申请访问以开始使用。
接下来是什么
此次更新只是一个开端。它是构建一个平台的基础,在这个平台中,模型可以被训练、优化、部署、测量并持续改进,而无需为生命周期的每个阶段拼接不同的系统。
开放权重模型使公司能够对质量、性能和成本拥有巨大的控制权。我们的目标是让用户在不将推理变成DIY基础设施项目的情况下,轻松获得这种控制权。这意味着提供开箱即用的默认配置、已经优化过的参数设置,并在需要时提供更深入的控制能力。
在接下来的几周里,我们将深入探讨平台背后的技术系统,包括部署配置文件、模型启动、自动扩展、可观测性、版本发布、A/B测试和影子流量等功能。目前,全新的专用模型推理平台现已上线,帮助您从早期迭代阶段顺利过渡到生产环境,并在到达生产环境后持续优化所服务的内容。
→ 立即开始 → 联系我们的团队 → 阅读文档 → 注册网络研讨会