Together AI Blog

Together AI expands fine-tuning service with more models, live metrics, and finer controls

8.5内容质量

TL;DR · AI 摘要

Together AI 扩展微调服务,新增 15+ 模型支持,提供实时指标跟踪与精细控制,降低大模型训练门槛。

核心要点

  • GLM-5.3 在 Terminal-Bench 2.1 评分 88.2,接近顶级闭源模型性能
  • 新增 15 款主流模型支持,涵盖 0.8B 至 27B 参数规模
  • 训练过程中可实时监控 loss 曲线并对比多组实验数据

结构提纲

按章节快速跳转。

  1. 阐述模型微调在生产环境中的核心价值与技术挑战

  2. 列举支持的 15 款最新开源模型及其参数规模分布

  3. 描述训练过程中的指标追踪机制与可视化方案

  4. 说明针对不同模型的差异化定价政策

  5. 介绍训练前数据验证与早停策略的实现方式

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Together AI 微调服务扩展
    • 新模型支持
      • GLM 系列
      • Qwen 系列
      • Gemma 系列
    • 功能增强
      • 实时指标跟踪
      • 多组实验对比
      • 自动早停机制
    • 成本优化
      • 分级定价策略
      • 资源利用率提升

金句 / Highlights

值得收藏与分享的关键句。

#微调#模型#AI#Together AI#大模型
打开原文

Together AI 扩展微调服务,新增更多模型、实时指标和更精细的控制

将一个开源模型转化为适用于特定任务的高性能模型需要一系列经过精确衡量的实验。团队需要了解模型将训练哪些内容,跟踪每次运行的进展,调整训练方案,并识别表现最佳的检查点。

今天,我们在微调工作流程的各个环节都进行了扩展。此次发布增加了对最新开源模型的支持,提供实时实验跟踪、更精细的训练和数据处理控制,并降低了部分模型的价格。

在训练前,您还可以检查和验证数据集,比较正在进行中的运行结果,并在验证损失趋于平稳时停止训练。

新增模型

开源模型正以前所未有的速度涌现,几乎每次发布都在质量、效率或两者方面都提升了标准。团队希望快速将这些进展应用于生产环境,而无需花费数周时间解决每个新架构的技术挑战。

对于需要前沿性能的任务,您可以选择最大且最强的模型,如 GLM-5.3 和 Kimi K2.7。例如,GLM-5.3 在 Terminal-Bench 2.1 上得分 88.2,与领先的专有模型仅相差 1 分。其他团队则优先考虑性能和成本,选择 Qwen 3.8-27B 或 Gemma 4 等模型。对于本地和设备端应用,Qwen 3.5 系列提供了从 0.8B 到 9B 参数的多种选择。

Together Fine-Tuning 支持所有这些模型,覆盖广泛规模,并内置了系统和算法的领先优化。提交训练任务后,我们将处理架构相关的复杂性。最新新增包括:

  • GLM 5.3
  • GLM-5.2
  • GLM-5.1
  • DeepSeek-V4-Flash-0731
  • DeepSeek-V4-Flash
  • Kimi K2.7-Code
  • Kimi K2.6
  • Qwen 3.8-27B
  • Qwen 3.6-35B-A3B
  • Qwen 3.6-27B
  • Qwen 3.5-27B
  • Qwen 3.5-9B
  • Qwen 3.5-4B
  • Qwen 3.5-2B
  • Qwen 3.5-0.8B
  • Gemma 4-31B
  • Gemma 4-26B-A4B

查看我们的文档,获取完整支持模型列表及其上下文长度。

实验跟踪

运行轨迹越早可见,就越能及时做出下一步决策——调整数据、更改超参数或让其完成训练。现在微调任务会在每个训练和评估步骤记录指标,并通过 Together API、CLI 和 UI 仪表板直接暴露这些指标。指标、任务状态和工件都集中在一个地方,因此您可以在整个模型开发过程中始终使用同一平台。

每次运行都会捕获核心训练信号:损失、梯度范数、学习率。当您添加验证集时,评估损失和指标将与训练指标一起被跟踪。

在仪表板中,每个任务都有一个“指标”标签页,显示在运行过程中实时更新的曲线图——您可以选择多个任务并在同一组坐标轴上进行对比,使一次扫描看起来像一张完整的图表,而不是十几个浏览器标签页。您也可以通过我们的 Python SDK 实现相同功能:一条命令,终端中显示曲线,无需切换上下文。

API 返回底层数据序列——每个记录的步骤,可根据范围过滤或降采样。这样,您可以将指标导入笔记本、现有的内部仪表板或任何其他目的地。

查看我们的文档了解详细信息。

更精细的训练控制

专家 LoRA

在专家混合模型中,超过90%的参数以及模型真正掌握的知识主要存在于专家层中。标准的LoRA微调方法从未触及这些层:适配器仅作用于注意力机制,而专家层始终保持冻结状态。现在你可以将LoRA适配器直接应用于专家层本身,这样你的训练任务就能针对知识实际存在的层级进行训练。

这种差异在需要模型真正学习新知识的任务中表现得尤为明显。我们向模型教授了200条虚构事实(基础模型对此一无所知):包含专家层的适配器能够回忆起高达89%的新知识,而仅关注注意力的适配器在相同模型上仅达到15%。它们还能更好地保留模型原有知识,并在MMLU-Pro测试中以75.3%对71.5%的显著优势获胜。

训练动态解释了这种差距:仅使用注意力适配器时,越来越多的路由专家层在微调过程中逐渐失效;而专家适配器则能保持整个混合结构的持续参与。

启用专家适配器非常简单:只需将专家模块添加到lora_trainable_modules中。其余的微调流程与任何其他LoRA任务保持完全一致。

提前停止机制

现在微调任务可以在停止改进时自动终止。这意味着你将获得最佳模型而非最后一个模型,且无需为不再产生帮助的训练过程付费。启用提前停止功能并提供验证集后,我们将持续监控每次评估的验证损失。当损失曲线趋于平稳时,系统将终止训练,保留验证损失最低的检查点作为最终模型,并自动退还所有未使用的训练步骤。

耐心值、对微小改进的敏感度以及预热阶段均可调节以实现更精细的控制。完整参数参考请查阅文档。

任意批量大小支持

某些任务需要的批量大小超出GPU内存容量:长序列、大型模型或针对大规模全局批量优化的方案。现在你可以根据需要选择任意有效批量大小,无论单次前向传播能否容纳。通过设置gradient_accumulation_steps参数,梯度将在微批量之间累积,每次优化器更新时形成有效批量大小=batch_size×gradient_accumulation_steps。详细信息请参阅文档。

价格调整

在Together,我们相信智能应当触手可及。我们充分利用所有可用系统和算法优化,为客户提供最大价值。我们持续优化训练堆栈,并希望将所有成本节约传递给用户。因此,我们大幅降低了大部分支持模型的训练价格,部分模型(如gpt-oss系列)的降幅高达30%-70%。

以下是每百万token训练LoRA适配器的价格调整:

模型 | 旧版SFT | 新版SFT | 旧版DPO | 新版DPO ---|---|---|---|--- Qwen/Qwen3.5-9B | 0.48 | 0.34 | 1.20 | 0.84 Qwen/Qwen3.8-27B | 1.50 | 1.05 | 3.75 | 2.62 google/gemma-4-31B-it | 5.00 | 2.50 | 12.50 | 6.25 openai/gpt-oss-120b | 5.00 | 2.50 | 12.50 | 6.25 openai/gpt-oss-20b | 0.40 | 1.00

完整价格表请参阅我们的定价页面。

案例研究:Adaption如何在Together上实现高达1T参数的开源模型训练自动化

Adaption是一家前沿人工智能研究公司,致力于构建能够持续学习的智能系统,通过实时数据和环境进行进化,而非依赖静态训练和昂贵的再训练周期。其研究涵盖三大支柱:

  • 自适应数据:在大规模数据上进行数据塑造
  • 自适应智能,使模型能够跨行业和语言进行演化
  • 自适应界面,重新构想人类与人工智能的交互方式

AutoScientist作为自适应智能的一部分,自动化了模型训练背后的完整研究循环。当自适应数据塑造输入时,AutoScientist则塑造模型本身:您设定目标,循环系统会搜索训练方案、优化数据、进行训练和评估,依次完成四个步骤,而非默认使用通用超参数。

它会在每次运行中不断优化选择,直到质量收敛于您的目标。它支持在主流开源模型(最高达1万亿参数)上进行LoRA和全量微调,训练由Together的微调平台提供支持,评估则在Together的专用端点上运行。其结果是一个持续改进模型的闭环系统,无需手动操作或重新训练成本。

"我们已与Together合作,在最高达1万亿参数的模型上运行Adaption的AutoScientist完整自优化训练循环。这使我们能够借助可靠工具,为全球企业提供可扩展的自优化智能解决方案。" - Adaption联合创始人Sara Hooker

灵活且透明的数据处理

检查标记化数据

此前,数据处理作为微调任务中的黑盒运行:您无法查看数据是如何被标记化和打包的。当结果与预期不一致时(例如聊天模板应用方式与预期不同、标签被错误遮蔽、行数据被静默截断),质量下降往往难以追溯根源。

现在您可以在任务开始前检查标记化数据。从任何上传文件中预览行数据,使用即将微调的基础模型精确的标记器和聊天模板进行标记化,直观查看训练将消耗的具体内容:标记ID、标记字符串、每个标记的标签、导致损失的跨度,以及该行是否在模型最大序列长度处被截断。预览可在数秒内完成。

您还可以检查训练循环实际消耗的数据。现在每个微调任务都会公开其完整数据集的一个子集——数据已精确标记化、打包和合并,与训练器接收到的内容完全一致。该功能可通过Python SDK访问,也可通过控制台任务页面的下载链接获取。

了解更多关于数据集预览的信息,请参阅文档。

样本权重

并非每个训练样本都应受到同等对待。现代数据集通常融合多个来源和领域(人工标注数据与合成数据并存,不同领域数据混合),但默认情况下每个样本对训练的影响相同,无论其质量或重要性如何。

Together Fine-Tuning现在支持样本权重功能,允许您精确控制每个数据点的影响。在JSONL文件的任意示例中添加权重字段,训练时将根据该权重调整该样本对损失的贡献。权重功能兼容所有支持的JSONL数据格式和所有训练方法。

了解更多关于样本权重的信息,请参阅我们的文档。

预飞行文件验证

数据集验证过去是在训练任务内部进行的。如果文件第59,000行存在格式错误的工具调用,您要等到任务排队、调度并启动后才会发现——需要浪费数分钟时间才能得知是一个拼写错误。

现在,一旦你的微调JSONL文件上传完成,就会立即启动完整的服务器端检查,检查结果会直接显示在文件对象本身上,这样你甚至在创建任务之前就能看到任何问题。检查涵盖完整的模式:消息结构和角色、工具定义和工具调用/响应配对、推理字段、多模态内容和图像解码、偏好对结构以及样本权重类型和范围——错误信息中还会包含有问题的示例索引。

验证成功后,系统还会报告我们检测到的关于你数据的信息——数据集格式、行数以及是否包含样本权重、消息权重、工具、并行工具调用、推理轨迹或图像——这样你可以确认平台是否按照你的预期读取了数据集。

了解更多关于文件预检验证的信息。

序列打包控制

序列打包是一种将多个序列拼接成一个序列的技术,以避免填充标记带来的计算浪费。它显著提高吞吐量并缩短训练时间,因此在Together Fine-Tuning中默认启用。尽管它具有效率优势,但并非总是最佳选择:在数据集较小时,打包可能导致每个训练周期的优化步骤过少。

序列打包及其对应的2D注意力掩码可视化(防止跨样本注意力,此处为Creative Commons 4.0授权)。

现在你可以完全控制序列打包:通过一个标志完全禁用它,或在预分词数据格式中使用position_ids来设置你想要的打包程度。

了解更多,请阅读我们的文档。

即将推出:从微调到推理的更快路径

在微调过程中,每个中间LoRA适配器都可以部署。你无需等待整个训练任务完成,而是在任务开始后不久即可开始评估结果,每次迭代可节省数小时甚至数天的时间。一旦第一个适配器被保存,你就可以通过专用模型推理进行部署,或在多LoRA配置中将其附加到正在运行的端点上,避免为每次实验设置独立端点所带来的成本和启动时间。

初步支持计划包括GLM-5.3,随后是Kimi K3。随着新工作流程接近发布,我们将分享可用性详情、完整支持模型列表以及完整的API操作指南。

结论

Together Fine-Tuning现在为你提供了对整个实验周期的更多可见性和控制权,从模型看到的数据到你部署的检查点。你可以在运行前验证数据集,在训练过程中跟踪和比较指标,并通过更精细的控制调整方案。

对最新开源权重模型的支持以及部分模型价格的降低,使得随着新模型的推出,这一流程更容易重复进行。

-> 开始微调 -> 阅读微调文档