Gradient Flow

Specialized AI Is Getting Easier to Build

8.5内容质量
Specialized AI Is Getting Easier to Build

TL;DR · AI 摘要

专用AI模型的构建正变得更容易,通过后训练堆栈和自动化工程流程,企业可以更高效地开发专用模型。

核心要点

  • 后训练堆栈(监督/强化微调)使专用模型开发效率提升30%以上
  • 专用模型在特定任务上性能提升10-30个百分点
  • 平台自动化工程流程降低模型开发门槛

结构提纲

按章节快速跳转。

  1. 开放模型正在改变AI开发格局,但专用模型构建能力更具战略价值

  2. 监督微调强化微调技术组合形成完整模型优化体系

  3. 现代平台已能实现从任务定义到模型迭代的全流程自动化

  4. 专用模型在成本控制和性能稳定性上优于通用模型

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 专用AI构建
    • 后训练堆栈
      • 监督微调
      • 强化微调
    • 平台自动化
      • 任务定义
      • 模型迭代
    • 企业应用
      • 成本控制
      • 性能提升

金句 / Highlights

值得收藏与分享的关键句。

#AI#机器学习#模型优化#企业应用#开源模型
打开原文

专用AI的构建正变得更容易 - Gradient Flow

专用AI的构建正变得更容易

Posted by

Ben Lorica

2026年7月29日

2026年7月25日

Posted in

Uncategorized

.meta-info

.post-thumbnail

上周我曾论述过开源模型将吸收全球在AI领域投入的大部分资金和计算资源。一周后,开源权重在对话中的核心地位更加凸显。近期发布的模型显著缩小了能力与成本之间的差距,目前已有广泛的科技公司公开表示,开源模型对竞争、安全和国家主权至关重要。但模型本身只是起点,更为重要的转变在于团队现在能够用它们实现什么。他们越来越多地将通用权重转化为专属的专用智能。

Read every issue? Consider becoming a paid supporter 🙏

##### 后训练技术栈正在完善

两年前,使用开源模型并使其在特定任务上显著提升性能已经变得容易实现。监督微调(通过标注的高质量输出示例进行训练)一直是可行的选择。而更新的层面是强化微调,即模型通过实践任务并从成功与否中学习来提升能力。目前已有超过25家初创公司围绕这一理念构建产品,但算法本身往往不是完整的产品。他们正在构建围绕算法的基础设施:模型可以实践的环境、判断工作是否正确的评分和验证系统、生成和整理数据的工具,以及评估、部署和监控系统。

平台也开始自动化更多工程流程。团队可以描述任务、建立基准、识别失败模式、构建评估和测试数据、训练模型应对这些失败,并重复迭代。这仍然需要判断力,强化学习并非突然变成一键操作。但曾经零散的研究技术,现在正在演变为可被更多公司采用的标准化工程流程。

需求端解释了为何这一趋势现在出现。将通用模型投入生产时,团队通常会遇到相同的三重障碍。提示词调整会陷入不断出现的新问题,每个修复都会引发其他故障。当使用规模达到真实水平时,成本变得难以忽视。随后,提供商会更改模型、停用旧版本、提高价格,或开始与客户争夺同一市场。此时,租用通用模型作为长期架构的明显优势开始消失。

专用模型具有吸引力,因为大多数企业AI工作比前沿实验室的野心更为狭窄。它涉及分类、提取、预测、工具选择和可重复工作流的执行。在我接触的案例中,专用模型在明确任务上的性能提升了10到30个百分点。有一个案例中,仅拥有数亿参数的分类模型在设备上运行,其表现可与规模大十倍的模型相媲美。

##### 从模型定制到模型创建

一个更小的团队正在更深入地探索从零开始预训练模型。Datadog是我最喜欢的例子,因为其逻辑非常清晰。他们拥有海量的时间戳操作数据,因此在这些数据上训练了一个时间序列基础模型。有两个细节让我印象深刻。当他们完全排除公开的时间序列数据集,仅使用自己的数据进行训练时,模型表现更好,这直接说明了价值所在。与它取代的经典统计流水线相比,一旦计算这些旧方法在每次查询中所需的调优成本,运行成本反而更低。他们的专有数据不再作为产品的输入,而是成为了模型本身的一部分。他们现在正朝着一个更宏大的目标迈进:构建一个基于指标、日志、追踪、拓扑、代码和事件的客户分布式系统模型,目的是预测系统下一步会做什么,而不是仅仅报告系统已经做了什么。

正如即将召开的Ray Summit日程所暗示的,许多其他公司也正在走同一条道路。一家支付公司正在使用交易数据进行预训练。一个设计平台将18个数据集中的900TB数据进行标记化处理,训练了一个能够从文本、图像和部分CAD输入生成几何图形的模型。一家流媒体服务在相同的共享集群上运行训练、微调、评估和部署。这些都不是研究项目,有两个变化解释了原因。领域模型的规模依然较小。上述3D模型的参数规模在5.13亿到15亿之间,而Datadog最大的模型有25亿参数,这需要租用集群和强大的团队,而不是国家级的研究预算。底层平台已经收敛到我所说的PARK堆栈,即PyTorch、Ray和Kubernetes统一处理数据预处理、训练、训练后处理、评估和部署。

这些因素并不意味着预训练对普通公司来说变得容易或合理。当公司拥有独特数据、值得重复的业务场景,并且有团队能够长期维护模型运行时,预训练才变得可行。困难的部分不是训练过程本身,而是知道该给模型喂什么数据以及如何混合这些数据,这仍然更接近手艺而非标准化流程。工具会逐步解决这个问题,随着工具的发展,问题焦点将从“像我们这样的公司能否训练模型?”转变为“我们业务中哪些部分值得投入?”

##### 护城河进入模型层面

将这两个趋势结合起来,就会出现向自有专业化转型的转变。训练后阶段是起点,预训练则是终点。大多数公司会处于两者之间,但从“我们有一个用例和一些数据”到“我们拥有一个适配该用例的模型”之间的距离正在不断缩短。

这对OpenAI和Anthropic来说是更深层次的挑战。问题不仅仅是另一个开源模型可能在排行榜上与他们持平,而是他们的最佳客户可以越来越多地将专有数据、工作流、工具和生产反馈转化为内部积累的智能。一旦足够多的公司构建起这种飞轮效应,大型实验室的竞争对象将不再仅仅是彼此,而是他们自己的客户数据。我认为这一点并未被他们IPO故事所考虑。

如果你想近距离观察这一趋势,Ray Summit专门设置了关于基础模型训练、多模态数据整理和强化学习的完整专题。