What Startups Taught Me About the Next Layer of AI Infrastructure

TL;DR · AI 摘要
强化学习初创公司正在构建AI基础设施,解决前沿模型在实际应用中的不可靠性问题,重点突破模拟环境与评分系统。
核心要点
- RL初创公司通过构建模拟环境和评分系统解决模型可靠性问题
- 当前工具主要面向前沿实验室,但未来可能向企业普及
- 应用领域涵盖编码、工业控制、物流等需要明确任务目标的场景
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 强化学习基础设施
- 核心挑战
- 模拟环境构建
- 评分系统设计
- 应用领域
- 编码/安全
- 工业控制
- 物流
金句 / Highlights
值得收藏与分享的关键句。
RL初创公司正在构建模拟环境和训练健身房,解决模型在多步骤任务中的可靠性问题
评分系统是RL落地的关键挑战,需检测代理是否作弊或规避奖励机制
编码和工业控制领域因具备明确的评分标准,成为RL最早商业化的场景
初创公司教会我的下一代 AI 基础设施——梯度流
初创公司教会我的下一代 AI 基础设施
作者: Ben Lorica 2026 年 7 月 15 日 2026 年 6 月 25 日
分类: 未分类
.meta-info
.post-thumbnail
不久前我写过一篇文章,讨论团队如何利用强化学习(RL)让智能体变得可靠。从那以后,我不断接触到一些初创公司,其中强化学习不再是研究脚注或堆栈中被埋没的功能,而是它们构建产品的核心。截至目前我已知超过 25 家相关初创公司,这个数字仍在增长,有些公司的产品本质上就是强化学习。目前仍处于早期阶段,现有工具主要面向前沿实验室、新锐实验室和异常复杂的 AI 团队。不过,已有足够多的信号表明,这些工具和经验最终会向下渗透到更广泛的领域。此时我对待自己的强化学习时间线,就像对待占星术一样——有趣但不具备约束力。我需要强调的是,这一波浪潮围绕着初创公司、产品和客户展开,而此前的周期大多没有这样的生态。
如果你经常阅读,欢迎成为付费支持者 🙏
##### 实践中学习的新基础设施
这些初创公司的共同点在于,它们都在应对同样的困扰:前沿模型虽然智能,但一旦需要执行真实且多步骤的任务,就会变得不可靠。强化学习是它们用来将原始能力转化为可靠行为的杠杆,无论目标是代码代理、客服机器人还是人形机器人。
但它们并没有真正将强化学习作为“神奇算法”来销售。它们正在构建围绕强化学习的缺失基础设施,而这些基础设施有两个核心难点。第一是为模型提供一个可以练习的环境,这解释了为什么许多公司都在构建模拟环境和训练平台。第二且更具挑战性的是评分机制:智能体是否完成了任务?是否遵守了规则?是否选择了正确的工具?是否避开了可能扭曲指标的捷径?令人惊讶的是,这个市场很大一部分实际上专注于评分器、验证器以及用于检测智能体作弊的工具链。
(放大)
从这里开始,目标开始分化。一些初创公司为前沿实验室构建强化学习环境,一些则为需要专业模型的企业构建训练后平台。一些专注于从生产日志中进行持续学习,另一些则将强化学习应用于机器人、工业控制和物流领域。它们的共同点很简单:只要你能定义任务、创建一个安全的练习环境并评估结果,强化学习就有用武之地。
##### 实践学习的回报
第一个商业化集群出现在你预期的地方。编程、软件工程、机器学习工程、安全和基础设施任务反复出现,因为它们自带明确的进度评估方式。代码可以编译或失败,测试可以通过或失败,沙盒环境可以揭示智能体的操作是否按预期改变了系统。反馈仍然不完美,但相比让人类从头开始评估每一步,这种机制要清晰得多。
第二大类应用场景是计算机使用和企业工作场景。这些智能体负责操作浏览器、电子表格、客户关系管理系统(CRM)、工单系统、内部工具、财务软件、文档和知识库。在这一领域,演示版智能体与生产环境智能体之间的差异会变得非常明显。能够解释工作流程的模型,与能够执行任务、从错误中恢复并满足企业标准的智能体存在本质区别。
还有一类虽小但令人印象深刻的使用场景完全脱离了屏幕:学习行走和抓取的机器人、数据中心冷却系统、货运路线规划。更广泛的规律是,强化学习(RL)正在出现在任何团队能够构建闭环的领域。必须存在一个任务、一个尝试执行的场所、一种观察结果的方式,以及一个与用户实际需求足够接近的评分标准。这一模式适用于代码编写智能体、企业研究、支持工作流程、金融建模、医疗推理、工业冷却、物流和机器人领域。这些领域各不相同,但实现方法却出人意料地一致。
##### 这些技术何时会普及到我们身边
我反复思考的问题是,这些技术何时能被更多AI团队使用。目前,许多工具仍假设用户具备深厚的技术能力。你需要定义环境、编写奖励函数、检查部署效果、发现奖励机制被滥用的问题,并将训练循环连接到实际系统。这不是周末随意尝试就能完成的工作。但当如此多初创公司正在构建训练环境、后训练平台、验证工具、智能体训练场和RLOps工具时,很难不期待一些抽象概念会变得更简单。
从某种意义上说,这种技术下沉已经开始了。目前帮助公司进行后训练或定制基础模型的初创公司,正在将强化学习工具引入企业环境。这是强化学习工具正在真实企业中落地应用,而非某个遥不可及的未来。下一步并非每个AI团队都要变成强化学习研究实验室,而是让更多团队获得实用工具:能够定义他们关心的工作内容、衡量成功标准,并随着时间推移根据这些信号持续优化模型。