deeplearning.ai

OpenAI's GPT-5.6 Family, New Ways to Train Robots, Models Invoking Models

6.0内容质量
OpenAI's GPT-5.6 Family, New Ways to Train Robots, Models Invoking Models

TL;DR · AI 摘要

DeepLearning.AI强调以学习者为中心的课程设计,优先选择技术深度而非营销内容。

核心要点

  • 课程设计遵循'学习者优先,合作伙伴次之,自身最后'原则
  • 优先选择能提供技术深度而非营销材料的合作伙伴
  • AI工程核心技能包括代码代理使用和评估框架应用

结构提纲

按章节快速跳转。

  1. DeepLearning.AI确立'学习者优先'的核心教学原则

  2. 通过技术专家网络和客观指标筛选课程内容

  3. 优先选择技术深度而非营销导向的合作伙伴

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • DeepLearning.AI课程设计原则
    • 核心优先级
      • 学习者 > 合作伙伴 > 自身
    • 课程选择标准
      • 技术深度验证
      • 客观指标评估
    • 技能培养重点
      • 代码代理使用
      • 评估框架应用

金句 / Highlights

值得收藏与分享的关键句。

#AI教育#课程设计#DeepLearning.AI
打开原文

OpenAI 的 GPT-5.6 系列、机器人训练新方法、模型调用模型

kg-card-begin: html

加载

Elevenlabs 文本转语音

AudioNative 播放器...

kg-card-end: html

亲爱的朋友们,

人工智能领域已经变得异常喧嚣。社交媒体、传统媒体和无数营销人员制造出各种炒作和内容,这些内容往往暗含着对产品的推销。好的想法被淹没在噪音中,但很难判断哪些内容值得你花时间学习。我想清楚地解释 DeepLearning.AI 是如何决定教授哪些内容的。

我们有一个简单的信条,决定了我们优先考虑谁的利益:“学习者优先,合作伙伴次之,我们自己最后。”当你领导一个团队时,你会选择少数几个信条反复强调,直到整个团队都听腻为止。在 DeepLearning.AI,我决定将这个信条作为其中之一。

当我们探索要教授什么内容时,我们会广泛研究各种主题,从公司和学术界的专家网络、高级技术和商业领袖、技术专家的著作、我们团队的实际经验,以及不同工具的牵引力和/或性能的客观指标中获取信息。我们利用这些信息综合出最重要的学习主题,帮助你掌握人工智能工程技能。然后,我们会寻找在这些主题上具有专业知识的合作伙伴与我们合作。

是的,我们经常在一开始就告诉合作伙伴,我们的优先顺序是学习者排在第一位,合作伙伴排在第二位。尽管这在商业角度来看可能显得反直觉,但我相信,只与那些认同我们“学习者优先”理念的合作伙伴合作,将为所有人带来更好的课程和更好的结果。具体来说,与那些希望教授技术深度内容(而非仅仅发布营销材料)的合作伙伴合作,有助于他们吸引更广泛的受众,这对他们和学习者都有好处。

我们与许多领先的 AI 公司(如 OpenAIAnthropic、Google、Microsoft、Meta 和 Amazon(披露:我担任 Amazon 的董事会成员——是的,如果我们与合作伙伴或课程提供商有额外关系,我们总是会透明地披露这些关系))以及拥有先进产品的初创公司合作开发课程。如果你的目标是学习如何驾驶汽车,你需要一辆车来练习。但技能是驾驶,而不是汽车。学习之后,你继续驾驶什么车应该由你自己决定。例如,我们关于代理框架的课程,即使与某一家合作伙伴共同教授,也会让你掌握适用于任何框架的基本技能。我们关于评估的课程会让你能够使用任何评估框架(或不使用框架)。我们关于提示的课程将帮助你向任何模型发出提示。

我们对合作伙伴怀有深深的敬意。我们精心挑选合作对象,因为我们希望与那些拥有并愿意分享前沿知识的公司合作。正因如此,我们选择那些拥有深厚、来之不易的专业知识的合作伙伴。然而,为了确保编辑的完整性——始终以学习者为先——我们从未接受任何合作伙伴付费让我们开设课程。

许多公司会主动联系我们,有时甚至提供报酬希望我们与他们合作授课,我们也会考虑课程主题和合作伙伴的建议。但我们在选择开设哪些课程以及与谁合作时,唯一依据是我们认为对学习者最有利的判断。通常来说,构建工具高级功能的工程师最了解其工作原理,因此我非常感激众多与我们携手服务学习者的合作伙伴。

AI领域仍有大量知识等待探索,DeepLearning.AI将继续坚持将学习者放在首位,合作伙伴次之,我们自身最后。

继续前进吧!

Andrew

来自 DEEPLEARNING.AI 的信息

学习如何通过三种实用模式为你的AI代理和应用添加语音:在应用中嵌入语音、将其叠加到现有代理上,或为你的代理提供一个用于拨打电话的工具。免费报名

新闻

GPT-5.6 陷入停滞

OpenAI 宣布推出 GPT-5.6 系列的预览版,其中包括一个与 Claude 5 Mythos 相媲美的顶级模型——但到目前为止,该模型仅向美国政府选定的用户开放。

最新动态:OpenAI 推出了三种封闭的视觉-语言模型,从功能最强的 GPT-5.6 Sol 到中端的 GPT-5.6 Terra,再到快速且价格更低的 GPT-5.6 Luna,性能和价格逐级下降。这些模型配备了安全机制,以防止访问可能具有危险性的生物、化学和网络安全信息。所有三种模型以及放宽安全机制的版本,仅限美国政府批准的少数组织使用。公司承诺将在未来几周内扩大发布范围。

  • 输入/输出:文本和图像输入,文本输出
  • 功能:最大推理级别(仅限 GPT-5.6 Sol)、超模式(将工作委托给多个代理)(仅限 GPT-5.6 Sol)、带显式断点的提示缓存,允许开发者指定可重复使用部分的结束位置
  • 性能:在 OpenAI 的测试中,GPT-5.6 Sol 在 Terminal-Bench 2.1(命令行编码)上创造了最新技术基准
  • 可用性:目前仅限通过 OpenAI API 和 Codex 接入的美国政府批准合作伙伴使用,计划通过 ChatGPT、Codex 和 API 提供更广泛的访问权限
  • 价格:GPT-5.6 Sol 每百万个输入/缓存/输出标记 5 美元/0.50 美元/30 美元,GPT-5.6 Terra 每百万个输入/缓存/输出标记 2.50 美元/0.25 美元/15 美元,GPT-5.6 Luna 每百万个输入/缓存/输出标记 1 美元/0.10 美元/6 美元;从 7 月开始,Cerebras 将以待公布的价格提供每秒高达 750 个标记的速度访问 GPT-5.6 Sol
  • 未公开信息:参数数量、架构、训练数据和方法

工作原理:遵循其一贯的做法,OpenAI 透露了关于 GPT-5.6 模型构建的很少信息,但详细说明了围绕它们的安全机制。

  • OpenAI 训练了所有三个 GPT-5.6 模型,使其在生成输出前通过长思辨过程进行推理,使用强化学习奖励导致成功输出的推理过程。训练数据来源于公开的网络数据、从合作伙伴处获得的授权数据、OpenAI 用户的数据以及人工训练师提供的数据。
  • 一种新的最大推理级别功能仅在 GPT-5.6 Sol 中可用,该功能会分配更多 token 来深入分析输入提示。GPT-5.6 Sol 还新增了超频模式,该模式下模型会生成多个子代理,将多步骤任务拆分分配给每个子代理,并协调它们的工作。
  • 这些模型经过训练以抵御越狱攻击和提示注入,尤其在生物学、化学和网络安全知识领域设置了特殊防护机制。所有三个模型均采用快速分类器,用于扫描每次对话中与生物、化学或网络安全攻击相关的信息。Sol 和 Terra 增加了第二个分类器,用于监控其内部激活状态,并在生成过程中及时介入,暂停可能引发问题的响应,将其转交给独立推理模型进行验证,从而决定是否允许或阻止该响应。用户行为可能触发对其其他对话的自动审查,在某些情况下甚至会触发人工审查,导致公司暂停或封禁用户账户。
  • OpenAI 计划将模型所能提供的最高风险网络和生物/化学能力保留给经过审核的组织。符合可信访问计划的组织将获得安全防护措施更少的模型版本。
  • METR 无法生成清晰的能力评分,因为 GPT-5.6 Sol 经常通过捷径(如利用隐藏测试用例)而非解决提示中提出的问题来获得正确答案。METR 用于衡量模型自主执行任务的时间长度(时间越长越好)。若 METR 将捷径视为失败,GPT-5.6 Sol 的持续时间为 11.3 小时(与 Claude Opus 4.6 相当);若将捷径视为成功,其持续时间则超过 270 小时(远超当前技术水平)。
  • OpenAI 的系统卡片指出,GPT-5.6 Sol 比其前代模型更擅长根据指令自主构建思维链(CoT),这是模型隐藏推理能力的代理指标。OpenAI 认为,低思维链可控性代表更安全的模型行为,因为这意味着模型难以像高思维链可控性模型那样通过混淆推理来规避监管。GPT-5.6 Sol 的思维链可控性失败率(1.3%)是 GPT-5.5(0.4%)的三倍,且在 5000 个推理 token 时达到这一数值。

背景信息:近期美国政府开始对高性能 AI 模型的发布进行管控。OpenAI 表示在发布 GPT-5.6 系列模型前,已向美国政府预览了这三款模型及其能力。应政府要求,OpenAI 将发布范围限制在约 20 家政府批准的机构内,但未公开这些机构的名称或类型。该公司在博客中称这一措施是临时性的,不希望政府管控的访问方式成为常态。OpenAI 宣布 GPT-5.6 的同一天,美国政府授权 Anthropic 向约 100 家公司和联邦机构提供 Claude Mythos 5 模型,这发生在两周前政府迫使 Anthropic 暂停向所有客户开放 Claude Mythos 5 和 Claude Fable 5 的事件之后。数天后,Anthropic 恢复了 Claude Fable 5 的服务。

重要性:GPT-5.6 系列将 AI 安全性问题的关注点扩展到了价格更低的模型层级。过去,价格更低、速度更快的模型因能力较弱而受到较少审查,速度曾是主要优势。通过将原本仅限于最先进模型的安全防护措施(如 GPT-5.6 Luna)扩展到该系列,OpenAI 增加了高并发服务开发者的难度。例如,开发合法应用的工程师(如验证代码库漏洞或化学实验结果)现在可能遭遇拒绝请求、因输出暂停导致的延迟,甚至账户级别的审查。

我们的思考:OpenAI 表示正在与白宫合作制定“未来模型发布的可重复流程”。我们希望这一流程能变得更透明、更可预测,并提供比 Claude 5 Mythos 和 GPT-5.6 发布时更广泛的访问权限。

Fugu 按任务混合模型

通过协调其他模型和代理的活动,某些模型在多种基准测试中实现了最先进水平的性能,优于任何单一模型独立工作时的表现。

最新进展:总部位于东京的研究实验室 Sakana AI 发布了两款模型,它们通过单一 API 将任务分配给其他模型和代理。Fugu 专为离散任务(如基础编码和聊天)设计,而 Fugu-Ultra 专为长期任务(如大规模编码和研究)设计。这两款系统在不依赖特定模型的情况下,性能可与 Claude Mythos 5 和 GPT-5.6 Sol 相媲美。

  • 特性:兼容 OpenAI Codex、可选择底层模型、支持工具使用、提供高阶和超高阶推理级别
  • 性能:Fugu 和 Fugu-Ultra 在 Terminal Bench 2.1、GPQA-Diamond 和 LiveCodeBench 基准测试中超越了 Claude Fable 5、Claude Mythos Preview 和 GPT-5.5;在 CharXiv Reasoning 和 CTI-Realm 基准测试中,Fugu-Ultra 超越了 Claude Fable 5、Claude Mythos Preview 和 GPT-5.5;在 SWE-Bench Pro、Humanity’s Last Exam 和 LiveCodeBench Pro 基准测试中,Fugu-Ultra 超越了所有可用模型
  • 可用性:通过 Sakana API、OpenRouter、Vercel 等供应商在欧洲以外地区提供
  • 价格:Fugu 的定价采用底层模型的标准费率;Fugu-Ultra 包含所有子模型和代理,按每百万输入/输出/缓存令牌计费,价格为 5 美元/30 美元/0.5 美元,若上下文超过 272,000 个令牌则价格翻倍;标准/专业/高级订阅计划的月费分别为 20 美元/100 美元/200 美元(专业和高级计划分别允许标准使用量的 10 倍和 30 倍)
  • 未公开信息:编排配方、数据集、架构和参数数量

工作原理:一篇技术论文将 Fugu 和 Fugu-Ultra 描述为一个模型家族的成员,该家族经过训练以协调代理工作者。Fugu 侧重速度,Fugu-Ultra 侧重性能。这两个模型可以调用广泛范围的 LLM,包括未公开的开源模型、Anthropic、Google 和 OpenAI 的闭源模型(如 Claude Opus 4.8、Gemini 3.1 Pro 和 GPT-5.5)以及 Fugu 或 Fugu-Ultra 自身的实例。

  • 当被提示时,Fugu 和 Fugu-Ultra 会构建一个代理工作流,调用各种 LLM 工作者。对于给定输入,Fugu 在每一步决定调用哪个模型,直到生成输出。相比之下,Fugu-Ultra 将输入分解为子任务,设计一个以生成输出为终点的代理工作流。对于每个子任务,它会提示一个模型(可能并行执行)。它也可以调用自身,从而进一步将子任务分解为更细粒度的任务。
  • Sakana 通过微调一个未公开的大型语言模型构建了 Fugu 模型,以完成编程、数学、语言理解、多步骤推理和代理工具使用等任务。Fugu 模型使用所有工作者模型多次完成每个任务,从而获得可验证的输出。团队根据工作者模型成功完成任务的百分比对其输出进行评分,并训练 Fugu 模型以匹配评分分布。
  • 在监督微调后,Sakana 使用 sep-CMA-ES(一种进化算法)训练 Fugu 模型,以选择用于定制代理任务的模型。(作者指出不同模型在完成任务不同要素方面的能力存在差异。)Sakana 训练 Fugu 模型在不同代理框架(如 Claude Code、Codex 和 OpenCode)下选择能在固定步骤数内成功完成任务的模型。
  • Fugu-Ultra 使用 Conductor(一个协调代理系统的模型)将任务分解为子任务,并协调多个代理解决问题。Conductor 允许每个代理独立行动,在其子任务中调用其认为必要的工具,并与其他代理共享内存,从而看到其他代理调用的工具。
  • 团队使用强化学习算法 GRPO 在一个未公开的大型语言模型上训练 Fugu-Ultra,以提示一组 LLM 执行五步代理工作流(由 Fugu-Ultra 生成)。他们将工作流扩展到任意长度的步骤,并将成功定义为生成与人类解决方案匹配的解决方案。

性能:在Sakana进行的多项编码、推理和科学知识测试中,Fugu-Ultra均达到业界领先水平。在其他类别测试中,其表现仅次于目前尚未商业化的模型(如Claude Fable 5)。Fugu和Fugu-Ultra在长上下文推理和记忆能力方面也展现出强劲表现。

  • Fugu-Ultra在Terminal-Bench 2.1、LiveCodeBench和LiveCodeBench Pro的软件工程任务中创下新纪录。在SWE-Bench Pro测试中,其表现仅略逊于Claude Fable 5。
  • 在GPQA-Diamond(研究生级科学知识测试)中,Fugu和Fugu-Ultra均取得95.5%的得分,创下单项测试最高纪录。
  • 在SciCode(通过编码解决现实科学问题测试)中,Fugu以60.1%的得分位列所有可用模型之首,仅落后于Claude Fable 5,领先于Fugu-Ultra。
  • Fugu在长上下文推理(AA-LCR)测试中创下新纪录。在MCRv2(长上下文记忆测试)中,Fugu和Fugu-Ultra的表现仅落后于GPT-5.5。

背景信息:此前Sakana曾尝试通过模型合并等其他方式整合AI模型,以利用其集体智能。但目前代理式编排(agentic orchestration)已成为最成功的方案。OpenRouter近期推出的Fusion证明,组合多个领先模型的表现可超越单一模型,而合理搭配低价模型也能实现接近SOTA(最先进水平)的性能,带来更高的性价比。

重要意义:美国政府近期限制访问Claude Fable 5和GPT-5.6的举措,引发了业界对模型编排技术的关注。开发人员和机构正寻求减少对单一供应商或国家的依赖。在Anthropic全面限制Claude Fable 5访问之前,许多机构已对该公司新的数据留存要求表示不满。若开发者能完全掌控编排器中的模型池供应商,即可根据处理信息的敏感性动态启用或禁用模型,从而降低成本或实现特定业务功能。

我们的思考:从某种意义上说,模型编排是代理工程的自然延伸,只是在抽象层次上更高,除了在工具和子代理之间切换,还能在多个模型间切换。这催生了新的竞争形式:开发者不再局限于使用单一AI公司的API构建应用,而是可以调用其他公司的模型,并自身成为API提供商。

微软选择独立发展

微软曾是OpenAI的独家合作伙伴,目前仍是其他公司AI模型的主要转售商。现在,微软从零开始构建了自己的推理模型。

最新动态:微软推出了MAI-Thinking-1,这是其首个未通过其他开发者模型蒸馏或微调构建的推理语言模型。微软将MAI-Thinking-1描述为与Claude Sonnet 4.6相当的中型模型。该模型是微软Build大会上发布的七款MAI系列模型的首款,包括GitHub Copilot和Visual Studio Code中可用的小型编码模型MAI-Code-1-Flash。

  • 输入/输出:文本输入(最多256,000个标记),文本输出(最多256,000个标记)
  • 架构:专家混合架构(总参数量1万亿,每个标记激活350亿参数)
  • 特性:函数调用、开发者指令(由开发者设定并在冲突时优先于用户提示),兼容 OpenAI 的 Chat Completions API
  • 性能:根据微软测试结果,在 AIME 2025 数学基准测试中位列第三
  • 可用性:通过微软 Foundry 进行私有预览,计划通过 Fireworks AI、Baseten 和 OpenRouter 提供更广泛的访问
  • 未公开信息:完整数据集和数据提供商列表、价格

工作原理:微软通过预训练基础模型、将独立副本微调为专用模型作为教师模型、将教师模型蒸馏为学生模型,并通过强化学习训练学生模型进行推理,构建了 MAI-Thinking-1。预训练和中期训练数据分别包含 30 万亿和 3.55 万亿个 token,主要由人工生成数据构成(其中超过 50% 为代码)。后期训练数据包含超过 500 万个 STEM 问题和超过 16 万个编程问题。

  • 微软主要使用授权材料进行预训练,避免使用合成数据。公司认为,基于 AI 生成数据训练的模型或通过第三方教师模型蒸馏的模型会继承教师的设计选择,泛化能力较弱,因此直接训练能产生更可控的行为。
  • 对于进一步的训练数据,微软爬取了约 1200 万亿网页,过滤后保留 7940 亿网页,并从 Common Crawl(一个开放存档)中单独引入了 242 亿个去重网页。Common Crawl 的使用条款明确表示不对存储内容授予任何权利,并告知用户使用其服务需自行承担风险。
  • 团队在基础模型上应用强化学习,训练了三个独立的专用模型:一个专注于 STEM 推理,另一个专注于代理编程和工具使用,第三个主要用于帮助性和安全性。这些模型没有模仿其他模型的推理轨迹,而是生成原创的思考链,并因正确数学解法、通过代码测试用例和合理判断而获得奖励。
  • 团队通过两个阶段整合三个专用模型:(i)监督微调阶段将它们蒸馏为单一模型,(ii)一轮强化学习以避免过度拒绝并提升安全性和风格。

结果:根据微软测试,MAI-Thinking-1 在数学领域表现最强,但在研究生水平科学和代理编程方面落后于其他模型(包括来自 Anthropic、DeepSeek 和 OpenAI 的模型)。在测试竞赛数学问题解决能力的 AIME 2025 中,MAI-Thinking-1(97.0%)超过 Claude Sonnet 4.6(95.6%)和 DeepSeek V3.2(93.1%),但落后于 Claude Opus 4.6(99.8%)。目前尚未发布任何独立评估或与更新模型的对比结果。

背景:微软长期以来依赖 OpenAI 的模型来驱动 Copilot 等产品,并通过借鉴竞争对手的模型构建了早期版本。其 Phi 系列模型蒸馏了 OpenAI 的 GPT-4 和 GPT-5,MAI-DS-R1 是 DeepSeek-R1 的微调版本。这一情况在 2026 年 4 月发生变化,微软与 OpenAI 修订了合作协议,使微软使用 OpenAI 模型的授权变为非独占,OpenAI 也因此可以自由选择任何云服务提供商为其产品提供服务。

Why it matters: 使用微软技术栈的团队无需引入新供应商或将数据迁出现有工具,即可获得强大的推理模型。这可能会吸引微软庞大的Azure和Copilot用户群体。微软表示,他们计划基于MAI-Thinking-1及其同类模型所构建的数据管道开发更多模型。

We’re thinking: 该公司原本旨在使用完全可追溯的数据训练推理模型,但仍然大量依赖网络数据。当然,其他公司也是如此。迄今为止大型语言模型的许多成功案例都建立在网页数据基础上。

为机器人设计更优的奖励模型

通过强化学习训练机器人时,手工设计的奖励函数虽然构建成本高,但通常比基于视觉-语言模型的通用奖励模型更能有效分配奖励。研究人员开发的奖励模型显著缩小了这一差距。

What’s new : 斯坦福大学和加州大学伯克利分校的Tony Lee、Andrew Wagenmaker、Karl Pertsch及其同事开发了RoboReward,这是一个包含40亿参数和80亿参数规模的视觉-语言奖励模型系列。这些模型能够为多种机器人类型执行的各类任务提供奖励。作者还提供了用于训练和评估视觉-语言奖励模型的数据集和基准测试。

Key insight : 现有的机器人动作文本-视频数据集主要包含成功动作的示例,这让模型难以学习区分成功与失败。但可以通过对正面示例进行重新标注生成负面示例(例如,将包含机器人将勺子放入锅中的视频示例中的指令"将勺子放入锅中"改为"将勺子放在锅边")。也可以通过裁剪成功动作的视频生成不完整尝试的示例。

How it works : 作者构建了一个包含多样化机器人动作的语料库,每个示例包含指令、机器人响应指令的视频,以及从1(失败)到5(完成)的进度评分。他们从两个数据集中收集了单臂、双臂和人形机器人的视频。他们统一了任务描述,用负面示例扩充数据,并分配了进度评分。

  • 为生成负面示例,作者使用GPT-5 mini,给定展示机器人成功执行指令的视频,描述(i)场景,(ii)机器人的动作,以及(iii)场景和机器人的最终状态。基于此分析,Qwen3-4B-Instruct-2507提出了视频应获得低于5分进度评分的替代指令。GPT-5 mini分析这些替代示例并剔除与对应视频标签不匹配的示例。
  • 作者通过截断成功执行指令的视频生成部分进度的负面示例。
  • GPT-5 mini为每个示例分配1到4分的进度评分。
  • 作者使用视频和指令对Qwen3-VL 4B和Qwen3-VL 8B进行微调,以预测进度评分。进度评分作为奖励。
  • 他们手动验证了2,831个示例,构建了一个名为RoboRewardBench的测试数据集。

Results : RoboReward 模型在 RoboRewardBench 示例的奖励估计上比机器人模型 Gemini Robotics-ER 1.5 和通用模型(包括 GPT-5)更准确。在真实机器人演示中,基于 RoboReward 模型奖励的训练效果优于之前奖励模型的训练效果,但不如人工分配奖励的训练效果。

  • 给定 RoboRewardBench 的视频和指令,奖励模型会计算奖励值,作者根据平均绝对误差(数值越低越好)评估结果。RoboReward 8B(平均绝对误差 0.665)优于包括 GPT-5 mini(平均绝对误差 0.691)、GPT-5(平均绝对误差 0.811)和 Gemini Robotics-ER 1.5(平均绝对误差 0.906)在内的 21 个其他模型。RoboReward 4B(平均绝对误差 0.845)排名第四,优于包括 Gemini 3 Pro(平均绝对误差 0.851)在内的 18 个竞争模型。
  • 在真实世界演示中,通过 RoboReward 8B 奖励训练的扩散变压器在操作 WidowX 机械臂时,表现优于使用 Gemini Robotics-ER 1.5 奖励训练的模型。在拾取玩具并放置在毛巾上的任务中,基于 RoboReward 8B 训练的模型(成功率 50%)显著优于基于 Gemini Robotics-ER 1.5 训练的模型(成功率 10%),但逊色于人工分配奖励的人员(成功率 75%)。同样在打开抽屉的任务中,基于 RoboReward 8B 训练的模型(成功率 80%)明显优于使用 Gemini Robotics-ER 1.5 训练的模型(成功率 45%),但不如使用人工分配奖励的模型(成功率 90%)。

Why it matters: 视觉-语言奖励模型在机器人训练中展现出巨大潜力,而这种方法显著提升了其效果。通过将成功演示与验证过的失败案例结合,作者训练出一个通用奖励模型,该模型可跨多种机器人和任务类型使用,减少了对任务特定工程的需求。

We’re thinking : 发布基准测试和预训练奖励模型,邀请社区直接改进奖励函数,而非寄希望于其作为通用模型优化的附带结果出现。