Sequoia Capital

Standard Intelligence: Training General Intelligence in Pixel Space

8.5内容质量
Standard Intelligence: Training General Intelligence in Pixel Space

TL;DR · AI 摘要

Standard Intelligence通过全视频预训练在像素空间中训练通用智能代理,展示了大规模视频数据在构建通用计算机代理中的潜力。

核心要点

  • 使用全视频预训练,FDM-1模型可以处理CAD齿轮生成等多种任务。
  • 1100万小时的计算机操作数据集是行业最大的。
  • FDM-1模型比竞争对手更高效地处理视频数据。

结构提纲

按章节快速跳转。

  1. 介绍Standard Intelligence及其视频预训练方法。

  2. 通过视频预训练,模型可以从原始屏幕数据中学习。

  3. 团队克服了视频数据处理的挑战,实现了高效的视频编码。

  4. FDM-1模型展示了视频预训练在多种任务上的应用。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Standard Intelligence

金句 / Highlights

值得收藏与分享的关键句。

  • Standard Intelligence’s thesis is that the best way to build a general agent is through full video pre-training on computer use, because it is the only approach that can truly scale action data.

    第 4 段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • An 11-million-hour computer action dataset — the largest in the industry.

    第 7 段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • A video encoder that is roughly 50× more token-efficient than competing approaches, enabling nearly two hours of 30 FPS video to fit inside a 1-million-token context window.

    第 7 段

    ⬇︎ 下载 PNG𝕏 分享到 X
#AI#General Intelligence#Video Pre-training
打开原文

标准智能:在像素空间中训练通用智能

跳转到主要内容

[](https://sequoiacap.com/ "红杉资本")

打开搜索

图像 1
图像 1

标准智能:在像素空间中训练通用智能

作者 黄索尼

发布于 2026年4月30日

有用的代理的未来可能不会从文本开始,而是从像素开始。

像素是否能成为训练有用代理的关键?

扩展语言模型——以及围绕它们的代理生态系统——的竞争正在白热化。通过推理解决问题并编写代码来解决这些问题的编码代理已经取得了很大的进展。

但一个雄心勃勃的年轻团队却选择了不同的赌注:最有可能实现通用计算机代理的方法可能不是通过语言、屏幕截图和工具调用,而是通过扩展原始视频。

标准智能的理论是,构建通用代理的最佳方法是通过对计算机使用情况进行全视频预训练,因为这是唯一能够真正扩展动作数据的方法。模型学习如何从原始屏幕数据中使用计算机,而不是预测文本标记,它会根据眼前的像素预测下一个鼠标移动、点击和按键。

这就像将特斯拉的FSD方法应用于计算机屏幕上的知识工作。

这使得这个赌注既非常反传统,又非常“苦涩教训”化的。标准智能没有选择手工设计工作流程或将语言模型包裹在日益复杂的框架中,而是押注于一种新的预训练范式:向模型提供计算机使用的原始流,积极扩展它,并让通用性从数据中浮现出来。

“我们不是视频人”

视频难以处理。它在计算上昂贵,在经济上昂贵,而且在技术上苛刻。以前尝试通过视频向AGI扩展的努力往往以失败告终。

标准智能团队明确表示“不是视频人”。他们没有带着关于如何将视频作为媒介工作的十年假设来到这里。相反,他们必须从第一原理出发,对每个挑战进行推理,并以不同寻常的乐观、创造力和坚韧不拔的态度应对这些挑战。

结果令人震惊。一个包含1100万小时计算机操作的数据集——行业内最大的数据集。一个视频编码器,其标记效率大约是竞争对手的50倍,使近两个小时的30 FPS视频能够适应100万个标记的上下文窗口内。一个30拍字节的存储集群在旧金山以不到50万美元的价格组装完成,比超大规模替代方案便宜约20倍。

FDM-1,他们的第一个直接基于大规模计算机使用视频训练的基础模型,提供了这种范式可能成为什么样子的早期预览。这是一个通用模型,可以在Blender中生成CAD齿轮,在经过一个小时的微调后驾驶汽车绕着旧金山街区行驶,并通过探索软件状态空间的方式找到软件中的错误,就像好奇的人类一样。

有责任感的年轻人创始人

创始人 加勒姆·米德德万什·潘迪 在2022年的阿特拉斯奖学金期间相识,这是一个面向对AI对齐和AGI感兴趣的高中生的精英奖学金项目。

加勒姆和德万什对实现AGI异常认真,并且对安全地实现这一目标也异常谨慎。两位创始人都超越了他们的年龄(分别是21岁和20岁),并且都出于紧迫感而离开了本科课程,致力于解决这个问题。

加勒姆和德万什因其品味、坚韧、技术勇气和雄心脱颖而出。这体现在产品思维、研究方向以及FDM-1报告本身中。

六人组成的完整团队虽小但强大。尼尔尤德希斯特乌利塞瑞安 各自独特且卓越。他们选择了放弃传统的道路(高级学位和大公司的职位邀请),共同追求这一勇敢的使命。

一种新的预训练制度

视频长期以来一直是AI的强大训练场。DQN展示了代理可以直接从Atari环境中的像素中学习丰富的行为。特斯拉将视频模型扩展到自动驾驶汽车和机器人导航物理世界。

但在通向通用知识代理的竞赛中,视频优先的预训练仍然是一个非常规的想法。

标准智能押注它不会长期保持非常规。

我们很高兴与Spark Capital的米科和亚斯敏一起领导标准智能的A轮融资。

分享

通过Facebook分享此内容 通过Twitter分享此内容 通过LinkedIn分享此内容 [通过电子邮件分享此内容](mailto:?subject=Standard%20Intelligence:%20Training%20General%20Intelligence%20in%20Pixel%20Space&body=https%3A%2F%2Fsequoiacap.com%2Farticle%2Fstandard-intelligence-training-general-intelligence-in-pixel-space%2F)

浏览本网站即表示您同意我们的cookie政策。

接受 拒绝

关于

企业实体

登录

Motion On Off

© 2026 红杉资本