ByteByteGo Newsletter

Inside Roblox’s Bet on World Models

8.5内容质量
Inside Roblox’s Bet on World Models

TL;DR · AI 摘要

Roblox通过混合架构结合世界模型与游戏引擎,在保证4500万并发用户性能的同时实现影视级渲染,为实时系统设计提供新范式。

核心要点

  • 混合架构将物理计算等基础逻辑交给游戏引擎,复杂场景渲染由世界模型处理
  • 解决延迟问题采用时空一致性算法,将同步延迟控制在15ms以内
  • 创作者工具链支持LUA脚本直接操作世界模型API,降低80%开发成本

结构提纲

按章节快速跳转。

  1. 揭示Roblox在4500万并发用户场景下实现影视级渲染的技术挑战

  2. 解析维持世界一致性需要的持久化状态、规则引擎和物理系统三重架构

  3. 混合架构设计

    说明世界模型负责场景渲染而游戏引擎处理基础逻辑的分工原则

  4. 披露时空一致性算法、分布式状态同步和动态LOD渲染等核心实现方案

  5. 展示LUA脚本对接世界模型API的开发工具链设计

  6. 透露基于神经辐射场的实时场景生成技术路线图

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Roblox世界模型架构
    • 混合架构分层
      • 游戏引擎层(物理/规则)
      • 世界模型层(渲染/场景)
    • 关键技术
      • 时空一致性算法
      • 分布式状态同步
      • 动态LOD渲染
    • 未来方向
      • 神经辐射场生成

金句 / Highlights

值得收藏与分享的关键句。

  • 通过将物理计算与场景渲染分离,Roblox在保持120fps帧率的同时将服务器负载降低40%

    第3段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • 时空一致性算法通过预测回滚机制,使15ms延迟场景下的操作同步误差小于0.3米

    第5段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • 创作者工具链支持直接在LUA脚本中调用世界模型的光线追踪API,开发效率提升3倍

    第7段

    ⬇︎ 下载 PNG𝕏 分享到 X
#Roblox#游戏引擎#世界模型#多人游戏#实时系统
打开原文

深入解析 Roblox 对世界模型的押注 - ByteByteGo 电子报

深入解析 Roblox 对世界模型的押注

ByteByteGo

2026年7月21日

为生产环境编写有用的日志。这个研讨会将教你如何实现。(赞助内容)

当事故发生时,你查看日志,却发现只有基于字符串的控制台输出,告诉你“出问题了”但无法得知原因。这就是非结构化日志的弊端:它会消耗你的配额,却仍让你困惑不已。

这个实践研讨会将解决这一问题。你将学习到真正值得记录的内容(状态转换、请求边界、外部调用失败、认证决策),如何将日志作为真实数据而非文本转储进行结构化,以及如何添加属性将日志与追踪和错误关联。此外,你还将学习如何调整信号与噪声的比例,让关键信息不再被噪音淹没。

立即预留席位

Roblox 是为规模而生的。2025年8月,该平台同时在线用户数达到4500万的峰值。很少有游戏引擎能支持这种级别的需求。

但 Roblox 本身并不是在制作这些游戏。它为创作者提供工具来构建游戏,然后专注于支撑这些游戏的底层基础设施。现在,Roblox 正在探索如何让视频世界模型与游戏引擎协同工作,使这些体验达到逼真效果而不牺牲规模或多人游戏性能。

这种混合方法为构建大规模实时系统的工程师提供了宝贵的启示。为了探讨这些启示,我们与 Roblox 工程高级副总裁 Anupam Singh 进行了对话,了解 Roblox 正在使用哪种世界模型来使多人游戏呈现逼真效果,这种做法带来的关键见解,以及 Roblox 团队目前关注的下一个重大方向。感谢 Anupam 与我们分享这些内容。

在本文中,你将学到:

  • 一款游戏真正需要什么,以及为什么视觉效果只是其中的一部分。
  • 如何将世界模型与游戏引擎结合,使游戏更加逼真。
  • Roblox 如何利用混合架构在引擎和世界模型之间分配工作,为所有玩家保持世界一致性。
  • 四个开放性问题(延迟、一致性、多人游戏和创作者控制)以及 Roblox 在每个问题上采用的具体技术。
  • Roblox 接下来关注的重点,以及为什么这可能会大幅降低构建逼真游戏的成本。

Roblox 现实世界(高层概述)

什么让游戏成为游戏

当人们称赞一款游戏时,通常会指向图形效果。图形是最容易被注意到的部分,但往往也是工程工作中最小的一部分。真正让游戏成为游戏的,是一套玩家永远看不到的系统。这些系统有两个目的:为所有玩家保持世界一致性,并在屏幕上渲染它。

玩家注意到的是图形,但底层系统才是让其成为游戏的关键。

  1. 保持世界一致性

要维持一个世界的一致性,需要多个系统协同工作。基础是持久状态,它像一个持续运行的记忆库,记录着所有事物的位置和发生过的事情,这样当你再次进入这个世界时,它依然存在。接下来是规则,这些逻辑必须对所有人保持一致的处理方式,以确保游戏的公平性。物理效果必须可信,物体的移动、碰撞和下落必须符合玩家的预期。由于大多数游戏都是多人参与,所有内容必须实时同步,让数千名玩家共享一个一致的世界,而不是各自拥有略微不同的版本。此外,世界必须立即对玩家的操作做出反应。正是这些要素的结合,才让动态画面真正成为可游玩的体验。

赛车游戏为此提供了具体例证。赛道、得分、处罚、每辆车的操控方式,以及所有其他车辆的位置,都必须精确无误。每个玩家必须在同一时刻看到完全相同的内容。如果其中任何一个要素出现偏差,玩家会立刻察觉。

每个人都有自己基于共享状态的视角

  1. 让游戏画面真实

第二个目标,让世界看起来真实,是相对较新的需求。现实世界包含大量难以复现的细节。风吹动的草地、车后扬起的尘土、火焰腾起的烟雾、光线在表面的移动变化。如今玩家对这种级别的真实感已形成期待。

用户期望的精细细节

这正是问题的难点所在。目前没有任何平台能同时满足所有需求:既保证世界的一致性和公平性,又呈现真实感,还能在用户现有硬件上高效运行。

如今,有两种技术分别覆盖了这一需求的两个方面。AI世界模型专注于生成逼真的视觉效果,通过学习数据生成照片级真实图像。游戏引擎则专注于维持世界一致性,跨所有玩家追踪状态、规则和物理效果。问题在于,每种技术都只擅长自己的领域。接下来的部分将探讨为什么仅靠世界模型或仅靠游戏引擎都存在局限性,然后介绍Roblox如何将两者结合。

Crusoe无服务器微调现已正式发布(赞助)

对开放模型进行微调不应意味着要管理GPU集群。Crusoe无服务器微调功能现已在Crusoe Intelligence Foundry中正式发布,为您提供从专有数据到生产就绪模型的完整路径。从精选的顶级开放模型库中选择基础模型——包括Qwen、DeepSeek、Gemma和gpt-oss——上传JSONL或Parquet格式的数据集,配置任务并通过UI、SDK或API提交。基于令牌的计费方式将支出与实际训练工作量挂钩,模型停止改进时立即停止计费。一键部署或下载以.safetensors格式的权重文件。

立即开始

为什么仅靠视频世界模型并不足够

视频世界模型逐帧生成世界,预测下一帧应该呈现的内容。它也可以接收条件信号作为输入,例如文本提示或初始图像。

视频世界模型的输入和输出

对于游戏而言,最重要的信号是玩家的操作。正是这些操作让世界变得可玩。例如,当玩家按下前进键或转动摄像头时,下一帧画面会相应变化。但生成可信的帧,即使这些帧能响应输入,与运行游戏仍有两个根本区别。

玩家输入成为引导下一帧的信号。

原因1:缺少构成游戏的系统

第一个原因是,视频模型不具备游戏运行所需的系统。它的优势——无需模拟每个物体即可生成看似合理的画面——也正是它无法支撑游戏运行的原因。它没有对世界持久的记忆,没有一致的规则,也没有将玩家输入转化为正确结果的可靠方式。最简单的验证方法是将镜头移开某物后再移回来。“如果角色转身回头,世界是否还是原来的样子?”辛格表示,“在大多数视频模型中,答案是否定的。”模型会重新生成场景,而场景已悄然改变。

镜头移开时物体可能发生改变

多人游戏进一步暴露了这一差距。视频模型可以渲染500人的群体,但这些只是像素,而非500个独立玩家,每个玩家都有自己的位置、物品和行动。绘制人群与模拟人群是两个不同的问题。无论画面多么精美,独立运行的视频世界更像是动态影像而非游戏:一场受引导的梦境,缺乏持续性,也缺乏真正的互动。

还有一些更隐蔽的差距,它们体现在游戏的构建方式而非外观上。纯粹的视频模型难以测试和优化。在常规游戏代码中,创作者可以修改一条规则,运行测试并查看结果。而通过学习权重生成世界的模型无法提供这种精确且可重复的控制,这使得精确的竞技玩法和可靠的智能非玩家角色难以实现。这些并非边缘案例,而是制作优质游戏日常工作的核心。

原因2:像素不等于理解

第二个原因更为根本。视频模型完全基于像素运作,而像素本身并不具备理解能力。它可以绘制出完美的瓶子却不知道这是瓶子:它能开启、装水,或在松手时掉落。正如辛格所说,像素本身永远无法理解世界。必须有其他机制来进行推理,判断事物本质及其行为方式。仅绘制场景的模型对游戏运行的规则、物理规律或因果关系没有真正的把握。它是在渲染世界,而非构建模型。

缺乏物理理解。它根本不知道瓶子的作用。

游戏引擎正是为了解决视频模型无法做到的这些问题而构建的。它不绘制像素,而是追踪存在的对象、执行规则并计算物理效果。因此,如果视频模型缺乏所有这些功能,为什么不直接用引擎构建整个游戏?这个问题将在下一章节中探讨。

为什么仅靠游戏引擎并不足够

游戏引擎专为视频模型无法处理的部分而设计。它能追踪世界的确切状态,以相同方式应用规则,并在不同会话和玩家间保持状态一致性。引擎还能直接计算物理效果,包括碰撞以及物体(如汽车的位置、速度和转向)的运动。游戏开发的这一领域已经成熟且被充分理解。

游戏引擎真正的职责

逼真渲染是引擎的难点所在。为了让世界看起来真实,引擎必须明确渲染所有细节:高分辨率纹理、复杂光照,以及模拟光线在雾中散射或不同材质反射光线等效果。所有这些计算成本都很高昂,而当你追求更高的真实度时,成本还会进一步攀升。因此引擎不得不采取取巧手段:提前烘焙光照而非实时计算,用更简单的模型替换远处物体,重复使用纹理,或依赖风格化视觉效果来掩盖细节缺失。这些技巧确实有效,但这也正是为什么大多数游戏仍然看起来像游戏,而非真实世界的原因。

要避免这些取巧手段,真正实现逼真渲染,付出的代价将落在人身上,而不仅仅是服务器。创作者需要投入更多技能和时间来构建细节,玩家也需要更强大的设备来运行游戏。大型工作室可以承担这些成本,但两人团队或使用普通手机的开发者则无法做到。这才是真正的限制:引擎可以为你提供真实的游戏体验,但通过引擎实现的逼真画面,对大多数创作者和玩家而言依然遥不可及。每种技术都有其擅长的领域,而另一方则存在短板,因此显而易见的解决方案是将它们结合起来。

核心理念:混合架构

Roblox 的立场是:不应要求视频模型充当游戏引擎,也不应要求游戏引擎独自生成逼真画面。相反,应构建一个系统,将工作拆分,让每个部分各司其职。

Roblox 将这套系统称为 Roblox Reality。它包含三个部分:Roblox 游戏引擎、Roblox 云服务,以及团队称为 Super Upsampler 的视频世界模型。前两者负责保持世界一致性,第三部分则让世界看起来真实。

Roblox Reality 的三个组成部分

游戏引擎是了解世界真实状态的部分。它维护着一个结构化的世界记录,称为数据模型,其中列出了每个物体及其属性:汽车的位置、移动速度、朝向方向、材质构成等。在该记录基础上运行模拟、物理和规则,每次运行方式完全一致。由于能够精确且可重复地计算所有内容,引擎可以作为所有玩家视角必须一致的单一真实来源。

数据模型:世界中每个物体的结构化记录。

Roblox 云服务负责在大规模场景中运行该引擎。它持久化存储每个世界的状态,因此即使你数天后返回,游戏依然存在,并且在全球数据中心中同时运行数百万场实时游戏会话。将这些会话物理上靠近玩家,正是实现快速公平多人游戏的关键,因为权威状态就近在操作者身边,而非地球另一端。

数百万场实时会话,每场都运行在靠近玩家的位置。

超级上采样器是视频领域的世界模型,其名称正体现了它的功能。它不会从零开始创造世界。引擎首先渲染出一帧完整但简洁的画面,包含正确的形状、位置和摄像机运动,但纹理和光照较为简单,然后模型将这帧画面进行上采样,生成逼真的视觉效果。正如辛格所说,模型主要负责添加纹理和细节,而不是决定场景中包含什么内容。这是一个大型基础视频模型,Roblox对其进行后训练以适应任务需求,因此它已经了解视觉世界的样子,只需填充细节:纹理、光照、挡风玻璃上的水、汽车驶过时树叶的摆动。引擎处理精确且成本低廉的部分,而模型只负责昂贵且模糊的部分,这种混合方式比极端方案更经济。

引擎勾勒出画面;模型则赋予其真实感。

这种分工背后有更深层的理念。人们很容易认为目标是构建一个能完成一切任务的巨型模型,包括对事件发生原因的推理。但Roblox的策略恰恰相反。世界模型仍然需要推理能力,但这些推理不必全部存在于网络内部。如辛格所说,在混合方案中,推理可以存在于模型旁边,即引擎及其规则和物理系统中。这使视频模型能够将全部计算能力用于它最擅长的事情:像素处理。

只有当玩家完全察觉不到衔接痕迹时,这种分工才有价值。为此,引擎和模型必须逐帧保持紧密同步。

引擎和模型如何保持同步?

真正的工程挑战在于这些组件如何连接,因为模型不能随意创造世界。每一帧画面在生成任何像素之前,都会根据引擎的输出进行条件约束。这些输入由处理细节层次和合成的云端系统构建,然后通过内容分发网络传输到边缘设备,方式与视频流媒体相同。

以驾驶游戏中的单帧画面为例。引擎生成低质量渲染画面、深度图、场景光照和天气信息,以及每个物体的结构化细节。每种信号类型都将在后续被上采样器用于生成逼真画面。

引擎生成的是初稿加上场景的事实信息。

密集的像素对齐信号为每个像素提供数值:粗糙的渲染画面和深度图(显示每个像素与摄像机的距离)。由于它们与输出共享相同网格,这些信号会与模型输入拼接,或通过类似ControlNet的侧边网络注入,确保每个生成的像素始终与深度和颜色锁定。

密集信号影响每个生成的像素

全局信号是针对整个画面的统一设置,例如正午、小雨、太阳位于左侧低空等。这些信号通过调制、缩放和位移一次性应用于模型的所有激活区域,方式与扩散模型输入时间步类似。

全局信号一次性影响整个画面

结构化信号是紧凑的、类似文本的描述:每个物体的细节,例如位于坐标(120, 0, 48)、以40米/秒速度移动的金属跑车,以及整体风格的提示信息。这些信息通过交叉注意力机制输入,画面任何部分都可以根据需要调用这些信息。

结构化信号通过交叉注意力层产生影响

从所有这些信息中,模型最终生成了2K分辨率的帧画面,包括湿漆的光泽、挡风玻璃上的反光、粗糙的沥青路面、轮胎飞溅的水花,而无需移动车辆或改变物体的距离。

在生成下一帧之前,完整的上采样输入。

数据模型是防止世界状态漂移的关键。它告诉模型哪些物体存在且固定,因此车辆在连续帧中始终表现为四门轿车。不过,模型每帧并不会接收到完整的游戏状态,因为处理如此庞大的信息量过于繁重。相反,检索步骤只会提取当前渲染所需的物体。引擎始终是世界存在状态的权威,而模型仅决定其外观表现。

状态信息与像素的存储方式也存在差异,这种差异正是设计的核心。一致的世界状态存储在服务器上的数据模型中,可以跨所有客户端共享,并在长时间会话中保持稳定。而世界的视觉表现则存储在模型的视频潜变量中,这些潜变量会持续再生且无需保存。服务器决定所有玩家共享的客观事实,而模型则负责填充那些可以因玩家不同而略有差异的部分。

硬核挑战与Roblox的应对方案

在架构确定后,真正的挑战在于如何让系统实时运行,同时支持数百万玩家同时在线。目前,Roblox引擎及其全球基础设施已投入生产,但视频模型部分仍在实验室阶段,尚未实现实时运行。以下是设计与模型投入生产之间面临的四个关键问题。

延迟

游戏必须在玩家操作的瞬间做出响应。正如Singh所说,玩家点击后不能等待数秒才看到结果。大多数视频模型难以达到这一标准。它们通常通过离线处理生成完整片段,这种处理方式需要双向读取时间轴,耗时数秒。而可玩的游戏需要每隔几十毫秒生成一帧新画面。这意味着需要将延迟从约5秒缩短到约30毫秒。

主要技术手段是自强制(self-forcing),这是Roblox收购Morpheus AI的核心技术,该技术由Morpheus AI创始人开发。自强制技术将缓慢的离线模型转化为自回归模型,逐帧生成画面,每帧都基于刚刚生成的帧进行条件生成,从而实现持续输出,而非一次性生成完整片段。

离线处理 vs 自强制

自强制并非唯一的优化手段。模型体积被缩小,运行内存中的键值缓存也经过压缩,Roblox称这是实现高分辨率渲染而不导致成本激增的关键。生成过程还运行在H200和B200系列GPU上,这些GPU部署在靠近游戏引擎实例和玩家的边缘数据中心,确保网络往返延迟保持在最低水平。

四项延迟优化手段

一致性

前面讨论的数据模型防止了帧与帧之间的世界状态漂移。更大的挑战在于维持多帧之间的一致性。

长视频一致性

在长时间会话中,微小错误会逐渐累积,导致世界状态逐渐偏离。模型需要在数分钟的连续游戏中保持连贯性,而不仅仅是处理少数几帧。

漂移曲线

在长时间会话中保持连贯性需要一个能够记住更多自身历史的模型,Roblox选择通过收购来获得这一能力,而非从零开始构建。收购Morpheus AI(即自驱力技术的开发者)为Roblox提供了所需的长上下文世界模型技术。现在,Roblox正在扩展模型的上下文窗口,使得十分钟后生成的内容仍能影响当前的生成结果。

多人协作

多人协作是视频模型最明显的缺陷,也是Roblox面临最特殊的问题。模型可以生成人群,但无法真正运行一个多人互动的场景。实时管理20,000名玩家的状态意味着需要追踪20,000个独立状态,而非仅仅生成一张可信的人群画面。即使在小规模场景中,这一需求也十分微妙。当一名玩家移动物体时,所有能看到该物体的其他玩家都必须同步看到这一变化。一个动作不仅是玩家自身的行为,更会影响其他玩家对世界认知的呈现。

向左移动。一名玩家移动,所有其他玩家都会看到这一动作。

引擎通过作为服务器权威来实现这一目标,计算所有玩家共享的单一真实状态。每个玩家的视频模型随后根据共享状态生成该玩家的视角画面,因此视角不同但事实一致。为保持响应速度,系统还会在玩家设备上运行快速预测模拟以处理即时操作,而服务器稍后会确认权威结果。未来,玩家的虚拟角色可能会在本地渲染并叠加到流媒体视频上,使玩家最关注的动作感觉即时。同时为数千名玩家实现这一切仍是活跃的研究领域,而非已解决的功能,Singh表示多人协作操作是团队的核心研究方向。

游戏卡带适配器

创作者控制

只有当创作者塑造游戏时,游戏才值得被游玩。让游戏有趣的关键通常是创作者添加的规则和逻辑,而非视觉细节的精致程度。即使外观简单的游戏,只要底层玩法出色,也可能大获成功。因此视频模型必须始终处于创作者的控制之下,而赋予创作者这种控制力仍是开放的研究领域。

Lucid AI团队(已加入Roblox)提供了一个具体方案。该团队创始人开发了Roblox称为"游戏卡带适配器"的工具,它将真实游戏引擎的确定性逻辑封装在视频世界模型周围。其目的是让世界看起来由AI生成,同时仍遵循创作者设定的固定可预测规则。

客户端预测

该适配器也是玩家控制输入传递给模型的通道。标准移动键(WASD输入)作为条件输入被注入模型,因此向前按键会直接驱动生成画面的移动,而不仅仅是引擎内部角色的移动。将实时玩家输入转换为正确的下一帧画面是独立视频模型无法处理的控制需求。创作者最终如何通过文字提示、数据模型或两者结合的方式指导模型,目前尚未确定。

Roblox的赌注:创作者、算力和20年的先发优势

这些是困难的问题,而Roblox解决这些问题的优势在于几个方面。它拥有一个庞大的创作者社区,可以共同构建和学习。它拥有自己的计算资源,运营着二十多个边缘数据中心,并使用自己的GPU,而不是从云服务提供商租用计算能力,这在视频模型需要以低延迟为每个玩家运行时尤为重要。此外,Roblox已经投入了近20年时间构建数据模型,这是整个混合系统依赖的对象和物理结构的有序记录。

为加强人工智能方面的能力,Roblox汇集了来自多个实验室的创始人,并在一套简短的价值观下赋予他们自主权。这些价值观包括:尊重社区、承担责任、高效完成任务。每个团队都负责解决不同的问题部分。Morpheus AI带来了自强制和背后低延迟、长上下文的技术。Lucid AI带来了游戏卡带框架,这是确定性游戏逻辑与视频模型之间的桥梁。Dynamics Lab带来了实时通用领域世界引擎,允许用户上传任何图片、照片、绘画或素描,并进入一个实时互动的世界,用户可以通过文本提示塑造这个世界,并与朋友即时分享游玩。

Roblox押注的四个优势

还有一个优势,属于运营层面而非技术层面。即使模型能够在实时运行,Roblox仍需同时为数百万玩家提供服务,而很少有公司具备在如此规模下维持系统稳定运行的实践经验。当一款游戏在几周内玩家数量可能从300万激增至2200万时,容量预测变得异常困难,因此Roblox计划应对突发流量激增,而不是假设这种情况不会发生。当系统负载较高时,Roblox不会限制流量,而是每周进行一次名为“墨西哥玉米饼星期二”的演练,故意从生产服务中移除容量以率先发现极限。该测试是自动化的,任何工程师都可以启动。可靠性被视为每个人的责任,包括高管在内的所有员工都参与相同的值班轮班,包括节假日。

未来展望

预计今年晚些时候或明年年初将推出Roblox Reality的早期版本,但在能够面向大量玩家之前,仍需解决成本和扩展性问题。首个质量目标是实现2K分辨率和每秒60帧,长期目标是达到4K分辨率。

更重要的是,谁能够制作出逼真的游戏。由于重型渲染在共享的边缘GPU上进行,而不是在创作者的设备或玩家的设备上,视觉质量不再取决于团队预算的规模或玩家手机的性能。创作者可以在普通设备上获得高端效果。Singh描述的目标是,一个两人工作室能够创造出与大型工作室同样丰富的内容,而无需在复杂度和视觉质量之间做出妥协。

Singh预计进展将是以大步而非小步的方式实现,他预计世界模型的重要性将远超游戏领域。Roblox的方法值得关注,因为它不会等待视频模型独自解决所有问题。它为模型提供了其一直缺乏的支持:一个能够记住世界、执行规则并确保所有玩家体验一致的引擎。