Waymo vs Tesla: Two Ways to Build Self-Driving Cars

TL;DR · AI 摘要
Waymo和Tesla在自动驾驶技术上采用不同策略,Waymo依赖大量预设规则和安全验证,Tesla则依赖海量数据训练和实时学习,两者各有优劣。
核心要点
- Waymo通过220.6百万英里无乘客自动驾驶里程验证系统安全性
- Tesla依赖300亿英里数据训练,但驾驶员仍需负责车辆
- 两者在路径选择和安全验证方法上存在根本差异
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 自动驾驶技术对比
- Waymo
- 预设规则系统
- 220.6百万英里数据
- 封闭测试验证
- Tesla
- 数据驱动模型
- 300亿英里数据
- 实时道路验证
金句 / Highlights
值得收藏与分享的关键句。
Waymo通过220.6百万英里无乘客里程验证系统安全性,但面临复杂场景覆盖不足问题
Tesla的300亿英里数据训练依赖驾驶员责任,其FSD订阅量达128万但存在安全争议
Waymo的预设规则系统在极端场景(如车辆着火)处理上更依赖人工验证
Waymo 与 Tesla:构建自动驾驶汽车的两种方式
ByteByteGo
2026年8月17日
Matic:全球首款直观的家庭机器人现已发布。(赞助)
在美国设计和组装的 Matic 是全球首款能够理解你的机器人。其全新功能 Matic Cues 让你可以像与其他人互动一样与它交流。
- 指点并说话。在指向一团混乱时说“嘿 Matic,清理一下”,Matic 会立即知道要清理什么。
- 支持 70 多种语言。无论你使用哪种语言,都可以让 Matic 清洁厨房、跟随你或前往水槽。
- 不需要应用程序。家中的任何人都可以使用 Matic,而不仅仅是精通应用程序的成年人,孩子和祖父母也能轻松使用。
在 Matic 之前,所有家庭机器人都需要一个界面。而 Matic 只需要你说话。立即尝试 Matic,享受其 6 个月无理由退款保证。
获取 Matic
以每小时 40 英里的速度行驶的车辆,每秒大约会移动 60 英尺。在这一秒内,软件必须确定物理上附近的物体,对每个物体进行分类,预估这些物体的移动轨迹,选择路径,并发出转向和刹车指令。
快速完成所有这些操作的问题已经基本解决。然而,在不可预测且多样化的交通场景中正确执行这些操作仍然是一个开放性问题。这是因为现实世界的交通会产生比任何团队预先确定的更多独特场景。例如,Waymo 描述了一种情况:前方道路上有一辆着火的车辆,但可行驶的车道在物理上仍然畅通 [3]。这种场景的几何结构可能允许直接穿过。然而,实际情况却需要掉头或采取预防措施。
致力于自动驾驶汽车的两家公司 Waymo 和 Tesla,尝试用不同的方式回答这些问题。
作为参考,截至 2026 年 3 月,Waymo 报告了 2.206 亿英里的单乘客自动驾驶里程。这些里程是在五个大都会区实现的,且驾驶座上没有人类 [5]。另一方面,Tesla 报告称美国有超过 300 万辆汽车,每年行驶里程超过 300 亿英里,2026 年第一季度有 128 万个活跃的全自动驾驶订阅用户 [10]。几乎所有这些 Tesla 的里程都涉及驾驶员,驾驶员仍需对车辆负责。Tesla 的无人驾驶服务是独立的,规模要小得多,目前在奥斯汀、达拉斯和休斯顿运行时没有安全监控员,而湾区服务则使用安全驾驶员 [10]。
这两种方法都高度依赖机器学习。但它们在预先确定内容的多少上存在差异。在本文中,我们将探讨这两种方法,同时尝试回答以下问题:
- 每个系统如何检测物理上附近的物体?
- 它们如何从这些数据中构建模型,为什么其中一个系统会保持结果的可读性?
- 每个系统如何预估其他道路使用者的行为?
- 路径是如何选择的,在车辆采取行动之前由什么进行验证?
- 每个系统发布了哪些安全证据,为什么这些数据衡量的是不同的内容?
- 每个系统内部的知识来源是什么?
免责声明:本文基于来自多个来源的公开信息。文末有参考文献。如果您发现任何不准确之处,请在评论中指出。
感知
相机记录的是像素网格上的光强度。距离信息在该网格中并不存在,因此必须通过像素排列来计算深度,但这种计算可能出错。远处的大型物体和近处的微型物体可能在图像中占据相同区域。
LiDAR通过不同方式得出相同结论。该设备发射激光脉冲,测量脉冲在从表面反射后返回所需的时间,并将该时间间隔转换为距离。我们可以将这种输出视为点云,即一组描述车辆周围表面的三维测量点[1]。此时距离不再是估算值,而是实际测量值。
Waymo第六代系统自2026年2月开始全自动驾驶,搭载13个摄像头、4个LiDAR单元、6个雷达单元以及一套用于检测警报器和铁路道口的外部音频接收器[2]。该系统在所有方向上均实现覆盖重叠,探测距离可达500米。这种重叠设计用于应对雨天、道路污垢或结冰等极端情况,此时摄像头的捕捉能力会受到限制,而LiDAR和雷达则能维持感知能力[2]。
特斯拉车辆主要依赖摄像头。相反,特斯拉完全采用"纯视觉"方案,仅依靠外部摄像头和人工智能进行导航。例如,特斯拉文档描述Model 3和Model Y均采用基于摄像头的Tesla Vision系统,不使用雷达,而是通过摄像头和神经网络处理实现导航[9]。
请参见下图:
此处还有另一个需要关注的要点。Waymo第五代Jaguar I-PACE车型搭载29个摄像头[1]。第六代系统减少至13个摄像头,Waymo将其归因于采用1700万像素的图像传感器,用不到一半的摄像头即可覆盖相同区域[2]。换句话说,Waymo也在减少整体传感器数量,同时仍将冗余描述为关键要素。
这种取舍在于:直接测量需要成本,同时增加可能明显失效的组件。然而,派生值可能成本较低,但同样可能出错。
表示
必须将数百万像素和点转换为系统可理解并操作的描述。这种描述的性质和形式是自动驾驶系统架构中最重要的决策之一。
Waymo将Waymo基础模型置于核心位置,该模型由两个组件构建:
- 传感器融合编码器:它随时间融合摄像头、LiDAR和雷达数据,输出物体、语义属性和嵌入向量。这些是下游组件使用的紧凑型数值摘要。
- 驾驶视觉语言模型(Driving VLM):使用Gemini训练并基于Waymo驾驶数据进行微调,可处理需要背景世界知识的罕见场景,例如前文提到的燃烧车辆案例。
两者均输入世界解码器,该解码器预测其他道路使用者的行为,生成高清地图,生成候选轨迹,并发出用于验证的信号。
系统维护紧凑的结构化表示,即显式的物体列表、语义属性以及描述车道和连接关系的道路图元素。Waymo工程团队提供了采用这种架构的三个原因:
- 正确性和安全性验证可在推理时(车辆行驶时)运行
- 由于紧凑的世界状态易于重放和修改,大规模仿真运行效率高
- 训练反馈变得可验证,因为评估驾驶质量的组件现在有了具体的衡量标准
这种设计相比纯端到端或模块化方法[3]带来了显著优势。
特斯拉的文档提到每个摄像头网络执行语义分割,即为每个像素分配类别,同时进行目标检测和单目深度估计(通过单一摄像头估算距离)[6]。这些数据会输入鸟瞰视角网络,用于输出道路布局、静态基础设施和三维物体的俯视图。完整的系统包含48个网络,需要近7万小时的GPU训练时间,每个时间步生成1000个不同的张量[6]。
先验地图也占据着这个决策的另一端。例如,Waymo在运营某个区域前会先进行测绘,记录车道线、标志、路缘和人行横道。然后将这些地图与实时传感器数据匹配以确定位置,因为GPS单独使用可能会丢失信号[1]。地图本质上是一次性获取并重复使用的知识。这虽然节省了每次行程的计算资源,但也带来了保持地图更新的义务。相比之下,特斯拉的方法跳过了测绘环节,而是在行驶过程中实时获取等效信息。
这种权衡在于:结构化表示可以被检查、记录、回放并对照明确标准验证。但这也限制了系统能表达的内容。另一方面,学习到的表示方式能捕捉到任何模式都无法预见的细微差别。
预测
一旦系统掌握了周围环境的描述,下一步就是预测这些物体将如何行动。同一时刻可能存在多个有效未来。例如,接近路口的骑行者可能直行、转弯或停车。安全的响应需要考虑所有可能性。
Waymo将系统描述为为每个道路使用者生成多个可能路径而非单一路径,利用积累的驾驶数据,并考虑汽车、骑行者和行人不同的移动方式[1]。
2025年6月,Waymo发表了关于预测质量是否可预测扩展的研究[4]。使用包含50万小时驾驶数据的内部数据集,研究发现运动预测质量遵循训练计算量的幂律关系,与语言模型观察到的模式一致。这里的幂律意味着每次计算量翻倍都会带来成比例的可预测改进。数据扩展被证明至关重要,推理阶段增加计算量能提升复杂场景的表现。
Waymo在闭环性能测试中也观察到相同趋势,测试结果通过模拟系统自身行为影响后续结果的场景来衡量。这一趋势表明,现实世界驾驶性能随着数据和计算量的增加而提升,而不仅仅是基准测试分数。
特斯拉在14.3版本中描述了升级的强化学习阶段,旨在覆盖长尾边缘案例,即即使在非常大的里程数下也罕见的特殊情况[10]。
承诺一个预测未来会使系统在预测最关键的情况下变得脆弱。但携带多个加权未来虽然每个周期都要消耗计算资源,却能防范罕见情况发生的可能性。
规划
验证层会在输出到达执行器之前拦截一类不可接受的输出,但它只能根据定义的标准进行评估。任何超出这些标准的内容都会未经审查地通过。这与生产代码中的断言存在相同的权衡:检查的有效性仅取决于背后的条件。
验证
Waymo 的安全影响中心报告称,截至 2026 年 3 月,其系统累计行驶了 2.206 亿英里且车内无乘客[5]。与相同运营区域内的人类驾驶事故率相比(已根据服务在每座城市内的行驶区域进行调整),其严重伤害或更严重事故减少了 94%,造成伤害的事故减少了 82%[5]。该方法已在同行评审期刊上发表,原始数据可供下载,以便第三方复现这些数据[5]。
特斯拉的车辆安全报告采用了不同的形式。它将开启全自动驾驶(监督模式)的特斯拉与手动驾驶的特斯拉进行对比,使用相同的遥测数据管道,并报告重大和轻微碰撞减少了 7 倍,非高速公路碰撞减少了 5 倍[7][8]。如果系统在碰撞前 5 秒内处于激活状态,则碰撞被计为系统开启时发生,这一时间窗口的选择是为了捕捉驾驶员在碰撞前短时间内接管车辆的情况[8]。特斯拉在报告数据中不归因任何责任,认为责任判定过于主观而不予包含[8]。
如你所见,这两份报告回答了不同的问题,我们无法简单地进行并排对比。差异源于每种统计群体所代表的含义:
- Waymo 测量的是在无人可干预的行驶里程中产生的结果。
- Tesla 测量的是在驾驶员仍需负责的情况下,辅助系统是否能减少碰撞。
两家公司也各自指出了自身的局限性。Waymo表示,目前尚不存在对自动驾驶与人类驾驶数据的完美对比,其运营城市几乎不会出现显著降雪[5]。Tesla则指出,其对美国平均数据的估算涉及不可避免的假设,这些假设可能导致数据向任意方向偏移[8]。
Waymo区分了两个容易混淆的方面。安全性影响是在部署后进行衡量的,而是否允许部署则在部署前通过安全框架和安全案例确定[5]。
训练
两个系统在每次发布后都会有所改进。然而,其底层机制的差异与架构的差异同样显著。
Waymo基于同一基础模型运行三个组件:
- 驾驶员模块生成操作序列。
- 模拟器生成用于训练和测试的场景。
- 评判模块评估驾驶质量并识别问题。
每个组件的大规模版本会被蒸馏成更小的版本以满足运行需求。两者通过两个循环连接:
- 内部循环在模拟环境中应用强化学习,其中场景可以低成本生成和重复。
- 外部循环从评判模块标记的现实驾驶中的次优行为开始,将改进方案转化为训练数据,在模拟中验证修复方案,并仅在安全框架确认不存在不合理风险后才部署。
Waymo表示,其完全自动驾驶的里程数现已远超人工驾驶数据,且无论模拟或测试驾驶员运行多少,都无法重现系统在无驾驶员在场时遇到的场景[3]。
Tesla的数据来自消费者车队。《车辆安全报告》描述了两条遥测路径[8]。当车辆切换至停车模式时,会传输匿名化的里程数据,按控制类型和道路分类进行细分。当检测到重大或轻微碰撞时,会传输与车辆绑定的独立数据包。仅在2025年第三季度,Tesla就接收了25亿个遥测数据包。Tesla还通过将匿名化车队片段汇编成测试套件,构建了评估基础设施,并结合模拟生成传感器数据用于自动化测试[6]。训练运行在Cortex 1上,该平台在生产中拥有超过10万台H100等效GPU,Cortex 2在早期部署阶段已拥有超过13万台GPU。
结论
在自动驾驶过程的每个阶段都会反复出现同样的问题。
有多少内容是在部署前以可检查的形式确定的,又有多少内容是在行驶过程中由内部状态不可触及的模型计算得出的?
每个阶段都提出了不同版本的这个问题:
- 感知询问距离是作为测量值还是推导值出现
- 表示询问世界描述是否可被检查
- 预测询问系统同时携带多少种未来可能性
- 规划询问在执行轨迹前由什么进行验证
- 验证询问结果证据能支持何种安全声明
- 训练询问哪些里程能改进系统
在大多数阶段,Waymo更倾向于书面化知识,这涉及按城市准备和定制硬件。Tesla则更倾向于计算化知识。两种方法各有优势,只有未来才能说明哪种方法会占据主导地位,或者事情会落在中间某个位置。
参考文献
- 《用于可靠出行的自动驾驶汽车技术》,Waymo
- 采用第六代Waymo Driver实现完全自动驾驶,Waymo,2026年2月
- 可验证安全的AI自动驾驶技术,Waymo,2025年12月
- 自动驾驶规模定律的新洞察,Waymo,2025年6月
- Waymo安全影响报告,Waymo
- 人工智能与机器人技术,特斯拉
- 完全自动驾驶(监督模式),特斯拉支持
- 完全自动驾驶(监督模式)车辆安全报告,特斯拉
- 自动驾驶辅助与完全自动驾驶功能,特斯拉支持
- 特斯拉2026年第一季度更新,特斯拉投资者关系