特斯拉再添一把火,「世界模型」如何重塑自动驾驶?

2025-12-08 14:00:33
关注

特斯拉再添一把火,「世界模型」如何重塑自动驾驶?

作者 |肖恩

编辑 |德新

两年一度的计算机视觉顶会ICCV于10月在美国檀香山落下帷幕,今年的最佳论文由卡内基梅隆大学团队的BrickGPT斩获。这项研究能从文本描述生成可实际搭建的积木结构,展现了生成式AI在物理世界中的巨大潜力。

对于自动驾驶领域,这次会议同样具有重要意义——特斯拉AI部门副总裁Ashok Elluswamy在“基础模型蒸馏与自动驾驶”论坛中,首次分享了FSD的最新进展。

自2022年AI Day公布占用格栅网络后,特斯拉几乎未再公开透露FSD的技术细节,特别是进入端到端架构后,系统性能突飞猛进,但背后的技术逻辑却一直讳莫如深。

Elluswamy此次透露了关键信息:FSD系统以视频为主的多模态输入直接驱动神经网络,输出控制信号,感知、预测、决策与控制在单一神经网络中耦合;其整体架构与当下热议的“世界模型”理念高度契合。同时,仿真侧利用世界模型生成对抗性场景,用于闭环测试与系统优化。

此前,围绕VLA与世界模型的技术路线之争已经白热化,而特斯拉的表态无疑为这场讨论注入了新的变量。无论最终技术路线如何确定,具备“未来想象”能力的世界模型,正在成为自动驾驶发展的核心驱动力。

一、特斯拉FSD:端到端基础模型与世界模型的融合

Elluswamy以“构建未来的自动化”为题,首先介绍了FSD的最新动态,包括Robotaxi的上线,以及实现从工厂到交付中心的全程自动驾驶。

随后,他详细阐述了特斯拉的端到端架构:多摄像头图像、导航地图、车辆运动数据以及音频信号被输入统一的神经网络,模型通过海量数据训练,支持长序列输入,并直接输出控制指令。

这一思路与国内主流技术路径基本一致,区别在于特斯拉额外引入了音频信息

为何选择端到端架构?Elluswamy给出了几个关键原因:

  • 人类驾驶难以用传统函数建模,规则系统易顾此失彼;
  • 传统的感知-预测-控制结构存在信息损失;
  • 端到端架构具备更强的扩展性,适用于长尾场景;
  • 系统具有稳定低延迟,且不依赖人工规则。

在构建高阶端到端系统过程中,特斯拉也面临三大挑战:

维度灾难

FSD需要处理高分辨率、高帧率、长时域的多模态输入。在以“5×5像素块”为token的前提下,仅视觉数据就需处理7个摄像头×36 FPS×500万像素×30秒,同时结合未来数英里的导航路径、100 Hz的速度/IMU/里程计等数据,以及48kHz音频信息。总token数约达20亿,若直接输入Transformer模型,将导致时间窗内的计算爆炸,难以满足车载系统的实时性。

特斯拉通过大量车队数据提炼出“关键token”,采用稀疏化和聚合策略,大幅降低推理复杂度,同时保持高精度。

同时,其数据引擎可从中筛选出高价值样本进行训练,帮助系统在极端或罕见场景中保持良好的泛化性能。

可解释性与安全验证

为提升AI系统的透明度,特斯拉在车端模型中引入了可解释输出层,涵盖全景分割、3D占据网络、三维高斯渲染的场景重建,以及语言化输出,便于开发人员理解模型推理过程。

其中,Elluswamy重点介绍了特斯拉的生成式高斯喷溅(Generative Gaussian Splatting),相较于传统方法,GGS具备更强的泛化能力,仅需220毫秒即可生成高质量场景,无需初始化,能建模动态物体,并可与端到端模型联合训练。

闭环评测与仿真

最后,也是最具挑战的部分,是模型评估。

即使在高质量数据集上实现开环预测性能提升,也不代表系统在现实世界中表现稳定。为此,特斯拉打造了一个神经世界模拟器(Neural World Simulator)。不同于传统模型预测动作,该模拟器基于当前状态和下一步动作生成未来状态,与车端模型形成闭环,用于真实效果的评估。

该模拟器可实时或近实时生成高分辨率、因果一致的响应,支持快速迭代验证。同时,其视频生成能力还可在闭环环境下进行大规模强化学习训练,以实现超越人类的驾驶表现。

图片来源:特斯拉

尽管特斯拉未明确使用“世界模型”一词,但从其神经世界模拟器的能力来看,其本质正是一个高度先进的世界模型。

与传统云端世界模型相比,特斯拉的系统不仅能生成高保真场景,还可在给定动作条件下预测未来几秒内的世界演化,实现前瞻决策与安全验证。

该模型不再只是“生成环境”,而是具备“想象并评估行动结果”的因果推理能力

从特斯拉将“预测未来几秒的世界演化”作为决策核心这一点来看,车端基础模型很可能正沿着世界模型的路线发展:在车端进行实时动作条件未来预测,而在云端利用神经世界模拟器进行大规模场景重演与回归验证,两者在表征与目标层面对齐,构建训练—评估—部署的完整闭环。

二、何为世界模型?

端到端架构为自动驾驶带来了更高的性能上限,已成为行业共识。然而,如何在端到端框架下实现接近甚至超越人类水平的自主驾驶,仍是未解难题。在众多技术路径中,世界模型正成为研究的热点。

图片来源:World Models for Autonomous Driving: An Initial Survey

世界模型虽无统一定义,但业内已逐步形成共识:它是一种生成式时空神经系统,能将来自摄像头、激光雷达、雷达、导航地图等多模态输入压缩为潜在状态,其中不仅包含几何与语义信息,还承载因果上下文。

世界模型可在潜在空间内推演环境演化,并在执行前“演练”整个轨迹。也正因此,有人将其称为“能在大脑中‘想象未来’的模型”。

世界模型通常涵盖三类任务:

  • 未来物理世界生成:基于传感器数据与历史记录,生成包含物体运动、点云、占据概率的视频级场景;
  • 行为规划与决策:结合预测结果生成轨迹或动作建议,支撑控制执行;
  • 联合预测与规划:在潜在空间中建模多主体交互,评估候选动作,实现闭环优化。

它不仅不是感知或预测模块的堆叠,而是一种统一的“智能中枢”:将现实世界编码为潜在表征,并通过生成式预测支撑规划与决策。其核心能力包括:

潜在时空表示

世界模型首先需将高维、多模态感知信息映射为低维潜在状态。该表示需包含环境的几何、语义信息,并能随时间更新,以捕捉环境演化。

动作条件的未来推演

在潜在状态基础上,模型需具备在给定动作条件下的未来推演能力,不单是时间上的外推,更是对“如果采取此动作,环境将如何变化”的因果推理。

与规划和控制的闭环耦合

世界模型的核心特征在于规划与预测的深度耦合,其输出不仅作为参考,更直接用于不同动作的风险评估与决策筛选。这种闭环能力,使其能在端到端框架中直接输出控制信号,如特斯拉的神经世界模拟器,可在闭环仿真中评估模型性能、生成对抗场景并进行强化学习。

多主体交互与不确定性建模

现实驾驶场景中,车辆并非孤立运行,还需与其他交通参与者互动。世界模型需在内部表示中建模这些互动,并跟踪其随时间的变化。

同时,未来并非唯一确定,前车可能加速也可能并线。因此,模型不能仅输出单一轨迹,而需提供多个可能演化路径,以在安全、效率、舒适之间进行权衡。

长期记忆与自我演化

世界模型应具备持续学习能力,积累驾驶经验,扩展内部表征,并实现跨场景泛化。

正是凭借这些能力,世界模型成为当下自动驾驶领域最具潜力的技术方向之一。许多人相信,世界模型是通向L3和L4自动驾驶的关键技术

三、中国的世界模型之路

作为全球自动驾驶应用最广泛的国家之一,中国的世界模型研究已经取得实质性突破,既有专注于生成式AI和数据闭环的商汤科技,也有坚定推动模型上车的蔚来、华为等整车企业。

蔚来NWM世界模型

蔚来是国内率先公开采用世界模型技术的车企之一。在2024年NIO IN发布会上,蔚来推出了中国首个驾驶世界模型“NWM(Nio World Model)”,被定义为“能够全量理解多模态信息、生成新场景并预测未来的多元自回归模型”。

图片来源:蔚来

NWM在空间维度实现“想象重建”——将感知到的物理世界重建为可编辑的虚拟世界;在时间维度进行“想象推演”——在内部时空预演多种可能的未来,最终输出可执行轨迹与动作。其在车端的部署表现尤为突出:NWM可在100毫秒内推理216种驾驶场景,并选出最优策略。蔚来表示,该模型可在3秒历史视频提示下生成20秒未来视频,通过生成式推演构建“平行世界”,在多个可能中评估动作后果。

除了视觉信息,NWM还融合激光雷达、导航地图与运动数据,甚至能理解驾驶员语音指令。

蔚来还开发了NSim生成式神经模拟器,将NWM的推演结果与NSim的仿真对比,从“唯一轨迹回放”升级为“平行世界对比”,形成数据闭环与对抗场景生成,结合“群体智能”持续采集真实世界中的长尾场景,形成双轮驱动。

NWM首个版本已于今年6月上线,并在主动安全方面新增三大功能:

  • 驾驶员失能处置:在高速/快速路场景中,系统识别驾驶员无意识操作后,缓慢减速并变道至最右侧应急车道,开启双闪与SOS,实现从“车道内停车”向“自主靠边”的升级。
  • 追尾预防与保护:在0–150km/h范围内对后向碰撞进行预警,并在不可避情况下500ms内完成从感知到制动建压,最大可降低93%的被动前移距离。
  • 通用障碍物预警增强:在转弯、变道等场景中,对抬杆、护墙、路沿等障碍物进行响应,减少低速靠边剐蹭风险。

同时,高速领航功能新增ETC智能通行与“智能驾享模式”(更平稳跟车与防御性驾驶),城区点到点领航新增:

  • 车位收藏与自动腾挪,实现无间断全域领航;
  • 停车场自主寻路功能,无需地图或记忆路线,可识别标识与文字,支持跨楼层/跨区域路径规划。

智能泊车系统也全面升级为全模型化,支持360°全向识别、车位范围扩大4倍,实现“可见即可选、可选即可泊”。

NWM的成功落地,充分展示了世界模型在车端的实战价值。

华为WEWA 架构

在世界模型路线的争论中,华为选择了WA(WorldAction)——一种强调从感知直接映射到控制的世界模型技术。

图片来源:华为

华为智能汽车解决方案BU总裁靳玉志明确表示,公司不会跟随VLA路线,而是坚持使用传感器信号直接生成控制的世界行动模型。

在华为看来,VLA虽然看似是捷径,但其依赖语言模型,难以提供真实世界下的自主能力;只有跳过语言层,直接从多模态感知生成驾驶指令,才能满足高阶自动驾驶的空间感知与实时性需求。

华为ADS 4平台进一步演进为WEWA架构:

  • World Engine(云端世界引擎):在云端通过大量仿真和实车数据训练模型,并生成优化参数;
  • World Action(车端世界行动模型):在车端运行,将感知信号直接映射为控制动作,跳过语言解析。

WEWA通过多颗激光雷达与高性能硬件确保环境感知的完整性。尽管成本更高,但靳玉志认为,这是实现安全自动驾驶的必由之路。

该架构中,云端模型通过“梦境训练”学习环境演化规律,车端模型则在物理一致的“世界表示”中进行实时决策。

商汤绝影:“开悟”世界模型与生成式仿真平台

商汤科技旗下的绝影智驾推出了世界模型“开悟”,并将其用于大规模仿真数据生成。在2025年WAIC上,绝影发布了升级版交互式世界模型平台,以及业内最大的生成式驾驶数据集WorldSimDrive

图片来源:商汤绝影

与蔚来的车端方案不同,“开悟”主要用于生成高保真仿真数据。该模型可生成150秒、1080p级的多摄像头视角视频,支持自由编辑道路布局、天气、光照等参数,快速生成风险场景。目前,绝影已与上汽智己合作,打造端到端数据工厂,针对加塞、追尾等高价值场景批量生成训练数据,并计划推出数百万片段的场景库。

WorldSimDrive数据集包含超过100万段生成片段,涵盖50+种天气、200+交通标识、300+道路连接,是目前业内最大的自动驾驶数据集之一。这些数据在画质、分辨率和时空一致性上与真实数据高度一致。

“开悟”构建了从数字世界到现实世界的桥梁:一方面支持文本或图像提示生成特定场景,另一方面与车企合作构建闭环数据工厂,用合成数据弥补长尾场景。

四、世界模型 VS VLA:自动驾驶终局路线之争

随着大语言模型的发展,视觉-语言-动作(VLA)模型也开始在自动驾驶领域崭露头角。理想、小米和元戎等企业坚定走VLA路线,理想已在7月率先推送VLA版本的量产系统

VLA将视觉、自然语言理解与行动生成整合为统一模型,通过语言增强系统对复杂场景的推理能力。与世界模型相比,两者存在显著差异:

结构与表示

世界模型采用潜在时空表示,其核心是一个能随时间演化的环境模拟器。它通过自监督方式将感知信息编码为潜在状态,并在该空间中预测未来。

VLA则以视觉—语言—行动统一架构为特征,引入大语言模型作为“大脑”,将感知转化为语言表述,再通过语言推理生成控制指令。这种方式虽便于解释,但其物理推理往往依赖外部模块。

推理路径

世界模型的推理依赖于内在的仿真推演,模型在潜在空间中模拟不同动作的后果,从中选择最佳方案。这种机制适合长期评估和对抗性测试。

VLA的推理路径则依赖语言链式推理。它利用语言模型的常识与逻辑能力,对场景进行解释和制定规则,再生成动作信号,具备更强的语义推理能力,但其物理一致性往往较低。

能力与应用

世界模型擅长处理长期、多主体和物理一致性问题,适用于复杂场景建模与闭环评估。例如,特斯拉的神经世界模拟器正是利用其闭环特性,进行强化学习和对抗场景生成。

VLA则更强调语义理解和高层交互,通过语言接口处理交通规则、场景描述等复杂输入,具备链式推理优势。

世界模型与VLA的路线之争仍在持续。世界模型更贴近自动驾驶的物理本质,而VLA则在长尾场景和语义理解上更具优势。未来的技术突破,或许在于两者的融合。

AI先驱李飞飞近期在空间智能领域发表长文指出,当前大语言模型虽擅长抽象知识处理,但在三维空间中的因果推理仍显薄弱。她强调,实现空间智能的核心在于世界模型,它能在语义、几何、动力学等多重维度中进行理解、生成与交互。

李飞飞的论述再次凸显了世界模型在AI发展中的战略价值。无论最终自动驾驶的实现路径如何演变,世界模型都将在其中扮演

您觉得本篇内容如何
评分

评论

您需要登录才可以回复|注册

提交评论

科技解密

这家伙很懒,什么描述也没留下

关注

点击进入下一篇

VLA与世界模型:自动驾驶的两条发展路径

提取码
复制提取码
点击跳转至百度网盘