特斯拉再添一把火,“世界模型”如何重塑自动驾驶?
作者 | 肖恩
编辑 | 德新
两年一度的计算机视觉顶级会议ICCV于10月在美国檀香山落下帷幕,今年的最佳论文由卡内基梅隆大学团队摘得,其提出的BrickGPT模型能够根据文本描述直接生成具有物理稳定性的积木结构,展示了生成式AI在现实物理世界中应用的潜力。
在自动驾驶领域,本次会议的另一项重要动态同样引人关注。特斯拉AI部门副总裁Ashok Elluswamy在“基础模型蒸馏与自动驾驶”论坛中,分享了其全自动驾驶(FSD)的最新进展。
自2022年AI Day上介绍占用栅格网络以来,特斯拉在公开场合鲜有FSD技术的更新,特别是其转向端到端架构后,性能提升显著,但技术细节始终保持神秘。
Elluswamy此次的发言透露了一些关键信息:FSD系统以多模态输入(尤其是视频)为主,经过端到端模型处理后,直接输出车辆控制指令。感知、预测、决策与控制环节在同一个神经网络中完成,这一架构与近期热议的“世界模型”理念高度吻合。此外,世界模型还被用于生成对抗性场景,支持模型的闭环评估与持续优化。
此前,关于视觉语言行动模型(VLA)与世界模型的技术路线之争已经持续多时,特斯拉此次表态无疑为这场争论再添热度。无论最终技术路线如何演变,具备“预测未来”能力的世界模型,已经逐渐成为自动驾驶技术发展的重要方向。
一、特斯拉FSD:端到端基础模型与世界模型的融合
Elluswamy以“构建未来的自动化”为主题,介绍了FSD的近期进展,包括Robotaxi的上线以及实现从工厂到交付中心的全程自动驾驶。
他进一步介绍了特斯拉的端到端架构:多摄像头图像、导航地图、车辆运动数据和音频信号等多模态信息,均被输入至一个端到端的神经网络模型中,经过大规模数据训练,支持长序列处理,最终输出控制信号。
与国内主流技术路线相比,特斯拉的特别之处在于引入了音频信号作为输入。
关于为何选择端到端架构,Elluswamy给出了几点理由:驾驶行为难以用传统规则系统准确描述;传统架构在感知、规划与控制之间存在大量信息丢失;端到端系统扩展性强,更适合处理长尾问题;具备稳定的时延性能,且无需依赖人类经验,而是依赖于数据和算力。
要构建高质量的端到端系统,面临哪些挑战?Elluswamy指出以下三个难点:
维度灾难
FSD系统需要处理高帧率、高分辨率和长时上下文的多模态输入。以“5×5像素块”作为token单位,在视觉输入中,仅7个摄像头、36 FPS、500万像素、30秒的输入就已相当于超过20亿个token。若直接输入Transformer结构,token数量将随时间窗口呈指数级增长,难以满足车载系统的时延需求。
特斯拉通过车队数据总结“关键token”,并通过稀疏化和聚合策略保留关键信息,在不显著影响精度的前提下有效降低了推理延迟。
可解释性与安全验证
为减少“黑盒”问题,特斯拉在车端模型中引入了可解释的中间输出,例如全景分割、三维占据网络、基于三维高斯渲染的场景重建和语言化输出,帮助工程师理解模型决策过程。
其中,生成式高斯喷溅技术(Generative Gaussian Splatting)在性能和泛化能力上优于传统方法,仅需220毫秒即可生成场景模型,且支持动态物体建模,具备与端到端AI联合训练的能力。
闭环评测与仿真
特斯拉开发了一个神经世界模拟器(Neural World Simulator),它基于公司自建的海量数据集进行训练,但不同于传统的预测模型,该模拟器根据当前状态与动作生成未来状态,与车端模型形成闭环,实现真实效果评估。
这一模拟器不仅能重放历史数据验证新模型,还能生成对抗性场景,提升极端情况下的测试覆盖率。其工程实现上强调实时或准实时的高分辨率响应能力,可用于强化学习训练,推动模型性能超越人类水平。
尽管特斯拉未明确提及“世界模型”一词,但从其技术架构来看,神经世界模拟器已具备世界模型的典型特征。
相较传统云端世界模型,特斯拉系统不仅具备高保真场景生成能力,还能在给定动作条件下预测未来演化,实现决策前瞻与安全评估。
通过车端实时预测和云端闭环验证,特斯拉的方案在目标与表征层面高度统一,构建了完整的训练—评估—上线闭环流程。
二、何为世界模型?
端到端架构虽为自动驾驶带来更高上限,但如何实现真正无人驾驶,目前尚无统一路径。在众多技术路线中,世界模型正成为关键方向。
世界模型并无严格定义,但业内普遍认为其是一个生成式时空神经系统,能够将多模态输入(如摄像头、激光雷达、雷达、导航地图)压缩为潜在状态,该状态包含几何、语义和因果上下文。
世界模型能够在潜在空间中推演未来场景,使智能体在执行动作前“预演”轨迹,因此也被比喻为“能够在脑海中想象未来”的系统。
世界模型通常涵盖三类任务:
- 未来物理世界生成:基于传感器数据与车辆历史信息,生成场景演化,包括物体运动、占据概率、点云或视频。
- 行为规划与决策:结合预测结果,为车辆生成轨迹或动作建议。
- 联合预测与规划:在潜在空间中建模多主体交互,评估不同动作的潜在影响。
它不是感知或预测模块的简单堆叠,而是一个统一决策中枢,将现实世界转化为可演化的内部表示,并通过生成式推演支撑规划与控制。
世界模型需具备以下核心能力:
潜在时空表示
世界模型需将多模态、高维感知信息压缩为低维潜在状态,该状态包含环境中的几何与语义信息,并能随时间演化。
动作条件的未来推演
在潜在状态基础上,模型应能根据候选动作(如加速、变道等)生成多步未来场景。这种推演不仅是时间上的延展,更是因果推理:模型需回答“如果我这样做,其他参与者将如何反应?”
与规划和控制的闭环耦合
世界模型的重要特征是预测与规划的深度耦合。模型生成的未来场景不仅用于参考,还直接用于不同动作的风险评估,最终输出最优控制决策。
多主体交互与不确定性建模
现实道路中包含多个参与者,世界模型需在内部状态空间中模拟其运动状态、意图及彼此互动。
由于未来具有不确定性,模型需生成多条潜在轨迹,以在安全、效率和舒适之间做出权衡。
长期记忆与自我演化
世界模型应具备长期记忆和持续演化的特征,能积累驾驶经验,实现跨场景和任务的泛化。
世界模型强大的能力使其成为当前自动驾驶研究的核心方向之一,被认为是实现L3和L4级别自动驾驶的关键路径。
三、中国的世界模型之路
在中国,世界模型的应用已进入实质性阶段。从云端数据生成到车端模型落地,多家企业正推动世界模型技术的全面发展。
蔚来NWM世界模型
蔚来是国内较早公开采用世界模型路线的企业。2024年“NIO IN”发布会上,蔚来发布了中国首个驾驶世界模型“NWM”,其定义为“多模态信息全量理解、生成新场景并预测未来的多元自回归生成模型”。
该模型在空间上实现“想象重建”,将感知数据重建为可编辑的虚拟世界;在时间上完成“想象推演”,在内部时空中模拟多种未来场景,并输出最优驾驶轨迹。
NWM可在100毫秒内推理出216种可能的驾驶场景并选择最优方案。蔚来官方表示,模型可根据3秒历史视频生成长达20秒的未来预测。
该模型融合多传感器数据,支持自然语言指令,已进入量产阶段,并在主动安全、高速领航和城市领航等多个功能中实现应用。
华为WEWA架构
作为国内智能驾驶领域的领军者,华为选择了“WA(WorldAction)”技术路线,强调从感知直接到控制的世界模型。
华为智能汽车解决方案BU总裁靳玉志表示,公司不追随VLA路线,而坚持采用多模态感知驱动的直接控制。
在ADS 4平台中,华为构建了WEWA架构(World Engine + World Action):云端World Engine用于训练和生成模型参数,车端World Action则直接映射感知数据至控制指令,跳过语言解析过程。
该架构通过多颗激光雷达和高性能硬件确保环境感知的完整性。华为认为,这是实现高级自动驾驶的可靠路径。
商汤绝影:“开悟”世界模型与生成式仿真平台
商汤旗下的绝影智驾推出了世界模型“开悟”,并基于该模型构建了大规模生成式仿真平台。
“开悟”主要用于生成高保真仿真数据,支持11个视角的视频生成,时长达150秒,画质可达1080p。用户可自由编辑场景元素、天气与光照等,快速生成高价值训练数据。
该平台已与上汽智己合作,构建端到端数据工厂,针对加塞、追尾等高风险场景批量生成训练数据,并计划推出覆盖数百万片段的场景库。
WorldSimDrive数据集包含超过100万段生成式驾驶片段,覆盖多种交通场景与环境条件,是当前最大的自动驾驶生成数据集之一。
四、世界模型 VS VLA:自动驾驶终局路线之争
随着大模型技术的兴起,基于语言模型(LLM)的VLA路线开始在自动驾驶领域崛起。理想、小米和元戎等企业已采用该路线,并在2024年推出VLA版本。
VLA模型融合视觉、语言和行动模块,通过语言推理提升情境理解能力。与世界模型相比,VLA更依赖语言层,虽然提升了可解释性,但在物理建模上存在局限。
从结构上看,世界模型以潜在时空表示为核心,构建物理演化系统;而VLA则借助语言模型实现语义推理,通过自然语言生成动作指令。
在推理方式上,世界模型依赖内部仿真,模拟不同动作下的未来场景;而VLA则依赖语言链式推理,在控制前进行语义决策。
在能力方面,世界模型更适用于长期、多主体、物理一致性的任务;VLA则在语义理解和高阶交互方面具备优势。
当前,围绕世界模型与VLA的技术路线之争仍在继续。两者各具优势,未来可能形成融合路径。
李飞飞在近期文章中指出,当前语言模型虽擅长处理抽象信息,但在物理世界的理解与行动方面仍有不足。她认为,实现真正空间智能的关键在于世界模型,它能在多重复杂世界中进行理解、推理、生成与交互。
无论自动驾驶最终技术路线如何,世界模型无疑将在这个过程中扮演重要角色。