端到端出现后,自动驾驶模块化架构就消失了吗?
本文首发于智驾最前沿微信公众号,从模块化到端到端,自动驾驶理解世界的方式被彻底颠覆。
模块化虽逻辑清晰,却在城市复杂路况前捉襟见肘。
端到端的常出现恰是为了解决模块化架构存在的那些问题,那端到端出现后,模块化架构真的消失了吗?
01
一段式端到端还是唯一答案吗?
特斯拉FSD的发展成为推动端到端路线的重要因素。
从FSD V12开始,特斯拉大幅减少了传统规则代码,让神经网络承担更多驾驶决策任务,这也被很多人认为是一段式端到端的重要标志。
所谓一段式端到端,就是从传感器输入开始,经过一个大型神经网络直接生成驾驶行为,中间不再经过传统意义上的感知、预测、规划等独立模块。
到2026年,端到端技术本身也在发生变化。
特斯拉FSD V14虽延续了端到端的基本框架,但在决策过程中引入了思维链能力,输出方向盘转角之前会先生成自然语言推理链。
特斯拉之所以会有这个变化,是因为纯端到端模型在复杂场景中表现虽好,但工程师很难追踪它的决策依据。
引入思维链相当于在输出动作之前留下一段可读的推理痕迹,至少可以让开发者有机会理解模型为什么这么开。
沿着这个方向,行业开始更系统地探索如何让端到端模型具备更深层的场景理解能力。
VLA的思路就是在视觉输入和动作输出之间插入一个语言模型,利用语言模型对语义和逻辑的把握能力,帮助系统理解它正在处理的是什么样的场景。
如一辆车斜停在路口,单纯从视觉特征看它可能只是一个障碍物,但结合语言推理之后,系统能判断出这辆车是在等待左转还是已经熄火抛锚,这两种情况可以对应的驾驶策略完全不同。
不过VLA中视觉到语言、语言到动作的两次转换会带来额外的计算开销和响应延迟,如何在推理深度和反应速度之间取得平衡,是需要解决的问题。
世界模型走的则是另一条路,它不做语言推理,而是让系统在动作执行之前,先在内部对接下来几秒钟可能发生的事情做一次模拟推演。
如前方有一辆自行车在路边晃动,世界模型会推演出几种可能的运动轨迹,然后选择最安全的应对方式,这种推演能力和人类驾驶员在脑中预判风险的机制有相似之处。
小鹏的X-Mind技术框架就是在这个方向上做的尝试,通过内嵌预测性世界模型来提升系统在动态环境中的预判能力。
VLA和世界模型在2026年都有了实质性进展,行业对这两条路线的关系也有了更清晰的判断。
小鹏在CVPR 2026上明确表示,VLA与世界模型并非竞争关系,而是共同构成物理世界基座模型的两个支柱。
两者解决的是不同层面的问题。
VLA负责对场景做语义层面的理解,世界模型负责对动态过程做时空层面的推演,合在一起才能让系统既有对场景的判断力,又有对风险的预判力。
从行业的这些尝试中其实可以看到,端到端让自动驾驶学会了怎么开,但要应对真实世界的复杂性和不确定性,系统还需要建立起对物理世界更深层的认知能力。
端到端解决的是驾驶技能的问题,而VLA和世界模型解决的,是让系统真正理解它正在驾驶的那个世界。
02
传统模块真的消失了吗?
前面铺垫了这么多,可以来聊聊今天的主题了。
既然端到端模型已经可以直接输出驾驶行为,感知、预测、规划这些传统模块还有存在的必要吗?模块化架构是不是已经消失了?
要回答这个问题,得先厘清一件事,我们说的模块化架构消失,到底指的是什么消失了。
如果是指感知、预测、规划、控制这种严格按流程切分的软件栈,那模块化架构确实在消退。
2026年,中国汽车产业正从模块化架构向端到端架构过渡,文远知行WRD 3.0采用单一AI大模型贯通感知、预测、规划与控制;博世的一段式端到端方案也已在国内实现量产。
主流的智能驾驶方案已从经典感知、决策、控制模块化方案转向端到端神经网络。
但如果说的是把自动驾驶系统拆分成可独立开发、独立验证的组成部分这种工程思路,那它不但没有消失,反而在新的架构里以另一种形式存活了下来。
不妨先看看行业里实际发生了什么变化。
Wayve在CVPR 2026上将自动驾驶路线分成了三代。AV1.0是经典模块化栈,感知、预测、规划、控制各司其职;AV1.5在端到端模型外面套一层规则检查器;AV2.0则让端到端模型承担从感知到控制的主要智能。

图片源自:网络
Wayve特意强调了一点,真正重要的不是有没有规则,而是安全保障的责任主体发生了变化。
传统系统将安全寄托在工程师写的规则上,而AV2.0的思路是让模型学会判断风险。
但即便在AV2.0的框架里,模块化的思想仍然存在,只是模块的边界从外部的功能拆分变成了模型内部的组件划分。
TIER IV的路线也说明了同样的问题。
这家公司在2025年7月发布了支持Level 4+的端到端AI架构,标志着从传统模块化感知、规划、控制流水线向数据驱动的神经网络整体式决策框架迈出关键一步。
但TIER IV并没有完全抛弃模块化,而是同时推进模块化AI架构和整体式端到端架构两条路线。
模块化AI架构在感知、预测、规划、控制等子模块中引入深度学习模型,保留可解释性与安全隔离优势;整体式E2E架构则通过神经网络直接从传感器输入映射到车辆控制输出。
两条路线并行推进,而不是非此即彼。
从这些企业的选择里其实能看出一个共同点,行业并没有在端到端和模块化之间做单选题。
端到端模型解决了驾驶行为的问题,即如何让车在复杂场景中开得更像人、更少接管。
但一套完整的自动驾驶系统还需要解决另外一些问题,那就是模型出了错怎么追溯原因?传感器失效了怎么安全降级?监管部门怎么验证系统的安全性?
这些问题,端到端模型本身回答不了。这也是为什么在很多智驾的量产方案中普遍保留了一层工程化的安全兜底。
自动驾驶L2之所以会大规模铺开,因为人还在方向盘后面负责兜底;而L3和L4想靠纯端到端上量,还需要在可解释性、安全验证等多个层面取得突破。
03
最后的话
所以到了2026年,传统模块真的消失了吗?
智驾最前沿以为,消失的是那种机械的、以人工规则堆砌为核心的感知、预测、规划、控制流水线,一段式端到端正在用统一的神经网络取代这些独立模块。
但模块化强调的将复杂系统拆解成可独立验证、可调试的组成部分这种思路并没有消失,它只是换了一种方式存在。
要么变成端到端模型内部可观测的组件划分,要么变成模型外面那层用于安全验证的规则层,要么变成TIER IV那种模块化AI与整体式E2E并行的双轨策略。
所以2026年的模块化,消失的是僵化的架构,而不是模块化本身。
审核编辑 黄宇
