汽车行业深度报告:AI系列深度22期:智能驾驶VLA模型的架构范式与厂商路线

证券研究报告·行业深度报告·汽车 东吴证券研究所 1 / 13 请务必阅读正文之后的免责声明部分 汽车行业深度报告 AI 系列深度 22 期:智能驾驶 VLA 模型的架构范式与厂商路线 2026 年 08 月 07 日 证券分析师 黄细里 执业证书:S0600520010001 021-60199793 huangxl@dwzq.com.cn 研究助理 童明祺 执业证书:S0600125080005 tongmq@dwzq.com.cn 行业走势 相关研究 《AI 系列深度 17 期:视觉智能为何引入 Transformer?》 2026-08-06 《AI 系列深度 16 期:语言智能为何从 RNN 转向 Transformer?》 2026-08-06 增持(维持) [Table_Tag] [Table_Summary] 投资要点 ◼ 智能驾驶 VLA 的核心,是将视觉感知、语言理解与动作决策整合进同一策略模型,并通过显式动作头弥合 VLM4AD 留下的动作生成缺口。从技术演进看,自动驾驶经历模块化流水线、端到端、VLM4AD 再到VLA4AD:VLM 能解释场景但难以直接生成可靠控制,VLA 则进一步把动作作为模型输出,使语义理解与驾驶策略更紧密耦合。 ◼ VLA4AD 的核心架构通常包括视觉编码器、语言处理器和动作解码器三部分。视觉编码器将摄像头、激光雷达等异构传感输入转化为隐层特征,并通过 BEV、点云、体素等方式增强三维空间理解;语言处理器引入预训练大模型、LoRA 或 RAG 等方法注入驾驶知识;动作解码器再将融合后的多模态表征转化为轨迹、控制量或动作 token。 ◼ VLA4AD 自身可归纳为被动解释器、规划协作者、统一动作生成器、推理中枢四个阶段;主要挑战包括鲁棒性、实时性能、数据与标注、多模态对齐、多智能体协同和评测标准化。这意味着 VLA 并非单一固定架构,而是自动驾驶端到端路线向大模型、多模态和动作生成继续演进的总称。 ◼ 厂商路线已出现差异化。Waymo EMMA 以 Gemini 驱动纯端到端,并将导航、状态、轨迹等统一到语言空间;理想从 E2E+VLM 双系统升级至MindVLA 统一架构,以 3D 高斯、MoE 和扩散动作解码组织三维理解、语义推理和轨迹生成;元戎启行以 40B VLA 基座设置 Driver、Analyst、Critic 三角色;千里 CoWorld-VLA 则通过多专家世界模型 Token 构建规划相关隐空间表征。 ◼ 小鹏第二代 VLA 进一步弱化显式语言中间层,以原生多模态 Tokenizer和视觉思维链直达动作,本质上趋近视觉—动作路线。由此可见,头部厂商在是否保留显式语言推理层上已经分化:一类强调语言作为慢思考和可解释中枢,另一类强调隐式视觉表征和动作直出。后续竞争将集中在实时性、数据闭环、评测口径和量产可靠性。 ◼ 我们认为,数字 AI 底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理 AI 将成为物理世界的AI 解决方案,从而在 AI 的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼ 风险提示:技术迭代不及预期的风险,大模型厂商 ARR 增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。 -15%-11%-7%-3%1%5%9%13%17%21%2025/8/72025/12/62026/4/62026/8/5汽车沪深300 请务必阅读正文之后的免责声明部分 行业深度报告 东吴证券研究所 2 / 13 内容目录 1. 智驾 VLA:从端到端到动作生成的范式升级 ................................................................................. 4 1.1. 自动驾驶技术演进:从模块化流水线到 VLA4AD................................................................ 4 1.2. VLA4AD 的核心架构:输入、三大模块与输出 ..................................................................... 4 1.3. VLA4AD 的阶段演进:从解释器到推理中枢 ......................................................................... 5 1.4. VLA4AD 的主要局限 ................................................................................................................. 6 2. 代表性模型:头部厂商 VLA 路线开始分化 .................................................................................... 7 2.1. Waymo EMMA:基于 Gemini 的纯端到端架构 ...................................................................... 7 2.2. 理想:从 E2E+VLM 双系统到 MindVLA 统一架构 .............................................................. 7 2.3. 元戎启行:40B VLA 基座的 Driver/Analyst/Critic 三角色 ................................................... 8 2.4. 千里科技 CoWorld-VLA:多专家世界模型 Token ................................................................ 8 3. 小鹏第二代 VLA:弱化显式语言层,强化视觉思维链 ................................................................. 9 3.1. 设计动机:标准 VLA 的语言转译瓶颈 .................................................................................. 9 3.2. 架构特征:原生多模态 Tokenizer 与视觉思维链 ................................................................. 10 3.3. 去显式语言层的边界:趋近 VA 的 VLA 变体 ..................................

立即下载
汽车
2026-08-07
东吴证券
黄细里,童明祺
13页
0.88M
收藏
分享

[东吴证券]:汽车行业深度报告:AI系列深度22期:智能驾驶VLA模型的架构范式与厂商路线,点击即可下载。报告格式为PDF,大小0.88M,页数13页,欢迎下载。

本报告共13页,只提供前10页预览,清晰完整版报告请下载后查看,喜欢就下载吧!
立即下载
本报告共13页,只提供前10页预览,清晰完整版报告请下载后查看,喜欢就下载吧!
立即下载
水滴研报所有报告均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
相关报告
热门报告
加入社群
回顶部
报告群
公众号
小程序
在线客服
收起