汽车行业深度报告:AI系列深度23期:智能驾驶的表征演进
证券研究报告·行业深度报告·汽车 东吴证券研究所 1 / 16 请务必阅读正文之后的免责声明部分 汽车行业深度报告 AI 系列深度 23 期:智能驾驶的表征演进 2026 年 08 月 07 日 证券分析师 黄细里 执业证书:S0600520010001 021-60199793 huangxl@dwzq.com.cn 研究助理 童明祺 执业证书:S0600125080005 tongmq@dwzq.com.cn 行业走势 相关研究 《AI 系列深度 17 期:视觉智能为何引入 Transformer?》 2026-08-06 《AI 系列深度 16 期:语言智能为何从 RNN 转向 Transformer?》 2026-08-06 增持(维持) [Table_Tag] [Table_Summary] 投资要点 ◼ 物理 AI 与数字 AI 的根本差异,首先体现在表征获取方式上。文本天然离散且带语义,数字 AI 输入具备较强可 token 化基础;物理世界的输入则由连续光子、点云、运动和空间关系构成,缺乏天然通用的物理世界 token 化方案。因此,物理 AI 需要先构建三维物理空间的可学习表征,再进入规划、控制和行动。 ◼ 以智能驾驶为例,表征演进可概括为原始像素、BEV/VectorNet、Occupancy、多模态 Token 和潜在状态五个阶段。原始像素端到端简洁但缺少结构约束;BEV+Transformer 与矢量化 VectorNet 是同一层级的两条并行路线,分别以特斯拉和 Waymo 为代表,前者把多摄像头信息统一到鸟瞰三维空间,后者把道路和参与者抽象成数学对象;Occupancy从识别对象类别转向判断空间占据;多模态 Token 连接视觉、语言和动作;潜在状态则把世界压缩到可预测空间。 ◼ 物理 AI 中的 token 化器本质上是重型编码网络。文本分词通常只是把离散符号映射为 token,而车端 BEV 编码器、占用网络、VAE、3D 编码器等承担了从连续物理输入到可学习表征的核心转换。离散化和嵌入不是预先给定的,而是由网络学习形成;这也是物理 AI 相较数字 AI多出的一道关键工程门槛。 ◼ 从公司证据看,特斯拉、小鹏、华为、理想、Waymo、Wayve 等路线虽不同,但共同主线是从目标级识别走向空间级理解,再走向潜在状态预测。多种表征长期并存,并非简单替换:BEV 与矢量、占用、3D 高斯、世界模型潜空间,分别服务不同层次的感知、预测、仿真和规划需求。 ◼ 世界模型可能成为表征训练的关键手段。标签稀缺使物理世界嵌入难以完全依赖人工监督,GAIA、Cosmos、JEPA 系等世界模型通过自监督预测未来状态、生成场景或学习潜在动力学,帮助模型在无标注或弱标注条件下形成更统一的物理表征。竞争壁垒正从单点感知精度,前移到如何将物理世界嵌入可预测潜在空间。 ◼ 我们认为,数字 AI 底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理 AI 将成为物理世界的AI 解决方案,从而在 AI 的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼ 风险提示:技术迭代不及预期的风险;大模型厂商 ARR 增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。 -15%-11%-7%-3%1%5%9%13%17%21%2025/8/72025/12/62026/4/62026/8/5汽车沪深300 请务必阅读正文之后的免责声明部分 东吴证券研究所 行业深度报告 2 / 16 内容目录 1. 表征演进:物理世界如何进入模型 ...................................................................................................... 4 2. 物理 AI 表征:缺乏天然通用 token 化方案 ........................................................................................ 4 2.1. 文本侧:离散 Token 降低输入表征成本 .................................................................................... 4 2.2. 物理世界侧:连续信号需要先构建可学习底座 ........................................................................ 5 3. 智能驾驶表征演进:从像素、BEV 到潜在状态 ................................................................................. 6 3.1. 原始像素端到端:起点与局限 .................................................................................................... 7 3.2. BEV 加 Transformer:从 2D 像素到 3D 向量空间 ...................................................................... 7 3.3. Occupancy 占用:从“是什么”到“是否被占据” ........................................................................... 9 3.4. 矢量化:从栅格图像到数学矢量 .............................................................................................. 10 3.5. 多模态 Token:走向视觉—语言—动作统一 ........................................................................... 11 3.6. 潜在状态:从观测编码走向可预测空间 .................................................................................. 12 4. 世界模型:标签稀缺下的自监督表征训练工具 ................................................................................ 14 5. 风险提示: ...............................................................................
[东吴证券]:汽车行业深度报告:AI系列深度23期:智能驾驶的表征演进,点击即可下载。报告格式为PDF,大小1.15M,页数16页,欢迎下载。



