汽车行业深度报告:AI系列深度09期:从LLM到VLM再到VLA意味着什么?

证券研究报告·行业深度报告·汽车 东吴证券研究所 1 / 11 请务必阅读正文之后的免责声明部分 汽车行业深度报告 AI 系列深度 09 期:从 LLM 到 VLM 再到 VLA 意味着什么? 2026 年 07 月 31 日 证券分析师 黄细里 执业证书:S0600520010001 021-60199793 huangxl@dwzq.com.cn 行业走势 相关研究 《 AI 系 列 深 度 08 期 : GAN 与Diffusion 两类生成范式有何差异?》 2026-07-31 《AI 系列深度 07 期:CNN 与 ViT 两类视觉骨干有何差异?》 2026-07-30 增持(维持) [Table_Tag] [Table_Summary] 投资要点 ◼ LLM、VLM、VLA 可理解为同一技术脉络上逐层扩展模态和输出能力的三类大模型。LLM 以文本为输入输出,主要解决语言理解、生成和推理;VLM 在语言底座上加入视觉理解,使图像和文字在同一语义空间交互;VLA 进一步把动作作为输出模态,使模型能够驱动机器人或车辆在物理世界中行动。三者存在继承关系,但不能简单归结为同一种 next-token 机制。 ◼ 从概念脉络看,LLM 由 Transformer、GPT 等奠定,核心是以海量文本和自监督训练形成语言基础模型;VLM 由 CLIP、Flamingo 等推动,通过图文对齐、视觉编码器和模态投影,把视觉信息接入语言模型;VLA由 Google DeepMind 在 RT-2 中明确命名,核心是把视觉、语言与动作统一到策略模型中。 ◼ 从数据和表征看,三者难度逐级抬升。LLM 训练依赖文本语料,VLM增加图文对和视觉编码,VLA 则需要机器人示教、遥操作轨迹、动作反馈和真实环境数据。动作不是普通输入模态,而是会改变物理世界的控制输出;因此,VLA 既可把动作离散化为 token 自回归生成,也可用扩散策略或流匹配生成连续动作轨迹。 ◼ 从应用边界看,LLM 主要处理知识、代码、对话和软件任务;VLM 把能力扩展到图像理解、图文问答、视觉检索和多模态交互;VLA 则进入机器人、自动驾驶和具身执行,需要处理实时性、安全性和物理反馈。NVIDIA 的慢思考 VLM 加快思考动作模型、π0 的连续动作生成、RT-2的动作 token 化,均体现 VLA 内部路线仍在分化。 ◼ 产业映射上,海外 OpenAI、Google、Meta、Anthropic 等主导 LLM/VLM,Google、Physical Intelligence、NVIDIA、Figure 等布局 VLA 和机器人;国内 DeepSeek、阿里、字节、百度、腾讯、智谱、月之暗面、MiniMax等布局 LLM/VLM,智元、银河通用等聚焦 VLA 与机器人本体。后续竞争核心将从模型能力延伸到数据、硬件、动作控制与场景闭环。 ◼ 我们认为,数字 AI 底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理 AI 将成为物理世界的AI 解决方案,从而在 AI 的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼ 风险提示:技术迭代不及预期的风险;大模型厂商 ARR 增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。 -12%-8%-4%0%4%8%12%16%20%24%2025/7/312025/11/292026/3/302026/7/29汽车沪深300 请务必阅读正文之后的免责声明部分 行业深度报告 东吴证券研究所 2 / 11 内容目录 1. LLM:以文本为核心的语言基础模型 .............................................................................................. 4 1.1. 概念界定与提出背景................................................................................................................. 4 1.2. 核心机制:自回归预训练与 Transformer ................................................................................ 4 1.3. 能力边界与应用场景................................................................................................................. 4 1.4. 代表性模型与公司..................................................................................................................... 4 2. VLM:视觉模态如何接入语言底座 .................................................................................................. 5 2.1. 概念界定与技术脉络................................................................................................................. 5 2.2. 核心机制:视觉编码、模态对齐与语言推理......................................................................... 5 2.3. 能力边界与应用场景................................................................................................................. 6 2.4. 代表性模型与公司..................................................................................................................... 6 3. VLA:动作输出如何进入多模态模型 ............................................................................................... 6 3.1. 概念界定与提出背景.............................................................

立即下载
汽车
2026-08-01
东吴证券
黄细里
11页
0.66M
收藏
分享

[东吴证券]:汽车行业深度报告:AI系列深度09期:从LLM到VLM再到VLA意味着什么?,点击即可下载。报告格式为PDF,大小0.66M,页数11页,欢迎下载。

本报告共11页,只提供前10页预览,清晰完整版报告请下载后查看,喜欢就下载吧!
立即下载
本报告共11页,只提供前10页预览,清晰完整版报告请下载后查看,喜欢就下载吧!
立即下载
水滴研报所有报告均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
相关报告
热门报告
加入社群
回顶部
报告群
公众号
小程序
在线客服
收起