汽车行业点评报告:AI系列深度06期:Transformer如何从序列任务走向基座模型?
证券研究报告·行业点评报告·汽车 东吴证券研究所 1 / 9 请务必阅读正文之后的免责声明部分 汽车行业点评报告 AI 系列深度 06 期:Transformer 如何从序列任务走向基座模型? 2026 年 07 月 30 日 证券分析师 黄细里 执业证书:S0600520010001 021-60199793 huangxl@dwzq.com.cn 行业走势 相关研究 《AI 系列深度 05 期:模型如何学习表征并实现对齐?》 2026-07-29 《AI 系列深度 04 期:什么是表征?》 2026-07-29 增持(维持) [Table_Tag] [Table_Summary] 投资要点 ◼ RNN 与 Transformer 是序列建模的两代核心架构,解决文字、语音、视频和轨迹等有先后顺序的数据如何形成表征的问题。序列建模的难点在于变长、有序和长程依赖:模型既要保留上下文,又要把相距较远的相关信息联系起来。 ◼ RNN 的基本思路是把历史压缩进一个随时间更新的隐藏状态。该结构推理成本相对恒定,适合早期机器翻译、语音识别和时间序列任务;LSTM、GRU 通过门控机制缓解长程遗忘,Seq2Seq 和注意力机制进一步推动模型更迭。但 RNN 必须逐步串行处理,难以充分利用并行算力,长距离信息也容易在压缩状态中衰减。 ◼ Transformer 采取不同路径:不再把历史压缩成单一状态,而是用自注意力让每个位置直接与所有位置交互。多头注意力、位置编码和前馈层共同构成其结构基础,使训练可以并行、长程依赖路径显著缩短,并为模型规模化扩展提供架构基础。GPT、BERT 以及后续 LLM、VLM、VLA 大多以 Transformer 为核心底座,反映其在云端通用基础模型中的主导地位。 ◼ 两者分歧可归纳为记忆、计算和长程建模三组权衡:RNN 以定长状态换取相对恒定的推理成本,但训练串行、记忆容量受限;Transformer 全量缓存历史,训练并行、长程建模更强,但注意力计算随序列长度平方增长,超长上下文推理成本较高。该约束也是 Mamba、RWKV、线性注意力和混合架构重新受到关注的重要原因。 ◼ Transformer 替代传统 RNN 主干,并不意味着循环思想消失。2023 年以来,状态空间模型、选择性状态更新和线性注意力在长上下文、端侧低功耗、低时延场景中体现价值;同时,存在混合架构的技术路径,用少数注意力层保留精确回忆能力,用多数高效层降低计算成本。整体看,Transformer 仍是通用基础模型主线,新循环更像特定约束下的重要补充。 ◼ 我们认为,数字 AI 底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理 AI 将成为物理世界的AI 解决方案,从而在 AI 的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼ 风险提示:技术迭代不及预期的风险,大模型厂商 ARR 增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。 -15%-11%-7%-3%1%5%9%13%17%21%2025/7/292025/11/272026/3/282026/7/27汽车沪深300 请务必阅读正文之后的免责声明部分 行业点评报告 东吴证券研究所 2 / 9 内容目录 1. RNN 与 Transformer:序列建模的两代答案 ................................................................................... 3 2. 共同问题:序列如何保留上下文 ...................................................................................................... 3 2.1. 序列数据的本质:变长、有序、长程依赖............................................................................. 3 2.2. 两类核心机制:状态压缩与全量检索..................................................................................... 4 3. RNN 机制:把历史压缩为隐藏状态 .................................................................................................. 4 3.1. 核心机制:循环、隐状态与时间展开..................................................................................... 4 3.2. 门控的引入:LSTM 与 GRU 如何缓解长程遗忘 .................................................................. 4 3.3. 固有约束:串行、难并行与长程上限..................................................................................... 5 4. Transformer 机制:基于自注意力实现全局交互 ............................................................................ 5 4.1. 自注意力与 QKV:全局检索的基础 ....................................................................................... 5 4.2. 核心设计:多头注意力、位置编码与前馈层......................................................................... 6 4.3. 规模化能力与计算代价............................................................................................................. 6 5. 路线分歧:记忆、计算与新循环回潮 .............................................................................................. 6 5.1. 三组关键分歧............................................................................................
[东吴证券]:汽车行业点评报告:AI系列深度06期:Transformer如何从序列任务走向基座模型?,点击即可下载。报告格式为PDF,大小0.57M,页数9页,欢迎下载。



