汽车行业深度报告:AI系列深度10期:预训练与后训练如何塑造大模型?
证券研究报告·行业深度报告·汽车 东吴证券研究所 1 / 10 请务必阅读正文之后的免责声明部分 汽车行业深度报告 AI 系列深度 10 期:预训练与后训练如何塑造大模型? 2026 年 08 月 01 日 证券分析师 黄细里 执业证书:S0600520010001 021-60199793 huangxl@dwzq.com.cn 行业走势 相关研究 《AI 系列深度 09 期:从 LLM 到 VLM再到 VLA 意味着什么?》 2026-07-31 《 AI 系 列 深 度 08 期 : GAN 与Diffusion 两类生成范式有何差异?》 2026-07-31 增持(维持) [Table_Tag] [Table_Summary] 投资要点 ◼ 预训练与后训练是理解大模型能力形成的一组关键框架。预训练利用海量低成本、弱标注或无标注数据学习通用底座,决定能力来源和上限;后训练利用少量高质量指令、偏好、反馈或可验证奖励数据进行适配,决定能力的调用方式、指令遵循、偏好对齐及特定任务中的推理表现。 ◼ 当前模型能力与训练的关系主要聚焦三个问题:能力主要来自预训练还是后训练,后训练究竟是塑形还是可带来新推理能力;两阶段是否正在扩展为预训练、中训练、后训练三阶段;规模化重心是否从预训练转向后训练与推理时计算。 ◼ 数字 AI 与物理 AI 在训练框架上同构、在数据和反馈上分立。数字 AI预训练主要依赖文本和图文语料,后训练依赖人类偏好、可验证奖励和工具反馈;物理 AI 复用视觉语言骨干,但还需要驾驶视频、机器人轨迹、真机数据、仿真环境和安全奖励。公共文本可能接近供给上限,而物理 AI 的核心瓶颈是真实交互数据稀缺。 ◼ 产业视角下,预训练仍属于资本开支密集的规模竞赛,后训练与推理效率则更多体现为以较小增量投入释放模型能力的效率竞赛。随着推理模型、推理时计算和 Agent 应用发展,部分数字 AI 场景的算力重心正由训练侧向推理侧迁移;中国厂商也更多围绕后训练、推理效率、MoE、长上下文和工具调用开展工程优化。总体看,预训练决定能力底座,后训练成为重要增量来源,二者互补而非替代。 ◼ 我们认为,数字 AI 底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理 AI 将成为物理世界的AI 解决方案,从而在 AI 的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼ 风险提示:技术迭代不及预期的风险;大模型厂商 ARR 增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。 -12%-8%-4%0%4%8%12%16%20%24%2025/7/312025/11/292026/3/302026/7/29汽车沪深300 请务必阅读正文之后的免责声明部分 行业深度报告 东吴证券研究所 2 / 10 内容目录 1. 预训练与后训练:底座形成与使用适配 .............................................................................................. 4 1.1. 术语溯源:两个概念的提出与演变 ............................................................................................ 4 1.2. 本质区别:通用底座与面向使用的适配 .................................................................................... 5 1.3. 当前主要分歧:三条主线先行概览 ............................................................................................ 5 1.4. 数字 AI 与物理 AI:框架同构、口径分立 ................................................................................. 5 2. 预训练:通用能力底座如何形成 .......................................................................................................... 5 2.1. 自监督学习:以“预测下一个词”为核心目标 ............................................................................. 5 2.2. 扩展律 Scaling Law:规模与性能的定量关系 .......................................................................... 6 2.3. 数据约束:高质量公共文本的供给上限 .................................................................................... 6 3. 后训练:从基座可用到对齐与推理增强 .............................................................................................. 6 3.1. 监督微调 SFT:习得指令遵循能力 ........................................................................................... 6 3.2. 基于人类反馈的强化学习 RLHF:对齐人类偏好 .................................................................... 6 3.3. 直接偏好优化 DPO 等简化路线 ................................................................................................. 7 3.4. 可验证奖励的强化学习 RLVR:后训练的推理目标线 ............................................................ 7 4. 阶段过渡:中训练与推理时计算正在重塑边界 .................................................................................. 7 4.1. 中训练 mid-training:正在形成的第三阶段 ..................................
[东吴证券]:汽车行业深度报告:AI系列深度10期:预训练与后训练如何塑造大模型?,点击即可下载。报告格式为PDF,大小0.61M,页数10页,欢迎下载。



