汽车行业深度报告:AI系列深度17期:视觉智能为何引入Transformer?
证券研究报告·行业深度报告·汽车 东吴证券研究所 1 / 16 请务必阅读正文之后的免责声明部分 汽车行业深度报告 AI 系列深度 17 期:视觉智能为何引入Transformer? 2026 年 08 月 06 日 证券分析师 黄细里 执业证书:S0600520010001 021-60199793 huangxl@dwzq.com.cn 行业走势 相关研究 《AI 系列深度 16 期:语言智能为何从 RNN 转向 Transformer?》 2026-08-06 《重卡全球化专题 02:基建物流双轮驱动东南亚扩容,中国重卡出海进入收获期》 2026-08-06 增持(维持) [Table_Tag] [Table_Summary] 投资要点 ◼ 视觉 Transformer 化的本质,不是 ViT 对 CNN 的一次性替代,而是图像被 token 化、视觉归纳偏置回归、视觉基础模型形成的渐进过程。CNN之所以在 AI1.0 时代成为视觉核心架构,源于局部连接、权重共享和平移等变三项视觉归纳偏置与图像数据高度契合;但同样的强先验也带来局部感受野、任务专用、封闭标签和全局建模不足等约束,构成Transformer 进入视觉任务的前提。 ◼ Transformer 进入视觉的关键,是 ViT 确立“图像 patch 即 token”的表示方式,使二维图像可被改写为一维序列,并接入自注意力和大规模预训练范式。相较 CNN,Transformer 具备全局建模与长距离依赖更优、接口统一利于跨任务与跨模态、可扩展性强等优势,且归纳偏置较弱,在大规模预训练下更能释放数据规模价值;但视觉数据并非天然离散序列,且高分辨率、多尺度和空间先验需求更强,因此视觉演化路径与语言不同,更多表现为融合与再平衡,而非彻底替换。 ◼ 本报告将视觉 Transformer 演进归纳为三大阶段、九个子阶段。第一阶段是图像被 token 化,Non-local 等注意力模块先补足 CNN 全局建模,ViT 和 DETR 进一步改写图像输入与检测输出范式;第二阶段是可扩展通用骨干,Swin、PVT、CoAtNet 等重新吸收局部性、层级结构和多尺度先验,ConvNeXt 则证明 ViT 训练经验可反哺卷积网络;第三阶段是视觉基础模型,DINOv2/DINOv3、CLIP、SAM/SAM2/SAM3 分别推动自监督通用特征、开放词表图文对齐和可提示分割。 ◼ 从落地看,视觉智能仍主要是“感知性”中间能力。图像分类、检测、分割、视觉特征等结果通常需要嵌入既有业务流程才能兑现价值,尚未独立形成语言模型式消费级交互入口;视觉的“互动性”更多通过 CLIP、GPT-4V、Florence-2 等视觉语言模型接入语言中枢获得。因此,以语言智能的四次跃迁(架构、规模、对齐、推理)为参照,视觉已完成架构与规模两次跃迁,对齐仅以图文对齐形式部分实现且依附于语言,推理跃迁在视觉侧尚未展现。 ◼ 我们认为,数字 AI 底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理 AI 将成为物理世界的AI 解决方案,从而在 AI 的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼ 风险提示:技术迭代不及预期的风险;大模型厂商 ARR 增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。 -15%-11%-7%-3%1%5%9%13%17%21%2025/8/62025/12/52026/4/52026/8/4汽车沪深300 请务必阅读正文之后的免责声明部分 行业深度报告 东吴证券研究所 2 / 16 内容目录 1. 复盘 CNN:视觉归纳偏置如何定义视觉任务上限 ......................................................................... 4 1.1. 基本原理:三项视觉归纳偏置与层级特征抽象..................................................................... 4 1.2. 从 LeNet 到 ResNet 的演进 ....................................................................................................... 4 1.3. 结构性局限................................................................................................................................. 5 2. Transformer 爆发之前,卷积网络的应用上限 ................................................................................ 5 2.1. 卷积网络时代视觉任务的主要成果......................................................................................... 5 2.2. 应用上限:封闭标签、任务专用与全局建模约束................................................................. 6 3. Transformer 与卷积网络的结构对比及其优点 ................................................................................ 6 3.1. 两种架构的结构对比................................................................................................................. 7 3.2. Transformer 相对卷积网络的主要优点 ..................................................................................... 7 4. Transformer 应用于视觉任务的学术成果梳理及发展阶段总结 .................................................... 8 4.1. 发展阶段框架............................................................................................................................. 9 4.2. 里程碑学术成果与论文...............
[东吴证券]:汽车行业深度报告:AI系列深度17期:视觉智能为何引入Transformer?,点击即可下载。报告格式为PDF,大小0.99M,页数16页,欢迎下载。



