汽车行业深度报告:AI系列深度07期:CNN与ViT两类视觉骨干有何差异?

证券研究报告·行业深度报告·汽车 东吴证券研究所 1 / 10 请务必阅读正文之后的免责声明部分 汽车行业深度报告 AI 系列深度 07 期:CNN 与 ViT 两类视觉骨干有何差异? 2026 年 07 月 30 日 证券分析师 黄细里 执业证书:S0600520010001 021-60199793 huangxl@dwzq.com.cn 行业走势 相关研究 《AI 系列深度 06 期:Transformer 如何从序列任务走向基座模型? 》 2026-07-30 《具身智能系列 01:本体厂商资本化加速,通用机器人产业链进入验证期》 2026-07-29 增持(维持) [Table_Tag] [Table_Summary] 投资要点 ◼ 视觉骨干网络是机器视觉系统的核心模块,其作用是把原始像素转化为高层语义特征,并决定分类、检测、分割等下游任务上限。CNN 与 ViT是过去十余年最重要的两代视觉骨干,分别代表“将图像先验写入结构”和“将关系学习交给数据与规模”两种设计哲学;二者之争本质上是先验、数据和算力如何分工。 ◼ 视觉架构大体经历四个阶段:手工特征时代依赖 SIFT、HOG 等专家设计;CNN 崛起后,AlexNet、VGG、ResNet 推动机器自动学习视觉特征;ViT 通过把图像切成 patch 并当作 token 输入 Transformer,使注意力机制进入视觉;2021 年后,Swin、CoAtNet、ConvNeXt 等推动 CNN 与 ViT相互吸收,进入融合时代。 ◼ CNN 的优势来自三项视觉归纳偏置:局部连接、权值共享和平移等变性。这些结构假设使模型在数据有限时更高效,也更适合端侧和实时部署;约束在于局部感受野逐层扩大,长程依赖建模较弱。ViT 以自注意力实现第一层全局交互,弱先验、强规模化,在大数据预训练下上限更高,但对数据、算力和位置编码依赖更强。 ◼ 核心争议在于 ViT 是否真正“强于”CNN,还是更多受益于更大数据和现代训练范式。ConvNeXt 证明纯卷积配合现代训练技巧仍可追平部分ViT,MLP-Mixer 也提示注意力未必是唯一变量;因此更准确的理解是,视觉架构正在从“强先验”与“弱先验”两端走向任务、数据、算力约束下的动态平衡。 ◼ 产业落地呈现分层:多模态大模型和研究前沿普遍采用 ViT 或类Transformer 视觉编码器,CLIP、SigLIP、Qwen-VL 等均沿此方向推进;自动驾驶量产系统则受车端算力、时延和安全约束影响,更多采用 CNN前端、BEV/Transformer 融合和混合骨干。研究前沿偏 ViT,车端量产偏混合,是当前现实分工。 ◼ 我们认为,数字 AI 底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理 AI 将成为物理世界的AI 解决方案,从而在 AI 的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼ 风险提示:技术迭代不及预期的风险,大模型厂商 ARR 增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。 -13%-9%-5%-1%3%7%11%15%19%2025/7/302025/11/282026/3/292026/7/28汽车沪深300 请务必阅读正文之后的免责声明部分 行业深度报告 东吴证券研究所 2 / 10 内容目录 1. 视觉骨干网络:机器视觉的表征底座 .............................................................................................. 4 2. 视觉架构演进:从手工特征到融合骨干 .......................................................................................... 4 2.1. 手工特征时代:依赖专家设计视觉描述子............................................................................. 4 2.2. CNN 崛起:深度网络自动学习视觉特征 ................................................................................ 4 2.3. ViT 登场:注意力机制进入视觉 .............................................................................................. 5 3. CNN 机制:卷积为何适合图像 .......................................................................................................... 5 3.1. 核心机制:卷积、池化与任务头............................................................................................. 5 3.2. 三项设计先验:局部连接、权值共享、平移等变性............................................................. 6 4. ViT 机制:将图像 patch 化为 token 序列 ......................................................................................... 6 4.1. 前置概念:Self-Attention 机制 ................................................................................................. 6 4.2. 核心设计:patch 切分、token 化与 Transformer 编码 ........................................................... 6 5. CNN 与 ViT:先验、数据与部署的四组分歧 .................................................................................. 7 5.1. 感受野:逐层扩大与首层全局交互......................................................................................... 7 5.2. 归纳偏置:强先验与数据驱动...................................

立即下载
汽车
2026-07-30
东吴证券
黄细里
10页
0.59M
收藏
分享

[东吴证券]:汽车行业深度报告:AI系列深度07期:CNN与ViT两类视觉骨干有何差异?,点击即可下载。报告格式为PDF,大小0.59M,页数10页,欢迎下载。

本报告共10页,只提供前10页预览,清晰完整版报告请下载后查看,喜欢就下载吧!
立即下载
本报告共10页,只提供前10页预览,清晰完整版报告请下载后查看,喜欢就下载吧!
立即下载
水滴研报所有报告均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
相关报告
热门报告
加入社群
回顶部
报告群
公众号
小程序
在线客服
收起