汽车行业点评报告:AI系列深度05期:模型如何学习表征并实现对齐?
证券研究报告·行业点评报告·汽车 东吴证券研究所 1 / 6 请务必阅读正文之后的免责声明部分 汽车行业点评报告 AI 系列深度 05 期:模型如何学习表征并实现对齐? 2026 年 07 月 29 日 证券分析师 黄细里 执业证书:S0600520010001 021-60199793 huangxl@dwzq.com.cn 行业走势 相关研究 《AI 系列深度 04 期:什么是表征?》 2026-07-29 《AI 系列深度 03 期:数字 AI 与物理AI 的边界在哪里? 》 2026-07-28 增持(维持) [Table_Tag] [Table_Summary] 投资要点 ◼ 表征如何组织、如何学习、如何跨模态共享?嵌入、自监督学习和 CLIP分别对应三层机制:嵌入是表征的工程形态,自监督是表征的规模化学习机制,CLIP 和多模态对齐则让图像与文字进入同一语义空间。本篇位于“表征是什么”与 CNN/ViT、Transformer 等具体架构之间,是理解后续技术路线的基础环节。 ◼ 嵌入的本质,是把文本、图像、商品、用户等对象映射为数字向量,并使语义相近的对象在向量空间中距离更近。由此,搜索、推荐、以图搜图、向量数据库和 RAG 等应用,都可被理解为在高维向量空间中进行近邻检索。嵌入是抽象表征最可操作、最工程化的呈现方式。 ◼ 自监督学习是通用表征规模化形成的关键机制。该方法不依赖人工逐条标注,而是利用数据自身构造训练信号,通过掩码预测、对比学习、下一个 token 预测等任务学习上下文、语义和结构关系。BERT、MAE、GPT 等路线任务形式不同,但均通过大规模自监督训练形成可迁移表征,这是预训练获得通用能力的重要基础。 ◼ CLIP 的意义在于把图像和文字对齐到同一表征空间。通过海量图文配对和对比学习,模型将正确配对的图文向量拉近、错误配对推远,使文字概念与对应图像在向量空间中自然接近。该机制成为图文检索、开放词表识别、文生图、视觉语言模型和多模态大模型的重要基础。 ◼ 从表征体系看,本篇补齐三类关键问题:嵌入回答表征如何被工程化表达,自监督回答表征如何在无标注或弱标注数据中形成,CLIP 回答不同模态表征如何进入同一空间。 ◼ 我们认为,数字 AI 底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理 AI 将成为物理世界的AI 解决方案,从而在 AI 的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼ 风险提示:技术迭代不及预期的风险,大模型厂商 ARR 增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。 -15%-11%-7%-3%1%5%9%13%17%21%2025/7/292025/11/272026/3/282026/7/27汽车沪深300 请务必阅读正文之后的免责声明部分 行业点评报告 东吴证券研究所 2 / 6 内容目录 1. 嵌入、自监督与 CLIP:表征落地的三类基础机制 ........................................................................ 3 1.1. 三类机制分工:工程形态、学习机制与跨模态对齐............................................................. 3 2. 嵌入 Embedding:表征的工程化形态 .............................................................................................. 3 2.1. 嵌入的本质:将对象映射为向量............................................................................................. 3 2.2. 嵌入的落地:检索、向量数据库与 RAG ............................................................................... 3 3. 自监督学习:通用表征的规模化学习机制 ...................................................................................... 4 3.1. 自监督的必要性:标注成本高,未标注数据规模大............................................................. 4 3.2. 三类主流自监督任务................................................................................................................. 4 3.3. 自监督是预训练的核心机制..................................................................................................... 4 4. CLIP 与多模态对齐:让图文共享表征空间 ..................................................................................... 4 4.1. 跨模态对齐:图像与文字初始处于不同空间......................................................................... 4 4.2. CLIP:基于图文配对的对比学习 ............................................................................................. 5 4.3. CLIP 成为多模态应用的重要基础 ............................................................................................ 5 5. 风险提示 .............................................................................................................................................. 5 请务必阅读正文之后的免责声明部分 行业点评报告 东吴证券研究所 3 / 6 1. 嵌入、自监督与 CLIP:表征落地的三类基础机制 表征要进入工程系统,需要回答三个问题:1)如何把对象表示为可计算结构;2)如何在不依赖大规模人工标
[东吴证券]:汽车行业点评报告:AI系列深度05期:模型如何学习表征并实现对齐?,点击即可下载。报告格式为PDF,大小0.49M,页数6页,欢迎下载。



