机器人行业系列深度之39:从发散到收敛,具身模型和数据体系的产业演进
证 券 研 究 报 告从发散到收敛,具身模型和数据体系的产业演进证券分析师:胡书捷 A0230524070007王珂 A0230521120002联系人:胡书捷 A02305240700072026.8.6机器人系列深度之39www.swsresearch.com证券研究报告2投资要点◼机器人产业发展的四大关键要素为模型、数据、本体和场景。其中,模型是机器人大脑,负责推理决策;数据是模型训练的燃料,没有高质量数据,模型无法进行有效训练;本体是机器人物理载体,执行能力的物理上限,所有智能指令最后依靠本体执行;场景是最终商业化落地的重点,和机器人的需求来源,也决定了机器人的任务边界,机器人必须有场景才能产生价值。我们认为,在当前阶段,模型和数据是行业最大的瓶颈。市场对该环节的关注和研究较少。◼模型:主流玩家的模型持续迭代,模型架构尚未收敛。主流玩家的模型持续迭代,从PI的π0到π0.7,谷歌的RT1到Gemini Robotics2,在跨本体泛化、操作流畅度、数据生成瓶颈方面持续突破;模型架构尚未收敛,但相似度较高,多为VLA、扩散模型、世界模型等的融合架构,大脑推理和小脑动作模型分层。参与者呈现百花齐放态势:1)科技大厂:谷歌、字节;2)具身模型&本体公司:PI、Figure、智元、星海图等;3)大语言模型厂商:OpenAI等。◼数据:模型训练的核心燃料,关键在于数据数量、质量和scale-up。相比大语言模型有海量的互联网数据训练,具身智能天然缺乏机器人轨迹数据,因此数据成为模型迭代的关键瓶颈。当前数据来源包含互联网数据、仿真合成数据、第一人称视角数据、遥操作数据等。当前,不同公司押注不同的数据路线,普遍采用多种数据类型、开源+内部数据集融合的方式。在模型训练阶段,数据生产商及采集设备商迎来投资机遇。◼投资提示:人形机器人进入具身智能驱动的新阶段。本体零部件是硬件基础,量产落地带动减速器、伺服、传感器需求释放;具身大模型作为机器人智能核心,算法与仿真平台构筑软件壁垒;训练数据是模型迭代核心约束,真实示教采集+第一视角采集+仿真合成数据等多路线并行,数据供给端稀缺性持续提升。中长期建议沿三条主线布局:①人形机器人核心零部件厂商;②具身模型和本体厂商;③机器人数据采集硬件与数据服务相关标的。◼风险提示:模型技术迭代不及预期风险、数据供给和质量瓶颈风险、商业化落地风险。www.swsresearch.com证券研究报告3机器人产业发展的四大关键要素模型场景数据本体参与者:OpenAI、Google Deepmind、字节、阿里千问、PI、Field AI、Generalist AI、Skild AI等VLA模型、世界模型、强化学习参与者:Scale AI、XDOF、各地数采厂、光轮智能等遥操作数据、人类视角数据、仿真合成数据、互联网数据参与者:特斯拉、宇树、智元、云深处等人形、轮式、四足、机械臂等参与者:科沃斯、石头科技、埃斯顿、云迹、极智嘉等工业、商用、酒店、家务、通用◼机器人产业发展的四大关键要素为模型、数据、本体和场景。◼1)模型:机器人大脑,负责推理决策,决定了机器人智能化水平的上限;◼2)数据:模型训练的燃料,没有高质量数据,模型无法进行有效训练;◼3)本体:机器人物理载体,执行能力的物理上限,所有智能指令最后依靠本体执行;◼4)场景:商业化落地的重点,和机器人的需求来源,也决定了机器人的任务边界,机器人必须有场景才能产生价值。注:部分公司参与多个环节,我们仅列出部分代表性公司图1:机器人产业发展的四大关键要素资料来源:申万宏源研究主要内容1. 具身模型:负责决策的核心大脑1.1 机器人模型迭代:从运动到认知,再到多模态和世界模型1.2 当前具身模型玩家持续扩容,大模型厂商投入加码1.3 模型架构:当前架构尚未收敛,各条路线持续迭代2. 数据采集:模型训练的关键燃料3. 相关标的梳理4. 风险提示4www.swsresearch.com证券研究报告51.1 机器人模型迭代:从运动到认知,再到多模态和世界模型◼阶段 1:经典控制模型时代(1960–2010),基于数学建模•过程:1960s工业机器人兴起,建立拉格朗日机器人动力学模型;针对双足机器人的控制算法迭代,如PID(单关节独立控制)、自适应控制、鲁棒控制等。典型代表:传统工业机械臂、早期 ASIMO 初代。•局限性:需要精确 CAD 参数、重量、摩擦系数;负载变化、柔性、间隙没有感知,无法自主理解环境;只能复现预设轨迹,四足、人形这类强耦合、非线性机器人很难精确建模。◼阶段二:数据驱动模型萌芽(2010–2018),机器学习补充动力学,感知接入•过程:机器学习推动数据驱动模式出现,包括:高斯过程 GP、神经网络补偿动力学;强化学习初步用于机器人;模型预测控制MPC开始用于人形和足式机器人。典型代表:MIT Cheetah四足机器人的简化刚体模型+MPC;DeepMind 早期机器人抓取。•局限性:感知服务于运动控制,而非认知模型;感知能力不足。◼阶段三:大语言模型诞生 —— 机器人认知模型启蒙(2018–2022)•过程:Transformer、LLM 出现,机器人开始拥有语义理解能力,但大小脑分层:①运动模型:以动力学+MPC/RL 为主,变化不大;②认知模型:引入外部大模型做任务规划。例如,LLM 作为“规划大脑”接收自然语言指令、拆解子任务,运动控制器作为“小脑”执行动作;典型代表:Google PaLM-SayCan(2022)•局限性:LLM只懂文本,没有空间几何感知、没有具身常识,无法理解物体位置、尺寸、可操作性;语言和机器人视觉、运动空间割裂。资料来源:申万宏源研究www.swsresearch.com证券研究报告61.1 机器人模型迭代:从运动到认知,再到多模态和世界模型◼阶段四:多模态具身基础模型时代(2022年至今,当前主流方向),视觉+语言+动作统一模型•过程:不再分开训练语言模型、视觉模型、机器人控制模型;构建统一多模态具身基础模型,输入图像、文本、动作;输出机器人动作序列。例如RT-1 / RT-2、π0、OpenAI RoboCat等,是当前最主流的模型架构。•局限性:泛化能力较差,仿真到现实迁移难度大,物理幻觉、无法应对不可预测性;世界模型派别认为LLM有根本性局限,难以实现能理解物理世界的智能。无法理解空间、物理规则、因果、持续感知与预测现实场景。◼阶段五:世界模型(下一代,演进中)•过程:模型的核心目标为,机器人不只输出动作,还能预测执行动作之后环境会发生什么,实现闭环逻辑:感知观测 → 世界模型预测未来状态 → 规划最优动作 → 执行 → 新观测,具备自我进化和自我学习能力。现在还在早期探索阶段。资料来源:《Survey of Vision-Language-Action Models for Embodied Manipulation》,申万宏源研究表1:机器人模型的迭代过程时代模型核心建模方式泛化能力适用场景经典控制 (1960-2010)刚体动力学解析模型第一性原理推导极低,固定任务传统工业机械臂机器学习 (2010-2018)动力学 + 浅层神经网络 / RL原理模型 + 数据残差拟合
[申万宏源]:机器人行业系列深度之39:从发散到收敛,具身模型和数据体系的产业演进,点击即可下载。报告格式为PDF,大小5.68M,页数47页,欢迎下载。



