在我们的研究框架中,AGI、混合虚拟现实、元宇宙均描述的是未来成型的生态。AGI/虚拟现实的真正实现,首先依托于智能科技视角下的两条技术路径——混合平台、重构时空,人形机器人即混合平台的一种工程方案。智能科技视角下,chatGPT是生产力范畴、MR眼镜与人形机器人是不同的计算平台/新空间,我们预计其中MR眼镜将于2024年进入C端,人形机器人预计将于2026年进入家庭C端。
国内外市场对人形机器人产业进程的分歧巨大(落脚于能否2026年进家庭C端),源于硬件的诸多关键部位均需0-1的定制化研发,软件(主要是AI算法)部分则较车端自动驾驶更具挑战。我们本篇报告聚焦于软件部位的AI算法部分:AI算法部分为何至关重要?自动驾驶FSD详细分析及最新进展、人形机器人的AI算法部分如何借力于FSD? 软件算法的迭代速度、技术高度对人形机器人的导入速度、产品高度起到决定性的作用,且随着硬件体系成熟,软件算法的重要性会愈加凸显:1)人形机器人与传统机器人的突破在和物理世界的实时感知交互,决定其实现的关键在于软件算法;2)算法能力的提升在一定范围内会降低对硬件的依赖与精度要求,参考自动驾驶方案逐步降低对雷达的依赖走向纯视觉方案;3)当产品的成熟度达到一定高度后,硬件趋向同质化,很难体现出产品的差异性,在一定范围内所体现出的重要性或将逐步降低,而软件的成熟度、稳定性等因素将日益成为影响产品差异性竞争力的重要因素。 特斯拉自动驾驶自研方案经历四次重要迭代,当前形成了“4D空间+占用网络”的核心架构。自动驾驶方案主要有感知、决策规划、运动控制三个模块,其中感知层相当于自动驾驶的“眼睛”,帮助汽车理解所处的外部环境,感知模型的输出是基础;建立在准确、可靠的感知输出结果上,决策规划模型相当于“大脑”,对自车及周边环境轨迹进行预测,通过打分机制筛选出最优运动轨迹输出给运动控制模块;获得行动轨迹后,运动控制模块将其分解为方向转向、行车速度等操作指令,将其传输给方向盘、油门、刹车等执行器进行操作,最终实现对汽车的控制。 我们对特斯拉FSD算法进行详细拆解,并对比了人形机器人与自动驾驶方案的异同:我们认为人形机器人建立在FSD的基础上有算法能力及供应链的加持,导入速度更快;但考虑到自由度更多,规控算法难度较大,因此达到成熟需要一定周期,预计未来会类似于自动驾驶一样,呈现产品智能等级逐步提升的过程。 相较市场对硬件部分的关注,我们本篇报告特别关注软件算法平台的机会: 1.市场认为机器人最终会类似于自动驾驶一样走向自研。我们则认为:1)短期内对于希望升级至人工智能方向的制造商,可能会借助软件算法公司的积累而进行业务迭代;2)长期来看机器人与自动驾驶的场域更加开放,为了提高用户体验,可能会走向更多长尾功能及场景的优化,体现为种类繁复的执行器及规控操作。如若每个公司都在感知等基础平台上重复造轮子,可能会带来产业资源的浪费。因此若最终指向通用人形机器人,我们判断感知、决策被模型化后或许会成为类似今天基础大模型一样的存在,在这类能力上具备强大实力的公司可能成为平台型的公司,而在其之上,不同应用场景的机器人公司可以部署垂类小模型,基于相应的执行器进行调整,这种模式或许是更经济的方案。由此推演,我们认为或许不排除未来特斯拉会成为AI公司提供基础能力,将上层执行器及运动控制的方案开放给更多的第三方合作伙伴。 2.有观点认为国内技术创新能力不足,不具备提供平台型能力的实力。我们反而认为:从算法能力方面,中国车企在自动驾驶方案上已经有一定积累,特别是新势力如理想、小鹏、华为、地平线等在感知、决策规划上已经具备相应的能力,且地平线已经宣布将进军机器人领域。此次大模型的火爆也在很大程度上推动了对技术创新、工程化落地重要性的认知,量变的积累可能引起质变,推动国内技术方案及工程能力整体水平的提升,因此我们认为国内的新势力公司仍值得关注。 关注人形机器人产业链: 特斯拉及其产业链上生态合作伙伴:其中软件部分系特斯拉自研,国内在产业链上的参与方式主要在零部件;传统机器人向智能化升级:传统人形机器人做智能化升级,比如波士顿动力引入ChatGPT做交互;非人形机器人向智能人形机器人迭代,如傅利叶智能; 互联网大厂向机器人方向拓展:谷歌、腾讯、字节跳动等;自动驾驶新势力:地平线等。 芯片、算力、数据等也非常重要:云端算力如超算中心的芯片及服务器;边缘、端算力,关注云天励飞;仿真模拟数据等。 风险提示:技术迭代进展不及预期、算力投产速度不及预期、安全、隐私法规等政策风险、测算不及预期。 研究报告全文:2023年08月20日行业专题传媒证券研究报告人形机器人的AI算法如何借力于自投资评级领先大市-A动驾驶FSDAI专题报告之十二维持评级在我们的研究框架中AGI混合虚拟现实元宇宙均描述的是首选股票目标价元评级未来成型的生态AGI虚拟现实的真正实现首先依托于智能科技视角下的两条技术路径混合平台重构时空人形机器人即混合平台的一种工程方案智能科技视角下chatGPT是生产力范畴MR眼镜与人形机器人是不同的计算平台新空间我们行业表现预计其中MR眼镜将于2024年进入C端人形机器人预计将于传媒沪深3002026年进入家庭C端5242国内外市场对人形机器人产业进程的分歧巨大落脚于能否32222026年进家庭C端源于硬件的诸多关键部位均需0-1的定制122化研发软件主要是AI算法部分则较车端自动驾驶更具挑-8战我们本篇报告聚焦于软件部位的AI算法部分AI算法部分-182022-082022-122023-042023-08为何至关重要自动驾驶FSD详细分析及最新进展人形机器人资料来源Wind资讯的AI算法部分如何借力于FSD升幅1M3M12M软件算法的迭代速度技术高度对人形机器人的导入速度产相对收益-56-86351品高度起到决定性的作用且随着硬件体系成熟软件算法的重绝对收益-75-129256要性会愈加凸显1人形机器人与传统机器人的突破在和物理世焦娟分析师界的实时感知交互决定其实现的关键在于软件算法2算法能SAC执业证书编号S1450516120001力的提升在一定范围内会降低对硬件的依赖与精度要求参考自jiaojuanessencecomcn动驾驶方案逐步降低对雷达的依赖走向纯视觉方案3当产品的相关报告成熟度达到一定高度后硬件趋向同质化很难体现出产品的差影视行业2023年迎多重利2023-08-19异性在一定范围内所体现出的重要性或将逐步降低而软件的好暑期档超预期将加速行成熟度稳定性等因素将日益成为影响产品差异性竞争力的重要业修复因素欧盟人工智能法案草案2023-06-15特斯拉自动驾驶自研方案经历四次重要迭代当前形成了4D通过关注优质IP方的两条空间占用网络的核心架构自动驾驶方案主要有感知决策规受益逻辑划运动控制三个模块其中感知层相当于自动驾驶的眼睛新IPAIGCNFT交互大2023-06-11帮助汽车理解所处的外部环境感知模型的输出是基础建立在繁荣内容新模式变现新准确可靠的感知输出结果上决策规划模型相当于大脑对空间从上网到上算自车及周边环境轨迹进行预测通过打分机制筛选出最优运动轨由网络世界至虚拟现迹输出给运动控制模块获得行动轨迹后运动控制模块将其分实AI专题报告之十一解为方向转向行车速度等操作指令将其传输给方向盘油门从上网到上算由网2023-05-23刹车等执行器进行操作最终实现对汽车的控制络世界至虚拟现实AI专题报告之十四层投我们对特斯拉FSD算法进行详细拆解并对比了人形机器人与自动驾驶方案的异同我们认为人形机器人建立在FSD的基础上资逻辑中主线是大模型有算法能力及供应链的加持导入速度更快但考虑到自由度更大模型携生态合作伙伴衍生出爆款落地应用本报告版权属于安信证券股份有限公司各项声明请参见报告尾页1行业专题传媒多规控算法难度较大因此达到成熟需要一定周期预计未来大模型及其应用的海外跟踪2023-04-10会类似于自动驾驶一样呈现产品智能等级逐步提升的过程从上网到上算由网络世界至虚拟现实相较市场对硬件部分的关注我们本篇报告特别关注软件算法AI专题报告之九平台的机会1市场认为机器人最终会类似于自动驾驶一样走向自研我们则认为1短期内对于希望升级至人工智能方向的制造商可能会借助软件算法公司的积累而进行业务迭代2长期来看机器人与自动驾驶的场域更加开放为了提高用户体验可能会走向更多长尾功能及场景的优化体现为种类繁复的执行器及规控操作如若每个公司都在感知等基础平台上重复造轮子可能会带来产业资源的浪费因此若最终指向通用人形机器人我们判断感知决策被模型化后或许会成为类似今天基础大模型一样的存在在这类能力上具备强大实力的公司可能成为平台型的公司而在其之上不同应用场景的机器人公司可以部署垂类小模型基于相应的执行器进行调整这种模式或许是更经济的方案由此推演我们认为或许不排除未来特斯拉会成为AI公司提供基础能力将上层执行器及运动控制的方案开放给更多的第三方合作伙伴2有观点认为国内技术创新能力不足不具备提供平台型能力的实力我们反而认为从算法能力方面中国车企在自动驾驶方案上已经有一定积累特别是新势力如理想小鹏华为地平线等在感知决策规划上已经具备相应的能力且地平线已经宣布将进军机器人领域此次大模型的火爆也在很大程度上推动了对技术创新工程化落地重要性的认知量变的积累可能引起质变推动国内技术方案及工程能力整体水平的提升因此我们认为国内的新势力公司仍值得关注关注人形机器人产业链特斯拉及其产业链上生态合作伙伴其中软件部分系特斯拉自研国内在产业链上的参与方式主要在零部件传统机器人向智能化升级传统人形机器人做智能化升级比如波士顿动力引入ChatGPT做交互非人形机器人向智能人形机器人迭代如傅利叶智能互联网大厂向机器人方向拓展谷歌腾讯字节跳动等自动驾驶新势力地平线等芯片算力数据等也非常重要云端算力如超算中心的芯片及服务器边缘端算力关注云天励飞仿真模拟数据等风险提示技术迭代进展不及预期算力投产速度不及预期安全隐私法规等政策风险测算不及预期本报告版权属于安信证券股份有限公司各项声明请参见报告尾页2行业专题传媒内容目录1安信智能科技研究框架62产业趋势机器智能模型系统迎来拐点行动系统蓄势待发63自动驾驶FSD有望迎来量产落地1231感知层进入4D重建占用网路阶段感知体系已较为成熟1432决策规划系高维非凸问题引入神经网络求解效率提升1833运动控制仅执行决策指令在工业上较为成熟2034数据及标注特斯拉领先之关键已建立强大自迭代体系2035算力自研芯片性能可期投产Dojo应对潜在增长需求244人形机器人产业链2641Optimus以FSD体系为基础指向人形对软硬件适配调整2642建立在智能驾驶体系之上人形机器人导入速度预计很快31421硬件架构无须破旧立新共享汽车零部件供应体系31422与智能汽车本质均为智能交互硬件复用算法模型及数据体系31423大模型加速智能驾驶方案迭代机器人大模型领域成果频出3243开放场景人形机器人相较于自动驾驶面对更多挑战34431特斯拉缺乏语言大模型能力需要补齐语料数据34432人形机器人运动控制具有极大难度35433对特斯拉自研算力提出更高的要求355预测人形机器人落地节奏及市场规模366投资建议387风险提示39图表目录图1安信传媒团队智能科技研究框架6图2陆奇提出的三位一体结构演化模式7图3全球互联网用户及对应渗透率7图4中国互联网用户及对应渗透率7图52016-2020年全球产生的数据量规模8图6从GPT-1到GPT-4的对比9图7商汤科技模型进化历程10图8视觉语言神经网络架构进化10图9具身智能指机器智能与物理世界交互反馈11图10特斯拉人形机器人的关键时间点12图11特斯拉自动驾驶架构13图12特斯拉算法迭代进程14图13特斯拉采用8颗摄像头采集车周围信息15图14特斯拉FSD感知算法流程图15图15特斯拉多头处理任务架构HydraNets16图16特斯拉针对尘雾场景进行模型训练16图17Transformer架构技术原理16图18早期BEV鸟瞰图为2D俯视角16图19特斯拉感知架构的演进17图20占用网络之体素分割17本报告版权属于安信证券股份有限公司各项声明请参见报告尾页3行业专题传媒图21占用网络构建步骤及输出17图22感知输出之动态障碍物18图23感知输出之车道线及路网18图24非凸问题优化18图25特斯拉采用交互搜索树进行决策规划19图26占用网络构建步骤及输出19图27特斯拉决策树剪枝方案19图28决策规划的输出轨迹19图29每个Clip数据集将通过算法标注输出空间信息20图302018-2023H1特斯拉车辆年度销量21图312018-2023H1特斯拉车辆累计销量21图32特斯拉FSDBeta版本覆盖的里程数据21图33仿真模拟的场景22图34Wayve利用AIGC生成仿真模拟环境22图35特斯拉数据流图23图36特斯拉数据仓库中包含大量多元数据24图37自动驾驶云端主要工作及关系24图38特斯拉D1芯片参数25图39特斯拉云端机柜DOJOPOD25图40特斯拉Dojo投产计划25图41智能机器人软硬件构成26图42特斯拉人形机器人外形参数27图43特斯拉人形机器人芯片及电池等参数27图44特斯拉人形机器人视觉传感器及感知占用网络27图45特斯拉人形机器人视觉导航系统28图46人形机器人采集运动控制数据28图47人形机器人的影子模式28图48人形机器人运动轨迹预测28图49人形机器人推倒测试29图50特斯拉人形机器人外形参数29图51特斯拉人形机器人芯片及电池等参数29图52特斯拉人形机器人外形参数30图53特斯拉人形机器人芯片及电池等参数30图54人形机器人与自动驾驶动力系统比对30图55特斯拉列举28种人类常见活动30图56特斯拉设计了6款执行器30图57汽车电子电气架构逐步从分布式走向集中31图582022年AIDay发布的特斯拉人形机器32图59为人形机器人编写跌倒测试软件32图60马斯克称将FSDv120版本将实现端到端33图61马斯克表示运动控制模块正在AI模型化33图62道路语义拓扑图33图63RT-2模型实现视觉-语言-动作三种模态对齐34图64中美自动驾驶分级标准36本报告版权属于安信证券股份有限公司各项声明请参见报告尾页4行业专题传媒图65智能机器人产业链39表12021-2022年中国各类互联网应用用户规模和网民使用率8表2CNNRNNTransformer优缺点对比9表3目前自动驾驶方案中主要的传感器对比14表4特斯拉历代FSD硬件版本26表5特斯拉汽车智能化发展阶段梳理36表6全球机器人销量37表72023-2030年人形机器人落地节奏及市场规模预测38本报告版权属于安信证券股份有限公司各项声明请参见报告尾页5行业专题传媒1安信智能科技研究框架当下我们正处于下一代计算平台构建成型的起点上以智能的真正实现为总纲技术维度的要素创新包括混合虚拟现实MR人机共生协同AI两个方向其中MR本质上是重构时空人机共生协同本质上是混合平台混合平台又包括不同的工程方案人形机器人以机器为智能载体脑机接口以人为智能载体工程方案理论上会有无穷多具象的工程方案探索严格意义上仍在初期目前仅基于视觉的技术探索但所有的工程方案都可以收拢到具体的技术路径中任何技术路径的目标是实现虚拟现实即模糊掉虚拟与现实之间的边界目前主流的技术路径为一是以AR的技术路径去实现但现阶段AR相关技术仍待攻克二是先VR再迭代至MR以VR作为过渡混合平台是智能实现的另一条技术路径如果将人的身体看作硬件智能的实现过程也是新智能交互硬件层出不穷旧硬件迭代甚至是重塑的过程因此未来的智能硬件不仅包括冷冰冰的电子器件本身也包括人类和电子器件之间不同程度的耦合即指向人机共生协同在这条技术路径上脑机接口与人形机器人是不同的工程方案即智能的实现分别以人机器人为载体图1安信传媒团队智能科技研究框架资料来源安信证券研究中心2产业趋势机器智能模型系统迎来拐点行动系统蓄势待发根据陆奇对于人工智能进化路径的理解人作为最成熟的通用智能体在处理外部环境时依次用到了信息系统模型系统行动系统分别获取数据信息分析处理信息并做出决策基于决策目标做出行动机器如果想要发展成为像人一样的通用智能体则也需要有这三个系统其演进的过程可以简单的概括为机器感知世界理解世界参与世界而前沿科技研究转化为生产力有一定的过程引发生产力大变革的拐点在于当应用这项技术的边际成本转化为某些特定公司固定成本时产业浪潮出现资料来源奇绩创坛我们认为这背后原因是当应用技术的边际成本转化为固定成本的时候行业可以发挥规模效应分摊技术成本且减少了重复资源浪费本报告版权属于安信证券股份有限公司各项声明请参见报告尾页6行业专题传媒图2陆奇提出的三位一体结构演化模式资料来源奇绩创坛安信证券研究中心回溯机器智能的进化史进行梳理互联网时代推动信息系统成熟化使得今天信息获取的成本极低模型系统正走过拐点大模型所带来的泛化能力使模型生产的边际成本下降转化为特定大公司如OpenAI背后的算力人才数据成本仍有待突破充满挑战的是行动系统的智能化1互联网时代推动信息系统成熟化机器能够感知人类世界现实物理世界的信息以各种形式存在如纸质的文字对话图像等机器如果需要和物理世界进行交互识别信息是第一步1995年进入互联网时代PC互联网的普及加速了信息的线上化使物理世界能够转化为机器可读取的信息目前物理世界的线上化率已经达到较高的水平体现为过去十年移动互联网发展进一步加速了用户上网率的提升截止2022年全球互联网用户规模为539亿相较于2013年增长925上网用户的渗透率达到6792022年中国互联网用户为1067亿较2013年增长7265中国上网用户的渗透率高于全球水平达到756图3全球互联网用户及对应渗透率图4中国互联网用户及对应渗透率全球互联网用户规模亿人渗透率中国互联网用户规模亿人渗透率60807307565175391270480465679645504314546561059641659660532558370556588503604033754484584793084644952804243039040640989103210672090447317728292061864968820102000020132014201520162017201820192020202120222013201420152016201720182019202020212022资料来源IWS安信证券研究中心资料来源CNNIC安信证券研究中心本报告版权属于安信证券股份有限公司各项声明请参见报告尾页7行业专题传媒互联网上覆盖了丰富多元的用户场景以中国互联网应用为例2022年网民使用率排名前五大的应用类别为即时通信网络视频短视频网络支付网络购物分别为972965948854792涵盖了通讯娱乐购物的用户需求此外线上办公网约车互联网医疗场景应用的网民使用率也分别达到了506409396也体现出用户生活的全面线上化趋势表12021-2022年中国各类互联网应用用户规模和网民使用率20212022用户规模应用用户规模万网民使用率用户规模万网民使用率同比增长率即时通信10066697510380797231网络视频9747194510305796557含短视频短视频9341590510118594883网络支付903638769114485409网络购物842108168452979204网络新闻771097477832573416网络音乐7294670768420641-62网络直播703376827506570367网络游戏5535453652168489-58网络文学5015948649233461-18网上外卖5441652752116488-42线上办公4688445453962506151网约车4526143943708409-34在线旅行预订397103854227239665互联网医疗2978828936254340217线上健身--37990356-资料来源CNNIC安信证券研究中心用户规模增长及线上用户场景的多元化也在推动数据量的快速增长从而提供了海量的信息供机器进行学习根据Statista给出的数据2016-2020年全球产生的数据量依次是18ZB26ZB33ZB41ZB47ZB数据量增长的复合增速是2711我们认为随着各类应用的用户使用率提升未来全球产生的数据量规模也将加速增长图52016-2020年全球产生的数据量规模全球产生的数据量规模ZB50474140333026182010020162017201820192020资料来源Statista安信证券研究中心2大模型展示出泛化能力模型系统正走过拐点机器能够理解人类世界得益于数据算力滋养神经网络模型能力逐步显现行业主流模型从CNNRNN走向Transformer2006年提出深度学习算法后神经网络结构经历了RNNCNN等几代的进化在视觉领域取得了非常显著的突破2014年3月香港中文大学多媒体实验室自主研发的DeepID系列面部识别算法准确率达到9852在全球范围内首次超过人眼识别准确率突破工业应用的红线因为语序对于语义理解很重要而不同语言间语序的重心又有所不同因此在小模型阶段CNNRNN算法在语言模型并未取得显著进步因此这一阶段人工智能技本报告版权属于安信证券股份有限公司各项声明请参见报告尾页8行业专题传媒术的突破主要体现在计算机视觉领域2016年AlphaGo打败世界围棋冠军李世石进一步引爆了人工智能的浪潮推动人工智能应用在金融安防等场景的渗透率提升及全球人工智能创业热潮但这一阶段均为小模型需要针对不同场景重新标注数据对模型进行训练人工标注成本较高且模型泛化能力较差导致拓展项目边际成本较高而收入增长速度缓慢2017年谷歌在论文AttentionIsAllYouNeed中提出了Transformer架构Transformer架构基于自注意力机制通过赋予权重能够并行化处理序列间关联关系在自然语言处理领域中得到了广泛的应用如机器翻译文本分类和生成模型等表2CNNRNNTransformer优缺点对比CNNRNNTransformer局部连接权值共享的卷具有循环连接的结构如模型结构基于自注意力机制的结构积结构LSTMGRU等具有较强的建模能力适用对局部特征提取能力强适用于处理序列数据能够特征表示能力于处理序列图像等多种数适用于图像语音等领域捕捉序列信息的演化过程据形式训练效率高可并行化处训练效率相对较低难以并训练效率较高可并行化处训练效率理行化理模型结构相对简单参数模型结构相对复杂参数较模型结构较为复杂参数较模型复杂度较少不适用于处理序列多多数据对数据噪声变形等鲁棒对数据噪声变形等具有一对数据噪声变形等具有较鲁棒性性一般定的鲁棒性强的鲁棒性应用场景图像识别视觉任务语音识别自然语言处理自然语言处理图像处理适用但难以处理非常长的适用能够高效地处理非常长序列建模不适用序列长的序列并行计算适用不适用适用参数量较少较少较多训练数据需求高较高高对位置信息敏感不敏感敏感敏感泛化能力一般一般良好资料来源智东西陈巍团队安信证券研究中心GPT系列模型提出预训练-微调的模式表明训练模型具备规模效应OpenAI在Transformer架构的基础上又进一步提出GPT模型其突破在于训练时采用预训练-微调的模式先采用大量无标注的语料预训练语言模型然后对预训练好的语言模型进行微调将其迁移到有监督学习的任务上我们认为这种模式所产生的价值在于提供了将训练模型的边际成本转化为固定成本的模型架构针对更底层通用的能力抽取出来训练大模型共担成本而针对特定场景的部署只需要少量数据就能够进行训练从而体现出规模效应的可行性图6从GPT-1到GPT-4的对比资料来源智东西陈巍团队安信证券研究中心本报告版权属于安信证券股份有限公司各项声明请参见报告尾页9行业专题传媒从GPT-3开始表现出涌现能力大模型不仅具备规模效应还产生了能力跃迁随着模型参数增加及语料库的丰富到GPT-3上模型参数达到1750亿模型开始体现出涌现能力即不仅体现出训练成本的规模效应还带来模型能力的增加这推动了学术界产业界对于大模型的追捧比如谷歌的BERT智源悟道百度文心华为盘古阿里达摩院M6等大模型GPT系列模型取得的成果给计算机视觉模型也带来了很多启发被用于图像分类图像切割等领域例如商汤目前拥有320亿参数的视觉大模型是亚洲最大的视觉大模型之一数据来源商汤公司公众号图7商汤科技模型进化历程资料来源商汤公众号安信证券研究中心GPT-4实现多模态能力感知能力极大提升GPT-1到GPT-35均为语言大模型GPT-4增加了视觉模型并实现了语言与视觉跨模态信息的对齐类似于人类认知世界时眼睛看到的图像信息会帮助我们加深对事物的认知而反过来因为具备认知能力看到不认识的事物时也能知道其功能会提升视觉识别信息的能力因此多模态能力的建立帮助机器提高了感知能力并为复杂场景中的决策规划打好了基础进而机器能够发挥计算优势给出更好的行动方案图8视觉语言神经网络架构进化资料来源智东西陈巍团队安信证券研究中心3基于信息-模型系统行动系统到来有望加速机器智能参与人类世界指向行动系统我们把执行操作的场景分解为物理世界与数字世界本报告版权属于安信证券股份有限公司各项声明请参见报告尾页10行业专题传媒在数字世界体现为机器基于特定目标自主完成任务并且自我迭代对应于当前研究热度较高人工智能代理Agent目前已经出现的产品包括Auto-GPTBabyAGIAgentGPTMicrosoftJarvisChaosGPT等在物理世界交互需要借助相应的躯体由此引出具身智能的概念具身智能指智能体可以是生物或机械通过与环境产生交互后通过自身的学习产生对于客观世界的理解和改造能力自动驾驶智能机器人等即为典型的智能硬件产品在实际生活中已经出现了很多机器人如工业场景的码垛机器人搬运机器人商业服务场景的送餐机器人等我们认为其与智能硬件的区别在于传统机器人是基于固定坐标系进行特定执行操作的机器人并不具备实时感知能力传统机器人若想要向智能机器人升级其优势在于执行控制模块具有优势积累需要补足感知及决策模块图9具身智能指机器智能与物理世界交互反馈资料来源奇绩创坛安信证券研究中心特斯拉人形机器人是目前最激进的智能硬件且产品迭代速度很快与现有机器人不同特斯拉人形机器人以自动驾驶FSD为支撑实时获得环境信息并进行决策规划最终输出行动指令形成了感知-决策规划-运动控制的实时交互反馈机制为了增强机器人的普适性将其设置为人形是因为现实物理世界是基于人的视角交互习惯所设置的采用人形能够用第一视角理解环境场景从2021年8月特斯拉在其首届AIDay上首次公开展示人形机器人的概念机TeslaBot至今其研发迭代速度非常快2021年8月首届AIDay公开展示人形机器人概念机TeslaBot2022年2月推出人形机器人原型机并作为开发平台进行深度研发2022年8月第二届AIDay展示实体版本人形机器人可以直立行走浇花搬运东西等但灵活度相对较低上下舞台时需要一定的人员协助2023年5月特斯拉2023年投资者大会发布人形机器人最新研发进展其已经学会了缓慢前行本报告版权属于安信证券股份有限公司各项声明请参见报告尾页11行业专题传媒图10特斯拉人形机器人的关键时间点资料来源特斯拉官网安信证券研究中心机器人潜在应用场景空间广阔在2022年特斯拉的AIDay上马斯克提出特斯拉机器人最初的定位是替代人们从事重复枯燥具有危险性的工作但远景目标是让其服务于千家万户比如做饭修剪草坪照顾老人等随着硬件成本下降有望推动用户需求增长我们认为推驱动用户买单的主要原因包括但不限于劳动力成本上涨劳动力短缺安全考虑等此外由于涉及的场景较为广泛我们判断除了人形机器人外未来可能还会衍生出更多不同形状的智能硬件其核心在于实时感知与交互性而外在躯体的样式可以根据所处场景进行适配采用不同的执行器可以预见机器人未来的市场空间非常广阔一旦人形机器人落地行动智能系统产业化拐点或将加速到来从软件层面看参考人是目前最强大的通用智能体人形机器人的算法难度最高若算法能在人形机器人上实现向其他场景泛化本质上是降维其次从硬件层面执行器等零部件若能共用产线会因为量产规模的增加而带来单个零部件的成本下降因此综上我们认为人形机器人达到一定成熟度后面向不同场景需求而研发具有行动系统的智能交互硬件的边际成本也将显著下降从而推动产业化浪潮的加速来临3自动驾驶FSD有望迎来量产落地特斯拉人形机器人的软件算法建立在自动驾驶所积累的数据算法架构基础之上由于目前官方披露人形机器人的算法相关数据相对较少我们将先以自动驾驶FSD算法为基础进行原理的解释进而说明人形机器人与整车算法的不同来帮助理解人形机器人算法研发所处阶段参考前述三位一体结构化模式自动驾驶方案主要有感知决策规划运动控制三个模块其中感知层相当于自动驾驶的眼睛帮助汽车理解所处的外部环境感知模型的输出是基础建立在准确可靠的感知输出结果上决策规划模型相当于大脑对自车及周边环境轨迹进行预测通过打分机制筛选出最优运动轨迹输出给运动控制模块获得行动轨迹后运动控制模块将其分解为方向转向行车速度等操作指令将其传输给方向盘油门刹车等执行器进行操作最终实现对汽车的控制而运动控制一旦发生必然产生空间位移这需要感知模型实时获取空间位移信息变化重新评估决策形成正向反馈在上述处理流程中数据算力发挥重要支撑作用本报告版权属于安信证券股份有限公司各项声明请参见报告尾页12行业专题传媒图11特斯拉自动驾驶架构资料来源特斯拉2022AIDay安信证券研究中心特斯拉自动驾驶自研方案经历四次重要迭代当前形成了BEVTransformer时序信息占用网络的核心架构特斯拉自动驾驶方案早期由供应商Mobileye提供2016年双方终止合作后特斯拉经历了与英伟达短暂合作后转向全栈自研从技术落后到引领行业发展特斯拉的技术方案主要经历了以下四次关键的技术迭代升级2018年构建了多任务学习神经网络架构HydraNet相较于此前单一目标检测遵循一个通用的网络结构HydraNet能够完成多头共用的任务减少重复计算2020年特斯拉团队对底层代码进行重写及网络重构引入了Transformer的架构将2D图像复原至3D视角使得自动驾驶方案环境感知的能力有了质的飞跃BEVTransformer的架构解决了行车过程中大多数共通的场景但驾驶的安全性仍受到很多长尾场景的挑战2021年至今特斯拉BEVTransformer架构输出的3D空间基础上使用视频信息作为训练模型的数据集引入了时序信息使3D空间转化为4D空间这样能够很好的解决物体行人被遮挡的场景2022年AIDay上特斯拉引入了占用网络环境中的物体无法用模型穷举实现识别占用网络通过将空间分割为体积不等的体素预测其是否被占用从而解决通用障碍物的识别的问题本报告版权属于安信证券股份有限公司各项声明请参见报告尾页13行业专题传媒图12特斯拉算法迭代进程资料来源汽车之心36Kr安信证券研究中心31感知层进入4D重建占用网路阶段感知体系已较为成熟在自动驾驶传感器领域一直分为视觉派和雷达派两大派系最简单的区别就是前者主张使用高清摄像头视觉识别算法后者主张除摄像头外再加入激光雷达超声波雷达毫米波雷达等感知硬件提高信息冗余以保证系统稳定表3目前自动驾驶方案中主要的传感器对比摄像头毫米波雷达激光雷达超声波雷达向目标发射探测信号通过摄像头拍摄车辆周激光束然后将接边场景并以此来识别把无线电波雷达波超声波雷达是通过超声收到的从目标反射回来车辆行人行车线等的电磁波发射出去根波发射装置向外发出超的信号与发射信号进行原理传感器从拍摄到的影据接收回波与发送之间声波再利用接收器接比较作适当处理后像可以检测出车辆及车的时间差测得目标位置收反射回来的超声波时就可获得距离方位灯行车道的白线及标距离数据间差来测算距离高度速度姿态甚识行人及自行车等至形状等参数探测距离0-200m01-3m雾烟灰尘穿透能力容易受天气情况影响强具有全天候全天时分辨率高隐蔽性好不同天气的传播速度不优点成本较低的特点抗干扰反隐抗干扰能力更强等同车速较快时误差较身能力更优大高潮湿环境产生衰减成本高加工精度相对车规级产品难度高成成本低穿透性强防缺点依赖算法能力要求高单片收发集成本高寿命短水防尘等优势电路的开发相对迟缓资料来源维科网安信证券研究中心特斯拉坚持第一性原理是视觉派的坚定拥护者特斯拉认为就像人只需要眼睛和大脑就可以完成对周围环境的感知一样自动驾驶也只需要借助摄像头和算法就能够实现这样的能力早期由于算法能力不足特斯拉传感器套件中除了八个摄像头外还包括一个前置雷达和车辆周围的几个超声波传感器2021年特斯拉宣布向TeslaVision方案过渡从2022年10月上旬开始特斯拉为北美欧洲中东和中国台湾制造的所有Model3和ModelY不再使用超声波传感器而是完全依赖TeslaVision来实现自动驾驶功能当前特斯拉车上共有8颗摄像头分别分布在左右前翼子板各1个左右B柱各1个后牌照上方各1个前挡风玻璃后各3个8颗摄像头视野范围达到360度对周围环境的监测距离最远可达250米每个摄像头采集分辨率为128096012-Bit36Hz的RAW格式图像作为信息输入本报告版权属于安信证券股份有限公司各项声明请参见报告尾页14行业专题传媒图13特斯拉采用8颗摄像头采集车周围信息资料来源特斯拉官网公众号智能车参考安信证券研究中心上述摄像头捕捉到的视觉信息作为感知层的输入经过一系列神经网络的处理将输出4D向量空间其操作步骤依次如下1相机校准对摄像头采集信息进行色温位移的校准调整为标准虚拟相机数据做校正变换后之前模糊的图像会变得清晰2通过RegNetBiFPN两个神经网络结构提取单视角图像特征3利用Transformer架构及占用网络对单视角特征进行转换及三维重建包括先将为每个相机对应的图像特征转换为Key和value再进行表搜索找到关联关系进行空间拼接之后根据摄像头IMU等传感器采集的时序特征进行时空联合对齐最终转化4D空间包含空间中的xyz坐标及时间t之后会采用反卷积的方式将其对应到8个摄像头中若存在偏差则继续修正重建效果图14特斯拉FSD感知算法流程图资料来源特斯拉2022AIDay安信证券研究中心在上述感知操作的流程中我们强调三个关键的技术1HydraNets共用主干网络模型训练边际成本低使业务拓展性强特斯拉视觉感知网络的基础结构是由主干Backbone颈部Neck与头部Head共同组成早期在图像检测任务中特斯拉针对每个任务都设计了一套神经感知网络分别由各自的backbone-neck-head构成2019年对架构进行调整提出多头任务处理架构HydraNets简称九头蛇网络这种架构是将主干网络合并由一个共同共享的主干并分支成多个头与本报告版权属于安信证券股份有限公司各项声明请参见报告尾页15行业专题传媒此前的架构相比其好处在于可以避免不同任务间重复计算提高运行效率拓展性极强当需要优化的新场景出现只需要针对其特定的需求进行单独微调既不影响现有任务运行同时也能有效降低新业务研发的边际成本比如针对大车开过会带起尘雾的场景特斯拉会用自己的车队采集特殊场景数据进行训练后加载Head部分即可图15特斯拉多头处理任务架构HydraNets图16特斯拉针对尘雾场景进行模型训练资料来源特斯拉2022AIDay安信证券研究中心资料来源特斯拉2022AIDay安信证券研究中心2Transformer架构推动感知从2D视角走向4D重建提高感知效率与可靠性Transformer架构优势是使用注意力机制处理输入和输出之间的依赖关系通过赋予权重找到关联关系特斯拉2020年将Transformer引入感知模型2020年特斯拉AIday上介绍展示了如何将检测到的物体可驾驶空间和其他物体放入BEV鸟瞰图中实现了环境感知从局部到整体的统一对齐早期受限于数据质量算力等诸多因素BEV的输出仍为2D俯视图与车所面临的3D物理空间中还是存在很大的不同进而产生很多问题比如无法估计物体的高度以及在高度方向上如有多个障碍物可能检测不到等随着数据算力等综合能力的提升Transformer架构能够处理参数量及数据量增加帮助BEV鸟瞰图从2D俯视图升级为3D空间更进一步地由于坐标系相同还可以进行时序融合形成4D空间图17Transformer架构技术原理图18早期BEV鸟瞰图为2D俯视角资料来源论文AttentionIsAllYouNeed安信证券研究中心资料来源特斯拉2020AIday安信证券研究中心Transformer架构完成了从摄像头捕捉的2D信息向4D向量空间的转换使感知可靠性标注效率大幅提升早期特斯拉在感知层做标注时是基于单张2D图片进行标注这种情况下标注误差很大比如在图片中标注远处车道线时可能会出现位置偏移从而导致汽车行驶过程转弯时间预估不准确或者压线等情况出现在依托Transformer重建的4D空间下所带来的好处是1降低标注误差4D空间相较于2D单视角图像对空间的认知更加全面而且在被数学表示的空间对于长度速度等环境信息的认知更具体2提高标注效率在4D向量空间中可以对建模后的场景进行拖拽旋转等数字化的操作为自动标注打好了基础从而提高标注效率根据特斯拉披露信息2021年后在重建好场景中对单个clip进行标注的本报告版权属于安信证券股份有限公司各项声明请参见报告尾页16行业专题传媒平均时间小于01hrs对单个clip计算的平均时间为05hrs相较于早期的图像标注效率有了大幅提高图19特斯拉感知架构的演进资料来源特斯拉2022AIDay安信证券研究中心3占用网络解决通用障碍物识别问题为安全兜底特斯拉在2020-2022年围绕4D空间重建取得的进步为占用网络的实现带来了可能性只用网络指预测汽车周围所有物体的体积占用率即将世界划分为一系列3D网格单元也被称为体素后预计3D空间中的每个体素或连续点都有被占用的概率以及它的未来运动2022CVPR及AIday上特斯拉对占用网络OccupancyNetwork进行了详细的介绍其实现的关键包括在提取图像特征后利用transformer机制计算得出3D空间的占据体积概率定义哪个单元被占用哪个单元是空闲的在获得空间占用情况后再结合里程计信息融合时序信息构建4D向量空间对于单个物体而言网格单元的大小可以被调整以保证尽可能多地包裹到所有的物体4D空间中除了反映空间占用情况外还用不同的颜色表示物体的速度方向等信息若物体之间若存在关系还有一条有语义信息的边基于4D空间所描述的特征及预测的轨迹方向最终输出occupancyVolume及动态的occupancyflow图20占用网络之体素分割图21占用网络构建步骤及输出资料来源特斯拉2022AIday安信证券研究中心资料来源极术社区安信证券研究中心占用网络帮助特斯拉解决了通用障碍物识别的问题增强了自动驾驶的安全性在行驶的道路上会遇到许多cornercase其中可能包含很多数据库中并不存在的物体比如侧翻的大本报告版权属于安信证券股份有限公司各项声明请参见报告尾页17行业专题传媒卡车等基于视觉感知的方案因无法获取其信息而决策失误发生事故在占用网络下类似情况会将其标注为空间占用并根据感知信息为其赋予速度等值根据以上信息车便能进行做出避让等操作因此我们认为占用网络是对数据库之外的信息识别的有效补充进而为安全兜底经过上述感知过程特斯拉感知模块最终有三个输出分别是占用网络车道线Lane及障碍物信息objects得益于特斯拉大量的细节工作输出的结果质量好精度高其将作为决策规划的输入决定了后续工作的高度图22感知输出之动态障碍物图23感知输出之车道线及路网资料来源特斯拉2022AIDay安信证券研究中心资料来源特斯拉2022AIday安信证券研究中心32决策规划系高维非凸问题引入神经网络求解效率提升自动驾驶问题是高维度空间中的非凸问题求解最优路径挑战很大自动驾驶决策规划模块需要解决的问题是在接收到感知模块输出后在其所重建好的空间中找到一条轨迹可以最大限度地提高汽车的安全性舒适性和效率将车辆规划至目的地因此其本质是找到一条满足约束的最优路径如果用数学方法求解自动驾驶的规划求解是在高维空间中解非凸问题求解后得出的最优解可能只是局部最优但考虑到安全问题自动驾驶决策规划必须要尽可能达到全局最优资料来源42号车库详解特斯拉是如何做决策规划算法的图24非凸问题优化资料来源42号车库安信证券研究中心特斯拉决策规划的工作可以简单的理解为两部分工作一是通过决策树生成潜在路径二是通过打分机制对决策树剪枝找到最优路径在决策树生成时特斯拉参考蒙特卡洛模拟生成了交互树其生成是由粗到细的1在感知输出的占用网络车道线车道拓扑关系基础上粗生成行驶目标给出车可能到达的车道线本报告版权属于安信证券股份有限公司各项声明请参见报告尾页18行业专题传媒及行驶区域2利用传统优化算法生成可能到达目标的行驶路径3动态博弈考虑t1t2等时间内与周边障碍物的交互博弈继续生成新的轨迹模型被引入决策树生成显著缩短规划路径生成时间在决策树生成的过程中特斯拉以数学优化为主特斯拉针对优化求解进行了诸多工程上的优化以缩短决策规划时间能够在1-5ms内完成计算但是如若面对更复杂的城市场景中可能仍无法满足需求2022年AIDay特斯拉介绍在生成网络时使用了轻量化的神经网络帮助快速生成规划路径标志着模型被引入了决策规划中在模型助力下目前可以在100us内生成一个候选规划路径图25特斯拉采用交互搜索树进行决策规划图26占用网络构建步骤及输出资料来源特斯拉2022AIday知乎石桥安信证券研究中心资料来源特斯拉2022AIDay安信证券研究中心决策树剪枝是第二步在有限的时间内完成响应需要拒绝掉一些偏差较大的方案特斯拉也同样运用了传统优化方法及数据驱动下的神经网络模型结合的方式其评价的维度主要包括了碰撞可能性舒适度分析类人程度被接管的概率等基于这些评分维度最终筛选出最优的规划轨迹作为决策规划的输出综上特斯拉的决策规划方案在解决自动驾驶高维非凸问题上是结合了优化与神经网络的算法如何平衡决策效率与安全性是当前决策规划任务的关键挑战其中采用优化求解是建立在工程师可解释的人类驾驶规则上进行编码保证了算法的可解释性相对更安全可控而结合神经网络计算是为了提高生成及筛选最优轨迹的效率同时也能对不可建模的驾驶经验进行建模从而推动自动驾驶走向更类人化的步骤但由于模型是黑盒具有不可解释性在安全失误率容忍度极低的驾驶场景的应用仍较为谨慎决策规划输出的轨迹体现在特斯拉中控屏幕上为长度方向变化的指示线其本质上包含了目标位置方向速度及加速度等信息这些信息被拆解为执行指令作为运动控制模块的输入进一步给到执行器图27特斯拉决策树剪枝方案图28决策规划的输出轨迹资料来源特斯拉2022AIDay安信证券研究中心资料来源特斯拉官网安信证券研究中心本报告版权属于安信证券股份有限公司各项声明请参见报告尾页19行业专题传媒33运动控制仅执行决策指令在工业上较为成熟当决策规划模块输出轨迹后由于其本身包含了方向速度加速度等信息进一步地分解为具体的指令会交给域控制器MCU调用执行器进行操作在运动控制方面其承担的主要角色是做执行操作这里主要是传统的工控软件在行业内都比较成熟并不涉及特别多AI算法因此本文在此不做展开34数据及标注特斯拉领先之关键已建立强大自迭代体系从上述感知-决策规划-运动控制三个模块的方案介绍中我们可以看到数据是重要的原料如何得到大量便宜且优质的数据对模型训练和结果输出都起到关键作用特斯拉自动驾驶方案的数据源包括车辆采集数据仿真数据影子模式三种其中1自车辆采集数据是特斯拉自有车队及量产出售给用户的车辆上的摄像头实时采集的数据是特斯拉训练模型的主要数据来源2仿真模拟数据是为了补充通过车端摄像头所无法采集到的长尾数据以尽可能补全模型训练时所可能遇到的场景3影子模式指特斯拉的自动驾驶模型部署到车端后在后台运行其执行输出与驾驶员操作时的不一致数据这部分数据作为很珍贵的异常数据用于为模型纠偏帮助模型训练结果更加类人数据来源一车辆采集数据车辆采集数据以Clip作为最小标注单元在感知部分我们详细介绍了特斯拉车上的8颗摄像头所采集的视觉数据该数据通常为一段45-60s的视频格式的路段数据除了摄像头视觉传感器之外车上还包括惯性测量单元IMUGPS里程计等传感器其中IMU是负责測量物体在三維空間中的角速度和加速度並以此解算出物体的姿态主要用以保持平衡GPS用于导航定位里程计是用于测量汽车的速度加速度信息综上摄像头IMUGPS里程计等传感器采集的数据会构成一个最小标注单元被成为Clip每个Clip数据都经过RegNetBiFPN提取图像特征进行特征融合结合位置速度加速度以及时序特征等信息用于实现将自身所处的物理世界转化至4D空间中进而通过标注分解出静态路网与动态障碍物等感知任务的结果用于后续输出图29每个Clip数据集将通过算法标注输出空间信息资料来源特斯拉官网安信证券研究中心与需要自建车队装配昂贵的激光雷达雇佣工程师驾驶车辆采集数据的自动驾驶团队不同Tesla依靠实际卖出的车辆采集数据不但获取车辆销售利润还能依靠特斯拉车主来采集数据2018年至今特斯拉每年车的销量持续提升其中2022年2023H1的销量分别为12471台8591万台分别同比增长40345742截止2023年6月底特斯拉售出的车辆累计达到43551万辆本报告版权属于安信证券股份有限公司各项声明请参见报告尾页20
|
相关行业报告
|
||||||||||||||||||||||||||
