>> 中信建投-人工智能行业机器人智能化三部曲(二):Meta及微软篇-231016
| 上传日期: |
2023/10/17 |
大小: |
5095KB |
| 格式: |
pdf 共26页 |
来源: |
中信建投 |
| 评级: |
-- |
作者: |
阎贵成,金戈,于芳博 |
| 下载权限: |
此报告为加密报告 |
|
|
核心观点:随着各项人工智能技术的不断发展,具备与物理世界交互潜力的智能机器人成为学界和业界的重要研究赛道。近年来Meta、微软均持续完善其机器人模型领域的布局。2023年8月,Meta推出在少量训练数据情况下便能取得优异表现的MT-ACT模型。2023年2月微软推出基于ChatGPT的机器人控制框架,将ChatGPT的“知识储备”落实到现实场景中。机器人模型发展百家争鸣,值得进一步关注。 从R3M到MT-ACT,Meta持续探索如何使用有限的数据集实现更优秀的机器人控制。在2022年3月推出的R3M模型中,Meta首次引入人类视频数据作为机器人控制模型的知识来源,提升机器人模型训练效率。在2022年12月推出的CACTI模型中,使用数据增强技术实现了训练数据规模高效扩充。2023年8月推出的MT-ACT模型将数据增强技术(基于SAM视觉模型)和动作序列生成技术结合,在7500个原始训练数据的情况下,在不同难度的测试中分别实现了81.67%、65.17%、31.33%的成功率,小规模数据表现优于其他可比模型。 将强化学习与MoE技术融合,Meta推出机器人控制模型新方案ASC。在2023年4月推出的ASC模型中,先通过强化学习分别对单一任务进行训练,再通过MoE技术实现不同技能模块之间的有机协同,在模拟场景和两个现实场景中分别实现了94.9%和96.7%/100%的成功率,并且具备较强的抗干扰能力,能够在环境变化的情况下自动调整完成相关任务的方式。通过将更强的OWL-ViT视觉模型与ASC模型结合,模型可以根据文本描述来识别更为复杂的物体,有望在更广泛的场景中处理更为复杂的任务。 Meta:机器人模型与谷歌有所差异。谷歌的技术路线在本系列第一篇中有详细描述,而Meta目前工作中尚未将大模型与机器人控制所结合,且相较谷歌尝试利用大规模的数据集提升机器人模型的表现,Meta的相关工作更加关注如何基于小规模的数据,结合数据增强、人类视频数据预训练等方式实现通用机器人控制模型的构建,即数据效率方面的提升。 微软:结合自然语言能力,微软提出面向机器人控制领域的新框架。2022年8月推出的机器人轨迹控制模型LATTE,可以识别用户的自然语言输入调整机器人的运行轨迹。2023年2月发表文章“ChatGPT for Robotics”,其核心在于通过大语言模型(ChatGPT)来处理用户指令,进而调用相应的机器人控制API来完成具体的任务。在演示中,经过进一步学习的ChatGPT模型在仅有自然语言输入的情况下,可以控制机器人利用不同颜色的方块拼接出微软Logo。 风险提示 算力发展不及预期:机器人模型的训练和推理对算力有着较高需求,若后续算力发展不及预期则会影响机器人大模型的迭代和发展。 机器人模型技术发展不及预期:机器人模型属于先进AI算法,若后续机器人模型算法更新迭代效果不及预期,则会影响机器人模型演进及拓展,进而会影响其商业化落地等。 数据数量与数据质量不及预期:机器人模型需要大量的高质量数据进行训练,若数据数量和质量存在短板,则会影响模型效果。 机器人大模型研发竞争激烈:美国科技大厂纷纷入局机器人模型研发,相关产品表现出了很强的竞争力,机器人模型研发竞争越发激烈。
研究报告全文:证券研究报告行业动态报告机器人智能化三部曲二Meta微软篇分析师阎贵成分析师金戈分析师于芳博yanguichengcsccomcnjingecsccomcnyufangbocsccomcnSAC编号S1440522030001SAC编号S1440518040002SAC编号S1440517110001SFC中央编号BNS315SFC中央编号BPD352发布日期2023年10月16日本报告由中信建投证券股份有限公司在中华人民共和国仅为本报告目的不包括香港澳门台湾提供在遵守适用的法律法规情况下本报告亦可能由中信建投国际证券有限公司在香港提供同时请务必阅读正文之后的免责条款和声明核心观点核心观点随着各项人工智能技术的不断发展具备与物理世界交互潜力的智能机器人成为学界和业界的重要研究赛道近年来Meta微软均持续完善其机器人模型领域的布局2023年8月Meta推出在少量训练数据情况下便能取得优异表现的MT-ACT模型2023年2月微软推出基于ChatGPT的机器人控制框架将ChatGPT的知识储备落实到现实场景中机器人模型发展百家争鸣值得进一步关注从R3M到MT-ACTMeta持续探索如何使用有限的数据集实现更优秀的机器人控制在2022年3月推出的R3M模型中Meta首次引入人类视频数据作为机器人控制模型的知识来源提升机器人模型训练效率在2022年12月推出的CACTI模型中使用数据增强技术实现了训练数据规模高效扩充2023年8月推出的MT-ACT模型将数据增强技术基于SAM视觉模型和动作序列生成技术结合在7500个原始训练数据的情况下在不同难度的测试中分别实现了816765173133的成功率小规模数据表现优于其他可比模型将强化学习与MoE技术融合Meta推出机器人控制模型新方案ASC在2023年4月推出的ASC模型中先通过强化学习分别对单一任务进行训练再通过MoE技术实现不同技能模块之间的有机协同在模拟场景和两个现实场景中分别实现了949和967100的成功率并且具备较强的抗干扰能力能够在环境变化的情况下自动调整完成相关任务的方式通过将更强的OWL-ViT视觉模型与ASC模型结合模型可以根据文本描述来识别更为复杂的物体有望在更广泛的场景中处理更为复杂的任务Meta机器人模型与谷歌有所差异谷歌的技术路线在本系列第一篇中有详细描述而Meta目前工作中尚未将大模型与机器人控制所结合且相较谷歌尝试利用大规模的数据集提升机器人模型的表现Meta的相关工作更加关注如何基于小规模的数据结合数据增强人类视频数据预训练等方式实现通用机器人控制模型的构建即数据效率方面的提升微软结合自然语言能力微软提出面向机器人控制领域的新框架2022年8月推出的机器人轨迹控制模型LATTE可以识别用户的自然语言输入调整机器人的运行轨迹2023年2月发表文章ChatGPTforRobotics其核心在于通过大语言模型ChatGPT来处理用户指令进而调用相应的机器人控制API来完成具体的任务在演示中经过进一步学习的ChatGPT模型在仅有自然语言输入的情况下可以控制机器人利用不同颜色的方块拼接出微软Logo11科技巨头加速布局智能机器人Meta持续推进机器人模型发展近年来Meta一直是AI领域不可忽视的力量前沿研究如CV领域的SAM模型NLP领域的LLaMa均是相关领域的最前沿技术之一在机器人模型领域Meta也已经展开了较为完善的布局提出了一些卓有成效的改进策略如数据增强动作序列生成等相关模型如R3MCACTIASCMT-ACT等其他领域的核心突破如SAM模型也应用到了其中本文将回顾Meta近年来在机器人模型领域的核心进展梳理其中的发展脉络图Meta机器人模型相关进展时间轴沿用视觉处理部分架构202212沿用数据增强思路20238CACTI使用数据增强扩充了训练数据规MT-ACT基于小规模的数据集结合数据增强作为预训练基础模型模并提升了模型的性能表现和动作序列生成实现较高质量的机器人控制SegmentAnythingSAM作为数据增强的工具20234ASC将强化学习与MoE技术融合以处20223理复杂的多任务场景R3M引入人类视频数据作为机器人控制模型的知识来源沿用动作序列生成部分20234ACT机器人动作序列生成的Transformer20222023资料来源Meta官网谷歌学术中信建投121R3M基于人类视频数据的预训练机器人模型Meta及斯坦福大学的研究人员在2022年3月推出了基于人类第一视角数据训练的机器人预训练模型R3M核心突破研究了一种在人类视频数据上进行机器人控制模型预训练的方法提升了机器人控制模型的性能效率和可用训练数据范围通过时间对比学习视频-语言对齐等方法来充分学习视频中的视觉信息构建出预训练模型作为后续任务的基础训练数据集使用了Ego4D的人类第一视角视频数据集包含共3500多小时的数据数据集中的视频来自全球70多个地方具体任务包括有烹饪社交组装物品等每个视频片段由参与者一次佩戴头戴式摄像头长达10小时并拍摄无脚本日常活动收集而来其中还包含视频中人物行为的自然语言注释图Ego4D数据集图R3M模型架构构建出预训练模型可以用于后续训练对比学习帧之间的变化学习语言指令和视频操作资料来源R3MAUniversalVisualRepresentationforRobotManipulation中信建投122R3M基于人类视频数据的预训练机器人模型在模拟场景中经过进一步演示的R3M模型能够整体以62的成功率完成12项不同的操作任务相较于其他预训练方法实现了10的提升如下左图绿色黄色蓝色柱形所示相较于不预训练的方法提升20如下图如下左图粉色柱形所示在现实场景中在每个任务经过20次演示的条件下R3M方法的成功率相较于CLIP方法的成功率实现明显提升整体成功率为56高出32同时在关抽屉推杯子等较为简单的任务中具有成功率较高我们认为相较于性能提升R3M将人类视频数据带入机器人模型训练领域更为重要可能成为机器人模型数据缺乏的解决方案之一图模拟场景中R3M模型的性能表现情况图现实场景中R3M的示例及性能表现情况10次尝试中的成功率资料来源R3MAUniversalVisualRepresentation其他预训练方法不预训练forRobotManipulation中信建投131CACTI可扩展的多任务多场景视觉模仿学习框架Meta哥伦比亚大学及卡耐基梅隆大学的研究人员在2022年12月推出了可扩展的多任务多场景视觉模仿学习框架CACTI阶段1数据收集现实场景通过人类演示收集了10个任务共1000个片段模拟场景通过强化学习智能体收集了18个任务共900个策略阶段2数据扩充通过不同的策略对专家示范数据进行增强进而实现数据集的扩充例如针对模拟的900个策略共生成了45000个片段阶段3数据压缩将扩充后的数据集中的视觉数据压缩成向量阶段4训练利用上述环节得到的不同任务数据训练出统一的控制策略图CACTI模仿学习框架数据增强阶段通过不同的策略对专家示训练阶段利用前置环节得到的任务范数据进行增强实现数据集的扩充数据训练出统一的多任务控制策略数据收集阶段在现实场景模拟场景中收集相关任务的专家示范数据数据压缩阶段将扩充后的数据集中的视觉数据压缩成向量资料来源CACTIAFrameworkforScalableMulti-TaskMulti-SceneVisualImitationLearning中信建投132CACTI可扩展的多任务多场景视觉模仿学习框架数据扩充环节旨在增强原始专家数据的多样性主要分为视觉增强和语义增强两种方式在现实场景中使用了开源的StableDiffusion模型对视觉信息进行增强和扩充而在虚拟场景中则通过调整渲染过程的场景属性来实现视觉增强改变场景的视觉属性如物体纹理照明条件等语义增强包括改变场景中物体的布局位置方向乃至添加新的人造物体等图CACTI数据扩充环节图示语义增强视觉增强资料来源CACTIAFrameworkforScalableMulti-TaskMulti-SceneVisualImitationLearning中信建投133CACTI可扩展的多任务多场景视觉模仿学习框架训练和推理过程中CACTI模型结合当前时刻视觉摄像机输入文本指令输入机械臂状态来生成下一时刻的机械臂状态其中视觉和文本信息均沿用了R3M模型的架构来实现embedding的转换图CACTI训练和推理架构示意图资料来源CACTIAFrameworkforScalableMulti-TaskMulti-SceneVisualImitationLearning中信建投134CACTI可扩展的多任务多场景视觉模仿学习框架模型性能表现在真实机器人上部署时总体成功率约为30在仿真中在所有18个任务中的成功率约为62且随着训练数据的逐渐丰富模型在训练集内训练集外的任务上性能均有所提升实验结果证明使用大量的互联网图像数据和人类日常行为数据来对机器人控制模型进行预训练具备较大潜力如左图绿色柱形所示在大部分场景中均展现出了相当甚至更优秀的效果对于模拟环境中使用额外互联网数据效果较差的实验结果研究人员认为这可能是模拟环境中的图像信息与现实场景图像信息差距较大导致的同时数据增强方法也对模型表现有着较大贡献如下左图深蓝色柱形与橙色柱形黄色柱形于浅蓝色柱形的对比所示在没有经过数据增强的情况下模型能力有较为明显的下降图现实环境结果图仿真环境结果在模拟场景中使用额外的互联网数据效果较差研究人员认为这可能是模拟环境中的图像信息与现实场景图像信息差距较大导致的随着训练数据的增加模型在处理过的任务上的性能先资料来源CACTIAFrameworkforScalableMulti-TaskMulti-SceneVisualImitationLearning中信建投降后升在未处理过的任务上的性能持续提升141ASC具备自适应技能协调能力的机器人模型Meta及GeorgiaInstituteofTechnology的研究人员在2023年4月推出了具备自适应技能协调能力的机器人模型ASC训练环境导航任务环境HM3D包含1000个真实室内环境的高质量3D扫描使用了其中800个作为本次的训练数据拾取放置任务环境ReplicaCAD包含104中不同布局的公寓机器人需要将YCB数据集中的13件物品拾取放置或重新排列到4件家具容器上模型原理通过强化学习在模拟环境中训练三种基于视觉的技能导航拾取放置进一步训练一种技能协调策略如下右图黄框所示以及一种纠正策略如下右图绿框所示来根据三种不同任务的输入对三种进行进行协调和控制进而完成较为复杂的下游任务技能协调策略纠正策略技能协调策略实质是混合专家模型中的门控网络在ASC中技能协调策略利用Dagger算法进行预训练在这一过程中定义好的教师策略会逐步指导和技能协调策略的行为而后技能协调策略和纠正策略均通过深度强化学习进行微调图ASC训练的模拟环境数据集图ASC模型架构导航技能拾取技能放置技能资料来源ASCAdaptiveSkillCoordinationforRoboticMobileManipulation中信建投142ASC具备自适应技能协调能力的机器人模型模型性能在公寓和实验室两个现实环境中ASC模型在30次实验过程中分别实现了967和1000的成功率在模拟环境中ASC模型在79中不同布局的虚拟公寓中进行了1500次的实验实现了949的成功率实验结果表明协调策略对模型性能影响较为显著如下表中第23行所示在模型中添加协调策略后模型性能平均提升了126而纠正策略的增加则如12行所示带来了平均64的性能提升这是由于三种基础技能都是在较为简单孤立的场景中训练出来的纠正策略的引入可以减少复杂的移动拾放过程中表现不佳的情况同时微调的方法无法代替纠正策略的作用如下表25列所示在缺少纠正策略的情况下通过微调并不能带来性能的提升反而性能还会有较为显著的下降图ASC模型在现实环境和模拟环境中的评估结果资料来源ASCAdaptiveSkillCoordinationforRoboticMobileManipulation中信建投143ASC具备自适应技能协调能力的机器人模型ASC模型具备较强的抗干扰能力ASC模型针对视觉的反馈进行下一步的行动而不是依赖于地图因此当环境布局或动态障碍物发生变化是ASC模型会将机器人重新安排到一条新的无碰撞路径上如下图所示当机器人的前进路线被障碍物或人挡住时机器人会选择新的路线来接近目标同时ASC模型对目标物体的变化也具有较强的抗干扰能力如下图所示若机器人在搜索过程中目标发生移动机器人会继续搜索目标图ASC模型控制的机器人可以在面临干扰的情况下较好的完成任务在被障碍物多次阻挡后机器人仍能找到正确的路径在被人多次阻挡后机器人仍能找到正确的路径在目标物体状态反复变化的情况下机器人仍能持续搜索并完成任务资料来源ASCAdaptiveSkillCoordinationforRoboticMobileManipulation中信建投144ASC具备自适应技能协调能力的机器人模型通过将更强的Owl-ViT视觉模型应用在ASC模型中模型可以根据文本描述来识别更为复杂的物体进而完成相应的拾取和放置任务图增强后的ASC模型应用在额外的复杂场景中资料来源ASCAdaptiveSkillCoordinationforRoboticMobileManipulation中信建投15ACT具备动作序列生成能力的Transformer架构MetaStandfordUniversityUCBerkeley的研究人员推出了可以进行动作序列生成的模型ACT核心原理针对某一时刻的输入生成接下来的若干时刻的动作预测而不是只生成下一时刻动作预测如下左图所示来自四个相机的输入经过encoder处理后通过decoder得到接下来若干个时刻的动作序列若不采用时序组合的方法如右上图所示模型在34之间需要重新进行推理得到新的4个动作且需要为3的动作可能存在一定误差导致模型的机器人控制出现卡顿和精确度缺乏的情况而通过时序组合的方式则可以这些来自不同时刻的预测汇总在一起每一个时刻的输出都是若干个时刻预测的综合并且考虑了环境的最新变化进而实现了更为精确而流畅的机器人控制图ACT模型架构图动作分块与时序组合的原理示意图每个时刻的输出是多次预测的加权组合资料来源LearningFine-GrainedBimanualManipulationwithLow-CostHardware中信建投161RoboAgent通过语义增强和动作序列生成提升机器人操控的通用性和效率Meta及CarnegieMellonUniversity的研究人员在2023年8月推出了高效的通用机器人模型框架MC-ACT模型框架训练过程中在语义增强阶段利用内绘增强技术使训练数据多样化在策略学习阶段使用多任务动作分块转化器训练语言条件策略将多模式多任务数据纳入单一的多任务机器人控制模型中推理过程中结合用户的文本输入和摄像头的图像输入对机械臂进行控制图MC-ACT模型框架资料来源RoboAgentGeneralizationandEfficiencyinRobotManipulationviaSemanticAugmentationsandActionChunking中信建投162RoboAgent通过语义增强和动作分块提升机器人操控的通用性和效率训练数据包含通过人类远程操作收集的7500个片段具体任务包括有拾取放置开启关闭等其中拾取和放置动作的数据量较大均超过了1000条相较于此前的机器人数据集如RT1RoboAgent数据集的规模更小但覆盖的任务范围更广图MT-ACT可以执行十二种不同的任务图RoboAgent数据集任务种类分布上及和其他数据集对比下不同种类任务训练数据分布数据量对比训练任务种类对比资料来源RoboAgentGeneralizationandEfficiencyinRobotManipulationviaSemanticAugmentationsandActionChunking中信建投163RoboAgent通过语义增强和动作分块提升机器人操控的通用性和效率语义增强使用了SegmentAnything模型基于其从图MT-ACT借助SegmentAnything对背景和被操作物体进行语义增强海量互联网数据中提炼出的视觉知识可以自动的检测并分割出视频中的相关物体再进一步在相关区域中引入由文本提示提供的物体对背景如下左图b所示和被操作物体如下左图b所示进行增强语义增强为模型性能带来了明显的提升尤其在更对背景的增强对被操作物体的增强为困难的任务中提升更大如右下图所示对着对图语义增强为模型性能带来了明显提升单一图像输入的语义增强数量从1提升到7L1-L3三种任务的成功率均有提升其中L3的提升最为明显成功率从不足10提升到了50以上资料来源RoboAgentGeneralizationandEfficiencyinRobotManipulationviaSemanticAugmentationsandActionChunking中信建投164RoboAgent通过语义增强和动作分块提升机器人操控的通用性和效率模型性能相较于此前的模型调整了其他可比模型的训练数据规模MT-ACT在所有难度的任务中展现出了更强的性能表现在L1L2L3难度的任务中分别实现了816765173133的成功率在其他方法都无法成功的L4难度中MT-ACT实现了将近25的成功率我们认为MT-ACT为有限训练数据情况下的机器人控制模型训练提供了成功案例有望成为后续机器人模型发展的重要技术路线之一图MT-ACT性能情况L1改变被操作物体的形L3增加新的任务和被操作态及场景灯光L2增加新的干扰物体物体L4NewkitchenL4never新的环境seenbeforeL4场景成功率L1场景成功率L1L2L3场景成功率资料来源RoboAgentGeneralizationandEfficiencyinRobotManipulationviaSemanticAugmentationsandActionChunking中信建投17Meta机器人模型进展总结Meta的机器人模型与谷歌有所差异目前的工作中尚未尝试将大语言模型与机器人控制所结合同时相较于谷歌尝试利用大规模的数据集提升机器人模型的表现Meta的相关工作更加关注如何使用小规模的数据实现通用机器人控制模型的构建也即数据效率方面的提升Meta在ASC模型中采用的强化学习与MoE的结合也是值得关注的方向为强化学习在复杂多任务场景中的进一步发展提供可能图Meta机器人模型梳理模型名字R3MCACTIASCRoboAgentMT-ACT基本发布时间202232022122023420238信息MetaFAIRGeorgiaInstituteof研究机构MetaStanfordUniversityMetaColumbiaUniversityCMUMetaFAIRCMUTechnology人类第一视角视频数据集整体数据集内容RL人类演示机器人Ego4D人类演示10个任务每个5次演示数据集大小7500个片段数据增强前3500小时重复20次模拟环境中强化学习导航模块HM3D12种技能数据RL45000个机器人操作片段人类演示收集后使用stable模块操作拾取放置参与者一次佩戴头戴式摄像头长diffusion进行增强ReplicaCAD数据集收集方式达10小时并拍摄无脚本日常RL针对单一任务通过RL得到专家策人类控制活动的第一人称视频并通过自略增加相应的视觉信息和噪音进行然语言进行注释增强机器人频率单位Hz1252control12sensor5硬件FrankaEmikaPandarobot8FrankaEmikaPandaarm8action机器人FrankaEmikaPandarobotBostonDynamicsSpotrobotactiondimensiondimensionR3M使用互联网数据和本次模型数据MaskR-CNN视觉处理R3M预训练FiLMCNNOwl-ViT模型MoCo仅使用本次的模型数据语言处理DistilBERTDistilBERT设置与R3M一致综合处理模型MLP协作模块本质为MoE的门控网络TransformerACT训练芯片NvidiaTitanXporsimilar2080Ti训练时长48hours算力推理芯片RTX3070资料来源Meta官网谷歌学术中信建投211LATTE结合预训练模型的机器人轨迹控制模型Microsoft及TechnischeUniversittMnchen的研究人员在2022年8月推出了基于自然语言的机器人轨迹控制框架LATTE模型框架使用Bert模型处理用户文本指令使用CLIP模型处理图像输入并且与用户的文本输入相匹配进而识别出用户指令中的目标对象上述信息与经过Encoder处理的物体姿态信息和航迹信息相结合通过Decoder生成全新的航迹图LATTE模型架构文本指令使用BERT模型和CLIP模型对文本指令和图像输入进行处理对象图像对象状态初始轨迹资料来源LATTELanguageTrajectoryTransformer中信建投
|
|