实现任务级交互将成为解决人形机器人通用化难题的关键。当前人形机器人行业面临着高需求、低渗透率、商业化落地难的发展瓶颈,其核心原因在于机器人通用化水平不达预期。按照机器人控制层级的划分,通用化能力的提升需要机器人能够拥有高层级的自主规划能力。因此,如何让人形机器人独立完成高层级规划,实现任务级交互,将成为决定人形机器人能否实现商业化落地的关键。
多模态大模型的发展为实现人形机器人任务级交互带来曙光。大语言模型在常识理解、任务拆分、逻辑推理、自然语言交流方面的能力已经为人形机器人带来了出色的人机交互能力。不仅如此,随着科技巨头的入局,融合了视觉、语言等多模态数据的大模型正不断涌现,两条技术路线下均有成果产出,有望进一步提高人形机器人的通用化水平。 大模型赋能机器人感知模块,进一步加速下游应用领域突破。大模型不仅为人形机器人带来决策能力的提高,在感知模块也正引领机器视觉训练新范式。Meta发布的SAM模型首次将大模型引入机器视觉领域,依靠AI算法自动实现图像/视频标注,大大降低了上游训练成本和难度,有望加速机器视觉在下游机器人应用领域的突破。 实时性问题是大模型的主要难点,运控问题上基础模型更有优势。虽然大模型在高层级规划问题上展现出了杰出的性能,但其依旧存在实时性差等局限,不适用于底层精细的运动控制;在此领域,参数量更少、响应速度更快的基础模型具有相对优势。 大模型or基础模型,人形机器人究竟需要怎样的模型?短期来看,人形机器人需要的是可以优化特定场景应用的基础模型+大模型,两者各司其职、相互补充;长期来看,随着算力提升和模型结构持续优化,新一代高效率大模型的出现和应用才能真正实现人形机器人通用化。 风险提示。技术迭代速度不及预期、安全隐私法规影响、道德风险。 研究报告全文:TablePage深度分析机械设备证券研究报告人形机器人系列之八TableTitleTableGrade行业评级买入前次评级买入人形机器人究竟需要怎样的AI模型报告日期2023-09-24TableSummary相对市场表现TablePicQuote核心观点实现任务级交互将成为解决人形机器人通用化难题的关键当前人形18机器人行业面临着高需求低渗透率商业化落地难的发展瓶颈其核12心原因在于机器人通用化水平不达预期按照机器人控制层级的划分7通用化能力的提升需要机器人能够拥有高层级的自主规划能力因此2092211220123032305230723如何让人形机器人独立完成高层级规划实现任务级交互将成为决定-3人形机器人能否实现商业化落地的关键-9机械设备沪深多模态大模型的发展为实现人形机器人任务级交互带来曙光大语言300模型在常识理解任务拆分逻辑推理自然语言交流方面的能力已经为人形机器人带来了出色的人机交互能力不仅如此随着科技巨头的分析师TableAuthor代川入局融合了视觉语言等多模态数据的大模型正不断涌现两条技术SAC执证号S0260517080007路线下均有成果产出有望进一步提高人形机器人的通用化水平SFCCENoBOS186大模型赋能机器人感知模块进一步加速下游应用领域突破大模型021-38003678不仅为人形机器人带来决策能力的提高在感知模块也正引领机器视daichuangfcomcn觉训练新范式Meta发布的SAM模型首次将大模型引入机器视觉领分析师孙柏阳域依靠AI算法自动实现图像视频标注大大降低了上游训练成本和SAC执证号S0260520080002难度有望加速机器视觉在下游机器人应用领域的突破021-38003680实时性问题是大模型的主要难点运控问题上基础模型更有优势虽sunboyanggfcomcn然大模型在高层级规划问题上展现出了杰出的性能但其依旧存在实请注意孙柏阳并非香港证券及期货事务监察委员会的注时性差等局限不适用于底层精细的运动控制在此领域参数量更册持牌人不可在香港从事受监管活动少响应速度更快的基础模型具有相对优势相关研究TableDocReport大模型or基础模型人形机器人究竟需要怎样的模型短期来看人形机器人需要的是可以优化特定场景应用的基础模型大模型两者各人形机器人系列之三核心零2023-06-18司其职相互补充长期来看随着算力提升和模型结构持续优化新部件的野望隐形冠军的摇一代高效率大模型的出现和应用才能真正实现人形机器人通用化篮风险提示技术迭代速度不及预期安全隐私法规影响道德风险AI制造系列报告之三AI与2023-04-24机器视觉协同赋能产业化应用方兴未艾AI制造系列报告之二AI赋2023-04-16能人形机器人春天来了吗联系人TableContacts姚佳021-38003794yaojiagfcomcn识别风险发现价值请务必阅读末页的免责声明133TablePageText深度分析机械设备重点公司估值和财务分析表Tableimpcom最新最近合理价值EPS元PExEVEBITDAxROE股票简称股票代码货币评级收盘价报告日期元股2023E2024E2023E2024E2023E2024E2023E2024E汇川技术300124SZCNY681320230824买入7459186240366328393479269720702100数据来源Wind广发证券发展研究中心备注表中估值指标按照最新收盘价计算识别风险发现价值请务必阅读末页的免责声明233TablePageText深度分析机械设备目录索引导读从大模型看人形机器人提升通用化水平的路径5一人形机器人商业化落地困难重重任务级交互任重道远6一通用化人形机器人高需求和低渗透率矛盾的核心原因6二任务级交互通用化难题的解决方案7二多模态大模型为实现任务级交互带来曙光10一大模型时代下人形机器人的机遇10二多模态技术为人形机器人决策层带来全新的技术突破方向11三科技巨头入局多条技术路线均有成果产出12三大模型赋能人形机器人感知模块SAM带来机器视觉训练新范式23四大模型OR基础模型人形机器人究竟需要怎样的模型27一实时性是大模型面临的重大难题27二基础模型存在的必要性28三人形机器人究竟需要怎样的模型29五风险提示31识别风险发现价值请务必阅读末页的免责声明333TablePageText深度分析机械设备图表索引图1从大模型看人形机器人提升通用化水平的路径5图2近5年中国15-59岁劳动人口数量与比重变化6图32020-2024年中国服务机器人销售额及增长率6图4机器人产业发展的正向循环7图5人形机器人三大技术模块8图6机器人的控制框架9图7大模型的能力与机器人任务级需求的映射关系11图8不同样本数量级下多模态模型的预测精确度和MSE损失12图9多模态大模型的两条技术路线12图10SayCan模型的架构和技术原理对可行指令集进行双向打分13图11SayCan模型可以让机器人结合实际情况做出最合理的决策14图12SayCan模型面对不同任务下的决策准确率不断提高14图13PaLM-E模型的架构通过LLM和ViT输出文本决策15图14多任务混合训练显著提高了机器人执行各类任务的准确率16图15给出任意模态的信息ImageBind可以脑补对应的场景17图16以图像视频为核心的多模态连接方式17图17零样本小样本下ImageBind的准确率远超一般模型17图18不同大模型的决策结果与运动控制指令之间的映射方式18图19RT-2的架构输入自然语言指令输出控制执行器运动的文本字符串19图20RT-2的两个实例模型和基线模型在不同训练任务中的执行成功率对比19图21引入CoT能够帮助RT-2完成更为复杂时间跨度更长的任务20图22RoboCat可以在虚拟空间或现实空间学习各类不同的任务21图23RoboCat的训练周期示意图21图24RoboCat的执行成功率远超基线模型左图为模拟空间的执行成功率右图为现实世界的执行成功率22图25SAM可以精准分割出图像中的任何物体23图26面对复杂的场景时SAM依旧可以精准分割23图27用户使用SAM的三种交互方式24图28SAM模型的基本架构编码器解码器24图29SAM模型中轻量级解码器的运行原理24图30SA-1B掩码量比OpenImages多出近400倍25图31SAM模型的学习成果可以通过数据引擎增加到SA-1B中25图32大模型和基础模型各有优缺点和适用的领域27图33RT-2的演示视频必须通过2倍速才能看到较为流畅的机器人运动过程28图34RT-2在移动马克笔的任务中因为控制周期跟不上马克笔的滚动速度而失败28图35借助MPC算法Atlas可以实时预测运动路径并做出姿态调整29图36随着大模型效率的提高人形机器人通用化水平将进一步提升30识别风险发现价值请务必阅读末页的免责声明433TablePageText深度分析机械设备导读从大模型看人形机器人提升通用化水平的路径现状研发通用化人形机器人一直是机器人领域最重要且至今尚未完成的挑战受制于人形机器人通用化水平低的现状人形机器人产业正面临高需求和低渗透率的困境使用大模型的探索如今多家科技巨头正积极布局多模态大模型领域希望借助大模型的能力提升人形机器人的通用化水平以此来实现商业化落地大模型的不同路径学界对多模态大模型的探索主要分为两条技术路径VLM和VLA分别聚焦于高层级规划问题和一体化解决方案其中VLM方向已经取得了阶段性的成果大模型缺陷基础模型的优势由于大模型在底层运动控制领域存在实时性差的缺陷短期内人形机器人更需要依靠基础模型大模型来实现小规模的应用场景落地两者各取所长相互配合是目前看到人形机器人相对较快的商业化落地方式长期机遇与可能性长期来看随着算力提升模型结构优化升级高效率的一体化大模型的出现和应用才能真正实现人形机器人通用化图1从大模型看人形机器人提升通用化水平的路径数据来源广发证券发展研究中心识别风险发现价值请务必阅读末页的免责声明533TablePageText深度分析机械设备一人形机器人商业化落地困难重重任务级交互任重道远本章节导读目前人形机器人产业出现了高需求和低渗透率的矛盾其核心原因在于难以实现通用化作为典型的软硬件一体产品人形机器人的硬件和软件相互促进却又相互限制彼此的发展能否实现机器人控制层级中的任务级交互将成为能否解决机器人通用化难题实现商业化落地的关键一通用化人形机器人高需求和低渗透率矛盾的核心原因研发能学习了解这个世界并能操控其中物体与世界进行交互的人形机器人一直是机器人领域最重要且至今尚未完成的挑战在劳动力人口持续下降的背景下人形机器人产业前景广阔根据中国电子学会编写的中国机器人产业发展报告2022年测算2022年全球服务机器人市场规模达到217亿美元预计2024年全球服务机器人市场规模将有望增长到290亿美元中国机器人市场规模将达到174亿美元五年年均增长率达到22图2近5年中国15-59岁劳动人口数量与比重变化图32020-2024年中国服务机器人销售额及增长率数据来源WIND国家统计局广发证券发展研究中心数据来源IFR中国电子学会广发证券发展研究中心然而与其高需求形成鲜明对比的是目前人形机器人在人类社会的渗透率微乎其微工业领域人形机器人的应用案例少之又少即使以使用最广泛渗透率最高的工业机器人为例截止2021年底中国工业机器人总体保有量1224万台而中国的制造业产业工人约有6676万人麻省理工学院教授撰写的RobotsandJobsEvidencefromUSLaborMarkets中提到美国平均一台机器人代替33名工人计算按平均33的替代率计算我国工业机器人的总体渗透率仅为6左右这意味着绝大部分工厂里的生产工作仍然由人工完成而在商用和服务领域绝大多数机器人厂商的产品还是处于Demo展示阶段例如优必选的人形机器人Walker更多的是出现在一些演出场合进行表演还没有达到能够量产进入千家万户的阶段除去价格因素目前人形机器人商业化落地的主要瓶颈在于通用性虽然目前人形机器人硬件性能距离科幻电影中所描述的未来科技仍然有巨大的差距但得益于工业机器人领域硬件技术的不断提高整体硬件的价格和性能已经达到了不错的商用识别风险发现价值请务必阅读末页的免责声明633TablePageText深度分析机械设备水平商业化难的主要问题还是集中在现有的人形机器人应用软件水平还不能充分发挥硬件的现有机能以特斯拉Optimus为例根据特斯拉在2023世界人工智能大会的展示Optimus全身共有28个自由度已经达到了人体的关节自由度但是在真实的使用场景下Optimus仍然无法实现最基础的流畅行走距离马斯克描绘的机器人全面接管特斯拉制造工厂的要求仍有不少差距机器人是典型的机电软一体化产品软件与硬件是相互限制又相互促进的矛盾体机器人产业的发展存在一个正向循环机器人技术的提升可以带来更好的硬件性能从而支持更强大的软件而更强大的软件可以支持开发更多的应用场景从而扩大市场促使机器人厂商加大投入研发性能更强大的机器人如果没有通用性的提高就难以说服客户群体选择人形机器人也就难以支撑人形机器人产业发展的正向循环这也就是目前人形机器人商业化困难重重的核心原因图4机器人产业发展的正向循环数据来源广发证券发展研究中心二任务级交互通用化难题的解决方案要理解实现任务级交互对于提高机器人通用化的意义我们首先需要了解人形机器人的三大主要技术模块以及一个机器人从收到指令到完成命令之间需要经过哪些环节一般地我们将人形机器人分成三大技术模块环境感知模块人机交互模块和运动控制模块环境感知模块主要负责数据采集的前端感知层利用传感器收集图像语音信息相当于人的眼耳鼻人机交互模块包括负责数据整理和算力处理的存储器和AI人工智能芯片负责对环境感知的信号进行处理分析形成决策信号反馈给控制器相当于人的大脑运动控制模块包括机械传动系统根据大脑反馈的信号指令行动相当于人的肌肉及四肢机器人通过眼脑手合一来实现与人类相似的行为模式识别风险发现价值请务必阅读末页的免责声明733TablePageText深度分析机械设备图5人形机器人三大技术模块数据来源广发证券发展研究中心落实到具体的流程规划问题机器人控制框架一般采用层级控制方法根据RoboticsModellingPlanningandControl机器人的控制过程可以被划分为四个层级任务级TaskLevel动作级ActionLevel初始级PrimitiveLevel和伺服级ServoLevel在任务级用户指定机器人系统应该执行的任务机器人通过分析各种数据将预期目标分解成一系列在空间和时间上协调的行动规划并输出相对抽象的符号命令在动作级机器人将来自任务级的符号命令转换成表示每个基本动作运动路径的中间构型序列具象化了执行每个命令的路径在初始级机器人根据动作级传输的中间构型序列插值计算出运动轨迹上的点再根据机械臂的动力学模型对运动轨迹进行速度加速度的限制和优化以输出机器人可以实现的运动路径最后在伺服级机器人根据初始级提供的运动轨迹计算结果伺服驱动各个关节的电机运动其中任务级和动作级属于高层级HighLevel负责规划和决策主要调动环境感知和人机交互模块初始级和伺服级属于低层级LowLevel负责执行主要调动运动控制模块以帮我接杯水为例按照上述机器人控制层级的定义机器人的执行过程应该包括以下几个环节1理解任务目标和拆解对应的动作根据给我接杯水的任务指令明确应当先去找到杯子然后打开水龙头接水2对每个步骤完成路径规划例如为了打开水龙头机械臂需要进行圆周运动3对路径插值计算生成具体的轨迹和控制指令例如规划的路径是否在物理上可行拿起杯子的时候需要用多少速度施加多少力4利用电流信号操纵电机完成各个制定好的动作运行伺服驱动器里的三环控制识别风险发现价值请务必阅读末页的免责声明833TablePageText深度分析机械设备图6机器人的控制框架数据来源SicilianoBSciaviccoLVillaniLetalKinematicsJRoboticsModellingPlanningandControl200939-103广发证券发展研究中心实现任务级交互是提升人形机器人通用化的必经之路所谓任务级交互意味着在任何场景下用户仅需向机器人明确抽象的任务目标它便能够理解自然语言并自主拆解任务内容输出具体决策与操作指令同时机器人还能够根据任务执行过程中的反馈信息及时对指令进行修正从而确保最终实现任务目标实现了任务级交互的机器人在整个执行过程中除了极少数场景下需要人类介入进行干预以外其余场景下均具备高度的自主运行能力无需掌握机器人专业操作知识的机器人应用工程师介入这就大幅提升了人形机器人的通用化水平解决了人形机器人商业化落地难的问题以目前的人形机器人落地案例来看实现任务级交互的难点主要集中在如何让机器人实现自主规划的问题上虽然如今低层级已经可以交由机器人自主去执行但是高层级的任务规划还是需要依靠人工示教的形式实现机器人难以自主完成当前的机器人控制系统不具备常识理解能力和专业技能无法把任务目标和需要执行的动作联系起来这就需要专业的机器人应用工程师提前理解任务并把任务拆解成合适的动作使用机器人编程语言完成机器人应用程序的编写调优和部署以上文提到的接水任务为例仅仅是打开水龙头这一个子任务对机器人来讲就有很多未执行水龙头的样式多种多样开启的方式也不尽相同机器人首先要能理解面对的是一个什么样的水龙头该如何开启开启到什么程度能兼顾接水速度和避免泼溅和溢出这些对于人类来讲很容易理解的动作程序都是需要机器人应用工程师们提前通过代码一行一行写出来这就大大降低了人形机器人的通用性因此如何让人形机器人实现自主规划将成为决定人形机器人能否顺利商业化落地的关键识别风险发现价值请务必阅读末页的免责声明933TablePageText深度分析机械设备二多模态大模型为实现任务级交互带来曙光本章节导读大模型在常识理解推理决策等方面的能力可以弥补人形机器人在决策层的短板为实现人形机器人任务级交互带来了曙光同时多模态化的趋势也让大模型越来越接近具身智能在多家科技巨头入局后VLM和VLA两条技术路线上均涌现出了一系列具有突破性意义的大模型本章节将详细介绍目前主流的几种多模态大模型一大模型时代下人形机器人的机遇在大模型问世以前当谈论到AI在人形机器人决策领域的潜力时研究者所持的观点是AGI通用人工智能短时间内还很难实现AI只能用在一些特定垂直的机器人领域上以往一套AI基础模型的训练通常需要经历数据收集--标注--调参优化迭代--部署--应用等一系列流程即使经验丰富的机器人算法工程师也需要花上几天甚至几周的时间进行设计与调试而这种方式训练出来的基础模型大多属于特定模型只针对某个特定领域有效而缺乏通用性在面对很多对时效性需求高的场合譬如需要频繁换产的工业现场动态变化的商用服务场景难以胜任在这些快速变化的场景中通常会诞生很多边缘问题即各种不可预测的特殊情况或极端状况由于机器人算法工程师难以穷尽所有的场景所以当机器人面临这些边缘问题时无法借助训练集的数据来给出合理的动作反馈目前基础模型解决边缘问题的主要方案还是case-by-case力图覆盖尽可能多的场景但这不仅需要大量计算资源也显著提高了机器人的训练成本随着AI算法的不断进步大模型正展现出其在高层级规划领域的杰出能力目前大语言模型LLMLargeLanguageModel的主要特点和优势包括具备多个领域的基础知识和常识拥有强大的自然语言理解和内容生成能力可以根据上下文进行连贯的交互还具备零样本小样本学习的能力把这些能力应用到人形机器人领域大模型可以适用于各种人形机器人任务包括任务描述任务拆解运动代码生成和任务过程交互这些能力合并在一起就满足了人形机器人通用化的关键需求任务级交互大模型的零样本小样本学习和常识理解能力赋予了机器人学习和归纳的能力在处理大量的边缘问题时人形机器人可以应用在其他场景中学到的知识迅速提供一个正确且可行的解决方案从而提高了泛化能力同时大模型对于自然语言的理解能力也让机器人的使用者从必须掌握编程语言的专业算法工程师变成了一般的普通用户大大降低了机器人的使用门槛使用门槛的降低是一个产品或一个产业走向大规模快速爆发的起点识别风险发现价值请务必阅读末页的免责声明1033TablePageText深度分析机械设备图7大模型的能力与机器人任务级需求的映射关系数据来源广发证券发展研究中心二多模态技术为人形机器人决策层带来全新的技术突破方向1950年图灵在他的论文ComputingMachineryandIntelligence中首次提出具身智能EmbodiedAI的概念在ITFWorld2023半导体大会上英伟达创始人兼首席执行官黄仁勋再次强调人工智能的下一个浪潮将是具身智能即能理解推理并与物理世界互动的智能系统虽然目前已有将语言大模型应用与人形机器人相结合的案例例如基于GPT-3的ChatGPTforRobotics已经可以实现将用户的自然语言指令转化为机器人编程语言但是单一模态大模型仍存在局限性语言和行动的鸿沟阻碍了搭载AI的人形机器人像人一样行动这些大模型欠缺和真实物理世界互动的知识导致其输出结果很难落地到实际机器人场景中一个合格的人形机器人不该只局限于一种模态的信号处理而是应当像人类一样能够多维度的感知和理解环境多模态数据强化了人形机器人对世界的理解和技能泛化能力有望实现具身智能自从2017年谷歌提出全新的Transformer神经网络架构大模型的研究方向逐渐从单一感知通道输入输出演变为多模态多通道的智能交互模式视觉听觉触觉等多模态数据的融合能够为模型决策提供更多维的信息有助于实现细粒度的语义理解对话意图识别以及更精确的情感分析从而提高决策的总体准确率提供更加人性化的人机交互体验根据WhatMakesMultimodalLearningBetterthanSingle的实验论证多模态学习通过聚合多源数据的信息可以使模型学习到的表示更加完备在充足的训练数据下模态的种类越丰富训练出来的模型预测误差值越小表征空间的估计越精确识别风险发现价值请务必阅读末页的免责声明1133TablePageText深度分析机械设备图8不同样本数量级下多模态模型的预测精确度和MSE损失数据来源HuangYDuCXueZetalWhatmakesmulti-modallearningbetterthansingleprovablyJAdvancesinNeuralInformationProcessingSystems20213410944-10956广发证券发展研究中心三科技巨头入局多条技术路线均有成果产出为了探索多模态大模型在机器人应用领域的可能性谷歌Meta等一众科技巨头纷纷入局其中有利用机器人训练数据对大语言模型直接微调的也有直接使用Transformer架构将多感官数据一同进行训练的有专注于解决机器人高层级决策问题的也有探索大模型直接参与机器人底层运动规划问题的从而产出了一系列的具身大模型纵观学界和业界对于多模态大模型的研究方向在人形机器人领域的技术路线主要分成两大路线一大路线是多模态VLM大模型传统控制算法通过大模型实现机器人的多模态感知和决策让人形机器人具备处理复杂陌生场景的能力再依靠API接口调用传统控制算法来实现机器人的运动控制另一大路线是尝试搭建一体化的VLA大模型直接将感知信号映射到机器人运控指令跳过中间复杂的信号转换过程实现感知-决策-动作的闭环图9多模态大模型的两条技术路线数据来源广发证券发展研究中心识别风险发现价值请务必阅读末页的免责声明1233TablePageText深度分析机械设备1技术路线其一多模态大模型VLM传统运动控制算法AI天生就是语言上的巨人行动上的矮子虽然大语言模型可以把高层级的任务拆分成若干个在语义上符合逻辑的子任务但是由于LLM普遍缺乏真实物理世界的经验无法判断其输出会对环境产生什么样的影响也不知道真实环境和机器人的状态信息以及机器人是否具备执行这些子任务的能力其生成的看似逻辑上合理的子任务指令不一定能在某个实际的场景中被机器人顺利执行因此谷歌Meta等科技厂商都在研究能与机器人融合的多模态技术尝试在LLM的基础上引入视觉模态以此提高机器人的感知和决策能力目前在这个领域有突破性进展的主要模型有SayCanPaLM-E和Imagebind1SayCan有所为有所不为针对LLM在机器人应用领域的局限性2022年8月谷歌机器人团队联合EverydayRobots开发了一种基于自然语言的文本-视觉处理模型SayCan该模型将机器人的决策过程拆分为两个部分Say和CanSay部分主要由大语言模型构成首先大语言模型会在Prompt的引导下拆分任务目标并输出所有与解决问题有关的决策集其次根据对任务目标的贡献来对这些决策进行打分Can部分主要由预训练得到的可供性函数Affordance函数组成Affordance函数是研究人员在预训练阶段通过人工对决策集进行打分再依靠强化学习方法训练得到的主要负责根据传感器的视觉信号感知现实环境并对决策集中的每一个决策计算出相应的成功执行概率通过Say和Can两者对决策集进行双向打分模型可以根据当下状态给出机器人应当采取的合理决策从而顺利的完成任务图10SayCan模型的架构和技术原理对可行指令集进行双向打分数据来源AhnMBrohanABrownNetalDoasicannotasisayGroundinglanguageinroboticaffordancesJarXivpreprintarXiv2204016912022广发证券发展研究中心识别风险发现价值请务必阅读末页的免责声明1333TablePageText深度分析机械设备Affordance函数的加入可以让SayCan模型基于现实情况推翻无法实现的决策在研究团队展示的一个案例中研究员下达了你将怎样把海绵放回柜子上的指令我们可以清晰地看到机器人的决策过程其中蓝色条表示LLM给出的可行概率红色条表示成功执行选定动作的概率绿色条则表示SayCan模型给出的综合得分在第一步中尽管大语言模型认为拿取海绵是正确的动作但Affordance函数根据视觉信息认为这是不可能的因此选择了寻找海绵由此看出Saycan模型确实可以帮助机器人做出最符合现实的决策图11SayCan模型可以让机器人结合实际情况做出最合理的决策数据来源AhnMBrohanABrownNetalDoasicannotasisayGroundinglanguageinroboticaffordancesJarXivpreprintarXiv2204016912022广发证券发展研究中心随着训练数量的不断扩大SayCan模型的决策成功率正逐渐提升在不到一年的时间里SayCan模型已经掌握了551种技能而且随着时间的推移平均决策成功率也正呈现出明显的上升趋势其中捡起移动打翻物品的决策成功率都超过了80直立放置物品和打开关闭抽屉的成功率虽然还低于50但也在随着训练快速提高图12SayCan模型面对不同任务下的决策准确率不断提高数据来源AhnMBrohanABrownNetalDoasicannotasisayGroundinglanguageinroboticaffordancesJarXivpreprintarXiv2204016912022广发证券发展研究中心SayCan模型的最大价值在于它解决了大模型在机器人应用领域中的第零层问题SayCan模型被赋予了一种让机器人基于现实环境考虑复杂问题的能力这种能力让识别风险发现价值请务必阅读末页的免责声明1433TablePageText深度分析机械设备机器人在处理每一个决策时能够在充分考虑其对长远目标的影响和贡献的同时还能够兼顾当前环境中的现实情况的预测和估计这种深入思考和全面权衡的能力使得AI真正离开了信息空间层面能够真正影响到现实空间2PaLM-E跨越多模态的通才为了更好的将图像-语言大模型的能力和知识迁移到机器人领域2023年3月谷歌和柏林工业大学的研究团队融合了Google当时最新的大型语言模型PaLM和最先进的视觉模型ViT-22B发布了一款应用于机器人领域的多模态大模型PaLM-E输入端是多模态信息输出端是自然语言的决策文本在输入端PaLM-E基于对现实世界的连续观察使用多模态标记与文本交错等方式形成多模态句子包括语言编码text视觉编码img和连续状态估计编码emb让大语言模型能够全面的了解任务目标和机器人的目前状态在输出端PaLM-E输出的是大模型生成的文本内容可以是问题的答案也可以是以文本形式生成的一系列机器人应当执行的决策图13PaLM-E模型的架构通过LLM和ViT输出文本决策数据来源DriessDXiaFSajjadiMSMetalPalm-eAnembodiedmultimodallanguagemodelJarXivpreprintarXiv2303033782023广发证券研究发展中心除了可以用于常规的语言生成任务PaLM-E还可以用于连续的机器人控制规划视觉问答图像字幕生成等多模态任务并且展示出了更高的准确率研究团队通过实验发现在不同任务类型混合的多个数据集上训练得出的PaLM-E可以展现出极强的迁移学习和泛化能力因而当PaLM-E面对各类任务时可以拥有比原先面向单一领域训练的模型更高的性能识别风险发现价值请务必阅读末页的免责声明1533TablePageText深度分析机械设备图14多任务混合训练显著提高了机器人执行各类任务的准确率数据来源DriessDXiaFSajjadiMSMetalPalm-eAnembodiedmultimodallanguagemodelJarXivpreprintarXiv2303033782023广发证券研究发展中心PaLM-E提供了一个将多模态大模型直接与人形机器人结合的可行方案Saycan模型因为需要在第一步利用大语言模型输出可行决策集再依靠Affordance函数判断能否执行所以它本质上还是更加依赖单一模态的大模型多模态数据仅仅起到了筛选的作用而PaLM-E则是在输入端就囊括了多模态数据就像人类大脑的运作模式一样PaLM-E可以基于更多维的信息来进行思考从而做出最符合当下环境的合理决策虽说目前PaLM-E的输入端只包含语言和视觉两大模态但其提出的架构为实现具身智能提供了可行方案相信未来随着更多维数据的引入PaLM-E可以实现类人的思考模式有望将机器人的自主水平提升至新的层次3ImageBind更多模态融合技术的积极探索2023年5月Meta宣布开源了一种可以将可以横跨6种不同模态的全新AI模型ImageBind包括视觉图像和视频形式温度红外图像文本音频深度信息运动读数由惯性测量单元或IMU产生使机器具备全面的理解能力可以将照片中的物体与它们的声音3D形状温度以及运动方式联系起来以视觉为核心ImageBind可做到6个模态之间任意的理解和转换在论文中Meta展示了一些应用案例例如在输入了一段火车鸣笛声后ImageBind可以给出一张火车的图片和视频同时它还可以根据声音的变化生成对应的深度图和文字描述在输入了鸟的图像和摩托车的声音后ImageBind创作出了一张鸟与骑车者的图像识别风险发现价值请务必阅读末页的免责声明1633TablePageText深度分析机械设备图15给出任意模态的信息ImageBind可以脑补对应的场景数据来源GirdharRohitetalImagebindOneembeddingspacetobindthemallProceedingsoftheIEEECVFConferenceonComputerVisionandPatternRecognition2023广发证券研究发展中心ImageBind为多模态融合提供了一种具有突破性意义的解决方案此前的多模态AI模型一般只支持一到两个模态融合的主要难点在于每个模态都有一个特定的嵌入需要对包含每种模态不同组合的数据进行训练不同模态之间难以进行互动和检索而ImageBind提出了一种具有突破性意义的解决方案以图片数据为桥梁把所有模态的数据放入统一的联合嵌入空间进行学习训练这种以图像为中心的配对方式一下子将训练模型所需数据组合数量从两两配对的15种降低到了5种大大降低了训练成本和难度同时ImageBind不仅能够实现一个模型为多个模态提取有效表征从而支持各类下游模型还能做到杰出的跨模态检索以及零样本学习的表现例如ImageBind在少于四个样本分类的top-1准确率上要比Meta的自监督AudioMAE模型和在音频分类fine-tune上的监督AudioMAE模型提高了约40的准确率图16以图像视频为核心的多模态连接方式图17零样本小样本下ImageBind的准确率远超一般模型数据来源GirdharRohitetalImagebindOneembedding数据来源GirdharRohitetalImagebindOneembeddingspacetobindthemallProceedingsoftheIEEECVFspacetobindthemallProceedingsoftheIEEECVFConferenceonComputerVisionandPatternRecognitionConferenceonComputerVisionandPatternRecognition2023广发证券研究发展中心2023广发证券研究发展中心识别风险发现价值请务必阅读末页的免责声明1733TablePageText深度分析机械设备ImageBind的诞生代表了AI在模拟人类感知领域发展的一大步作为第一个能够同时处理6种感官数据的AI模型也是第一个在没有明确监督的情况下学习一个单一嵌入空间的AI模型ImageBind充分证明了结合复杂多模态方案的大模型有望完全具备与世界交互的能力Meta团队还表示未来还将加入触觉语音嗅觉和大脑功能磁共振信号进一步探索多模态大模型的可能性借助ImageBind具身人形机器人离我们又近了一步2技术路径其二感知-决策-控制一体化的VLA大模型VLM大模型输出的决策指令仍需借助低级别策略或API才能完成对机器人的运动控制虽然目前在VLM大模型领域已经产出了许多优秀成果多模态技术也让人形机器人在输入端可以实现类似人类的多感官感知但VLM大模型在人形机器人的输出端仍存在天然的缺陷VLM输出的预测结果处于高层级但落实到实际机器人关节的运动控制仍然需要调用低层级的库或API来将实现对机器人动作的控制和映射例如谷歌的PaLM-E默认提供一个低层级的控制网络用以将模型输出的高层级指令转换成运动控制信号图18不同大模型的决策结果与运动控制指令之间的映射方式数据来源广发证券发展研究中心针对VLM大模型的缺陷许多研究团队正在尝试搭建直接对低层级运动控制进行预测的视觉-语言-动作多模态大模型VLA目前在这个领域有出色表现的模型包括RT-2和RoboCat1DeepMindRT-2直接实现端到端的机器人控制2023年7月GoogleDeepMind发布了基于RT-1开发的新一代视觉-语言-动作大模型RoboticTransformer2RT-2可以从网络和机器人数据中学习并将这些知识转化为机器人控制的通用指令RT-2的输入端依旧是多模态的自然语言指令而输出端是可以直接用以控制机器人的文本字符串以此实现端到端的机器人控制RT-2抛弃了从头训练Transformer模型的方式而是直接采用已有的VLM模型作为主模型再使用更适合机器人任务的fine-tuning方法对其进行微调在预训练阶段RT-2仍使用VLM来进行自然语言决策而在微调阶段研究团队通过构建了一种文本字符串Token包括末端执行器的识别风险发现价值请务必阅读末页的免责声明1833TablePageText深度分析机械设备坐标旋转角等信息让RT-2直接学习自然语言指令与Token之间的关系图19RT-2的架构输入自然语言指令输出控制执行器运动的文本字符串数据来源BrohanABrownNCarbajalJetalRt-2Vision-language-actionmodelstransferwebknowledgetoroboticcontrolJarXivpreprintarXiv2307158182023广发证券发展研究中心与之前的基线模型例如RT-1和视觉皮层模型VC-1相比RT-2的泛化性能得到了大幅提高为了探索RT-2的能力谷歌团队定义了三类技能符号理解推理和人类识别每项任务都需要理解视觉语义概念以及执行机器人控制以操作这些概念的能力例如捡起即将从桌子上掉下来的袋子或将香蕉移动到二加一的和之类的命令机器人被要求对机器人数据中从未见过的对象或场景执行操作任务在超过6000项机器人试验中RT-2在学习过的任务方面继续保持着出色的性能执行成功率在87左右而在未曾见过的场景中展现了显著的泛化优势成功率从RT-1的32提高到了62图20RT-2的两个实例模型和基线模型在不同训练任务中的执行成功率对比数据来源BrohanABrownNCarbajalJetalRt-2Vision-language-actionmodelstransferwebknowledgetoroboticcontrolJarXivpreprintarXiv2307158182023广发证券发展研究中心RT-2的另一项长处体现在面对复杂任务下的多阶段语义推理能力DeepMind研究团队将思维链CoT纳入模型中利用增强数据对RT-2进行了微调增强数据中包括一个额外的计划步骤使得RT-2在输出结果时同时输出自然语言的决策目的以及动作Token例如输入指示我饿了输出计划选择rxbar巧克力行动1128124136121158111255通过实验结果可以看出CoT的引入可以让机器人更有逻辑地去完成一项复杂的长任务识别风险发现价值请务必阅读末页的免责声明1933TablePageText深度分析机械设备图21引入CoT能够帮助RT-2完成更为复杂时间跨度更长的任务数据来源BrohanABrownNCarbajalJetalRt-2Vision-language-actionmodelstransferwebknowledgetoroboticcontrolJarXivpreprintarXiv2307158182023广发证券发展研究中心2RoboCat能够自我学习的机器猫当前训练具身大模型面临的最主要的挑战之一是高质量训练数据非常欠缺前面提到的PaLM-E以及RT-2中所使用的机器人数据集绝大部分数据是通过人工示范与人工遥操作的方式收集的费时费力而且效率很低如果可以通过某种方式自动生成机器人的训练数据无疑可以节约大量时间和人工成本2023年6月谷歌DeepMind推出了一种名为RoboCat的AI智能体是全球第一个可以解决和适应多种任务的机器人AI智能体研究人员将多模态大模型Gato的架构与包含了各种机器人手臂的图像序列和动作的大型训练集相结合赋予了RoboCat在模拟环境与物理环境中处理语言图像和动作等任务的能力仅需100次示教RoboCat就可以学会自己操纵机械臂来抓取物品在DeepMind演示视频中RoboCat可以通过自主学习完成套圈搭积木拿放水果等任务值得注意的是不论是操控的机械臂还是要完成的任务RoboCat之前都从未见过在观察了在短短几个小时内收集的1000次人类控制的演示后RoboCat就可以灵巧地指挥这只新手臂以86的成功率拿起齿轮而在经过一定时间的训练后仅需100次示教RoboCat就可以学会一项新任务通过相同水平的演示RoboCat可以快速解决需要精度和理解性的任务例如从碗中取出水果或解决形状匹配谜题这为实现更加复杂的机械控制和应用场景拓展提供了基础识别风险发现价值请务必阅读末页的免责声明2033
|
相关行业报告
|
||||||||||||||||||||||||||
