研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 华泰证券-计算机行业专题研究-RT-2:谷歌具身智能新突破-230803
上传日期:   2023/8/3 大小:   1791KB
格式:   pdf  共11页 来源:   华泰证券
评级:   增持 作者:   谢春生
行业名称:   计算机
下载权限:   此报告为加密报告
具身智能:AI的下一个浪潮
  2023年5月,英伟达CEO黄仁勋表示,AI下一个浪潮将是“具身智能”。微软、Google、英伟达等大厂均开展了相关研究。微软基于ChatGPT的强大自然语言理解和推理能力,生成控制机器人的相关代码。英伟达VIMA基于T5模型,将文本和多模态输入交错融合,结合历史信息预测机器人的下一步行动动作。斯坦福大学利用LLM的理解、推理和代码能力,与VLM交互并生成3D value map,来规划机械臂的运行轨迹。Google具身智能路线较多,包括从PaLM衍生来的PaLM-E,从Gato迭代来的RoboCat,以及最新基于RT-1和PaLM-E升级得到的RT-2。
  RT-1:第一代RT系列机器人
  RT的全称是Robot Transformer,是吸收了包含机器人轨迹数据在内的Transformer架构模型。RT-1的主体包括:卷积神经网络(EfficientNet)、Token学习器和Transformer。RT-1的重要贡献之一是收集了大量的机器人真实数据。Google依靠自己强大的资金和科研实力,耗时17个月,在13台机器人上收集了13万条机器人数据,覆盖超过700个机器人相关任务。大量的机器人真实数据,保证RT-1在训练完成后具有良好的泛化能力。
  RT-2:Google具身智能新突破
  Google将RT-2定位为新型的视觉语言动作(VLA)模型,实现了视觉语言模型与机器人动作的结合。RT-2一方面吸收了VLM语义推理、问题解决、视觉解释能力,另一方面能够从真实的机器人动作中实现具身任务推理,且两方面能够相互促进。训练方式上,通过将机器人动作拆解为文本token的形式,实现了直接与视觉语言数据混合后输入VLM进行联合微调。此外,Google还专门开发协议,将模型部署在多TPU云服务实现实时推理。实验结果表明,基于现成的VLM模型PaLM-E和PaLI-X,RT-2取得了良好的泛化和涌现性能。
  机器人数据来源与动作映射探讨
  目前来看,机器人数据来源通常是真实数据和合成数据。Google在RT-1中耗费17个月时间收集了13台机器人的13万条机器人真实数据;GoogleRoboCat,会先收集100-1000个真实的人类专家示例,再合成更多数据;NVIDIAOPTIMUS使用任务运动规划系自动的合成一定数量的机器人轨迹数据;斯坦福VoxPoser则直接生成3D value map引导机器人动作。动作映射上,如果具身模型输出高于机器人低级别动作层级,则需要借助现成的策略或API来实现动作映射;如果模型输出已经在低级别动作层级,则通过简单的变换即可映射到机器人的具体动作。机器人是大模型重要入口和边缘侧的重要载体之一,相关标的包括:柏楚电子、中科创达和萤石网络。
  风险提示:宏观经济波动,技术进步不及预期。本报告内容均基于客观信息整理,不构成投资建议。
  
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1