>> 华泰证券-计算机行业专题研究-RT-2:谷歌具身智能新突破-230803
| 上传日期: |
2023/8/3 |
大小: |
1791KB |
| 格式: |
pdf 共11页 |
来源: |
华泰证券 |
| 评级: |
增持 |
作者: |
谢春生 |
| 行业名称: |
计算机 |
| 下载权限: |
此报告为加密报告 |
|
|
具身智能:AI的下一个浪潮 2023年5月,英伟达CEO黄仁勋表示,AI下一个浪潮将是“具身智能”。微软、Google、英伟达等大厂均开展了相关研究。微软基于ChatGPT的强大自然语言理解和推理能力,生成控制机器人的相关代码。英伟达VIMA基于T5模型,将文本和多模态输入交错融合,结合历史信息预测机器人的下一步行动动作。斯坦福大学利用LLM的理解、推理和代码能力,与VLM交互并生成3D value map,来规划机械臂的运行轨迹。Google具身智能路线较多,包括从PaLM衍生来的PaLM-E,从Gato迭代来的RoboCat,以及最新基于RT-1和PaLM-E升级得到的RT-2。 RT-1:第一代RT系列机器人 RT的全称是Robot Transformer,是吸收了包含机器人轨迹数据在内的Transformer架构模型。RT-1的主体包括:卷积神经网络(EfficientNet)、Token学习器和Transformer。RT-1的重要贡献之一是收集了大量的机器人真实数据。Google依靠自己强大的资金和科研实力,耗时17个月,在13台机器人上收集了13万条机器人数据,覆盖超过700个机器人相关任务。大量的机器人真实数据,保证RT-1在训练完成后具有良好的泛化能力。 RT-2:Google具身智能新突破 Google将RT-2定位为新型的视觉语言动作(VLA)模型,实现了视觉语言模型与机器人动作的结合。RT-2一方面吸收了VLM语义推理、问题解决、视觉解释能力,另一方面能够从真实的机器人动作中实现具身任务推理,且两方面能够相互促进。训练方式上,通过将机器人动作拆解为文本token的形式,实现了直接与视觉语言数据混合后输入VLM进行联合微调。此外,Google还专门开发协议,将模型部署在多TPU云服务实现实时推理。实验结果表明,基于现成的VLM模型PaLM-E和PaLI-X,RT-2取得了良好的泛化和涌现性能。 机器人数据来源与动作映射探讨 目前来看,机器人数据来源通常是真实数据和合成数据。Google在RT-1中耗费17个月时间收集了13台机器人的13万条机器人真实数据;GoogleRoboCat,会先收集100-1000个真实的人类专家示例,再合成更多数据;NVIDIAOPTIMUS使用任务运动规划系自动的合成一定数量的机器人轨迹数据;斯坦福VoxPoser则直接生成3D value map引导机器人动作。动作映射上,如果具身模型输出高于机器人低级别动作层级,则需要借助现成的策略或API来实现动作映射;如果模型输出已经在低级别动作层级,则通过简单的变换即可映射到机器人的具体动作。机器人是大模型重要入口和边缘侧的重要载体之一,相关标的包括:柏楚电子、中科创达和萤石网络。 风险提示:宏观经济波动,技术进步不及预期。本报告内容均基于客观信息整理,不构成投资建议。
|
|