研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 长江证券-软件与服务行业研究:谷歌发布RT-2机器人大模型,具身智能奇点渐近-230802
上传日期:   2023/8/3 大小:   483KB
格式:   pdf  共4页 来源:   长江证券
评级:   看好 作者:   宗建树
下载权限:   此报告为加密报告
事件描述
  7月28日,谷歌DeepMind团队发布RT-2机器人大模型。RT-2是2022年发布的RT-1机器人的升级版项目,是首个用视觉-语言-动作(VLA)模态来控制的机器人大模型。RT-2模型控制的机器人具备符号理解(Symbol understanding)、推理(Reasoning)和人类识别(Humanrecognition)三大能力,可以识别理解并泛化从未见过的物体,完成基于数学与图片的逻辑推理,识别理解人类客体。
  事件评论
  RT-2是首个用视觉-语言-动作(VLA)模态来控制机器人的大模型。RT-2机器人复用了RT1的训练数据,将机器人运动数据作为一种模态,混合编入PaLI-X多模态大模型和PaLME多模态大模型的语言-图像大模型(VLM),并通过联合调参的方式构建出VLA模型。调参得到的RT-2大模型展现出了较强的性能,符号理解、推理和人类识别的能力相比于RT-1模型的性能提升了约2-3倍。此外RT-2还具备较强的思维链能力,可以完成多步骤逻辑推理;模型在输入图像数据后会首先输出语言规划结果,再把语言规划结果分解成机械臂动作完成。
  RT-2大模型融合了人形机器人的两条技术路径。目前人形机器人存在两条技术路径:1)运动控制优先,主要用于工业、巡检安防等场景,对机器人动作强度、精度要求较高,此类机器人软件部分搭载了传统的感知、决策、规划算法;2)人机交互优先,主要用于接待、客服等场景,对机器人内容生成、逻辑推理要求较高,此类机器人软件部分搭载了文本-图像大模型(VLM)。RT-2大模型融合了两条技术路径,将机器人动作融入视觉-语言大模型,可以在人机交互能力上较好地完成对机器人的运动控制。
  大模型有望彻底颠覆人形机器人开发范式。当前机器人的感知、决策、控制系统由大量传统算法组合而成,如SLAM算法、路径规划算法等;而传统算法模型即使经历大量的训练,仍存在较多小概率场景(corner case)难以覆盖,泛化能力较低。大模型的出现有望彻底颠覆机器人的软件开发范式。预训练后的大模型具备较高的泛化能力,可以应对从未见过的任务场景,有望大幅度降低了算法开发的复杂度,同时可以简化合并算法模型数量,提升开发效率。
  软件算法在人形机器人产业链上具备较高价值量。当前人形机器人产业链的硬件部分已有商业化落地的方案,产业驱动逻辑在于量产规模效应实现降本;而软件部分尚无成熟的技术方案,因此成为限制人形机器人发展的主要瓶颈。未来随着大模型的渗透率提升,机器人智能化程度有望大幅度提高。参考智能汽车领域的“软件定义汽车”逻辑,软件算法或成为人形机器人厂商的技术护城河,是机器人主机厂实现产品差异化的关键因素。
  风险提示
  1、人形机器人技术突破不及预期;
  2、人形机器人产品需求不及预期。
  
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1