本期投资提示:
绘制具身智能(智联汽车+机器人+智能家居)的产业链格局图,绘制汽车传感器、机械传感器、AI感知、AI推理+理解+运动的产业链位置。1)2020-2022年,大智联汽车的传感器环节是产业链重点。2)2022-2023年,大机器人成为重点,催化剂为特斯拉机器人的进展。3)2022H2至今,软件能力、智慧能力,得到大幅度增强,主要是大模型的研发、营销、工程化落地加速。其中AI 3D视觉的Nerf/BEV/占用网络大大增强,在正文1.4-1.6论述。2023年6月CVPR2023最佳论文、小鹏XNGP能力,增加了自动驾驶大模型的关注度,尤其端到端AI,在1.7论述。具身智能的推理/理解/运动能力大幅增强(例如谷歌/微软/李飞飞VoxPoser),其“智慧性”体现在泛化和“零样本”特征,在1.8-1.11论述。 讨论两大关键问题:耦合/解耦,钟摆效应。1)部分投资者认为具身智能会“解耦“,即软件、硬件(甚至制造和生产等)分离。我们认为:可能是两套体系。尤其“东方式”、“西方式”产业链不同。2)正是由于“解耦”与“耦合”,均在较长时间内存在,但市场往往一段时间只倾斜一个,这就形成认知的钟摆。TMT很多领域是“耦合“的世界领军利润更多(例如安防、手机、工业AI、半导体、GPU),也有较多领域中“解耦”的世界领军利润大(例如专用通信、手机、半导体)。部分领域两种模式都有巨头。3)最终两种路径往往互相学习、借鉴,形成“折中”的形态。模拟了智能汽车产业链中,传感器、大模型两套体系互相借鉴和折中的过程,并做了一些预测。 当前情况下,具身智能和AI软件的工程化落地是关键。1)我们从历史经验中发现,现金流好的公司,创新胜率明显更高。相关公司1996-2006年财务情况验证了安全边际的重要性:即使网景公司如日中天时,自由现金流也不佳。即使亚马逊还在起步阶段,2002年起自由现金流已经是正数。2)工程化能力虽然难以量化,但净营业周期往往是很好的代替,就是经营周转能力。往往反映了“研发+产品+工程+销售+话语权”。正文提供了一些筛选。 如上述AI下沉到具身智能(智能汽车、机器人、智能家居),较多领军公司有机会。但投资者关注的解耦/耦合问题,软硬件钟摆问题,会较长时间带来渗透率的提升,且产业大概率以“多样性”为结果。其中: 1)属于耦合商业模式的(AI和软件能力在服务商乙方本身):萤石网络(tmt&家电家居)、德赛西威(tmt&汽车)、中控技术(机械&tmt)、步科股份(申万机械)。 2)属于解耦商业模式的软件厂商(AI和软件能力在用户甲方本身):柏楚电子(申万机械)、虹软科技。 3)属于解耦商业模式的代工生产为主(乙方是代工生产为主):立讯精密(申万电子)、双环传动(申万汽车&机械)、科博达(申万汽车) 风险:由于复工/宏观环境等扰动,2022-2023年内存在业绩波动风险。智联汽车、具身智能领域一向的风险依然是研究竞争、产业链地位与管理。若难以相对准确地把握,可能会选中了次好的公司,对投资产生不良的结果。 研究报告全文:行业及产计算机业2023年08月20日具身智能深度研究解耦还是耦行业研合从AI化到工程化究行看好智联汽车系列之31暨机器人系列之10业点评相关研究本期投资提示信创下的华为链软硬件自动驾驶证鸿蒙4回归与成长-计算机行业周报绘制具身智能智联汽车机器人智能家居的产业链格局图绘制汽车传感器机械传20230807-202308112023年8月12券感器AI感知AI推理理解运动的产业链位置12020-2022年大智联汽车的传研日感器环节是产业链重点22022-2023年大机器人成为重点催化剂为特斯拉机器人究金融IT等顺周期如期弹性具身智能报AI催化频频-计算机行业周报的进展32022H2至今软件能力智慧能力得到大幅度增强主要是大模型的研发告20230731-202308042023年8月5营销工程化落地加速其中AI3D视觉的NerfBEV占用网络大大增强在正文14-16日论述2023年6月CVPR2023最佳论文小鹏XNGP能力增加了自动驾驶大模型的关注度尤其端到端AI在17论述具身智能的推理理解运动能力大幅增强例如谷歌微软李飞飞VoxPoser其智慧性体现在泛化和零样本特征在18-111论述证券分析师刘洋A0230513050006讨论两大关键问题耦合解耦钟摆效应1部分投资者认为具身智能会解耦即liuyang2swsresearchcom软件硬件甚至制造和生产等分离我们认为可能是两套体系尤其东方式西屠亦婷A0230512080003tuytswsresearchcom方式产业链不同2正是由于解耦与耦合均在较长时间内存在但市场往往戴文杰A0230522100006一段时间只倾斜一个这就形成认知的钟摆TMT很多领域是耦合的世界领军利润更daiwjswsresearchcom王珂A0230521120002多例如安防手机工业AI半导体GPU也有较多领域中解耦的世界领军利wangkeswsresearchcom润大例如专用通信手机半导体部分领域两种模式都有巨头3最终两种路径往刘正A0230518100001往互相学习借鉴形成折中的形态模拟了智能汽车产业链中传感器大模型两liuzhengswsresearchcom杨海晏A0230518070003套体系互相借鉴和折中的过程并做了一些预测yanghyswsresearchcom李蕾A0230519080008当前情况下具身智能和AI软件的工程化落地是关键1我们从历史经验中发现现金lileiswsresearchcom流好的公司创新胜率明显更高相关公司1996-2006年财务情况验证了安全边际的重洪依真A0230519060003hongyzswsresearchcom要性即使网景公司如日中天时自由现金流也不佳即使亚马逊还在起步阶段2002施鑫展A0230519080002年起自由现金流已经是正数2工程化能力虽然难以量化但净营业周期往往是很好的shixzswsresearchcom黄忠煌A0230519110001代替就是经营周转能力往往反映了研发产品工程销售话语权正文提供了一huangzhswsresearchcom些筛选李国盛A0230521080003ligsswsresearchcom如上述AI下沉到具身智能智能汽车机器人智能家居较多领军公司有机会但投林起贤A0230519060002linqxswsresearchcom资者关注的解耦耦合问题软硬件钟摆问题会较长时间带来渗透率的提升且产业大概研究支持率以多样性为结果其中崔航A0230122070011cuihangswsresearchcom1属于耦合商业模式的AI和软件能力在服务商乙方本身萤石网络tmt家电家居联系人德赛西威tmt汽车中控技术机械tmt步科股份申万机械刘洋8621232978182属于解耦商业模式的软件厂商AI和软件能力在用户甲方本身柏楚电子申万机械liuyang2swsresearchcom虹软科技3属于解耦商业模式的代工生产为主乙方是代工生产为主立讯精密申万电子双环传动申万汽车机械科博达申万汽车风险由于复工宏观环境等扰动2022-2023年内存在业绩波动风险智联汽车具身智能领域一向的风险依然是研究竞争产业链地位与管理若难以相对准确地把握可能会选中了次好的公司对投资产生不良的结果行业点评本篇报告1解释具身智能智联汽车机器人智能家居的产业链格局图绘制汽车传感器机械传感器AI感知AI推理理解运动的产业链位置2再涉及投资者关心的两大问题软硬件解耦还是耦合认识的钟摆效应3技术和工程化的初步筛选4部分标的好的属于耦合商业模式的AI和软件能力在服务商乙方本身萤石网络tmt家电家居德赛西威tmt汽车中控技术机械tmt步科股份申万机械属于解耦商业模式的软件厂商AI和软件能力在用户甲方本身柏楚电子申万机械虹软科技属于解耦商业模式的代工生产为主乙方是代工生产为主立讯精密申万电子双环传动申万汽车机械科博达申万汽车1产业链图理解传感器大模型具身智能11从框图开始理解具身智能AI下面这张图是AI感知的不同方式包括传感后融合传感前融合AI大模型等图1AI感知机器人驾驶具身智能的智能化曾都卡在这里这里展示传感后融合-传感前融合-AI大模型注这张图可以近似描述L2-L3-L4自动驾驶的信息最上面是传感后融合传感器数据处理后再融合请务必仔细阅读正文之后的各项信息披露与声明第2页共37页简单金融成就梦想行业点评预测决策控制中间是传感前融合即数据先同步和融合后再预测决策控制下面近似为端到端大大增加了预测规划控制的数据处理资料来源申万宏源研究它尤其适用于描述L2-L3-L4自动驾驶的智能化处理方式而自动驾驶是具身智能重要落地场景最上面是传感后融合传感器数据处理后再融合预测决策控制中间是传感前融合即数据先同步和融合后再预测决策控制下面近似为端到端大大增加了预测规划控制的数据处理如果这个问题扩张到更大的范畴例如增加AI推理理解运动把机器人也绘制进去就得到下面的具身智能产业链图图2把上述问题放到具身智能产业链图即智能驾驶机器人智能家居相关传感器和AI算法资料来源申万宏源研究12传感器汽车传感器对于汽车传感器或智能驾驶域控制器其上下有关系波特五力情况如下图图3汽车传感器的上下游关系和波特五力请务必仔细阅读正文之后的各项信息披露与声明第3页共37页简单金融成就梦想行业点评资料来源申万宏源研究图4ADAS系统在各级别智能汽车中的ASP估计价格单位元数量单位个资料来源百度Apollo官网申万宏源研究请务必仔细阅读正文之后的各项信息披露与声明第4页共37页简单金融成就梦想行业点评13传感器机器人传感器类似的对于机器人传感器其上下有关系波特五力情况如下图值得一提的是2020-2022年是智能汽车传感器获得高关注的阶段尤其硬件预埋趋势下2022-2023年是机器人传感器获得高关注的阶段图5机器人传感器的上下游关系和波特五力资料来源申万宏源研究14AI3D视觉NeRF三维重建新范式NeRF即NeuralRadianceFields神经辐射场其通俗理解给予海量不同视角的二维图合成同一场景不同视角下的图像还可以通俗理解为X-Y-Z到三维极坐标的转化第三视角到第一视角的转化NeRF提出的隐式表达以空间点的坐标和观察者的视角位置作为输入输出则是点的RGB信息和占用密度占用密度这一点与占用函数相似但没有像占用函数那样粗暴地用0和1表示一个点是否被占用而是用01之间的数字表示点被占用的程度这样可以大幅减少计算量请务必仔细阅读正文之后的各项信息披露与声明第5页共37页简单金融成就梦想行业点评辐射场如果我们从一个角度向一个静态空间发射一条射线我们可以查询到这条射线在空间中每个点xyz的密度以及该位置在射线角度下呈现出来的颜色ccRGB即FxyzRGB密度是用来计算权重的对点上的颜色做加权求和就可以呈现像素颜色给定Fxyz直接查表获得RGB值和密度给体渲染方法体渲染对上述辐射场的密度和颜色做积分就可以得到像素的颜色并遍历所有像素这个视角下的图像就渲染出来了图6NeRF从相机焦点出发往一个像素连出一条图7NeRF五维输入输出颜色和密度并且做射线获取射穿过空间中每个点的属性进行积分得到端到端的训练这个像素的颜色资料来源NeRFRepresentingScenesasNeural资料来源申万宏源研究RadianceFieldsforViewSynthesis申万宏源研究15AI3D感知BEV可用于具身智能感知BEV鸟瞰图BEV的全称是Birdseyeview鸟瞰图我们以特斯拉为例特斯拉车型使用多个摄像头采集图像并进行有效的融合系统直接通过将所有摄像头采集图像通过矫正后统一输入到神经网络来提取特征然后利用大模型的Transformer将这些特征进行关联之后再投影到一个向量空间之中BEV的通俗理解把不同视角的观察合成一个天眼模式整体图了解全局尤其图像是2D传感通过连续序列恢复出3D信息请务必仔细阅读正文之后的各项信息披露与声明第6页共37页简单金融成就梦想行业点评图8BEV方式解决多传感器3D感知问题资料来源特斯拉AIDay发布路咖汽车申万宏源研究这种方式的优点有减少硬件传感器提高纯视觉精度可复用多种数据源甚至多模态缺点是成本高1这种鸟瞰图仿佛就是开了一个整体视角让车辆能够把近处的感知统一放到一个平面中尽可能的增大了感知的范围和冗余度2但缺点是成本2023年如果要做BEV的城市辅助驾驶可能需要投入超过百亿元3BEV可以结合国内的传感器优势尽管国外通常利于AI软件优化智能驾驶国内通常利用激光雷达等传感器优化智能驾驶但BEV可以融合激光雷达的点云做到尽量统一下图就是一个案例主要有两个分支将点云数据转换为BEV表示上分支提取3D空间中的点云特征提供更准确的检测结果下分支提取2D空间中的BEV特征原始点云转换提供更高效的网络图9BEV融合激光雷达数据的一个案例资料来源自动驾驶之心申万宏源研究请务必仔细阅读正文之后的各项信息披露与声明第7页共37页简单金融成就梦想行业点评16AI3D感知占用网络占用网络OccupancyNetworkTesla在2022年10月的AIDay中展现了OccupancyNetwork感知技术基本的思想是将三维空间划分成体素voxel通过01赋值对voxel进行二分类有物体的voxel赋值为1表示voxel被物体占据没有物体的voxel被赋值为0当然实际中的赋值可以是概率值表示voxel存在物体的概率这个概率也可以理解成密度或者透明度OccupancyNetwork的通俗理解两维的鸟瞰BEV变为三维的鸟瞰而增加运动序列预测Voxel的使用1voxel其实是计算机图形学和计算机视觉中早期使用的三维重建表达方式主要用于一些对精度要求不是很高的场景进行三维建模2Voxel的属性除了是否被占据还包含语义信息和速度信息OccupancyFlow等其中速度信息是一个三维向量用于表述voxel运动的速度和方向类似于2D图像中的光流OpticalFlow这可以用于判断物体是否运动Occupancy和OccupancyFlow都是底层层次信息非常适合表示非刚体non-rigid场景3一个应用领域是汽车AI还一个领域是CT医学图像Voxel的表达方法存在分辨率内存占用大渲染效率的问题在三维重建领域早已经被mesh所取代但近些年来随着深度学习在三维重建领域中的兴起voxel的重建方案重新兴起以上来自自动驾驶之心2023年1月观点图10TeslaAIday发布的占用网络资料来源特斯拉在CVPR2022公开发布申万宏源研究在恢复空间特征后融合恢复高分辨率复杂输出是关键特斯拉采用暂时对齐TemporalAlignment将不同时序的特征对齐后融合进而采用反卷积上采样恢复高分辨率毕竟是分割3D空间的每个voxel信息量更加稠密低分辨率可能会导致性能请务必仔细阅读正文之后的各项信息披露与声明第8页共37页简单金融成就梦想行业点评受限接下来就是占用网络的预测输出VolumeOutputs后面则可以做更多高级语义非任务和输出比如OccupancyFlowSemanticShapeRoadSurface等可以根据特斯拉在CVPR2022workshop的演讲特斯拉历次AI发布会的披露了解细节占用网络有双重监督信号第一是直接占用值的监督第二是NeRF渲染的监督智能汽车软件进步还包括端到端能力多模态大模型规控算法等2023年5月特斯拉推出FSDv14要现FSD端到端能力即包含高速领航城市道路领航和泊车的智驾功能2023年6月多模态神经网络可能成为后续特斯拉亮点如摄像视频地图导航IMU惯性测量单元GPS等虽然国内的传感器方案较为领先预计会越来越多的借鉴TransformerBEV占用网络等技术2023年6月理想汽车家庭科技日的发布可以作为国内汽车大模型发展的缩影1ADMax30基于BEV架构的车端感知模型已经可以在绝大多数路段实时生成稳定的道路结构信息奠定摆脱高精地图依赖的基础2不止感知算法层面规控算法也使用了大模型技术3其NOA技术架构特点可以理解为使用NPN特征和TIN网络增强BEV大模型做到不依赖高精地图识别万物使用模仿学习让规控算法做出更加拟人的决策全自动全闭环的训练平台支撑大模型持续进化17从AI感知到端到端具身智能感知预测推理理解运动2023年6月Planning-orientedAutonomousDriving以路径规划为导向的自动驾驶获得本届CVPR2023年最佳论文奖BestPaperAward其涉及的是自动驾驶大模型很多思路可以同时用于未来智联汽车具身智能机器人而上述难点1识别控制相关软件2基于感知的运动5学习与控制交叉也在本篇论文的思路中有所涉及从分块优化变成一体化AI优化即端到端在过去自动驾驶AI中一般将认为划分为多模块例如感知预测路径规划等论文提出的端到端即一体化训练一体化AI论文提出UnifiedAutonomousDriving即UniAD它把感知预测规划等三大类主任务多种子任务目标检测目标跟踪场景建图轨迹预测栅格预测和路径规划整合到统一的端到端网络框架下图11自动驾驶大模型尝试多种子任务目标检测目标跟踪场景建图轨迹预测栅格预测和路径规划整合到统一的端到端网络框架请务必仔细阅读正文之后的各项信息披露与声明第9页共37页简单金融成就梦想行业点评资料来源YihanHu等Planning-orientedAutonomousDrivingCVPR2023申万宏源研究例如1在backbone环节特征提取其中涉及BEV和多模态等大模型技术将一系列多相机图像输入特征提取器并将生成的特征通过BEVFormer中的现成BEV编码器转换为统一鸟瞰图BEV特征UniAD并不局限于特定的BEV编码器并且可以利用其他替代方案通过长期时间融合或多模态融合来提取更丰富的BEV表示2在感知环节目标检测与跟踪模块可以实现对动态元素的特征提取帧间物体跟踪检测和跟踪agentsMapFormer将mapqueries作为道路元素例如车道和分隔线的语义抽象semanticabstractions并对地图进行全景分割3预测模块实现动静态元素交互与长时序轨迹预测而且已经有联合训练AI占据栅格预测模块实现了短时序全场景BEV实例级预测由于每个单元的动作都会显着影响场景中的其他因此该模块对所有考虑的单元进行联合预测4在规划模块基于轨迹预测做防碰撞其中涉及占用网络Occupancynetwork等大模型技术基于自身的轨迹预测和基于占据栅格的碰撞优化并使自己远离OccFormer预测的占用区域occupiedregions以避免碰撞请务必仔细阅读正文之后的各项信息披露与声明第10页共37页简单金融成就梦想行业点评图12论文指数也每个环节的重要指标且指出联合训练AI的作用例如两个识别子任务大大帮助了运动预测资料来源YihanHu等Planning-orientedAutonomousDrivingCVPR2023申万宏源研究此前端对端AI训练很容易出现的问题是由于涉及环节太多系统太复杂很容易出现局部最优和梯度下降问题我们本来以为会用残差网络ResNet增加反馈参数来帮助自动驾驶大模型的训练而论文提出的联合训练AI即预测联合训练预测规划一体训练实现了类似全局优化而子任务的引入也细化了环节这篇论文的趋势可能会改变具身智能智联汽车机器人智能家居的AI软件训练方式尝试端对端并用一系列联合训练来防止局部最优达到更好的效果18具身智能AI推理理解例如谷歌微软等作为科技巨头微软的chatGPT也在努力渗透硬件载体例如机器人软件领域而这些恰恰将AI从感知推进到推理和理解范畴ChatGPT在人机交互的4大潜在应用1Zero-shottaskplanning根据自然语言指令生成适用于不同机器人平台和任务的代码无需任何预先训练或微调这种能力可以让用户快速地探索不同的机器人方案而不需要了解底层的编程细节场景机械臂操作无人机导航家庭助理机器人等优点可以实现跨平台跨任务的机器人控制缺点可能存在代码错误或效率低下的风险2Userontheloop交互式对话以解决复杂的机器人任务例如需要多步骤或多个目标的任务用户可以通过对话提供高层次的反馈指导或修改指令而ChatGPT可以根据用户的意图和上下文调整代码或行为这种能力可以让用户更灵活地控制机器人而不需要一次性给出完整的指令请务必仔细阅读正文之后的各项信息披露与声明第11页共37页简单金融成就梦想行业点评场景机器人协作机器人教学机器人规划等优点可以提高机器人任务的成功率和鲁棒性缺点可能需要更多的对话轮次或用户干预3Perception-actionloopsChatGPT可以利用视觉信息来指导机器人的动作例如识别物体估计距离规避障碍等可以通过XML标签或其他格式来接收和处理图像数据并生成相应的代码或动作序列这种能力可以让机器人更好地适应复杂和动态的环境而不需要预先定义所有可能的情况适用场景包括机器人导航机器人抓取机器人搜索等优点是可以增强机器人的感知和决策能力缺点是可能存在视觉误识别或动作不准确的风险1Reasoningandcommon-senseroboticstasksChatGPT可以利用常识知识和推理能力来解决一些需要逻辑几何或数学思维的机器人任务例如计算角度判断方向选择最优路径等ChatGPT可以通过自然语言或数学表达式来表达和解决这些问题并生成相应的代码或动作序列这种能力可以让机器人更智能地执行一些抽象或难以描述的任务而不需要用户提供过多的细节适用场景包括机器人推理机器人游戏机器人创造等优点是可以拓展机器人的应用范围和难度缺点是可能存在常识错误或推理失败的风险图13当用户的指令模糊不清时ChatGPT会提出图14工业检查场景MicrosoftAirSim模拟器澄清问题ChatGPT能够有效解析用户的高级意图和几何线索准确控制无人机资料来源申万宏源研究资料来源微软官方网站申万宏源研究谷歌的PaLM-E会利于具身智能EmbodiedAI的发展一方面具身智能主要涉及机器人的感知规划控制导航等上层部分另一方面具身AI不再像传统AI仅从图像视频文本等数据库中学习而是基于自身传感器多是视觉传感器感知环境并通过与环境交互进行学习大模型AI发展后其对具身智能的提升至少包括请务必仔细阅读正文之后的各项信息披露与声明第12页共37页简单金融成就梦想行业点评1通过抽象的自然语言直接对机械智能控制2Zeroshot下的CV能力图像分类语义分割目标检测实例分割物体追踪3更多跨模态的理解能力其中PaLM-E目前一大特色就是跨模态PaLM-E562BillionparametersPalM540BViTVisionTransformer22B它本身是个多模态的大模型不仅能理解文本还能理解图片因为加了ViT可以理解图片中的语义信息Few-shotprompt可以看懂笑话左上角zero-shot可以具有图文思维链图15PaLM-E图像分割语义分割目标检测实例分割四种任务资料来源PaLM-EAnEmbodiedMultimodalLanguageModel申万宏源研究19具身智能AI理解运动上述微软谷歌等AI功能似乎和运动执行路径规划等更加聚焦的智能关联度低而以UCLA论文DesignofaHighlyDynamicHumanoidRobotDevelopmentandReal-TimeOptimization-basedControlofaFull-sizedHumanoidforDynamicWalkingandRunning为例涉及这些软件较为深入这些会启发我们2023H2甚至未来多年机器人软件AI大模型的一些趋势计算单元分为控制安全接口控制接口摄像感知接口硬件接口等均涉及软件图16UCLA机器人论文中ARTEMISS的软件系统示意包括安全接口控制接口摄像感知接口硬件接口等请务必仔细阅读正文之后的各项信息披露与声明第13页共37页简单金融成就梦想行业点评资料来源UCLADevelopmentandReal-TimeOptimization-basedControlofaFull-sizedHumanoidforDynamicWalkingandRunning申万宏源研究它们对AI机器人软件的涉及包括1稳定性问题可以归纳为识别控制相关软件ARTEMIS的最初动机是一个可以进行超动态运动的平台本论文侧重于这项努力的第一步有力地行走和奔跑的能力后续希望满足跳跃转身等复杂问题需要做一些延展例如其一为推广运动生成流水线使其不需要专家知识和平台经验可以归纳为zero-shot经验的运动生成其二为提高稳定性的软件跟踪潜在复杂和快速变化的鲁棒控制器2路径规划当前已经有一定泛化能力希望后续发展身体控制路径规划跨平台运动没有感知数据地面上存在重大障碍物时ARTEMIS也能够保持平衡并在遇到意外时避免掉落这是因为ARTEMIS的运动堆栈的反应性质但下一步可以在没有运算指引的情况下通过身体控制路径规划等实现高效的运动ARTEMIS可以稳健地从A点移动到B点但走哪条路仍然是一个未完成的任务如果这样做成不仅限于ARTEMIS还为混合系统的路径规划领域开辟路径3基于感知的运动下一步有两个路径一个是多步骤足迹规划一个是状态估计当前基于环境的运动有一定进展当前先感知数据以告知机器人脚可以定位的安全区域这可以从头部的立体相机或位于其身体的两个立体相机获得感知数据可用后下一个挑战是呆在安全区域一个解决方法是更长的足迹规划另一个解决方法是态估计目前机器人浮动底座的位置状态不可观察导致坐标系漂移若将感知数据与定位上下文中的状态估计结合则所有状态都变得可观察请务必仔细阅读正文之后的各项信息披露与声明第14页共37页简单金融成就梦想行业点评图17ARTEMISS平台上的三维ZED视觉可以帮助基于视觉的路径规划资料来源UCLADevelopmentandReal-TimeOptimization-basedControlofaFull-sizedHumanoidforDynamicWalkingandRunning申万宏源研究图18ZED2的三维视觉和两个英特尔实感D435i拼接后生成周围环境的点云帮助基于感知的路径规划资料来源UCLADevelopmentandReal-TimeOptimization-basedControlofaFull-sizedHumanoidforDynamicWalkingandRunning申万宏源研究尽管这是当前领先的设计但也做出下一步机器人软件发展的趋势展望4把物理接触建模在抓取碰撞等任务中问题会放大工作控制器中模拟建模和实际物理情况经常有差距模拟与现实之间的差距经常在学习社区中讨论但在机器人技术中却很少被强调这个问题可能会在碰撞检查很重要的其他机器人领域反复出现例如灵巧操作和抓取领域请务必仔细阅读正文之后的各项信息披露与声明第15页共37页简单金融成就梦想行业点评5学习与控制交叉口硬件上做上述测试成本太高在考虑鲁棒性或随机性的作品但另一种方法可能是在管道中采用基于机器学习AI的方法而且可以推测一旦AI训练资源足够很可能后续的动作会更加多样因为论文提到模型相关的计算负担模型中的非线性通常会禁止它们在在线规划和控制中的使用Additionallynonlinearitiesinthemodelsoftenprohibittheirusageinonlineplanningandcontrolbecauseofthecomputationalburdenassociatedwiththem6人机交互HRIARTEMIS也可以成为一个有趣的平台可用于探讨超动态运动以外的主题其中之一就是人机交互7合成运动也就是连续运动反映的意图和情绪运动发生的规模和速度可以暗示接下来的运动是什么此外运动的空间和时间方面的差异也可以表示情绪和意图而其中1识别控制相关软件2基于感知的运动5学习与控制交叉正是下一章节论文涉及的110具身智能的零样本尝试如李飞飞VoxPoser解决需要预定义动作机器无法直接被LLM大语言模型操控问题2023年7月VoxPoserComposable3DValueMapsforRoboticManipulationwithLanguageModels中指出1很多训练需要预训练预定义大语言模型LLM虽然取得了进展但大多数人仍然依赖预定义的动作原语来与环境进行物理交互这仍然是一个主要瓶颈2大语言模型直接输出控制不可行文本通常由高维空间中的高频控制信号驱动而机器人运动无法直接达到高维高频率本论文的解决思路是利用LLM的优点LLM在自由形式语言教学中擅长推断可能性和约束条件而且通过LLM可以具备代码编写能力代码能力可以与视觉语言模型VLM交互以组成3D价值图将知识根植于观察空间然后将组合的值映射为机器人的轨迹专业说法是基于模型的零样本具有动态扰动鲁棒性的闭环机器人轨迹论文将这种方法称为VOXPOSER这是一种从LLM中提取可能性和约束的公式用于在3D观察空间中组成体素Voxel1值图以引导机器人与环境交互具体来看1从指令语言中输出语言的可供性和约束2转化成PYTHON代码3代码调用API1体素voxel是像素pixel体积volume和元素element的组合词相当于3D空间中的像素体素用于三维成像科学数据与医学影像等领域概念上类似二维空间的最小单位像素也可以把它类比为点云激光雷达的输出的简化版本请务必仔细阅读正文之后的各项信息披露与声明第16页共37页简单金融成就梦想行业点评4API操纵3D体素Voxel5AI的奖励机制正文指出有效地提供观察空间中的密集奖励能够在每一步都重新规划训练动作6路径规划期目标函数并合成路径图19VoxPoser算法示意图注最上面一行展示了感兴趣的实体是对象或零件的位置值映射将引导它们指向目标位置下面两行展示了感兴趣的实体是机器人末端执行器的任务最底层的任务涉及两个阶段这两个阶段也由LLM协调资料来源VoxPoserComposable3DValueMapsforRoboticManipulationwithLanguageModels申万宏源研究图20VoxPoser的零样本合成轨迹和错误分解资料来源VoxPoserComposable3DValueMapsforRoboticManipulationwithLanguageModels申万宏源研究请务必仔细阅读正文之后的各项信息披露与声明第17页共37页简单金融成就梦想行业点评111具身智能的泛化尝试谷歌RT1RT2我们分析了2022年12月RT-1ROBOTICSTRANSFORMERFORREAL-WORLDCONTROLATSCALE2023年7月RT-2Vision-Language-ActionModelsTransferWebKnowledgetoRoboticControl做一些分析2022年12月RT-1ROBOTICSTRANSFORMERFORREAL-WORLDCONTROLATSCALE指出1难点是可扩展和大容量AI在视觉NLP等领域已经成功从孤立的小规模数据模型转向大型通用模型预训练过后续要点是开放式任务不可知训练以及能够吸收大规模数据形成高容量架构2难点是机器人的多任务模型在有监督学习中消除对大型特定任务数据集的训练很有意义但对于多任务训练很难在机器人领域希望训练一个强力的大型的多任务骨干模型图21RT-1的体系结构图注该指令被转换后通过FiLM层调节预先训练的EfficientNet生成的视觉语言标记由TokenLearner精简输入到Transformer中输出标记化动作资料来源RT-1ROBOTICSTRANSFORMERFORREAL-WORLDCONTROLATSCALE申万宏源研究具体来说请务必仔细阅读正文之后的各项信息披露与声明第18页共37页简单金融成就梦想行业点评3对图像和语言转为标记Token模型建立在Transformer架构上以图像和任务描述的历史作为输入并直接输出标记化的动作4依赖图像和语言的预训练这是后续可以改善的图像通过ImageNet预训练的EfficientNet-B3TanLe2019模型该模型以6幅分辨率为300300的图像作为输入并从最终卷积层输出形状为99512的空间特征图对于语言的预训练先通过Universal语句编码器嵌入Cer等人2018然后转为FiLM层Perez等2018的输入该层被添加到预训练的EfficientNet中以调节图像编码器5经过TokenLearner到标记化动作上述指令被转换后通过FiLM层调节预先训练的EfficientNet生成的视觉语言标记由TokenLearner精简输入到Transformer中输出标记化动作2023年7月RT-2Vision-Language-ActionModelsTransferWebKnowledgetoRoboticControl1增加互联网学习能力利于扩展论文指出研究了如何将基于互联网规模数据训练的视觉语言模型直接纳入端到端机器人控制中并使RT-2能够从互联网规模的训练中获得一系列紧急能力这利于解释机器人训练数据中不存在的命令的能力例如将对象放置在特定数字或图标上以及响应用户命令执行基本推理的能力如例如拾取最小或最大的对象或最接近另一对象的对象2增加有效率的泛化能力论文指出为了将自然语言响应和机器人动作都适应相同的格式将动作表示为文本标记并以与自然语言标记相同的方式将其直接合并到模型的训练集中正文称之为视觉语言动作模型VLA值得注意的是本文的VLAVLM与李飞飞团队定义的VLM的含义有相似之处均为visionlanguageactionmodel只是VLA更强调动作action3强调了动作微调为了使视觉语言模型能够控制机器人必须训练它们输出动作论文采取了一种直接的方法来解决这个问题将动作表示为模型输出中的标记类似语言标记动作空间主要包括机器人末端执行器的六自由度6DoF位置和旋转位移连续维度除离散终止命令外被均匀地离散为256个仓因此机器人动作可以使用离散仓的序数表示为8个整数为了使用这些离散化的动作将视觉语言微调为VLA视觉语言动作模型需要将模型的现有标记化中的标记与离散动作仓相关联可见RT-2的发展将具身智能的智能化继续推进它1延续了RT-1的多模态视觉指令动作一体化智能与李飞飞团队VoxPoser的VLM思路有相似之处2泛化和延展性大大增加但在0样本和动作自由度上依然有空间请务必仔细阅读正文之后的各项信息披露与声明第19页共37页简单金融成就梦想行业点评3投资者2022-2023年机器人投资标的主要是减速器传感器等硬件预计未来会走向大模型软件等标的4相关标的柏楚电子申万机械虹软科技中控技术tmt机械萤石网络等图22RT-2能够概括到需要推理符号理解和人类认知资料来源RT-2Vision-Language-ActionModelsTransferWebKnowledgetoRoboticControl申万宏源研究图23RT-2在应急技能左大小和训练消融中右的定量表现资料来源RT-2Vision-Language-ActionModelsTransferWebKnowledgetoRoboticControl申万宏源研究112产业链小结可见12020-2022年大智联汽车的传感器环节是产业链重点22022-2023年大机器人成为重点催化剂为特斯拉机器人的进展请务必仔细阅读正文之后的各项信息披露与声明第20页共37页简单金融成就梦想
|
相关行业报告
|
||||||||||||||||||||||||||
