>> 国盛证券-计算机行业下半年的超级场景一:多模态GPT-230503
| 上传日期: |
2023/5/3 |
大小: |
1641KB |
| 格式: |
pdf 共17页 |
来源: |
国盛证券 |
| 评级: |
增持 |
作者: |
刘高畅 |
| 行业名称: |
计算机 |
| 下载权限: |
无限制-登录即可下载 |
|
|
腾讯推出自研机器人灵巧手TRX-Hand和机械臂TRX-Arm,灵活程度堪比人手。4月25日,腾讯Robotics X实验室发布最新机器人研究进展,展示实验室在灵巧操作领域的成果,推出自研机器人灵巧手“TRX-Hand”和机械臂“TRX-Arm”。软硬件一体灵巧手TRX-Hand拥有像人手一样灵活的操作能力,可适应不同场景,灵活规划动作,自主完成“操作”。高性能七自由度拟人机械臂TRX-Arm具有运动灵巧、爆发力强、触控一体以及柔顺安全等特点。RoboticsX实验室计划继续推动TRX-Hand和TRX-Arm的融合,并引入深度学习等前沿算法,提升机器人的灵巧操作能力和解决复杂问题的能力,让其更好的服务现实需求。 GPT-4进入视觉场景,已能实时分析视频信息。2023年3月17日发布的GPT-4支持多模态,能给定由穿插文本和图像的输入,GPT-4生成文本输出。近日已经有开发人员将GPT-4与目标检测网络结合,实时捕获摄像头中的物体进行分析并执行人类指令。演示中开发人员使用一个预训练的Yolov8视觉模型来实时捕获摄像头中的物体信息,结合联网的GPT-4,可以让GPT执行与摄像头中物体相关的人类指令。比如GPT-4能识别出摄像头中开发人员手里的牙刷,然后还能按要求在网上找到牙刷的购买链接。 VIT+GPT,多模态GPT典型范式已明朗,AI进步助力行业机器人加速落地。ViT是可行性得到了充分验证的处理视觉等模态信息的典型技术。2020年,谷歌推出Vision Transformer(ViT)模型,不使用CNN,直接将Transformer编码器用于视觉模型。2023年谷歌又推出了220亿参数的ViT-22b,并用于PaLM-E模型中,可以用于机器人规划操作,完成指令。微软的KOSMOS-1模型结合VIT和LLM理解图像和上下文,Meta的SAM分割图像模型也使用VIT进行图像编码。多模态GPT能极大助力机器人产业的发展,首先可以帮助机器人更好地理解人类指令;还能提升机器人综合处理现实世界的不同模态信号的能力;最后多模态GPT带来泛化能力提升,让机器人的通用性变高,有望实现行业内通用智能。 未来已来:从多行为分析、人机交互到通用机器人。当前多模态的输入输出主要是文本、图像和音频,应用场景包括智能办公和虚拟世界交互。从下半年开始的5年内,随着GPT的发展带来AI泛化能力提升,通用视觉、通用机械臂、通用物流搬运机器人、行业服务机器人、真正的智能家居会进入生活,目前阿里已在实验将通义千问大模型应用到工业机器人。未来5~10年,结合复杂多模态方案的大模型有望具备完备的与世界交互的能力,在通用机器人、虚拟现实等领域得到应用。 建议关注: 算法&行业机器人潜力:大华股份、海康威视、千方科技、中科信息、云从科技、亿嘉和、萤石网络、商汤科技、中科创达等。 硬件供应商:三花智控、拓普集团、鸣志电器、绿的谐波等。 相关多模态处理:万兴科技、当虹科技、星环科技等。 风险提示:AI技术迭代不及预期风险;经济下行超预期风险;行业竞争加剧风险。
|
|