研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 申万宏源-计算机行业AIGC系列之13:Meta发布SAM分割模型,或成CV大模型第一步-230410
上传日期:   2023/4/10 大小:   1673KB
格式:   pdf  共15页 来源:   申万宏源
评级:   看好 作者:   施鑫展,刘洋,洪依真
行业名称:   计算机
下载权限:   此报告为加密报告
本期投资提示:
  根据Meta官方发布,2023年4月6日推出了一个AI模型Segment Anything Model(SAM,分割一切模型),能够根据文本指令等方式实现图像分割。
  SAM任务目的:零样本(zero-shot)或者简单prompt下,就对任意图片进行精细分割。SAM证明,多种多样的分割任务是可以被一个通用大模型涵盖的。
  模型方法:整体轻便高效。包括三个部分:两个encoder和一个轻量级mask decoder直接输出有效的mask。在单块V100上,1200x800图生成所有的mask仅需2-3秒。
  开源了SA-1B数据集,包含11亿个mask,1100万张图片,而且可能会大幅改变原有标注范式。SAM团队使用了更加高效的标注方式,一个mask标注平均只需要14秒时间,比COCOmask标注快6.5倍。目前这一数据库已经开源。
  SAM应用,可能包括AR/VR、科学等多个领域。Meta预计与专门为一组固定任务训练的系统相比,基于prompt工程等技术的可组合系统设计将支持更广泛的应用。SAM可以成为AR、VR、内容创建、科学领域和更通用AI系统的组件。比如SAM可以通过AR眼镜识别日常物品,为用户提供提示。
  目前应用于工业和自动驾驶等场景仍需要提升。在背景相对简单、物体逻辑关系也并不复杂的环境下,SAM表现出较好效果。而在工业或自动驾驶等场景中,物体运动速度快、背景复杂、物体逻辑关系复杂,则zero-shot效果可能并不理想。
  我们最终期待怎样的CV大模型?语言大模型和小模型最大区别在于更好的泛化能力。在自然语言理解NLP中,常见任务包括翻译、问答、文本填空等小模型任务,GPT-3等大规模预训练模型不再规定任务,而是对以上不同任务都有较好效果。同样的,我们期待用同一个模型,完成分割、识别、检测、追踪等各种类型的常见CV任务。可以是单目标,也可以是多目标。同时在Zero-shot、Few-shot下也可以获得较好的效果。
  SAM做到的分割一切并不是CV大模型的终点,我们期待一个模型可以无监督完成分割、检测、识别、跟踪等所有CV任务,届时视觉大模型应用会得到极大发展。
  整体对上市公司影响:1、利好有摄像头和场景客户的企业;2、在视觉算法上有积累,可以通过CV大模型进一步提升效率的企业,是机遇也是挑战;3、对于纯标注类型企业,可能新的方法论会产生一定冲击。
  建议重点关注:1)虹软科技,具备A股罕见的AI软件算法能力,且聚焦在图片/CV等领域,其图像分割/VR/AR等技术天然适应此类趋势。2)大华股份/AI领军,国内在AI图像/视频的核心公司,中国的场景禀赋安防/视觉/AI全球领先,所以图像/视频的AI升级,更利于国内。3)当虹科技:当虹科技发布跨模态AIGC(人工智能生产内容)产品,以静态照片生产三维体积视频,不同模态之间相互切换。
  风险提示:大模型技术中美仍存在差异,部分技术尚处于早期实验室阶段,存在落地风险。
  
  
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1