>> 申万宏源-计算机行业AIGC系列之13:Meta发布SAM分割模型,或成CV大模型第一步-230410
| 上传日期: |
2023/4/10 |
大小: |
1673KB |
| 格式: |
pdf 共15页 |
来源: |
申万宏源 |
| 评级: |
看好 |
作者: |
施鑫展,刘洋,洪依真 |
| 行业名称: |
计算机 |
| 下载权限: |
此报告为加密报告 |
|
|
本期投资提示: 根据Meta官方发布,2023年4月6日推出了一个AI模型Segment Anything Model(SAM,分割一切模型),能够根据文本指令等方式实现图像分割。 SAM任务目的:零样本(zero-shot)或者简单prompt下,就对任意图片进行精细分割。SAM证明,多种多样的分割任务是可以被一个通用大模型涵盖的。 模型方法:整体轻便高效。包括三个部分:两个encoder和一个轻量级mask decoder直接输出有效的mask。在单块V100上,1200x800图生成所有的mask仅需2-3秒。 开源了SA-1B数据集,包含11亿个mask,1100万张图片,而且可能会大幅改变原有标注范式。SAM团队使用了更加高效的标注方式,一个mask标注平均只需要14秒时间,比COCOmask标注快6.5倍。目前这一数据库已经开源。 SAM应用,可能包括AR/VR、科学等多个领域。Meta预计与专门为一组固定任务训练的系统相比,基于prompt工程等技术的可组合系统设计将支持更广泛的应用。SAM可以成为AR、VR、内容创建、科学领域和更通用AI系统的组件。比如SAM可以通过AR眼镜识别日常物品,为用户提供提示。 目前应用于工业和自动驾驶等场景仍需要提升。在背景相对简单、物体逻辑关系也并不复杂的环境下,SAM表现出较好效果。而在工业或自动驾驶等场景中,物体运动速度快、背景复杂、物体逻辑关系复杂,则zero-shot效果可能并不理想。 我们最终期待怎样的CV大模型?语言大模型和小模型最大区别在于更好的泛化能力。在自然语言理解NLP中,常见任务包括翻译、问答、文本填空等小模型任务,GPT-3等大规模预训练模型不再规定任务,而是对以上不同任务都有较好效果。同样的,我们期待用同一个模型,完成分割、识别、检测、追踪等各种类型的常见CV任务。可以是单目标,也可以是多目标。同时在Zero-shot、Few-shot下也可以获得较好的效果。 SAM做到的分割一切并不是CV大模型的终点,我们期待一个模型可以无监督完成分割、检测、识别、跟踪等所有CV任务,届时视觉大模型应用会得到极大发展。 整体对上市公司影响:1、利好有摄像头和场景客户的企业;2、在视觉算法上有积累,可以通过CV大模型进一步提升效率的企业,是机遇也是挑战;3、对于纯标注类型企业,可能新的方法论会产生一定冲击。 建议重点关注:1)虹软科技,具备A股罕见的AI软件算法能力,且聚焦在图片/CV等领域,其图像分割/VR/AR等技术天然适应此类趋势。2)大华股份/AI领军,国内在AI图像/视频的核心公司,中国的场景禀赋安防/视觉/AI全球领先,所以图像/视频的AI升级,更利于国内。3)当虹科技:当虹科技发布跨模态AIGC(人工智能生产内容)产品,以静态照片生产三维体积视频,不同模态之间相互切换。 风险提示:大模型技术中美仍存在差异,部分技术尚处于早期实验室阶段,存在落地风险。
|
|