>> 长江证券-软件与服务行业研究:Meta发布SAM,CV领域迎来GPT时刻-230410
| 上传日期: |
2023/4/11 |
大小: |
948KB |
| 格式: |
pdf 共4页 |
来源: |
长江证券 |
| 评级: |
看好 |
作者: |
宗建树 |
| 下载权限: |
此报告为加密报告 |
|
|
事件描述 2023年4月Meta发布了人工智能模型SAM,可以从图像中挑选出单个对象,以及一个图像注释数据集。Meta官方表示这是有史以来最大的分割数据集(Segmentation Dataset)。根据官网演示,该模型或可实现图片多样分割、可提示的设计分割、可扩展的输出以及零样本迁移。 事件评论 Meta发布SAM,CV有望走向新范式。SAM最高参数量约6.36亿,图片规模1100万,目前可以实现交互分割+自动分割,且可以实现全图一键分割。该分割算法相较于以往主要变化在于两点(1)架构变化:基于vit架构,引入Transformer和RNN,传统视觉算法为CNN;(2)出现零样本学习迁移,即没训练过的物体也可以识别,传统CV均需专项训练后才可有效识别。其作用首先可以在图像标注、分割上作为工具提升效率,其次其出现的零样本学习有望进一步探索新的CV边界。 除此之外,Meta发布图像注释数据集Segment Anything 1-Billion(SA-1B),包含10亿掩模。传统视觉算法图像分割需要提前定义分割特定对象的类别及大量手动注释对象来训练。SAM将交互分割和自动分割相结合,掩模数据集中99.1%实现自动生成。同时SAM有望实现根据提示词进行分割。即未来图像分割范式有望向更加泛化发展。 模型仍有缺陷,但未来成长可期。根据实测该模型对于地面裂缝类似的刁钻图像效果仍不如传统算法,目前该模型应该仅在特征明显的物体上有着更好的效果,对于长尾场景处理仍有缺陷。但根据模型论文描述,该模型目前仅用1100万图片及参数量仅6.36亿,训练细节为在256张A100上训练68h后得到,训练潜力仍可期。 下一个U-net,远观有望带来新场景从可用转向好用。新的模型架构及新的作用实现,该模型有望成为下一个CV foundation model。借鉴U-net分割算法出现带动生物医学图像分割识别走向新阶段,SAM图像分割新范式有望使更多CV复杂场景从可用走向好用。建议关注视觉相关场景,例如安防、智能驾驶、XR、遥感应用、工业视觉。公司层面建议关注中科创达(XR叠加智能驾驶叠加工业视觉)、经纬恒润(智能驾驶)、航天宏图(结合遥感数据应用增效加速场景落地)等公司。 风险提示 1、技术发展不及预期; 2、下游应用需求不及预期。
|
|