研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 东吴证券-汽车行业深度报告:AI系列深度17期,视觉智能为何引入Transformer?-260806
上传日期:   2026/8/6 大小:   1112KB
格式:   pdf  共16页 来源:   东吴证券
评级:   推荐 作者:   黄细里
行业名称:   汽车
下载权限:   无限制-登录即可下载
投资要点
  视觉Transformer化的本质,不是ViT对CNN的一次性替代,而是图像被token化、视觉归纳偏置回归、视觉基础模型形成的渐进过程。CNN之所以在AI1.0时代成为视觉核心架构,源于局部连接、权重共享和平移等变三项视觉归纳偏置与图像数据高度契合;但同样的强先验也带来局部感受野、任务专用、封闭标签和全局建模不足等约束,构成Transformer进入视觉任务的前提。
  Transformer进入视觉的关键,是ViT确立“图像patch即token”的表示方式,使二维图像可被改写为一维序列,并接入自注意力和大规模预训练范式。相较CNN,Transformer具备全局建模与长距离依赖更优、接口统一利于跨任务与跨模态、可扩展性强等优势,且归纳偏置较弱,在大规模预训练下更能释放数据规模价值;但视觉数据并非天然离散序列,且高分辨率、多尺度和空间先验需求更强,因此视觉演化路径与语言不同,更多表现为融合与再平衡,而非彻底替换。
  本报告将视觉Transformer演进归纳为三大阶段、九个子阶段。第一阶段是图像被token化,Non-local等注意力模块先补足CNN全局建模,ViT和DETR进一步改写图像输入与检测输出范式;第二阶段是可扩展通用骨干,Swin、PVT、CoAtNet等重新吸收局部性、层级结构和多尺度先验,ConvNeXt则证明ViT训练经验可反哺卷积网络;第三阶段是视觉基础模型,DINOv2/DINOv3、CLIP、SAM/SAM2/SAM3分别推动自监督通用特征、开放词表图文对齐和可提示分割。
  从落地看,视觉智能仍主要是“感知性”中间能力。图像分类、检测、分割、视觉特征等结果通常需要嵌入既有业务流程才能兑现价值,尚未独立形成语言模型式消费级交互入口;视觉的“互动性”更多通过CLIP、GPT-4V、Florence-2等视觉语言模型接入语言中枢获得。因此,以语言智能的四次跃迁(架构、规模、对齐、推理)为参照,视觉已完成架构与规模两次跃迁,对齐仅以图文对齐形式部分实现且依附于语言,推理跃迁在视觉侧尚未展现。
  我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。
  风险提示:技术迭代不及预期的风险;大模型厂商ARR增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。
  
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1