研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 浙商证券-IT服务行业点评报告:世界模型渐成共识,行业从“多模态生成”走向“可交互工作流”-260612
上传日期:   2026/6/14 大小:   397KB
格式:   pdf  共3页 来源:   浙商证券
评级:   看好 作者:   徐紫薇
下载权限:   此报告为加密报告
多模态模型正从单点图像/视频生成,走向理解、生成、编辑和反馈一体化的可交互工作流,世界模型逐渐成为行业共识。我们认为,当前商业化最先落在图像编辑、视频生成、广告素材、电商内容、短视频等Renderer场景;中期竞争重点将转向状态保持、物理一致和跨镜头连续;长期则有望进一步接入机器人、游戏、数字孪生和Agent任务闭环。
  世界模型的定义与节奏:短期商业化在Renderer,中期壁垒在Simulator,长期价值在Planner。
  多模态模型正在从单点内容生成,走向“观察—状态—行动”的世界模型闭环。我们借鉴李飞飞对世界模型的定义:Renderer负责把世界画出来,对应当前文生图、文生视频、图像/视频编辑等最成熟的商业化场景,核心看画质、速度、成本和可控编辑;Simulator负责预测世界怎么变化,要求模型维护空间结构、物体状态、物理关系和时间连续性,是从“看起来真实”走向“可以被使用”的中期壁垒;Planner负责根据目标判断下一步怎么做,是模型进入机器人、游戏、数字孪生和Agent任务闭环的长期价值所在。我们认为,多模态竞争不应只看单次生成效果,短期看内容生产场景的收入验证,中期看状态连续和物理一致性,长期看能否接入真实交互与行动反馈。
   “统一多模态架构”成为从生成工具走向工作流系统的关键方向。
  传统多模态链路通常是理解模型先读图/读文字,生成模型再出图/出视频,后续修改还要依赖编辑器,理解、生成和编辑之间容易断开,多轮修改时主体身份、空间关系和上一轮结果都可能丢失。我们认为,多模态正在从“多模型串联”走向“理解、生成、编辑协同”,主要沿三类问题推进:
  1)表示统一:需要让文本、图像、视频、音频在统一latent/token空间中被持续读写,减少不同模态和任务之间的信息转换损耗;
  2)能力协同:理解侧更偏语义和逻辑,生成侧更偏画面细节和视觉质量,统一架构不是取消分工,而是在共享上下文中重新组织分工,降低理解与生成互相干扰;
  3)训练与效率扩展,通过统一训练目标、奖励模型、MoE、蒸馏等方式提升生成、编辑和视频任务的可用性,使统一架构从概念走向真实工作流。
  整体看,统一多模态架构有望改善多轮编辑、角色一致、镜头控制和跨模态引用能力,是多模态产品从“一次性生成工具”走向“持续可编辑工作流”的基础。
  产品侧验证正在出现:Google、字节、OpenAI分别从视频创作闭环、国产视频商业化和图像生产工具化切入。
  Google Gemini Omni的核心看点不只是视频生成,而是将多模态输入、自然语言编辑和视频创作工具连接起来,并接入Gemini、YouTube等创作和分发入口;Seedance 2.0则体现国产视频模型从能力展示进入API调用、企业接入和MaaS商业化验证阶段;ChatGPTImages 2.0则代表图像生成从“一次出图”走向可交付视觉资产,重点转向文字可读、版式清晰、多图参考和连续编辑。整体来看,多模态产品竞争正在从单点模型效果,延伸到创作工具、平台入口、客户调用和生产流程嵌入。
  商业化右侧信号开始出现,但榜单领先不等于终局胜出。
  根据36Kr,Seedance 2.0单月营收已超10亿元,火山引擎MaaS 26年营收目标上调至150亿元,说明视频模型正在从演示能力走向API调用、企业接入和内容生产工作流。与此同时,图像和视频模型榜单仍在快速轮换,模型质量只是入场券,最终胜负还取决于入口分发、推理成本、编辑稳定性、内容安全、版权合规和工作流嵌入深度等。
  投资建议
  多模态模型正从单点生成能力走向创作、编辑、分发和反馈闭环。我们看好具备底层模型能力、工程化效率、内容生态入口和商业化场景的AI平台型厂商。重点推荐:快手,阿里巴巴。建议关注:Minimax。
  催化剂:多模态模型能力迭代、MaaS调用量变化、视频生成成本下降、内容生产工作流渗透率及真实客户付费验证。
  风险提示
  1、多模态技术迭代不及预期;
  2、宏观政策风险;
  3、商业化落地不及预期及监管风险
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1