>> 浙商证券-IT服务行业点评报告:世界模型渐成共识,行业从“多模态生成”走向“可交互工作流”-260612
| 上传日期: |
2026/6/14 |
大小: |
397KB |
| 格式: |
pdf 共3页 |
来源: |
浙商证券 |
| 评级: |
看好 |
作者: |
徐紫薇 |
| 下载权限: |
此报告为加密报告 |
|
|
多模态模型正从单点图像/视频生成,走向理解、生成、编辑和反馈一体化的可交互工作流,世界模型逐渐成为行业共识。我们认为,当前商业化最先落在图像编辑、视频生成、广告素材、电商内容、短视频等Renderer场景;中期竞争重点将转向状态保持、物理一致和跨镜头连续;长期则有望进一步接入机器人、游戏、数字孪生和Agent任务闭环。 世界模型的定义与节奏:短期商业化在Renderer,中期壁垒在Simulator,长期价值在Planner。 多模态模型正在从单点内容生成,走向“观察—状态—行动”的世界模型闭环。我们借鉴李飞飞对世界模型的定义:Renderer负责把世界画出来,对应当前文生图、文生视频、图像/视频编辑等最成熟的商业化场景,核心看画质、速度、成本和可控编辑;Simulator负责预测世界怎么变化,要求模型维护空间结构、物体状态、物理关系和时间连续性,是从“看起来真实”走向“可以被使用”的中期壁垒;Planner负责根据目标判断下一步怎么做,是模型进入机器人、游戏、数字孪生和Agent任务闭环的长期价值所在。我们认为,多模态竞争不应只看单次生成效果,短期看内容生产场景的收入验证,中期看状态连续和物理一致性,长期看能否接入真实交互与行动反馈。 “统一多模态架构”成为从生成工具走向工作流系统的关键方向。 传统多模态链路通常是理解模型先读图/读文字,生成模型再出图/出视频,后续修改还要依赖编辑器,理解、生成和编辑之间容易断开,多轮修改时主体身份、空间关系和上一轮结果都可能丢失。我们认为,多模态正在从“多模型串联”走向“理解、生成、编辑协同”,主要沿三类问题推进: 1)表示统一:需要让文本、图像、视频、音频在统一latent/token空间中被持续读写,减少不同模态和任务之间的信息转换损耗; 2)能力协同:理解侧更偏语义和逻辑,生成侧更偏画面细节和视觉质量,统一架构不是取消分工,而是在共享上下文中重新组织分工,降低理解与生成互相干扰; 3)训练与效率扩展,通过统一训练目标、奖励模型、MoE、蒸馏等方式提升生成、编辑和视频任务的可用性,使统一架构从概念走向真实工作流。 整体看,统一多模态架构有望改善多轮编辑、角色一致、镜头控制和跨模态引用能力,是多模态产品从“一次性生成工具”走向“持续可编辑工作流”的基础。 产品侧验证正在出现:Google、字节、OpenAI分别从视频创作闭环、国产视频商业化和图像生产工具化切入。 Google Gemini Omni的核心看点不只是视频生成,而是将多模态输入、自然语言编辑和视频创作工具连接起来,并接入Gemini、YouTube等创作和分发入口;Seedance 2.0则体现国产视频模型从能力展示进入API调用、企业接入和MaaS商业化验证阶段;ChatGPTImages 2.0则代表图像生成从“一次出图”走向可交付视觉资产,重点转向文字可读、版式清晰、多图参考和连续编辑。整体来看,多模态产品竞争正在从单点模型效果,延伸到创作工具、平台入口、客户调用和生产流程嵌入。 商业化右侧信号开始出现,但榜单领先不等于终局胜出。 根据36Kr,Seedance 2.0单月营收已超10亿元,火山引擎MaaS 26年营收目标上调至150亿元,说明视频模型正在从演示能力走向API调用、企业接入和内容生产工作流。与此同时,图像和视频模型榜单仍在快速轮换,模型质量只是入场券,最终胜负还取决于入口分发、推理成本、编辑稳定性、内容安全、版权合规和工作流嵌入深度等。 投资建议 多模态模型正从单点生成能力走向创作、编辑、分发和反馈闭环。我们看好具备底层模型能力、工程化效率、内容生态入口和商业化场景的AI平台型厂商。重点推荐:快手,阿里巴巴。建议关注:Minimax。 催化剂:多模态模型能力迭代、MaaS调用量变化、视频生成成本下降、内容生产工作流渗透率及真实客户付费验证。 风险提示 1、多模态技术迭代不及预期; 2、宏观政策风险; 3、商业化落地不及预期及监管风险
|
|