研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 国盛证券-通信行业深度:AI文生视频,多模态应用的下一站-231009
上传日期:   2023/10/9 大小:   2565KB
格式:   pdf  共24页 来源:   国盛证券
评级:   中配(下调) 作者:   宋嘉吉,孙爽
行业名称:   通信
下载权限:   无限制-登录即可下载
市场认为,AI应用已经逐渐步入成熟期,但未见杀手级应用。本篇报告中,我们谨以“文生视频”这一多模态应用为例,阐述AI应用的发展尚处于早期,相对应地,算力需求远未见顶。
  文生视频是多模态AIGC圣杯,优化迭代速度慢。视频是多帧图像的组合,然而文生视频在文生图的基础上增加了时间维度,技术实现更困难。即便是Meta和Google这样的硅谷人工智能巨头,在文生视频上进展缓慢,它们分别推出的Make-A-Video和Phenaki均尚未公测。
  文生视频底层模型及技术仍在优化,未筛选出最优模型。文生视频技术主要发展过程经历了基于GAN和VAE、基于Transformer模型、基于扩散模型三个阶段。目前主流的文生视频模型主要依托Transformer模型和扩散模型。1)基于Transformer的代表Phenaki突破了视频生成时长限制,但效果相对粗糙缺少细节。2)基于扩散模型的代表Make-AVideo重在提升视频质量,但其视频时长均在4s以内。
  文生视频效果各异,总体质量较低。当前文生视频可公测应用较少,仅有RunwayGen-2、ZeroScope及Pika Labs等少数几个,它们有如下共同问题:1)复杂人物动作生成帧连续效果较差;2)非日常场景的视频架构能力连续能力一般;3)多主体视频生成缺乏逻辑连续性等。
  文生视频当前商用化程度较低,可从图片生成看其商业前景。1)根据七麦数据,图片生成类应用在多模态大模型中,表现出较强的收费能力,应用数量上占比最高。2)当前唯一收费的文生视频应用(RunwayGen-2),商业模式与图片生成趋同,即主要按照生成量定价。
  看好人像生成细分领域,但营收持续增长能力仍待验证。1)Lensa AI推出人像生成功能后,去年12月前12日内创收2930万美元,但2023年7月全球收入已回落为100万美元;2)妙鸭相机上线即火爆,半月营收估计超过29万美元,后续须上线新模板、新玩法维持营收增长。
  看好算力储备大厂在多模态生成领域的发展。1 )文生图应用Midjourney日活达1500万,年收入超1亿美元,它推出的多版无限量套餐、高速GPU服务反映出市场对算力的巨大需求。2)目前国内文生图多为计次付费,尚未出现无限量套餐,或因算力受限,我们认为,具有算力储备的云服务厂商在发展视频生成类应用上具有天然优势。
  看好业务协同向发展,看好文生视频与文生图、图生视频的联动。AI对产品价值的拉动表现为:1)促活、拉新:Adobe、Microsoft 365Copilot分别在软件原有基础上推出AI工具;2)提升产品价格:OfficeCopilot是基于GPT-4 API的应用,Copilot加入后Office当前四种商业版整体订阅价格涨幅达53-240%。我们看好文生视频能与原有产品产生协同,降本增效的公司,例如游戏、影视制作等领域的公司。
  投资建议:1)算力:AIGC蓬勃发展的基石,建议关注光通信,包括中际旭创、天孚通信、新易盛、太辰光、德科立;算力设备:盛科通信、恒为科技、锐捷网络、寒武纪、美格智能、紫光股份、工业富联、中兴通讯等;算力租赁:中贝通信、云赛智联等;2)模型层:建议关注金山办公、万兴科技、科大讯飞等;3)应用层:看好游戏的迭代创新,建议关注恺英网络、神州泰岳、盛天网络、游族网络等。
  风险提示:伦理风险、知识产权及版权风险、计算资源限制。
研究报告全文:证券研究报告行业深度2023年10月09日通信AI文生视频多模态应用的下一站市场认为AI应用已经逐渐步入成熟期但未见杀手级应用本篇报告增持维持中我们谨以文生视频这一多模态应用为例阐述AI应用的发展尚处于早期相对应地算力需求远未见顶行业走势文生视频是多模态AIGC圣杯优化迭代速度慢视频是多帧图像的组合然而文生视频在文生图的基础上增加了时间维度技术实现更困通信沪深300难即便是Meta和Google这样的硅谷人工智能巨头在文生视频上进80展缓慢它们分别推出的Make-A-Video和Phenaki均尚未公测6448文生视频底层模型及技术仍在优化未筛选出最优模型文生视频技术32主要发展过程经历了基于GAN和VAE基于Transformer模型基于16扩散模型三个阶段目前主流的文生视频模型主要依托Transformer模0型和扩散模型1基于Transformer的代表Phenaki突破了视频生成时-16长限制但效果相对粗糙缺少细节2基于扩散模型的代表Make-A-2022-102023-022023-062023-09Video重在提升视频质量但其视频时长均在4s以内文生视频效果各异总体质量较低当前文生视频可公测应用较少仅作者有RunwayGen-2ZeroScope及PikaLabs等少数几个它们有如下共同问题1复杂人物动作生成帧连续效果较差2非日常场景的视频分析师宋嘉吉架构能力连续能力一般3多主体视频生成缺乏逻辑连续性等执业证书编号S0680519010002邮箱songjiajigszqcom文生视频当前商用化程度较低可从图片生成看其商业前景1根据分析师孙爽七麦数据图片生成类应用在多模态大模型中表现出较强的收费能执业证书编号S0680521050001力应用数量上占比最高2当前唯一收费的文生视频应用Runway邮箱sunshuanggszqcomGen-2商业模式与图片生成趋同即主要按照生成量定价相关研究看好人像生成细分领域但营收持续增长能力仍待验证1LensaAI1通信亚马逊重金投资AnthropicAI战场的合纵推出人像生成功能后去年12月前12日内创收2930万美元但2023连横2023-09-26年7月全球收入已回落为100万美元2妙鸭相机上线即火爆半月2通信AI算力再起开启全球共振2023-09-24通信文生游戏诞生开启游戏营收估计超过29万美元后续须上线新模板新玩法维持营收增长3RobloxAIGC革命2023-09-18看好算力储备大厂在多模态生成领域的发展1文生图应用Midjourney日活达1500万年收入超1亿美元它推出的多版无限量套餐高速GPU服务反映出市场对算力的巨大需求2目前国内文生图多为计次付费尚未出现无限量套餐或因算力受限我们认为具有算力储备的云服务厂商在发展视频生成类应用上具有天然优势看好业务协同向发展看好文生视频与文生图图生视频的联动AI对产品价值的拉动表现为1促活拉新AdobeMicrosoft365Copilot分别在软件原有基础上推出AI工具2提升产品价格OfficeCopilot是基于GPT-4API的应用Copilot加入后Office当前四种商业版整体订阅价格涨幅达53-240我们看好文生视频能与原有产品产生协同降本增效的公司例如游戏影视制作等领域的公司投资建议1算力AIGC蓬勃发展的基石建议关注光通信包括中际旭创天孚通信新易盛太辰光德科立算力设备盛科通信恒为科技锐捷网络寒武纪美格智能紫光股份工业富联中兴通讯等算力租赁中贝通信云赛智联等2模型层建议关注金山办公万兴科技科大讯飞等3应用层看好游戏的迭代创新建议关注恺英网络神州泰岳盛天网络游族网络等风险提示伦理风险知识产权及版权风险计算资源限制请仔细阅读本报告末页声明2023年10月09日内容目录1文生视频多模态AIGC圣杯411相较于文字和图片视频能承载的信息量更大412当前公测的文生视频应用数量较少413文生视频难在哪里52技术路线沿革文生视频哪种技术更强621阶段一基于GAN和VAE以Text2Filter为代表622阶段二基于Transformer以Phenaki为代表623阶段三基于扩散模型以Make-A-Video和阿里通义为代表7231MetaMake-A-Video8232阿里达摩院通义文生视频大模型9233Zeroscope由阿里达摩院Modelscope文生视频模型优化得出93实测文生视频模型当前风格各异总体质量较低1031复杂人物动作生成帧连续效果较差1032非日常场景的视频架构能力连续能力一般1133多主体视频生成缺乏逻辑连续性124从图片生成看文生视频的商业前景1341为什么选择图片生成作为对标对象13411图片生成相对成熟13412已经收费的视频生成应用商业模式与图片生成趋同1342细分领域看好人像生成短期内变现较快14421LensaAI人像生成功能推出后用户付费意愿高14422妙鸭相机国内首个破圈应用写真生成引起社交裂变1543竞争优势看好有算力储备的公司16431Midjourney无限量套餐拢获用户映射市场对算力的高需求16432腾讯云云服务厂商加紧多模态生成布局17433无界AI按时长付费和潮汐生成模式彰显算力底座特性1844业务协同看好多模态生成与原有业务有协同的公司19441AdobeAI生成工具有望带来增量付费用户19442Microsoft365Copilot推出增强功能高定价反应市场强需求2045展望看好文生视频与文生图图生视频的联动205投资建议21风险提示23图表目录图表1文生图与文生视频发展进程4图表2Phenaki与Make-A-Video模型对比5图表3基于GAN及VAE文生视频示意图6图表4Phenaki文生视频示意图7图表5Phenaki模型原理图7图表6扩散模型原理示意图8图表7Make-A-Video视频生成过程图解8图表8Make-A-Video模型原理图8图表9通义-文本生成视频大模型-英文-通用领域-v10模型原理示意图9图表10RunwayZeroScopePikaLabs生成时长平台对比10P2请仔细阅读本报告末页声明2023年10月09日图表11RunwayGen-2ZeroScopePikaLabs人物动作应用效果对比11图表12RunwayGen-2ZeroScopePikaLabs非日常场景应用效果对比11图表13RunwayGen-2ZeroScopePikaLabs多主体应用效果对比12图表14各家图像生成类模型应用对比13图表15RunwayGen-2套餐收费标准及对应权益14图表16LensaAI魔法头像应用截图14图表17妙鸭相机写真制作过程图15图表18妙鸭相机榜单排名15图表19妙鸭相机近一月收入估算截至2023年8月14日16图表20Midjourney套餐收费标准及对应权益16图表21腾讯云AI绘画PaaS版收费标准17图表22腾讯云AI绘画功能示意图17图表23无界AI专业版购买时长收费标准18图表24无界AI权益卡等级与对应权益18图表25AdobeFirefly功能示意图19图表26Firefly定价方案19图表27科幻预告片TrailerGenesis创世纪2周内在YouTube上达14万播放量20图表28投资标的22P3请仔细阅读本报告末页声明2023年10月09日1文生视频多模态AIGC圣杯文生视频当前处于起步阶段随着文生图图片对话技术的成熟文生视频成为多模态大模型下一步发展的重点目前国内亦有文生视频功能但主要停留在图片组合阶段我们认为多模态尤其是文生视频的发展将为应用的爆发提供更立体的基础设施同时对算力的需求也将指数级增长对AI下阶段的发展至关重要本文所介绍的文生视频是指内容之间有关联性与协同性能生成有连续逻辑的视频模型11相较于文字和图片视频能承载的信息量更大相较于文字和图片视频在多维信息表达画面丰富性及动态性方面有更大优势视频可以结合文本图像声音及视觉效果在单一媒体中融合多种信息形式从视频生视频到文生视频图生视频多模态的发展重视用更少的用户输入信息量实现更丰富的AI生成结果自Runway推出Gen-1视频生视频工具后AI处理视频图片功能在社交平台爆火其背后即是多模态大模型发展的表现之一在多模态应用方面当前可应用的模态转化主要集中在文字图片视频的转化12当前公测的文生视频应用数量较少文生图领域2021年1月5日OpenAI发布其首个基于Clip模型的文生图模型DALLE但并未开源自此众多公司争先研发文生图模型2022年3月13日Midjourney发布可公测的文生图模型其效果优越引发了公众关于AI艺术的讨论目前已积累较多用户可稳定使用的文生图模型主要有MidjourneyStableDiffusionDALLE等文生视频领域目前公众可使用的主要有RunwayGen-1RunwayGen-2ZeroScopePikaLabs其中除Runway收费外ZeroScopePikaLabs均可免费使用文生视频发展速度慢于文生视频在视频质量视频时长等方面突破较为困难相比于文生图的快速优化迭代文生视频的进展较慢图表1文生图与文生视频发展进程资料来源OpenAIMicrosoftMidjourneyGoogleStabilityAIAdobe阿里达摩院百度魔塔国盛证券研究所P4请仔细阅读本报告末页声明2023年10月09日即便是Meta和Google这样的硅谷人工智能巨头在文生视频方面也进展缓慢她们分别推出的Make-A-Video和Phenaki均尚未公测从官方公布的Demo看Phenaki虽然可生成任意长度视频但其质量较差且欠缺真实性Make-A-Video无需文本-视频配对数据集视频质量相对较好但时长短图表2Phenaki与Make-A-Video模型对比PhenakiMake-A-Video模型原理Transformer扩散模型数据集类型文本图像文本视频文本图像突破点视频长度视频品质资料来源PhenakiVariablelengthvideogenerationfromopendomaintextualdescripitonsMake-A-VideoText-To-VideogenerationwithoutText-Videodata国盛证券研究所13文生视频难在哪里文生视频更困难技术实现本身更困难从本质看视频是连续的多帧图像然而文生图到文生视频并非简单的图片组合而文生视频在文生图的基础上增加了时间维度文生视频需突破瓶颈多可用的文生视频需具备一定的时长优良的画面质量一定的创意逻辑性及还原指令要求能力计算难度大计算成本高通过文本生成高质量图片对算力的要求已经达到了一定程度由于生成视频模型复杂度提升及其时长分辨率提高等因素文生视频对算力的需求进一步加大计算复杂性提升文生视频需要进行高维特征融合模型复杂度显著提升数据要求高缺乏高质量配对数据集视频的合理性及连贯性体现模型的架构能力创造力理解能力例如当用户输入一只大象在厨房做饭这类文字指令时模型需理解文字指令内容并根据训练数据库选取画面及对象组合过程中可能出现缺乏相应素材难以合理组合人物难以合理架构场景等问题文生视频需要大量的文本-视频配对数据但当前缺乏相应数据集数据标注工作量极高缺乏具备多样性的数据集由于用户的文本指令要求各异缺乏多样数据集使得模型无法生成预期效果技术融合难度大多领域融合技术复杂性提升文生视频涉及自然语言处理视觉处理画面合成等领域跨学科多领域使其需攻克的技术难点增加P5请仔细阅读本报告末页声明2023年10月09日2技术路线沿革文生视频哪种技术更强同文生图及大语言模型的发展类似文生视频也在不断探索中寻找更为高效且效果更佳的基础模型目前主流的文生视频模型主要依托Transformer模型和扩散模型目前阿里ModelScope社区中提供了可用的基于扩散模型的开源文生视频模型促进了如ZeroScope高质量文生视频模型的发展有利于后续文生视频的技术迭代优化21阶段一基于GAN和VAE以Text2Filter为代表原理文生视频发展早期主要基于GANGenerativeAdversarialNets生成式对抗网络和VAEVariationalautoencoder变分自编码器进行视频生成GAN由生成器和判别器构成生成器类似于小偷生成器生成图片判别器类似于警察负责判断是生成器生成图片还是真实图片VAE由编码器及解码器构成其使得图片能够编码成易于表示的形态并且这一形态能够尽可能无损地解码回原真实图像生成过程分为两步首先利用条件VAE模型从文本中提取出要点即静态和通用的特征生成视频的基本背景再借助GAN框架中的神经网络生成视频细节问题应用范围窄仅适用静态单一画面分辨率低代表Text2Filter图表3基于GAN及VAE文生视频示意图资料来源VideoGenerationFromText国盛证券研究所22阶段二基于Transformer以Phenaki为代表原理Transformer模型在文本及图像生成中均得到了广泛应用因此也成为文生视频使用较多的框架之一但各模型在具体应用上仍有差别主要思路即输入文本后利用Transformer模型编码将文本转化为视频令牌进行特征融合后输出视频问题训练成本高对配对数据集需求大代表PhenakiCogVideoVideoGPTPhenaki是基于Transformer框架进行文生视频的代表之一其突破了文生视频的时长限制进行任意时长视频生成Phenaki模型基于14s左右的短视频进行训练通过连P6请仔细阅读本报告末页声明2023年10月09日续的文字指令生成连续的较短时长的视频并串联成1分钟左右的长视频例如通过输入一段类似故事的文字指令从而实现逐个短视频的衔接成为长视频图表4Phenaki文生视频示意图资料来源PhenakiVariablelengthvideogenerationfromopendomaintextualdescripitons国盛证券研究所图表5Phenaki模型原理图资料来源PhenakiVariablelengthvideogenerationfromopendomaintextualdescripitons国盛证券研究所23阶段三基于扩散模型以Make-A-Video和阿里通义为代表原理当前扩散模型是文生视频领域使用更广的架构之一通过预训练模型进行文本特征提取后再进行文本到图片图片到视频的生成过程中需基于扩散模型进行简单来说扩散模型即在图片上逐渐添加高斯噪声再进行反向操作以扩散模型为基础的文生视频模型一般是在文生图基础上增加时间维度实现视频生成扩散模型在语义理解内容丰富性上更有优势问题耗时长代表Make-A-VideoVideoLDMText2Video-ZeroRunway-Gen1Runway-Gen2以及NUWA-XLP7请仔细阅读本报告末页声明2023年10月09日图表6扩散模型原理示意图资料来源DiffusionModelsinVisionASurvey国盛证券研究所231MetaMake-A-VideoMake-A-Video是基于扩散模型的代表之一其重点在于提升视频品质其模型训练时间较短无需文本-视频配对数据即可生成视频Make-A-Video生成视频主要思路为首先接受文字指令后利用CLIP文字解码将其转化为向量接着先验网络将CLIP文本向量翻译到对应的CLIP图像向量后利用BaseDiffusionModel一种文生图的模型生成视频的基本框架此处得到额外的卷积层和注意力层到时间维度后利用TemporalSuper-ResolutionTSR进行帧插值以补充关键细节最后利用两个空间超分辨率模型升级各个帧的分辨率图表7Make-A-Video视频生成过程图解资料来源Make-A-VideoText-To-VideogenerationwithoutText-Videodata国盛证券研究所图表8Make-A-Video模型原理图资料来源Make-A-VideoText-To-VideogenerationwithoutText-Videodata国盛证券研究所P8请仔细阅读本报告末页声明2023年10月09日232阿里达摩院通义文生视频大模型通义-文本生成视频大模型-英文-通用领域-v10是由阿里达摩院提供的发布在阿里ModelScope平台上的开源文生视频大模型目前仍在集成中暂未开放公测通义-文本生成视频大模型仅支持英文输入基于多阶段文本到视频生成扩散模型根据ModelScope官网该模型整体参数约60亿由五个子网格构成文本特征提取利用图文预训练模型CLIPViT-L14336px的textencoder来提取文本特征文本到图像特征扩散模型Diffusionprior部分以CLIPtextembedding为条件输出CLIPimageembedding图像特征到64x64视频生成模型同样采用diffusionmodel以GLIDE模型中UNet结构为基础改造UNet3D结构采用crossattention实现imageembedding嵌入输出16x64x64视频视频插帧扩散模型16X64x64到64X64x64diffusion视频插帧模型输入包括16x64x64视频imageembedding输出64X64x64视频其中16x64x64视频复制4次到64X64x64以concat形式输入imageembedding同样以crossattention形式嵌入视频超分扩散模型64X64x64到64X256x256diffusion视频超分模型同样为UNet3D结构推理过程输入64X64x64视频输出64X256x256视频图表9通义-文本生成视频大模型-英文-通用领域-v10模型原理示意图资料来源ModelScope官网国盛证券研究所233Zeroscope由阿里达摩院Modelscope文生视频模型优化得出在我们找到的三个文生视频模型RunwayGen-2PikaLabs和Zeroscope中Zeroscope明确提出其由开源模型优化而来我们认为这在一定程度上代表了一种新的技术路线基于开源开枝散叶ZeroScope所依托的文本生成视频大模型是阿里达摩院vilabmodelscope-damo-text-to-video-synthesis后者由文本特征提取文本特征到视频隐空间扩散模型视频隐空间到视频视觉空间这3个子网络组成整体模型参数约17亿ZeroScope由两个组件构成Zerscopev2567w用于以较低分辨率快速创建内容和Zeroscopev2XL用于将内容升级到高清分辨率ZeroScopeV3目前在Discord服务器内测试即将推出P9请仔细阅读本报告末页声明2023年10月09日3实测文生视频模型当前风格各异总体质量较低对于文生视频应用用户主要关注视频生成质量是否可定制化生成特定内容如风格可对生成内容调整细节等使用简易程度等尽管当前已有可公测的应用但由于生成结果粗糙等问题文生视频并未在实际的媒体内容生成创意制作领域得到广泛应用具体来看当前可测试的产品风格各异总体质量较低RunwayGen-1Gen-2是当前文生视频领域实际应用最出圈的模型具有较好的画面质感其功能众多可在文字图片视频中自由转化ZeroScope是目前文生视频领域高质量的开源大模型之一ZeroScope在ModelScope的模型基础上优化而来能提供更高的分辨率ZeroScope可供用户免费使用尽管视频分辨率生成质量与RunwayGen-2有一定差距但其后续潜力大PikaLabs为近期发布的文生视频平台该模型一经发布便因其真实感动作连续性效果好引发关注从生成时间看当前的文生视频结果时间短目前RunwayGen-2最长可生成18秒视频内容一般其他可公测使用文生视频模型生成结果均在4s左右且无法融合音频从生成平台看与RunwayZeroScope不同PikaLabs采取了与Midjourney相同的应用平台当前可通过申请在Discord端试用Discord是一款可进行社群交流的数字发行平台用户可发布文字图片视频音频等内容图表10RunwayZeroScopePikaLabs生成时长平台对比模型名称最长生成视平均生成所需时应用平台频时长间秒秒RunwayGen-21860网页APPPikaLabs440DiscordZeroScope380HuggingFace网页资料来源RunwayZeroScopePikaLabs国盛证券研究所目前的文生视频模型产出结果质量较低主要存在以下问题时长有限分辨率低细节粗糙画质低画面模糊不清晰语义理解困难生成内容不合逻辑人体器官静态形象不合理动作不合理视频对象运动缺乏连贯性场景变化不自然多物体运动中发生混同31复杂人物动作生成帧连续效果较差复杂人物动作的视频生成考验文生视频模型的帧连续效果及动作理解能力从测试效果看RunwayGen2基本完成文字指令要求突出一个女孩人物主题跳舞动作有一定流畅性但后续出现身体器官重叠问题PikaLabs未理解文字指令主题一个女孩出现多个人物但其舞蹈动作连续流畅性相对较好ZeroScope人物模糊但身体部位变化自然且未出现变型消失等问题P10请仔细阅读本报告末页声明2023年10月09日图表11RunwayGen-2ZeroScopePikaLabs人物动作应用效果对比文字指令Agirldancingintheclassroom资料来源RunwayZeroScopePikaLabs国盛证券研究所32非日常场景的视频架构能力连续能力一般非日常场景的视频生成考验文生视频模型的指令理解及架构能力从猫拿遥控器看电视这一虚构场景文字指令的要求生成效果看RunwayGen-2整体仍然最为出色但后续动作变化不自然且幅度小出现脸部变形等情况PikaLabs对文字指令的理解有一定问题并未体现拿遥控器的动作但其视频画面细节如毛发飘动动作更为连贯顺畅ZeroScope真实性较强但动作僵硬且幅度较小图表12RunwayGen-2ZeroScopePikaLabs非日常场景应用效果对比文字指令CatwatchingTVwitharemoteinhand资料来源RunwayZeroScopePikaLabs国盛证券研究所P11请仔细阅读本报告末页声明2023年10月09日33多主体视频生成缺乏逻辑连续性多主体的视频生成考验文生视频模型的复杂场景处理能力及细微语言理解能力当前文生视频模型出现直接忽略文字指令中的如手牵手一个男孩和一个女孩等细微要求问题RunwayGen-2对画面及人物动作细节及双人互动如牵手指令的处理较好生成人物符合逻辑但人物动作幅度不明显PikaLabs未体现双人牵手细节但跑步动作自然连贯ZeroScope在多人物互动及跑步动作上处理较好但画面粗糙图表13RunwayGen-2ZeroScopePikaLabs多主体应用效果对比文字指令Agirlandaboyrunninghandinhand资料来源RunwayZeroScopePikaLabs国盛证券研究所总体来看三个文生视频模型的不同生成效果体现其背后模型及训练数据特点RunwayGen-2画面精细度清晰度及艺术美感均较强视频动作幅度均较小视频动感主要体现在如头发的飘动上PikaLabs擅于生成连贯动作ZeroScope表现较为平均P12请仔细阅读本报告末页声明2023年10月09日4从图片生成看文生视频的商业前景41为什么选择图片生成作为对标对象411图片生成相对成熟图片生成类在多模态大模型中的商业程度较高可为视频生成的商业化前景可提供一定参考以相对成熟的美国市场为例据七麦数据8月13日IOS应用榜单以AI作为搜索关键词榜内共计247个应用其中摄影与录像图形与设计类的图像生成类应用占比316而音乐类应用仅占比28效率类语言生成或对话式应用占比202可见图片生成类的商业化程度最高且从实际案例来看目前已有图片生成类应用表现出较强的收费能力412已经收费的视频生成应用商业模式与图片生成趋同目前从类别上看图片生成类为现阶段多模态大模型相对成熟的商业化场景视频生成类的商业前景可参考图片生成类的商业化发展历程整体来看图片生成类的商业模式较为单一收费模式和收费依据较为趋同即按照人工智能生成产品的生成量生成速度计算收费现已出现的视频生成模型的收费依据也与其类似另外市场上已出现个别破圈现象级图片生成类应用以及与其原有业务协同的AI增强功能产品也可为未来视频生成类应用的发展提供一定参考图表14各家图像生成类模型应用对比产品名Midjourney文心一格妙鸭相机LensaAI公司名Midjourney百度阿里巴巴PrismaLabs活跃用户数8月网站NA7月16日-8月14日总9月下载量总访问量下载量203万10万2100万套餐内容标准版以上套仅为限量套餐且单张99元可解锁30种模50张图399美元特点餐拥有无限量图片生成价格与板制作写真生成1100张图599美元图片生成数Midjourney限量套餐价次200张图799美元量格接近资料来源各公司官网SimilarWeb七麦数据CNNSensorTower国盛证券研究所RunwayGen-2是文生视频领域最先形成商业模式的多模态大模型案例其收费标准为文生视频领域大模型及应用端树立了标杆与广泛的图片生成类模型及应用的商业模式类似RunwayGen-2也按照生成量附加权益等区分不同套餐定价自发布以来RunwayGen-2引起关注度很高由于是为数不多的开放公测的文生视频大模型很多玩家前往其官网进行文生视频的尝试2023年9月其网站总访问人次为760万平均停留时长为3分37秒P13请仔细阅读本报告末页声明2023年10月09日图表15RunwayGen-2套餐收费标准及对应权益套餐版月付套年付套点数权单个视套餐内可存储空间本餐价格餐价格益频可生生成视频权益美元美元点成的最的总长度GB月月数长长度秒秒标准版151262516125100Pro版35282250161450500无限制9576无限16无限500版资料来源Runway官网国盛证券研究所42细分领域看好人像生成短期内变现较快421LensaAI人像生成功能推出后用户付费意愿高LensaAI切入人像生成领域新功能推出后收入可观但是否可若想形成持续性付费收入仍需探索LensaAIApp于2018年上线原本的主要用途是图片编辑和美化2022年11月21日LensaAI上线的新功能魔法头像MagicAvatars让其在全球人气迅速飙升用户上传人像图可通过魔法头像自动生成各种不同风格的人脸照包括摇滚风格时尚风科幻风动漫风等11月30日至12月14日连续两周位列美国AppStore免费榜榜首还拿下十多个国家的免费榜Top1从商业模式上看该应用提供三种不同的购买方案主要的区别是生成的照片的数量差异用户可以选50100200张照片分别对应399599799美元图表16LensaAI魔法头像应用截图资料来源Medium国盛证券研究所根据分析公司SensorTower的数据该应用程序在12月的前12天在全球范围内安装了约1350万次是11月200万次的六倍多这12天消费者在App上花费了大约2930万美元日流水超百万美元根据SensorTower的最新数据LensaAI在今年7月的全球下载量仅为40万人次同月全球收入仅为100万美元可见人像生成类应用若想维持热度形成长期稳定的收费能力市场玩家仍需继续探索P14请仔细阅读本报告末页声明2023年10月09日422妙鸭相机国内首个破圈应用写真生成引起社交裂变人像生成写真应用妙鸭相机上架即火爆迅速爬升社交类应用第一名妙鸭相机是国内第一个出圈的图片生成类应用用户通过上传一张正面照以及不少于20张的补充照片就能利用妙鸭相机生成各式写真妙鸭相机收费99元可以解锁现有模板包括证件照古装写真晚礼服写真等图表17妙鸭相机写真制作过程图资料来源AIHub国盛证券研究所妙鸭相机上线后非常火爆生成图片的等待时长一路走高7月20日晚间高峰期有4000-5000人排队需等待十几个小时才能生成图片据七麦数据妙鸭相机近自发布以来热度高涨截至8月13日妙鸭相机在iPhone社交类应用中排名第一图表18妙鸭相机榜单排名资料来源七麦数据国盛证券研究所妙鸭相机现阶段收入规模可观但市场对其复购及持续收费能力存疑后续须不停上线新模板开创新玩法据七麦数据妙鸭相机近自上线以来半个月时间收入预估总计超过29万美元近七日日均收入超过3万美元在国内图像生成领域的应用中遥遥领先可以算作破圈的现象级产品但目前还处于拉新阶段后期用户的复购收入持续增长的能力亟待验证P15请仔细阅读本报告末页声明2023年10月09日图表19妙鸭相机近一月收入估算截至2023年8月14日资料来源七麦数据国盛证券研究所43竞争优势看好有算力储备的公司目前国内外图像生成类模型及模应用大多按照生成量生成速度等来区分定价但不同点是国外产品的付费套餐中多有无限量套餐而国内产品未出现无限量套餐可看出国内算力仍为瓶颈因此具有算力储备的云服务厂商在发展视频生成类应用时具有天然优势431Midjourney无限量套餐拢获用户映射市场对算力的高需求Midjourney作为文生图领域的代表性多模态大模型相比于大多数有限生成量的图片生成类模型及应用Midjourney的无限量套餐具有天然优势其用户规模和营收已建立起一定壁垒据SimilarWeb数据Midjourney官网在2023年8月网站访问量为2850万人次平均停留时长达到6分30秒且从市场公开信息得知Midjourney的日活用户已达到1500万超过开源模型StableDiffusion的1000万日活其年营收也超过1亿美元从官网看Midjourney共有四个套餐版本分别为图表20Midjourney套餐收费标准及对应权益套餐版本套餐价格图片生成数量高速GPU体是否具有隐私美元月张验模式小时基础版10200无否标准版30无限无否Pro版60无限30是Mega版120无限60是资料来源Midjourney官网国盛证券研究所P16请仔细阅读本报告末页声明2023年10月09日432腾讯云云服务厂商加紧多模态生成布局反过来看由于本身具有算力能力优势云服务大厂也开始注重多模态生成的能力建设上线图像生成类产品以腾讯为例腾讯的AI绘画产品作为功能模块集成在腾讯云解决方案平台上客户可选择开通AI绘画服务便可使用此项功能目前用户可在腾讯云上体验智能文生图及智能图生图功能两种功能每月共提供20次体验额度正式服务需接入API使用腾讯云AI绘画功能分为PaaS和SaaS两种产品形态PaaS需要二次开发SaaS版开箱即用图表21腾讯云AI绘画PaaS版收费标准接口名称新用户价格新老同享不限购资源包限购1次价格价格元千次元智能图生图199651智能文生图299651资料来源腾讯云国盛证券研究所图表22腾讯云AI绘画功能示意图资料来源腾讯云国盛证券研究所P17请仔细阅读本报告末页声明2023年10月09日433无界AI按时长付费和潮汐生成模式彰显算力底座特性无界AI于2022年5月入局AI绘画为国内较早起步的AI作画工具平台之一用户可通过直接开通会员享受基本权益价格为100元月1000元年能实现文生图选择画面大小主题风格等元素还享有潮汐模式免费无限创作解锁全部专用模型存储无限扩容精绘折扣选择更多参数等会员权益其中潮汐模式下会员可以免费无限创作潮汐模式由夜间生成更便宜的夜间生成模式发展而来旨在利用算力资源空闲时段作画实现以时间换价格用户还可开通权益卡或购买时长其中1开通权益卡能获得更多积分适用于对普通文生图有更多需求如更多超分辨次数更多单张加速次数的用户2购买时长适用于需要更多生成类型如图生图条件生图和功能如局部重绘多区域控制绘图等的用户即专业版用户按时长付费也是阿里云腾讯云等AI云算力服务商常用的收费方式我们认为这在一定程度上反映出AI图片生成应用与底层算力服务的高度相关性图表23无界AI专业版购买时长收费标准时间套餐价格预计生成创作张小时元12045048018001221654002443210800资料来源无界AI国盛证券研究所图表24无界AI权益卡等级与对应权益权益卡等级套餐价格赠送积分有效期超分辨次数单张加速次数元月积分月月次次AI魔法体验卡030---青铜权益卡9912001--白银权益卡19912002--黄金权益卡129918006100100铂金权益卡4699360012200200资料来源无界AI国盛证券研究所P18请仔细阅读本报告末页声明2023年10月09日44业务协同看好多模态生成与原有业务有协同的公司441AdobeAI生成工具有望带来增量付费用户Adobe上线AI创意生成工具Firefly萤火虫或为Adobe带来增量付费用户Photoshop于2023年3月发布AI创意生成工具Firefly具有文生图及图像填充功能并且于5月底宣布全面开放深度绑定Adobe旗下产品Photoshop图表25AdobeFirefly功能示意图资料来源AdobeFirefly官网国盛证券研究所Adobe于2023年9月13日宣布Firefly正式商用将采取按生成点数Generativecredits收费的模式每个点数对应一张图片其中免费账户每月享有25生成点数升级版用户每月支付499美元即可享有100积分根据Adobe官网Firefly自2023年11月1日起将实行限额生成积分的消耗取决于生成输出的计算成本和所使用的生成人工智能功能的价值图表26Firefly定价方案资料来源AdobeFirefly官网国盛证券研究所P19请仔细阅读本报告末页声明2023年10月09日442Microsoft365Copilot推出增强功能高定价反应市场强需求Microsoft365Copilot定价策略大幅超预期侧面反应人工智能生成产品的强劲需求OfficeCopilot是基于GPT-4API的应用具有文档编辑表格处理等在Office软件原有基础上利用AI开发的增强功能7月18日微软在合作伙伴会议上宣布Microsoft365Copilot定价策略Microsoft365Copilot将面向Microsoft365E3E5BusinessStandard和BusinessPremium客户的商业客户提供价格为每用户30美元月大超发布前的市场预期此前Microsoft365商业版定价最高为22美元月按照当前四种商业版的订阅价格计算Copilot加入后整体订阅价格涨幅约在53-240此次Copilot的定价反映了微软对其新产品的信心以及市场对AI增强功能的强需求45展望看好文生视频与文生图图生视频的联动由于当前文生图文生视频文生音频等都具有一定局限性已经有创作者借助不同模型平台进行视频合成从而实现最优效果例如近日出现的一则约一分钟左右完全由AI生成的科幻预告片TrailerGenesis创世纪其中用到了Midjourney处理图像Runway处理视频Pixabay处理音乐CapCut剪辑视频我们预计后续AI在文生图文生视频文生音频及剪辑等方面的应用仍有很大的发展空间其对于生产力的释放值得期待图表27科幻预告片TrailerGenesis创世纪2周内在YouTube上达14万播放量资料来源Youtube国盛证券研究所P20请仔细阅读本报告末页声明
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1