研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 华泰证券-传媒行业专题研究:AIGC引领内容生产方式变革-230209
上传日期:   2023/2/10 大小:   4711KB
格式:   pdf  共36页 来源:   华泰证券
评级:   增持 作者:   朱珺,吴晓宇
行业名称:   传媒
下载权限:   此报告为加密报告
ChatGPT引发热潮,科技巨头加码布局,AIGC迎来发展机遇
  AIGC即生成式AI,是自动化内容生成的技术合集。22年AIGC产品集中发布,从效率、质量、多样性等方面为内容生产带来变革。文本方面,ChatGPT引领热潮,通过引入RLHF机制,持续优化模型效果,能完成问答、诗歌创作、代码写作等,科技巨头亦加码布局交互式文本。图像方面,Diffusion取代GAN成为图像生成的主流模型,由文字到图像的跨模态生成成为重点探索方向。此外,视频/代码/游戏/3D亦有较广阔的空间。建议关注:昆仑万维、蓝色光标、风语筑、阅文集团、三人行,产业链相关公司还包括:视觉中国、中文在线、值得买、美图公司等。
  技术助力AIGC发展,掀起全场景内容生产力革命
  AI技术逐渐实现从分析到创造的迭代,而生成算法、预训练模型、多模态技术则是驱动AIGC发展的关键,长期看大模型+多模态将成为趋势。从产业链上看,AIGC主要包括基础层(预训练模型)、中间层(垂直化、场景化、个性化的模型)和应用层(面向C端的AIGC应用),由于技术与投资环境差异,中外公司整体差距在3年左右。AIGC有望通过其强大的生成能力广泛服务于内容生产的各类场景和内容生产者,在内容行业的应用场景不断增加和拓展,从而引领全场景内容生产力革命。AIGC所应用的细分场景众多,目前看文本、音频、图像领域发展较快。
  ChatGPT引领热潮,大厂加码布局交互式文本
  AI文本生成作为AIGC最早发展的技术,已在新闻报道、商业营销、客服机器人等领域广泛落地。22年11月30日,OpenAI推出的智能聊天工具ChatGPT引入RLHF机制,持续优化模型效果,不仅能作答问题,还能完成短文和诗歌创作、代码写作、数学和逻辑运算,推出仅2月平均日活超1,300万。科技巨头亦加码布局交互式文本,微软在23年1月追加投资OpenAI,并宣布整合OpenAI语言模型到Bing搜索引擎和Edge浏览器中;谷歌亦发布Bard与投资ChatGPT的竞品Anthropic来应对挑战;百度公布了大模型新项目文心一言。
  图像领域预训练模型迭代升级,AI图像生成迎机遇
  AIGC图像包括文字生成图像、图像属性编辑、图像部分编辑与图像端到端生成,其中由文字到图像的跨模态生成成为重点探索方向。22年成为AI绘画元年,从技术上看,Diffusion逐渐取代GAN成为图像生成的主流模型,助推了AIGC图像的发展。2022年8月,《太空歌剧院》出圈引发AI图像生成的热潮;同月Stability AI推出Stable Diffusion模型,为后续图像模型的更迭打下基础;此外OpenAI、谷歌在图像模型上亦持续迭代;百度文心·一格支持中国风AI创作。据6pen,未来5年全球10-30%的图像有望由AI生成或辅助生成,AI图像领域潜力较大。
  音频&视频部分应用落地较快,代码/游戏/3D等仍待成熟
  AIGC通过提取信息生成音频,主要应用于TTS(Text-to-speech)场景和乐曲/歌曲生成;TTS技术已相当成熟,广泛应用于客服及硬件机器人、有声读物制作、语音播报等。AIGC视频生成可以降低视频制作时间,主要应用于视频自动编辑、视频自动生成和文字生成视频等,有望显著降低视频内容的制作门槛、大幅提升制作效率,但在视频全自动生成方面仍有较大提升空间。此外,AIGC在代码/游戏/3D等生产方面不断进步,包括:代码补全生成、游戏操作策略/角色逻辑/剧情生成、3D模型/3D角色制作/3D场景生成等,但生产质量及应用成熟度仍待提升。
  风险提示:AI技术发展不及预期,商业化存在不确定性,政策监管风险。
  
研究报告全文:证券研究报告传媒AIGC引领内容生产方式变革华泰研究传媒增持维持2023年2月09日中国内地专题研究研究员朱珺ChatGPT引发热潮科技巨头加码布局AIGC迎来发展机遇SACNoS0570520040004zhujun016731htsccomAIGC即生成式AI是自动化内容生成的技术合集22年AIGC产品集中SFCNoBPX711861063211166发布从效率质量多样性等方面为内容生产带来变革文本方面研究员吴晓宇ChatGPT引领热潮通过引入RLHF机制持续优化模型效果能完成问SACNoS0570522100002wuxiaoyuhtsccom答诗歌创作代码写作等科技巨头亦加码布局交互式文本图像方8675523993324面取代成为图像生成的主流模型由文字到图像的跨模态DiffusionGAN联系人王星云生成成为重点探索方向此外视频代码游戏3D亦有较广阔的空间建SACNoS0570121100014wangxingyunhtsccom议关注昆仑万维蓝色光标风语筑阅文集团三人行产业链相关8675582492388公司还包括视觉中国中文在线值得买美图公司等行业走势图技术助力AIGC发展掀起全场景内容生产力革命技术逐渐实现从分析到创造的迭代而生成算法预训练模型多模态AI传媒沪深300技术则是驱动AIGC发展的关键长期看大模型多模态将成为趋势从产2业链上看AIGC主要包括基础层预训练模型中间层垂直化场景化个性化的模型和应用层面向C端的AIGC应用由于技术与投资5环境差异中外公司整体差距在3年左右AIGC有望通过其强大的生成能12力广泛服务于内容生产的各类场景和内容生产者在内容行业的应用场景18不断增加和拓展从而引领全场景内容生产力革命所应用的细分场AIGC25景众多目前看文本音频图像领域发展较快Feb-22Jun-22Oct-22Feb-23引领热潮大厂加码布局交互式文本资料来源Wind华泰研究ChatGPTAI文本生成作为AIGC最早发展的技术已在新闻报道商业营销客服重点推荐机器人等领域广泛落地22年11月30日OpenAI推出的智能聊天工具ChatGPT引入RLHF机制持续优化模型效果不仅能作答问题还能完目标价股票名称股票代码当地币种投资评级成短文和诗歌创作代码写作数学和逻辑运算推出仅2月平均日活超昆仑万维300418CH2488买入1300万科技巨头亦加码布局交互式文本微软在23年1月追加投资蓝色光标300058CH696买入OpenAI并宣布整合OpenAI语言模型到Bing搜索引擎和Edge浏览器风语筑603466CH1768买入中谷歌亦发布Bard与投资ChatGPT的竞品Anthropic来应对挑战百阅文集团772HK4290买入度公布了大模型新项目文心一言三人行605168CH12922买入资料来源华泰研究预测图像领域预训练模型迭代升级AI图像生成迎机遇AIGC图像包括文字生成图像图像属性编辑图像部分编辑与图像端到端生成其中由文字到图像的跨模态生成成为重点探索方向22年成为AI绘画元年从技术上看Diffusion逐渐取代GAN成为图像生成的主流模型助推了AIGC图像的发展2022年8月太空歌剧院出圈引发AI图像生成的热潮同月StabilityAI推出StableDiffusion模型为后续图像模型的更迭打下基础此外OpenAI谷歌在图像模型上亦持续迭代百度文心一格支持中国风AI创作据6pen未来5年全球10-30的图像有望由AI生成或辅助生成AI图像领域潜力较大音频视频部分应用落地较快代码游戏3D等仍待成熟AIGC通过提取信息生成音频主要应用于TTSText-to-speech场景和乐曲歌曲生成TTS技术已相当成熟广泛应用于客服及硬件机器人有声读物制作语音播报等AIGC视频生成可以降低视频制作时间主要应用于视频自动编辑视频自动生成和文字生成视频等有望显著降低视频内容的制作门槛大幅提升制作效率但在视频全自动生成方面仍有较大提升空间此外AIGC在代码游戏3D等生产方面不断进步包括代码补全生成游戏操作策略角色逻辑剧情生成3D模型3D角色制作3D场景生成等但生产质量及应用成熟度仍待提升风险提示AI技术发展不及预期商业化存在不确定性政策监管风险免责声明和披露以及分析师声明是报告的一部分请务必一起阅读1传媒正文目录技术助力AIGC发展长期看大模型多模态成趋势3AI由分析转向创造22年AIGC产品集中发布3生成算法预训练模型多模态技术成为AIGC发展的关键4AIGC产业链基础层中间层应用层中外差距约3年6AIGC颠覆传统生产模式掀起全场景内容生产力革命7AIGC从效率质量多样性为内容生产带来革命7文本音频和图像生成等落地相对较快游戏等方向仍待成熟8AIGC多场景快速落地文本图像关注度较高10文本ChatGPT引领热潮大厂加码布局交互式文本10图像预训练模型迭代升级AI图像生成迎机遇15音频集中应用于TTS场景和乐曲歌曲生成21视频可实现视频自动编辑视频自动生成和文字生成视频等24其他游戏代码3D生成等领域应用前景广阔28相关公司31昆仑万维300418CH买入评级目标价2488元31蓝色光标300058CH买入评级目标价696元32风语筑603466CH买入评级目标价1768元32阅文集团772HK买入目标价4290港币32三人行605168CH买入评级目标价12922元33风险提示33免责声明和披露以及分析师声明是报告的一部分请务必一起阅读2传媒技术助力AIGC发展长期看大模型多模态成趋势AI由分析转向创造22年AIGC产品集中发布AI技术逐渐实现从分析到创造的迭代AIArtificialIntelligence即人工智能传统的AI技术被称为分析式AIAnalyticalAI偏向于分析数据并总结规律同时将规律运用到其他用途比如运用AI技术进行垃圾邮件检测向用户推荐感兴趣的短视频等但随着技术的迭代AI已经不仅仅局限于分析已有事物而是开始创造有意义具备美感的东西即完成感知世界到创造世界的变迁这种新型的技术被称为生成式AIGenerativeAI从定义上看AIGC既是一种内容形态也是一种内容生成的技术合集即生成式AI从狭义上看AIGCAIGeneratedContent是继PGCProfessionalGeneratedContent与UGCUserGeneratedContent之后的一种内容形式即利用人工智能技术生成的内容从广义上看AIGC指的是自动化内容生成的技术合集基于生成算法训练数据芯片算力生成包括文本音乐图片代码视频等多样化内容图表1什么是AIGC分析式AIAIGC生成式AI预训练模型诈骗信息识别生成算法多模态技术垃圾邮件检测预测外卖时间代码图片推荐感兴趣的视频等文本音乐视频资料来源红杉资本华泰研究AIGC起源于20世纪50年代经过多年发展在2022年AIGC产品集中发布多款产品出圈引发社会广泛关注据中国信通院AIGC起源于20世纪50年代莱杰伦希勒和伦纳德艾萨克森完成历史上第一只由计算机创作的音乐作品依利亚克组曲但受制于技术水平截至1990年AIGC均仅限于小范围实验1990-2010年是AIGC的沉淀积累阶段AIGC逐渐从实验向实用转变但受限于算法瓶颈效果仍有待提升2010年以来伴随着生成算法预训练模型多模态技术的迭代AIGC快速发展2022年多款产品出圈2022年8月StabiltyAI发布StableDiffusion模型为后续AI绘图模型的发展奠定基础由Midjourney绘制的太空歌剧院在美国科罗拉多州艺术博览会上获得数字艺术类别的冠军引发社会广泛关注2022年11月OpenAI推出基于GPT-35与RLHFReinforcementLearningfromHumanFeedback人类反馈强化学习机制的ChatGPT推出仅2月日活超1300万据Forbes2023年1月OpenAI的估值从2021年的140亿美元提升到2023年1月的290亿美元此外科技巨头亦加码布局AIGC如微软表示将自己的消费者和企业产品中部署OpenAI的模型宣布将OpenAI语言模型整合到Bing引擎和Edge浏览器中谷歌在ChatGPT发布后亦加快AI自研2023年2月7日正式发布下一代AI对话系统Bard此外谷歌还投资ChatGPT的竞品Anthropic国内方面据百度官网2023年2月7日百度公布了大模型新项目文心一言ERNIEBot据彭博社百度计划在2023年3月将最初的版本将内嵌到搜索服务中免责声明和披露以及分析师声明是报告的一部分请务必一起阅读3传媒图表2AIGC的发展历程2014年lan1950年艾伦图灵提2018年人工智能2007年世界第一部提出生出著名的图灵测试JGoodfellow生成的画作在佳士2022年11月30日推出的人完全由人工智能创作成式对抗网络GAN工智能聊天工具ChatGPTAIGC给出判定机器是否具有得拍卖行以4325的小说1TheRoad典型事件智能的试验方法万美元成交成为问世2017年微软小冰推出首个出售的人工智1957年第一支由计世界首部100由人工智能创能艺术品算机创作的弦乐四重奏作的诗集阳光失了玻璃窗2022年8月由AI绘图依利亚克组曲llliac工具Midjourney绘制的太空歌剧院在美国Suite完成2018年英伟达发布科罗拉多州艺术博览会StyleGAN模型可以自1966年世界第一款2021年OpenAI上获得数字艺术类2012年微软展示全动生成高质量图片可人机对话的机器人推出了别的冠军自动同声传译系统DALL-EEliza问世主要应用于文本与2022年8月StabilityAI发布可将英文演讲者的内2019年DeepMind图像交互生成内容的StableDiffusion模型80年代中期IBM创造容自动翻译成中文语发布DVD-GAN模型语音控制打字机音用以生成连续视频TangoraAIGC从实验性向实用性AIGC受限于科技水平转变受限于算法瓶颈深度学习算法不断迭代人工智能生成内容迎来集中爆发发展特点AIGC仅限于小范围实验无法直接进行内容生成百花齐放效果逐渐逼真直至人类难以分辨多款产品出圈人工智能早期萌芽阶段沉淀积累阶段快速发展阶段迎来爆发阶段总体阶段20世纪50年代至90年代中期20世纪90年代中期21世纪10年代中期至20212022至今至21世纪10年代中期资料来源中国信息通信院OpenAI官网华泰研究生成算法预训练模型多模态技术成为AIGC发展的关键从技术上看生成算法预训练模型多模态技术是AIGC发展的关键从流程上看算法接收数据进行运算并生成预训练模型多模态技术则是将不同模型融合的关键长期看大模型多模态将成为趋势1生成算法持续优化算法即解决问题的策略和机制2014年伊恩古德费洛提出的GANGenrativeAdversarialNetwork生成对抗网络成为最早的AI生成算法随后DiffusionTransformer基于流的生成模型Flow-basedmodelsCLIPContrastiveLanguage-ImagePre-Training等深度学习算法相继被推出其中Diffusion逐渐代替GAN成为图像生成的主流模型Transformer的推出为预训练模型奠定了基础CLIP则广泛应用在多模态技术中图表3AIGC主流算法梳理模型提出时间模型描述变分自动编码Variational2014基于变分下界约束得到的Encoder-Decoder模型对AutoencodersVAE生成对抗网络GAN2014基于对抗的Generator-Discriminator模型对基于流的生成模型Flowbased2015学习一个非线性双射转换bijectivetransformation其将训练数据映射到另一个空间在该空间上分布是可以models因子化的整个模型架构依靠直接最大化log-likelihood来完成扩散模型DiffusionModel2015扩散模型有两个过程分别为扩散过程和逆扩散过程在前向扩散阶段对图像逐步施加噪声直至图像被破坏变成完全的高斯噪声然后在逆向阶段学习从高斯噪声还原为原始图像的过程经过训练该模型可以应用这些去噪方法从随机输入中合成新的干净数据Transformer模型2017一种基于自注意力机制的神经网络模型最初用来完成不同语言之间的文本翻译任务主体包含Encoder和Decoder部分分别负责对源语言文本进行编码和将编码信息转换为目标语言文本神经辐射场NeuralRadianceField2020它提出了一种从一组输入图像中优化连续5D神经辐射场的表示任何连续位置的体积密度和视角相关颜色的NeRF方法要解决的问题就是给定一些拍摄的图如何生成新的视角下的图CLIPContrastiveLanguage-Image20211进行自然语言理解和计算机视觉分析Pre-Training模型2使用已经标记好的文字-图像训练数据一方面对文字进行模型训练一方面对另一个模型的训练不断调整两个模型的内部参数使得模型分别输出的文字特征和图像特征值并确认匹配资料来源腾讯研究院华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读4传媒2预训练模型持续完善2015年以前小模型一度被认为是行业发展的方向但这些小模型更偏向处理分析性任务生成能力较弱2017年谷歌研究院在AttentionisAllYouNeed中提出Transformer算法的概念而Transformer能够有效提取长序列特征具备较高的计算效率和可扩展性大大降低训练时间2018年谷歌发布基于Transformer的NLPNaturalLanguageProcessing自然语言处理预处理模型BERT标志着人工智能进入预训练模型时代从流程上看预训练模型采用两阶段学习法即首先在大量的通用数据上训练并具备基础能力再结合多样的垂直行业和场景对预训练模型进行微调从而有效提升开发效率随着参数规模的扩大预训练模型在语言理解图像识别等领域迅速取得突破所需的计算量也急剧增长据红杉资本2015-2020年用于模型训练的计算量增加了6个数量级据腾讯研究院按照类型分类预训练模型包括1NLP自然语言处理模型使得人与计算机能够用自然语言有效通信包括OpenAI的GPT系列Facebook的M2M-1002CV模型ComputerVision计算机视觉运用计算机及相关设备对生物视觉进行模拟比如微软的Florence3多模态预训练模型包含图像文字视频等多种形式如谷歌的ImageStabilityAI的StableDuffusion等图表4AIGC主要预训练模型梳理企业预训练模型应用参数量领域谷歌BERT语言理解与生成4810亿NLPLaMDA对话系统NLPPaLM语言理解与生成推理代码生成5400亿NLPImagen语言理解与图像生成110亿多模态Parti语言理解与图像生成200亿多模态微软Florence视觉识别64亿CVTuring-NLG语言理解生成170亿NLPFacebookOPT-175B语言模型1750亿NLPM2M-100100种语言互译150亿NLPDeepMindGato多面手的智能体12亿多模态Gopher语言理解与生成2800亿NLPAlphaCode代码生成414亿NLPOpenAlGPT3语言理解与生成推理等1750亿NLPCLIPDALL-E图像生成跨模态检索120亿多模态Codex代码生成120亿NLPChatGPT语言理解与生成推理等NLPStabilityAlStableDiffusion语言理解与图像生成多模态英伟达Megatron-TuringNLG语言理解与生成推理5300亿NLP资料来源腾讯研究院华泰研究3多模态技术快速发展多模态技术MultimodalTechnology即将图像语音视频文字等多模态融合的机器学习技术而CLIPContrastiveLanguageImagePre-training的推出成为跨模态应用生成的重要节点CLIP在2021年由OpenAI开源推出能够将文字和图像进行关联且关联特征丰富后续CLIP其他模型成为跨模态生成领域的较通用的做法如DiscoDiffusion便是将CLIP与Diffusion模型进行关联用户输入文字指令便能够生成相关的图片在多模态技术的加持下预训练模型已经从早期单一的NLPCV向多模态跨模态的方向发展免责声明和披露以及分析师声明是报告的一部分请务必一起阅读5传媒AIGC产业链基础层中间层应用层中外差距约3年从产业链结构来看AIGC主要包括基础层中间层和应用层中外差距在3年左右由于技术与投资环境差异AIGC在我国大多作为公司的部分业务进行开发独立的初创公司数量较少导致AIGC实际的场景开发较国外仍有差距据量子位中外公司的整体差距在3年左右底层技术是核心原因1基础层基础层即预训练模型构成了AIGC的基础随着预训练模型参数的增加预训练所需要的数据量同样快速提升带来较高的成本投入据中国信通院与京东探索研究院发布的人工智能生成内容白皮书2022模型参数量已从最初的千万级发展到了千亿级别训练代价也从数十天增长到几十万天按在单张V100GPU计算据北京智源人工智能研究院2020年OpenAI发布的NLP模型GPT-3的参数量约1750亿训练数据量达45TB模型训练成本近1200万美元因此该领域的参与者主要是科技巨头与头部的研究机构如OpenAI谷歌微软Meta百度等2中间层中间层即垂直化场景化个性化的模型在预训练模型的基础上能够快速生成垂直化的小模型实现流水线式的开发降低开发成本提升效率如StableDiffusion开源后多个绘画模型基于StableDiffusion开发二次元绘画领域包括知名的NovelAI而昆仑万维的天工巧绘SkyPaint模型则采用全球第一款多语言StableDiffusion分支模型兼容StableDiffusion据腾讯研究院随着大模型多模态加速成长为通用性技术平台模型即服务Model-as-a-ServiceMaaS逐渐实现通过API授权有望助力AIGC变现3应用层应用层即面向C端的AIGC应用从模态上看应用层包括图像音频文本视频等其中图像领域代表产品包括MidJourneyDreamStudio等音频包括DeepMusic等文本包括ChatGPTSudowrite等视频包括Runway等从形式上看应用层包括App网页小程序聊天机器人等将C端用户与模型联通已经逐渐渗透到生活中的各个领域如MidJourney搭载在聊天软件Discord中推出ChatGPT则支持网页直接登录国内的如昆仑万维的天工巧绘SkyPaint能够通过微信小程序登录满足用户的多样化需求图表5AIGC产业链结构GAN预训练模型CLIP串联融合DiffusionTransformer资料来源腾讯研究院华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读6传媒AIGC颠覆传统生产模式掀起全场景内容生产力革命AIGC从效率质量多样性为内容生产带来革命AIGC技术的突破性进展引发内容生产方式变革内容生产由PGC专业制作和UGC用户创作时代逐渐步入AIGC时代AIGC顺应了内容行业发展的内在需求一方面内容消费量增加急需降低生产门槛提升生产效率另一方面用户端表达意愿明显上升消费者对内容形态要求更高内容生成个性化和开放化趋势明显图表6内容生产方式的四个发展阶段资料来源AIGC发展趋势报告2023华泰研究AIGC通过其强大的生成能力广泛服务于内容生产的各类场景和内容生产者在内容行业的应用场景不断增加和拓展将在内容生产中产生变革性影响具体来看主要有以下三点1自动内容生成提升内容生产效率降低内容生产门槛和内容制作成本当前大量文本图像音频视频等内容都可以通过AIGC技术自动生成高效的智能创作工具可以辅助艺术影视广告游戏编程等创意行业从业者提升日常内容生产效率此外自动内容生成可以降低内容生产门槛和内容制作成本例如借助AI编曲软件可以自动生成编曲而人为创作大概需要7-10年的经验积累2提升内容质量增加内容多样性AIGC生成的内容可能比普通的人类创建的内容质量更高大量数据学习积累的知识可以产生更准确和信息更丰富的内容谷歌的Imagen生成的AI绘画作品效果已经接近中等画师水平而且AIGC可以帮助企业和专业人士创建更多样化更有趣的内容VQGAN可以生成抽象绘画作品不咕剪辑Cooclip内置丰富的贴纸音频经典梗素材等可以增加视频本身的玩法与乐趣3助力内容创新实现个性化内容生成AIGC将内容创作中的创意和实现分离替代创作者的可重复劳动可以帮助有经验的创作者捕捉灵感创新互动形式助力内容创新例如AICG在设计初期生成大量草图可以帮助美术创作者生成更多创作灵感根据个人用户的喜好生成个性化内容也有利于多种创意落地AIGC发展中仍面临法律安全伦理和环境等问题首先AIGC引发了新型版权侵权风险因版权争议国外艺术作品平台ArtStation上的画师们掀起了抵制AIGC生成图像的活动其次AIGC滥用容易引发信息内容安全内生安全诈骗违法犯罪行为等安全隐患诈骗团队利用AIGC换脸伪造埃隆马斯克的视频半年诈骗价值超过2亿人民币的数字货币再次算法歧视等伦理问题依然存在人工智能大规模替代人类劳动引发争议最后AIGC模型训练消耗大量算力碳排放量巨大对环境保护造成压力免责声明和披露以及分析师声明是报告的一部分请务必一起阅读7传媒文本音频和图像生成等落地相对较快游戏等方向仍待成熟细分场景众多文本音频图像领域发展较快基于模态我们认为目前AIGC下游落地场景有文本音频图像视频游戏代码3D生成等较之国外我国AIGC行业仍处于刚起步阶段体系化发展等仍待完善图表7AIGC主要下游落地场景资料来源红杉中国腾讯研究院量子位MicrosoftOpenAIrctai华泰研究文本生成AIGC目前可以较好地完成新闻播报等结构化写作推荐相关内容帮助润色等非结构化内容同时在虚拟男女友心理咨询等闲聊机器人中应用较为广泛剧情续写营销文本等非结构化写作与文本交互游戏等应用尚未实现规模化应用未来或可实现文本生成的终稿达到人类平均水平甚至专业水平图像生成随着算法模型的不断迭代AI作画水平不断提高在图像编辑工具上去除水印提高分辨率特点滤镜等已较广泛应用根据随机或按照特点属性生成画作等的创意图像生成与根据指定要求生成营销类海报模特图等的功能性图像生成发展接近成熟当前图像生成水平与专职艺术家设计师和摄影师的产品设计作品存在一定差距音频生成发展较为成熟消费与企业级的应用正在铺开AIGC目前在语音克隆生成虚拟人的特定歌声播报等的文本生成特定语言包含作曲与编曲的乐曲歌曲生成上得到广泛应用代表企业和应用的有倒映有声Deepmusic网易-有灵智能创作平台等AI降噪去除压缩和采样中的噪音仍需改善AI作曲不再机械化与人类创作音乐水平相仿在未来值得期待视频生成AIGC目前对于删除特定主体生成特效跟踪剪辑等的视频属性编辑已较广泛应用视频换脸等的视频部分剪辑预计不久将规模化应用对特定片段进行检测与合成的视频自动剪辑发展仍不完善当前全自动生成长时间的视频作品还不能实现距离依个人梦想定制电影和剧集还较为遥远其他游戏代码3D代码补全生成来替代程序员重复性劳动的发展较为成熟大量应用已落地游戏中游戏操作策略生成和NPC逻辑及剧情生成尚需进一步完善3D生成尚处于早期阶段3D模型3D角色制作和3D场景尚未实现规模化应用3D游戏代码自动生成更加智能将成为未来的增长方向免责声明和披露以及分析师声明是报告的一部分请务必一起阅读8传媒AIGC的商业模式同样处于持续探索的阶段由按量收费等传统方式向SaaS订阅模式等应用场景更灵活的方式拓展AIGC让AI公司为更多中小型企业甚至个人提供服务可规模化地降本增效为AI行业带来一种全新的可能性和商业模式1按量收费AI技术传统应用模式主要以API接口对外开放以实际使用量训练量计算收费如OpenAI的GPT3语言模型服务以每千tokens定价OpenAI使用的字符计算单位一千tokens约等于750个单词AdaBabbageCurieDavinci四种模型的能力和产出速度不同单价也有所不同分别为00004000050002000200每千tokens图像生成方面DALLE模型同样按次收费不同尺寸的图像收费不同生成一张256x256512x5121024x1024像素的图片单次收费0016001800202SaaS模式AIGC为B端及C端用户提供了会员SaaS收费的模式降低了传统AI公司的客户服务规模化的难度据OpenAI官网2023年OpenAI推出付费版本的ChatGPTPlus起价为每月20美元提供更快的响应速度以及新功能和更新的有限使用权美国AIGC公司Jasper主打AI生成文案服务以类SaaS服务收费2021年成立当年营收达4500万美元以其Starter模式为例基础收费是24美元月可以使用不超过2万字最高332美元月可以使用32万字3其他通过降本增效来增利定制化服务付费个性化产品销售等市场积极探索其他场景商业化在广告营销影视音乐游戏艺术品等领域AIGC有望继续拓展更多样化的商业化形式蓝色光标推出的销博特发布AIGC创策图文营销套件该套件的定制版服务将销博特营销能力服务部署为企业自有云服务并根据企业个性化需求进行二次开发构建企业内部营销创意基础设施平台为企业提供专属营销策划和创意内容AIGC的商业模式同样处于持续探索的阶段由按量收费等传统方式向SaaS订阅模式等应用场景更灵活的方式拓展AIGC让AI公司为更多中小型企业甚至个人提供服务可规模化地降本增效为AI行业带来一种全新的可能性和商业模式免责声明和披露以及分析师声明是报告的一部分请务必一起阅读9传媒AIGC多场景快速落地文本图像关注度较高文本ChatGPT引领热潮大厂加码布局交互式文本据量子位AI文本生成分为交互式与非交互式非交互式包括结构化写作非结构化写作和辅助性写作其中结构化写作指基于数据或规范格式在特定情况下生成的文本如新闻简讯等非结构化写作以创作型文本生成为主具备更高的开放度作为AIGC最早发展的技术AI文本生成已经在新闻报道商业营销客服机器人等领域广泛落地2022年11月30日OpenAI推出的智能聊天工具ChatGPT引入RLHF机制降低训练成本且效果优化不仅能够对问题作出回答还能完成短文和诗歌创作代码写作数学和逻辑运算等任务据SimilarwebChatGPT推出仅2月平均日活超1300万引发社会广泛关注科技巨头亦加码布局交互式文本微软在2023年1月追加投资OpenAI未来还计划将ChatGPT整合到旗下的搜索引擎Bing中谷歌通过内部研发与投资ChatGPT的竞品Anthropic来应对挑战23年2月6日公布了与ChatGPT类似的对话服务Bard据彭博社百度计划将ChatGPT类似程序嵌入搜索服务中图表8国内外重点企业及产品介绍大类小类公司国家应用模型介绍非交互式结构化写作澜舟科技中国contentnote智能文案主要针对营销文案的智能化写作腾讯中国Dreamwriter腾讯财经开发的一款自动写作新闻软件百度中国AI助理基于百度文心大模型可产出不同风格的文章标题内容段落字节中国Xiaomingbot一款新闻写作机器人该机器人在里约奥运会上共撰写了457篇关于羽毛球乒乓球网球的消息简讯和赛事报道AutomatedInsights海外WordSmith已经被美联社等机构使用帮助报道大学橄榄球赛事公司财报等新闻NarrativeScience海外Quill将数据转化为自然语言并凸显最重要的洞见非结构化写作Phrasee海外PhraseeScore解决电子邮件营销优化的问题一键生成数百万种符合品牌要求的内容Persado海外Persado生成电子邮件网页和其他营销活动等的文案北京彩彻区明科技中国彩云小梦人工智能小说续写APP已入驻喜马拉雅谷歌海外Dramatron一款AI剧本写作模型能够自动产生人物位置情节的描述并生成对话中文在线中国AI文字创作功能已在17K小说上线作者在使用该功能时通过针对不同的描写场景填写关键词和辅助短语即可生成对应的文字内容描写为作品使用Jasper海外Jasper支持26种语言可实现剽窃检测速写长篇文档编辑等辅助性写作智搜信息中国Gilso写作机器人内容创作AI辅助工具提供热点写作提纲写作汽车写作等类型写作赅推智能中国Get写作用AI加速写作以人机协作的方式提升写作效率快速创作北京万卷在线中国写作猫AI智能写作内容辅助写作工具谷歌海外Wordcraft基于LaMDA模型能够根据现有文本产生新想法或者帮助创作者重写已有的句子Sudowrite海外Sudowrite支持头脑风暴想出新角色帮助详细描述重写等交互式闲聊机器人OpenAI海外ChatGPT人工智能聊天机器人可完成撰写邮件视频脚本文案翻译代码等任务谷歌海外Bard基于谷歌的LaMDA模型能够利用网络上的信息提供最新的高质量的回答百度中国文心一言预计2023年3月嵌入百度搜索引擎文本交互游戏Latitude海外AIDungeon利用了GPT-2模型根据上下文和用户输入生成文本的文字冒险游戏资料来源各公司官网量子位华泰研究1交互式文本在交互式文本当中最近热度较高的ChatGPT是代表性应用展现出较强的智能水平ChatGPT是OpenAI在2022年11月30日推出的人工智能聊天工具其不仅能够模仿人类的风格作出问题回答还能完成短文和诗歌创作代码写作数学和逻辑运算等任务据腾讯研究院ChatGPT目前可以驾驭各种风格和文体能够做到回答后续问题承认错误质疑不正确的前提和拒绝不适当的请求等ChatGPT的内容输出质量内容覆盖维度已经可以直面搜索引擎与问答社区据CNBCChatGPT通过了Google3级工程师的编码面试据NBCNews沃顿商学院教授ChristianTerwiesch发现ChatGPT能够以B-到B的成绩通过该校MBA核心课程运营管理的期末考试展现出较强的智能水平免责声明和披露以及分析师声明是报告的一部分请务必一起阅读10传媒图表9ChatGPT对话实例资料来源OpenAI官网华泰研究ChatGPT的出现迅速引起广泛关注仅推出2月平均日活超1300万成为一款现象级的产品ChatGPT用户数在5天内突破了100万据Similarweb2023年1月每天平均有1300万独立访客使用ChatGPT超12月的2倍而这距离ChatGPT的推出仅2个月ChatGPT强大的性能引发了社会的广泛关注特斯拉CEO马斯克在Twitter上表示许多人已经陷入了ChatGPT的疯狂循环中我们离强大到危险的AI不远了2023年2月微软创始人比尔盖茨接受Forbes采访时表示AI将成为2023年最热门的话题ChatGPT这种人工智能技术出现的意义不亚于互联网和PC的诞生ChatGPT引入RLHF机制通过引入人类反馈持续优化模型效果据OpenAI官网ChatGPT的模型在GPT-35的基础上引入了RLHFReinforcementLearningfromHumanFeedback人类反馈强化学习机制这一模式增强了人类对于模型输出结果的调整对结果进行更具理解性的排序并提升训练效率加速模型收敛具体来看ChatGPT的训练分为1第一阶段监督调优在数据集中随机抽取问题由标注人员给出高质量回答并用标注好的回答微调GPT-35模型获得SFTSupervisedFine-Tuning模型2第二阶段训练奖励模型在数据集中随机抽取问题标注人员对于每个问题的不同回答给出排名顺序并用排序结果训练奖励模型3第三阶段近端策略优化将奖励模型用于改进SFT模型第一阶段仅训练1次通过持续迭代第二和第三阶段即可生成高质量的ChatGPT模型图表10历代GPT模型参数对比图表11ChatGPT底层引入了RLHF技术GPT-1GPT-2GPT-3ChatGPT发布时间2018年6月2019年2月2020年5月2022年11月参数量117亿15亿1750亿预训练数据量约5GB40G45TB资料来源机器之心华泰研究资料来源OpenAI官网华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读11传媒ChatGPT再获微软投资合作持续加深未来将集成至Bing搜索引擎与Edge浏览器中据路透社OpenAI在2019年获得微软10亿美元的投资2021年微软对OpenAI追加了投资据微软官网微软在2023年1月表示作为两家公司合作的第三阶段微软将加大对supercomputingsystems的投资以支持OpenAI的发展此外微软未来会把自己的消费者和企业产品中部署OpenAI的模型并为客户引入基于OpenAI技术的体验将OpenAI的技术构建到GitHubCopilot和MicrosoftDesigner等同时微软仍然为OpenAI的独家云提供商从具体的落地层面看2023年1月微软CEO萨提亚纳德拉表示微软旗下的Azure云服务即将整合ChatGPT技术2023年2月微软旗下的Teams推出嵌入ChatGPT的高级服务同时微软宣布将OpenAI的语言模型整合到Bing搜索引擎和Edge浏览器中据Theinformation截至2023年1月OpenAI估值达290亿美元ChatGPT在商业化路径上持续探索推出付费版本ChatGPTPlusOpenAI的CEOSamAltman在Twitter上表示ChatGPT平均一次聊天成本在个位数美分除了API外公司正在探索更多的商业化变现模式而ChatGPTPlus便是其中之一据OpenAI官网2023年OpenAI推出付费版本的ChatGPTPlus起价为每月20美元目前只对美国的用户开放据OpenAI官网ChatGPTPlus即使在高峰时段也可以访问有更快的响应可以优先使用新功能和改进图表12ChatGPT推出付费版本ChatGPTPlus图表13ChatGPT平均一次聊天成本在个位数美分资料来源OpenAI官网华泰研究资料来源Twitter华泰研究谷歌通过内部研发与投资应对ChatGPT或带来的颠覆性挑战据Insider2022年12月谷歌为ChatGPT带来的威胁发布了红色警报着手进行紧急应对应对措施方面谷歌一方面加快内部研发据谷歌官网美国时间2023年2月6日谷歌发布了与ChatGPT类似的对话服务Bard目前Bard向测试人员开放未来几周将持续向公众开放该服务Bard基于谷歌的LaMDA模型LanguageModelforDialogueApplications用于对话场景的语言模型能够利用网络上的信息提供最新的高质量的回答此外据TheIndependent谷歌或将在2023年通过子公司DeepMind推出聊天机器人Sparrow可通过谷歌搜索引用特定的信息源准确性更强谷歌也在通过投资持续布局相关领域据金融时报2023年2月谷歌投资AIGC初创公司Anthropic超3亿美元获得了约10股份据Anthropic官网谷歌已经与Anthroic签署了一份大型云计算合同Anthropic从谷歌云购买计算资源谷歌提供AI模型算力Anthropic在2021年由前OpenAI研究副总裁DarioAmodei建立核心产品是与ChatGPT类似的聊天机器人Claude免责声明和披露以及分析师声明是报告的一部分请务必一起阅读12传媒图表14Anthropic宣布使用谷歌云训练模型图表15谷歌发布基于LaMDA的对话服务Bard资料来源Twitter华泰研究资料来源谷歌官网华泰研究国内大厂对于ChatGPT的发展持乐观态度百度将集成文心一言至搜索引擎腾讯研究院在2023年1月发布AIGC趋势报告2023对于ChatGPT的发展持乐观态度指出AIGC有望作为数据与内容的强大生产引擎升级甚至重塑内容工具申请的人机对话方法装置设备及计算机可读存储介质专利可实现人机顺畅沟通京东集团副总裁何晓冬表示京东会不断结合ChatGPT的方法和技术点融入到产品服务中推动人工智能的产业落地据百度官网2023年2月7日百度公布了大模型新项目文心一言ERNIEBot据彭博社百度计划在2023年3月将最初的版本将内嵌到搜索服务中阿里巴巴达摩院申请了人机对话及预训练语言模型训练方法系统及电子设备的专利积极布局AIGC2非交互式文本结构化写作已经在新闻写作公司财报客服类聊天问答等场景广泛应用国外方面代表性的垂直公司AutomatedInsights成立于2007年旗下的Wordsmith是一个自然语言生成平台能够借助NLP技术将数据转化成描述性的语言据公司官网目前AutomatedInsights已经在新闻写作中具有较广泛的应用下游的客户包括雅虎美联社等主流媒体国内方面小冰公司腾讯百度字节澜舟科技等公司均有布局澜舟科技成立于2021年主要产品是基于孟子轻量化预训练模型打造的一系列SaaS功能引擎被广泛应用于包括搜索生成翻译对话等领域字节推出的Xiaomingbot是新闻写作机器人该机器人在里约奥运会上共撰写了457篇关于羽毛球乒乓球网球的消息简讯和赛事报道整体来看目前结构化写作已具备较成熟的应用长期来看NarrativeScience创始人预测到2030年90以上的新闻将有AI写作完成图表16AutomatedInsights下游客户图表17澜舟科技技术方案模型资料来源AutomatedInsights官网华泰研究资料来源澜舟科技官网华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读13传媒非结构化写作开放度和技术要求更高主要运用在营销和剧情写作领域据量子位非结构化写作主要运用在剧情写作营销文本等领域开放度和自由度更高对于生成技术亦有更高的要求而目前长篇文字在内部逻辑上仍然有较明显的问题暂不适合直接使用预计未来的4-5年或取得一定的突破国外方面代表性的公司包括谷歌AnywordPencilCopyaiJasper等其中Jasper成立于2021年基于GPT-3训练模型通过AI技术帮助企业完成社交媒体广告营销电子邮件等多种内容2022年10月Jasper宣布获得125亿美元的A轮融资估值达15亿美元谷歌的AI剧本写作模型Dramatron则能够自动产生人物位置情节的描述并生成对话国内代表性公司为中文在线彩云小梦等在彩云小梦App中创作页面输入一段文字便能够生成三条不同的故事走向用户可以点击选择继续或者让彩云小梦重新续写从而让故事走向更加符合用户的设定中文在线的AI文字创作功能已在17K小说上线作者在使用该功能时通过针对不同的描写场景填写关键词和辅助短语即可生成对应的文字内容描写为作品使用图表18Jasper广泛应用于社交媒体广告等领域图表19彩云小梦能够实现非结构化写作资料来源Jasper官网华泰研究资料来源AppStore华泰研究辅助性写作落地场景广泛主要运用在资讯和文章写作等场景据量子位除端到端的文本创作外辅助性写作是国内目前供给及落地最为广泛的场景辅助性写作主要是基于素材爬取的协助作用如定向采集信息素材文本素材预处理自动聚类去重等提供相关素材国外代表性的公司为Sudowrite其辅助性写作工具支持头脑风暴想出新角色帮助详细描述重写等谷歌发布的Wordcraft基于LaMDA模型能够根据现有的文本产生新想法或者帮助创作者重写已有的句子国内方面代表性的公司包括写作猫Gilso写作机器人Get写作等其中智搜信息的Gilso写作机器人拥有资讯写作文章校对文章改写提纲写作营销写作等功能曾为中国南方电网经济日报等提供服务图表20智搜信息的客户案例图表21Sudowrite帮助在写作中找到合适的词资料来源智搜信息官网华泰研究资料来源Sudowrite官网华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读14传媒图像预训练模型迭代升级AI图像生成迎机遇据量子位AIGC图像包括文字生成图像图像属性编辑图像部分编辑与图像端到端生成其中由文字到图像的跨模态生成成为重点探索方向从底层技术上看Diffusion逐渐取代GAN成为图像生成的主流模型助推了AIGC图像的发展2022年8月由Midjourney生成的太空歌剧院出圈引发AI图像生成的热潮2022年8月StabilityAI推出StableDiffusion模型成为AI图像生成的里程碑为后续图像模型的更迭打下基础此外OpenAI谷歌在图像模型上亦持续迭代百度文心一格则支持中国风AI创作据6pen未来5年全球10-30的图像有望由AI生成或辅助生成AI图像领域展现出较大的潜力图表22国内外重点企业及产品介绍分类公司国家应用模型介绍文字生成图像MidJourneyLab海外MidJourney一款搭载在Discord上的聊天机器人玩家机器人并输入相关的提示词Prompts即可在1分钟以内生成4张图片百度中国文心一格基于ERNIE-ViLG20目前支持国风油画水彩水粉动漫写实等十余种不同风格高清画作的生成StabilityAI海外StableDiffusion该模型的运行速度快消费资源及内容较少使用消费级显卡即可迅速生成高质量的图像且该模型完全免费开源所有的代码均在GitHub上公开OpenAI海外DALLE2根据文本描述生成图像较前代图像质量提升了3倍能够在更细的颗粒度上实现文本到图像的转化能够根据自然语言进行P图同时会反馈阴影纹理等元素的变化生成速度极大提升谷歌海外Imagen从效果上看Imagen在写实场景中表现更加优秀图像属性编辑Alexey海外Prisma照片编辑器在全球拥有12亿用户及500款样式库借助Prisma的AI自动生成框架可将照Moiseenkov团队片转化为艺术品谷歌海外RawNeRF能够将夜晚照片降噪此外能将2D照片合成3D效果并调节焦点美图公司中国美图AI开放平台专注于人脸技术人体技术图像识别图像处理图像生成等核心领域接入的客户包括欧莱美图秀秀雅兰蔻宝洁等图像部分编辑英伟达海外CycleGAN自动将一类图片替换为另一类图片如支持将图内的斑马和马苹果和橘子等内容进行互换Metaphysicai海外Metaphysic能够调节照片的情绪年龄和微笑万兴科技中国万兴爱画APP支持AI修改局部画面支持通过文本修改如输入珍珠项链可在图片中添加Deepswapai海外Deepfake支持AI换脸图像端到端生成阿里巴巴中国阿里鹿班设计水平已经非常接近普通设计师平均1秒钟就能完成8000张海报设计蓝色光标中国销博特通过结合AI统计算法和多维数据库一键自动化生成策划案消费者洞察营销创意等内容谷歌海外ChimeraPainter使用机器学习可以把随手画的粗略草图生成怪物图像ArtbreederBot海外Artbreeder支持有机组合多张图像生成新图像RosebudAI海外Rosebudai支持生成虚拟的模特面部用于品牌广告和娱乐VanceAI海外VansPortrait在5秒内将图片变成绘画素描或动画资料来源各公司官网量子位华泰研究早期AIGC图像主要基于GAN模型但生成效果欠佳GAN模型主要由生成器Generator和判别器Discriminator两部分组成生成器负责模拟出与真实训练样本类似的假数据并将假数据混入原始数据交由判别器区分两个模型相互博弈直到生成器的假数据能够以假乱真早期的AIGC图像主要基于GAN模型生产但是GAN存在训练难以收敛模型坍塌梯度消失等问题造成训练结果冗余图像生成质量差免责声明和披露以及分析师声明是报告的一部分请务必一起阅读15传媒图表23基于GAN的图像生成原理资料来源CSDN华泰研究Diffusion模型逐渐取代GAN成为主流模型推动图像生成技术的发展Diffussion受热力学模型启发通过增加高斯噪声破坏训练数据然后通过反转噪声来恢复学习的数据经过训练的模型便能够应用去噪方法来生成干净的数据Diffussion相对于GAN具有更灵活的模型框架和精确的对数似然所需数据更少但图像生成效果较更佳目前逐渐取代GAN成为新一代图像生成的主流模型图表24Diffusion模型生成原理资料来源量子位GitHub华泰研究1文字生成图像由Midjourney生成的太空歌剧院出圈引发社会广泛讨论Midjourney是一款搭载在Discord上的聊天机器人玩家只需要机器人并输入相关的提示词Prompts即可在1分钟以内生成4张图片凭借着极低的上手门槛和Discord社区加持截至2023年2月4日Discord数据显示Midjourney在Discord约有980万成员2022年8月由Midjourney生成的太空歌剧院在美国科罗拉多州艺术博览会上获得数字艺术类别的冠军使得AI绘画引发了广泛的关注围绕AI能够替代艺术创作的讨论热度较高免责声明和披露以及分析师声明是报告的一部分请务必一起阅读16传媒图表25Midjourney搭载在Discord社区图表26太空歌剧院资料来源Discord华泰研究资料来源TheInformation华泰研究StableDiffusion模型成为AI图像领域的里程碑Stability估值达10亿美元2022年8月StabilityAI推出StableDiffusion模型随着算法和模型的持续优化StableDiffusion的运行速度快消费资源及内容较少使用消费级显卡即可迅速生成高质量的图像且该模型完全免费开源所有的代码均在GitHub上公开因此也为后续整个图像模型的更迭打下基础据TechCrunch截至2022年10月已有超20万开发者下载和获得StableDiffusion的授权各渠道的累计日活已经超过1000万基于StableDiffusion面向消费者的AI智能绘图软件DreamStudio用户数超150万已生成17亿张图片2022年10月StabiltyAI宣布获得CoatueLightspeedVenturePartners和OShaughnessyVenturesLLC投资的101亿美元估值达10亿美元跻身独角兽行业图表27StableDiffusion的组成资料来源CSDN华泰研究OpenAI持续迭代DALLE模型图片画质生成效率均有提升2021年1月OpenAI发布模型DALLE能够根据文本描述生成图像2022年4月OpenAI公布了DALLE2研发进展据量子位从原理上看DALLE2是CLIP与Diffusion模型的结合其中CLIP将文本嵌入转变为图像嵌入而图像嵌入将通过调节扩散DiffusionDecoder生成最终的图像DALLE2与前一代相比图像质量提升了3倍DALLE2生成图像画质为10241024DALLE画质为256256且生成的速度更快此外DALLE2能够在更细的颗粒度上实现文本到图像的转化能够根据自然语言进行P图同时会反馈阴影纹理等元素的变化免责声明和披露以及分析师声明是报告的一部分请务必一起阅读17传媒图表28DALLEE2较前一代图像质量提升3倍资料来源OpenAI官网华泰研究谷歌的Imagen在写实场景表现优秀Muse图像生成效率更高2022年5月Google公布了自研的Imagen模型据量子位从技术上看该模型并未采用CLIPGAN或CLIPDiffusion的常规做法语言模型采用谷歌的T5-XXL并仅负责编码文本特征图像生成由一系列Diffusion模型构成从效果上看Imagen在写实场景中表现更加优秀2023年1月Google发布了从文本生成图像的Transformer模型Muse与Imagen和DALLE2等Diffusion模型相比Muse由于采用离散标记且需要更少的采样迭代生成效率显著提升据GoogleResearch与Dataconomy在TPUv4芯片上Muse生成512x512分辨率的图像仅需13秒较StableDiffusion14的37秒更快图表29谷歌Imagen模型原理图表30Muse模型图像生成速度更快ModelResolutionInterenceTimeStableDiffusion1451251237sParti-3B25625664sImagen25625691sImagen10241024133sMuse-3B25625605sMuse-3B51251213s资料来源量子位华泰研究注基于TPUv4芯片资料来源GoogleResearchDataconomy华泰研究百度推出国产基础模型ERNIE-ViLG20文心一格支持中国风AI创作伴随AI绘图的火热国内也出现了众多的AI作图产品但这些产品大多基于DALLE2或StableDiffusion等海外大模型百度在2022年10月发布的ERNIE-ViLG20是国内首个在基础模型方向取得突破的产品据百度AI官网从技术上看ERNIE-ViLG20通过引入视觉知识和语言知识提升模型跨模态语义理解能力与可控生成能力在扩散降噪过程中通过混合专家网络建模增强模型建模能力提升图像的生成质量此外百度构建了近2亿的高质量中文图文数据对比具备强大的中文语义理解能力助力中国风元素构建从应用上看ERNIE-ViLG20可以用于工业设计动漫设计游戏制作摄影艺术等场景通过简单描述在几十秒内生成设计图提升效率降低门槛基于ERNIE-ViLG20百度也推出了AI艺术与创意辅助平台文心一格目前支持国风油画水彩水粉动漫写实等十余种不同风格高清画作的生成免责声明和披露以及分析师声明是报告的一部分请务必一起阅读18传媒图表31ERNIE-ViLG20助力中国风图像创作资料来源百度AI官网华泰研究2图像属性编辑据量子位AI图像属性编辑包括去水印自动调整光影设置滤镜修改颜色纹理复刻修改图像风格提升分辨率等类似于低门槛的PSPhotoshop在该领域布局的初创公司较多并且谷歌Adobe等大厂亦有涉及国外方面以Prisma为例作为一款照片编辑器在全球拥有12亿用户以及500款样式库借助Prisma的AI自动生成框架用户无需投入精力即可将照片转化为艺术品谷歌的RawNeRF技术能够将夜晚照片降噪此外能将2D照片合成3D效果并调节焦点国内的代表产品为美图公司旗下的美图AI开放平台专注于人脸技术人体技术图像识别图像处理图像生成等核心领域为客户提供经市场验证的专业AI算法服务和解决方案目前接入的客户包括欧莱雅兰蔻宝洁等助力图像属性处理面向C端的美图秀秀则通过医美级去皱面部丰盈一键更换刘海等增值功能收费图表32Prisma相片编辑器功能展示图表33美图秀秀支持自动调节光影资料来源AppStore华泰研究资料来源美图秀秀官网华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读19传媒图表34美图AI开放平台下游客户资料来源美图AI开放平台官网华泰研究3图像部分编辑据量子位图像部分编辑包括部分更改图像部分构成与修改面部特征英伟达的CycleGAN能够自动将一类图片替换为另一类图片如支持将图内的斑马和马苹果和橘子等内容进行互换修改面部特征方面据量子位Metaphysics支持调节照片的情绪年龄和微笑Metaphysics还是电影Here的唯一制定AI视觉特效供应商国内方面万兴科技推出的万兴爱画App支持AI修改局部画面支持通过文本修改如输入珍珠项链可在图片中添加图表35英伟达的CycleGAN支持图片替换图表36Metaphysics能够调节照片年龄资料来源英伟达华泰研究资料来源Metaphysics官网华泰研究4图像端到端生成据量子位AI图像端到端生成包括草图生成完整图像有机组合多张图像生成新图像根据指定属性生成目标图像等按照场景划分包括创意图像生成和功能型图像生成其中创意图像多为NFT产品功能性图像包括营销海报用户头像等国外方面谷歌推出的ChimeraPainter可以将粗略草图生成3D怪物图像垂直类公司包括VanceAIDeepdreamGeneratorRosebudai等其中VanceAI旗下的VansPortrait可在5秒内将图片变成绘画素描或动画国内的代表产品包括阿里鹿班诗云科技蓝色光标等其中阿里鹿班支持海报LOGO等设计据阿里技术阿里鹿班平均1秒钟就能完成8000张海报设计一天可以制作4000万张2017年双11设计约4亿张banner海报蓝色光标的销博特通过结合人工智能统计算法和多维数据库一键自动化生成策划案消费者洞察营销创意等内容免责声明和披露以及分析师声明是报告的一部分请务必一起阅读20
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1