投资要点:
AIGC成为新的内容生产方式,跨模态生成值得重点关注。区别于PGC与UGC,AIGC是利用人工智能技术自动生成内容的新型生产方式。按照模态区分,AIGC可分为音频生成、文本生成、图像生成、视频生成及图像、视频、文本间的跨模态生成,细分场景众多,其中,跨模态生成需要重点关注。 自然语言处理(NLP)赋予了AI理解和生成能力,大规模预训练模型是NLP的发展趋势。NLP的两个核心任务分别是自然语言理解(NLU)和自然语言生成(NLG)。以ELMo、BERT、GPT为代表的预训练模型,降低了NLP的技术门槛。ELMo解决了“一词多义”的问题;BERT通过MLM(类似于完形填空)和NLP(判断句子是否相连)进行预训练,增强了上下文的理解能力。GPT通过预测下一个词,获得了生成能力;GPT-3在此基础上使用了更大的数据和更大模型,无需针对下游任务进行传统的微调,并且采用了小样本学习提升生成效果。 ChatGPT是NLP发展中具有里程碑式意义的模型之一。ChatGPT是OpenAI从GPT-3.5系列中的模型进行微调产生的聊天机器人模型。它能够通过学习和理解人类的语言来进行对话,还能根据聊天的上下文进行互动,真正像人类一样来聊天交流,甚至能完成撰写邮件、视频脚本、文案、翻译、代码等任务。 生成模型赋予了AI创造力,扩散模型是最前沿的技术之一。AIGC的快速发展归功于生成算法领域的技术积累。GAN的核心思想是“生成”与“对抗”,相比传统的深度神经网络,GAN能产生更好的生成样本,但是仍需解决应用中的问题。扩散模型较GAN更接近人的思维模式,是基于马尔科夫链,通过学习噪声来生成数据。扩散模型实现了跨模态应用,包括OpenAI的GLIDE和DALL·E 2、谷歌的Imagen、Stability AI的Stable Diffusion等。 人工智能由单模态智能,向多种模态融合方向发展。建立统一的、跨场景、多任务的多模态基础模型或将成为人工智能发展的主流趋势之一。CLIP模型将语言信息和图像信息联合训练,能够链接文本和图片,成为跨模态生成应用的一个重要节点,“CLIP+其他模型”在跨模态生成领域成为一种较为通用的做法。2022年,微软提出的BEiT-3多模态基础模型,在视觉-语言任务处理上具备出色表现,包括视觉问答、图片描述生成和跨模态检索等。多模态提高了基础模型的灵活性,使其在其他模态的应用中发挥新的潜质。 未来,值得关注的技术要素包括:长文本生成、开放式文本生成、NeRF模型、扩散模型、跨模态大型预训练模型(支持的模态数据类型、模态对齐架构设计、支持的下游应用)、小样本学习及自监督算法、强化学习及环境学习等。 投资建议:把握AIGC技术催化和商业落地的投资机会。技术发展有望促进生产效率提升,并进一步创造新的消费和需求,有利于文娱内容和互联网行业。在AIGC和ChatGPT方面,我们建议持续关注技术发展和应用情况,把握技术催化和商业化落地带来的投资机会:1)具备AIGC和ChatGPT的技术探索和应用的公司:百度集团-SW、商汤-W、万兴科技、拓尔思等;2)具有海量内容素材且具有AIGC探索布局的,图片/文字/音乐/视频内容及平台公司腾讯控股,阅文集团、美图公司、视觉中国、中文在线、汉仪股份、昆仑万维、天娱数科、风语筑等。 风险提示:技术发展不及预期、监管政策变化、知识产权相关问题等。 研究报告全文:TableMain证券研究报告行业专题传媒2023年02月10日传媒AIGC专题一探析AIGC的技术发优于大市维持展和应用证券分析师TableSummary投资要点马笑资格编号S0120522100002AIGC成为新的内容生产方式跨模态生成值得重点关注区别于PGC与UGC邮箱maxiaoteboncomcnAIGC是利用人工智能技术自动生成内容的新型生产方式按照模态区分AIGC可分为音频生成文本生成图像生成视频生成及图像视频文本间的跨模态研究助理生成细分场景众多其中跨模态生成需要重点关注自然语言处理NLP赋予了AI理解和生成能力大规模预训练模型是NLP的发展趋势NLP的两个核心任务分别是自然语言理解NLU和自然语言生成NLG市场表现以ELMoBERTGPT为代表的预训练模型降低了NLP的技术门槛ELMo解沪深300决了一词多义的问题BERT通过MLM类似于完形填空和NLP判断句5子是否相连进行预训练增强了上下文的理解能力通过预测下一个词0GPT-5获得了生成能力GPT-3在此基础上使用了更大的数据和更大模型无需针对下游-10任务进行传统的微调并且采用了小样本学习提升生成效果-15-20-242022-022022-062022-10ChatGPT是NLP发展中具有里程碑式意义的模型之一ChatGPT是OpenAI从-29GPT-35系列中的模型进行微调产生的聊天机器人模型它能够通过学习和理解人类的语言来进行对话还能根据聊天的上下文进行互动真正像人类一样来聊天交流甚至能完成撰写邮件视频脚本文案翻译代码等任务相关研究1传媒互联网行业周报ChatGPT生成模型赋予了AI创造力扩散模型是最前沿的技术之一AIGC的快速发展归加速商业化AIGC或带来泛娱乐和功于生成算法领域的技术积累GAN的核心思想是生成与对抗相比传统互联网的革新202325的深度神经网络GAN能产生更好的生成样本但是仍需解决应用中的问题扩2分众传媒002027SZ首次覆散模型较GAN更接近人的思维模式是基于马尔科夫链通过学习噪声来生成数盖报告当风轻借力一举入高空据扩散模型实现了跨模态应用包括OpenAI的GLIDE和DALLE2谷歌的202321ImagenStabilityAI的StableDiffusion等3腾讯控股0700HK22Q4业绩前瞻及观点更新宏观经济波动致收人工智能由单模态智能向多种模态融合方向发展建立统一的跨场景多任务入端承压降本增效成果释放带来利的多模态基础模型或将成为人工智能发展的主流趋势之一CLIP模型将语言信息润端高增速2023131和图像信息联合训练能够链接文本和图片成为跨模态生成应用的一个重要节点4百度集团-SW9888HK22Q4CLIP其他模型在跨模态生成领域成为一种较为通用的做法2022年微软及2022年全年业绩前瞻疫情扰动提出的BEiT-3多模态基础模型在视觉-语言任务处理上具备出色表现包括视觉或致经营短期承压展望后续收入业问答图片描述生成和跨模态检索等多模态提高了基础模型的灵活性使其在其绩双端修复2023130他模态的应用中发挥新的潜质5春节档期票房超65亿行业持续复苏估值业绩双升可期未来值得关注的技术要素包括长文本生成开放式文本生成NeRF模型扩2023128散模型跨模态大型预训练模型支持的模态数据类型模态对齐架构设计支持的下游应用小样本学习及自监督算法强化学习及环境学习等投资建议把握AIGC技术催化和商业落地的投资机会技术发展有望促进生产效率提升并进一步创造新的消费和需求有利于文娱内容和互联网行业在AIGC和ChatGPT方面我们建议持续关注技术发展和应用情况把握技术催化和商业化落地带来的投资机会1具备AIGC和ChatGPT的技术探索和应用的公司百度集团-SW商汤-W万兴科技拓尔思等2具有海量内容素材且具有AIGC探索布局的图片文字音乐视频内容及平台公司腾讯控股阅文集团美图公司视觉中国中文在线汉仪股份昆仑万维天娱数科风语筑等风险提示技术发展不及预期监管政策变化知识产权相关问题等请务必阅读正文之后的信息披露和法律声明行业专题传媒内容目录1AIGC的跨模态生成值得重点关注52基于大模型预训练的NLP赋予了AI理解和生成能力521ELMo将输出的词向量作为特征解决了一词多义722BERT通过上下文预训练提高了理解能力823GPT-3利用超大数据和超大模型省去了微调的过程9231ChatGPT趋近人类价值观及意图有望进一步商业化113基于大模型的主流生成模型赋予了AI创造力1231GAN是基于生成与对抗提出的生成模型1332扩散模型更接近人的思维模式实现了跨模态应用13321扩散模型实现了从文本到图像的跨模态应用144人工智能由单模态智能向多种模态融合方向发展165AIGC技术不断发展有望带来更多商业化价值166投资建议把握AIGC技术催化和商业落地的投资机会187风险提示19220请务必阅读正文之后的信息披露和法律声明行业专题传媒图表目录图1内容生产模式的四个发展阶段5图2自然语言处理的发展历史6图3大规模预训练模型大幅提升研发效率6图4BERT的每一层都是双向模型GPT为单向模型ELMo为单项模型叠加7图5大规模预训练语言模型的发展趋势之一是参数量不断增加7图6ELMo基于RNN双向RNN可以利用前后文信息8图7ELMo将词嵌入作加权和给出最终的词向量8图8ELMo解决了一词多义问题且兼顾语义与词性8图9BERT的结构是Transformer中的Encoder部分9图10BERT采用了预训练微调的两阶段模型9图11NSP任务中输入向量生成示意图9图12GPT模型结构10图13GPT-3将例子直接作为模型输入10图14FewShot较ZeroShot在模型增大后表现提升更显著10图15GPT-35的进化树11图16RLHF工作原理11图17ChatGPT的训练模式11图18ChatGPT能够进行对话甚至能完成撰写代码12图19ChatGPT上线2个月后月度用户数量破1亿12图20OpenAI推出付费订阅项目ChatGPTPlus价格20月12图21不同生成模型之间的区别13图22GAN的基本思想13图23训练后的GAN生成案例13图24DiffusionModel基于马尔科夫链通过学习噪声来生成数据14图25GLIDE可以进行文本到图像的生成14图26GLIDE可以执行图像修复14图27unCLIP模型示意图15图28DALLE2的生成案例15图29Image的架构示意图15图30Image的生成案例15图31StableDiffusion生成效果16图32StableDiffusion20引入了图像深度扩散模型16320请务必阅读正文之后的信息披露和法律声明行业专题传媒图33AIGC相关技术场景及成熟度分类17表1ELMoBERT与GPT系列的对比6表2国外主要AIGC预训练模型一览表17表3部分公司在AIGC领域的布局截至20232618420请务必阅读正文之后的信息披露和法律声明行业专题传媒1AIGC的跨模态生成值得重点关注根据中国信息通信研究院发布的人工智能生成内容AIGC白皮书目前对AIGC这一概念的界定尚无统一规范的定义国内产学研各界对于AIGC的理解是继专业生成内容ProfessionalGeneratedContentPGC和用户生成内容UserGeneratedContentUGC之后利用人工智能技术自动生成内容的新型生产方式传统AI关注对于现有数据的分析能力而AIGC注重生成创造新事物的能力按照模态区分AIGC可分为音频生成文本生成图像生成视频生成及图像视频文本间的跨模态生成细分场景众多其中跨模态生成需要重点关注自然语言处理NLP与生成模型是AIGC发展的重要技术支柱自然语言处理增强AIGC的认知能力使得人类语言与计算机语言之间实现互通生成模型升级AIGC内容创作能力使生成的作品更接近人类思维与偏好图1内容生产模式的四个发展阶段资料来源AIGC发展趋势报告2023德邦研究所AIGC近年来的快速发展依赖于生成模型预训练模型和多模态等技术的融合生成模型从GAN发展到后续的扩散模型不断趋近人的思维模式预训练模型提高了AIGC技术的灵活性和效果质量基于大量数据训练的巨量参数模型可以轻松应用到下游任务中降低了使用门槛和技术成本推动了自然语言处理计算机视觉等技术的发展多模态技术提高了AIGC的通用性使得图像声音语言等互相融合2基于大模型预训练的NLP赋予了AI理解和生成能力自然语言处理NLP主要研究用计算机来理解和生成自然语言的各种理论和方法属于人工智能领域的一个重要甚至核心的分支自然语言处理NLP的两个核心任务分别是自然语言理解NLU和自然语言生成NLG四大任务是序列标注分词语义标注等分类任务文本分类情感计算等句子关系判断生成式任务机器翻译文本摘要等人工智能应用领域的快速拓展对自然语言处理提出了巨大的应用需求2018年NLP正式进入预训练时代简化了下游任务模型的接入降低了NLP的技术门槛预训练是指首先在一个源任务上训练一个初始模型然后在下游任务也称目标任务上继续对该模型进行精调从而达到提高下游任务准确率的目的预训练的优势在于一是对庞大的文本语料库进行预处理可以学习通用的语言表征帮助完成下游任务二是预训练提供了更好的模型初始化带来更好的普适性并加速与目标任务的衔接三是预训练可以看作是一种正则化方法regularization以避免对小数据的过度拟合520请务必阅读正文之后的信息披露和法律声明行业专题传媒图2自然语言处理的发展历史图3大规模预训练模型大幅提升研发效率资料来源车万翔等自然语言处理新范式基于预训练模型的方法德邦研资料来源澜舟科技德邦研究所究所2018年3月AllenNLP提出了ELMo模型属于Feature-Based模型使用预训练模型产出的词向量作为输入接入下游的独立的模型进行预测2018年6月OpenAI提出了第1代GPT模型开启了大规模预训练语言模型时代GPT属于Finetune-Based模型在目标任务上精调整个模型而不是只将模型的输出结果作为固定的词向量特征由于预训练模型自身非常复杂因此接入的下游任务模型可以非常简单很大程度上降低了NLP的技术门槛表1ELMoBERT与GPT系列的对比模型应用名称时间机构底层结构参数量学习方向NLP学习方法主要应用领域优势劣势Feature-Based使用预ELMo用于特征抽RNN模型较解决了一词多义的从左到右叠训练模型产出的词向量取不同下游任务Transformer效果ELMo20183AllenNLPRNN94M问题兼顾语义与加从右到左作为输入接入下游的需要使用不同的对较弱上下文的特词性独立的模型进行预测应模型征融合能力较差可以出色完成NLPFinetune-Based将原来Transformer除生成任务以外的BERT20196谷歌340M双向的模型在下游任务上进NLP研究生成任务较弱的Ecoder其他任务包括阅行训练预训练微调读理解QA等自然语言推理问Finetune-Based将原来答与常识推理语-120186110M的模型在下游任务上进具备生成能力需要进行微调义相似度识别文行训练预训练微调本分类生成文本段落的能着重生成任务例力强内容语法工模型效果有提升空-22019215B无监督零样本学习如写作问答翻整语义一致效Transformer间GPTOpenAI从左到右译写摘要果较好无微调的Decoder泛化能力更强NLP的绝大部分任务例如面向问题小样本学习的准确零样本学习单样本学的搜索阅读理逻辑推理能力有待-320205175B率更高训练效果习或小样本学习解语义推断机提升更好器翻译文章生成和自动问答等资料来源谷歌AllenNLPOpenAI等德邦研究所620请务必阅读正文之后的信息披露和法律声明行业专题传媒图4BERT的每一层都是双向模型GPT为单向模型ELMo为单项模型叠加资料来源JacobDevlinetalBERTPre-trainingofDeepBidirectionalTransformersforLanguageUnderstanding德邦研究所大规模预训练语言模型的发展趋势之一是使用更大规模的数据训练更大的模型ELMo的参数量约为94MGPT-1的参数量约为110MBERT的参数量为340MGPT-2的参数量约为15BGPT-3的参数量约为175B随着技术的不断成熟大模型在开发成本易用性开发周期性能上会更具优势给产品化和商业化带来更多可能性图5大规模预训练语言模型的发展趋势之一是参数量不断增加资料来源Turing-NLGA17-billion-parameterlanguagemodelbyMicrosoft德邦研究所21ELMo将输出的词向量作为特征解决了一词多义ELMoEmbeddingsfromLanguageModels是由AllenAI于2018年3月发表的基于RNN的语言模型ELMo的主要突破在于引入词向量WordEmbedding作为输出解决了一词多义的问题ELMo在RNN的基础上整合上下文信息获得对应的词向量RNN所实现的是输入一个词汇就可以输出它之后所对应的词Token例如输入BOS表示开始RNN就输出潮水输入潮水就输出退了以此类推双向的RNN会将正向和逆向的词嵌入接起来作为最终的词向量因此前后文的信息都可以使用到RNN可以有多层因此会产生很多个上下文词向量ELMo会将所有的上下文嵌入作加权和权重是根据不同的下游任务学习出的720请务必阅读正文之后的信息披露和法律声明行业专题传媒图6ELMo基于RNN双向RNN可以利用前后文信息图7ELMo将词嵌入作加权和给出最终的词向量资料来源李宏毅PuttingWordsintoComputers德邦研究所资料来源李宏毅PuttingWordsintoComputers德邦研究所由于ELMo形成词向量是根据不同的下游任务学习出的因此每一个词并非对应唯一的词向量同时对于ELMo而言上下文中意思相近的词拥有相近的词向量例如在句子我喜欢吃土豆中土豆的表示应该和马铃薯相似而在句子我在土豆上看电影中土豆的表示则应该和爱奇艺相似图8ELMo解决了一词多义问题且兼顾语义与词性资料来源MatthewEPetersetalDeepcontextualizedwordrepresentations德邦研究所22BERT通过上下文预训练提高了理解能力BERTBidirectionalEncoderRepresentationfromTransformer是由Google于2019年6月发布的语言模型BERT的双向性Bidirectionality使其可以充分利用文本上下文并通过MLM类似完形填空和NLP判断句子是否相连任务进行预训练在NLP任务除生成任务外中取得了更好的效果例如阅读理解等BERT采用了预训练和微调的两阶段模型属于半监督学习模型Semi-supervisedLearningBERT的预训练过程采用大量的无标签数据是自监督学习Self-supervisedLearning微调过程采用少量的有标签数据因此是有监督训练SupervisedLearning820请务必阅读正文之后的信息披露和法律声明行业专题传媒图9BERT的结构是Transformer中的Encoder部分图10BERT采用了预训练微调的两阶段模型资料来源JacobDevlinetalBERTPre-trainingofDeepBidirectional资料来源李宏毅PuttingWordsintoComputers德邦研究所TransformersforLanguageUnderstanding德邦研究所BERT的预训练有MaskedLMMLM和NextSentencePredictionNSP两种方式MLM类似于完形填空是将输入的句子中15的词随机遮盖BERT需要猜测遮盖住的部分是什么字训练目标是最小化预测词的误差NSP是从训练集中拿出两个句子BERT需要判断两个句子是否相连如果两个句子是连在一起的那么就输出Yes如果不是那就输出No图11NSP任务中输入向量生成示意图资料来源JacobDevlinetalBERTPre-trainingofDeepBidirectionalTransformersforLanguageUnderstanding德邦研究所BERT的双向性使其可以更好地理解人类语言但在一定程度上限制了它的生成能力相较于单向模型仅通过上文即可进行后文续写生成双向模型在缺乏下文语境时生成能力受限23GPT-3利用超大数据和超大模型省去了微调的过程GPTGenerativePre-Training是由OpenAI于2018年6月提出的GPT与BERT同样是基于Transformer但是单向模型因此它具有更好的生成能力GPT需要做的是预测下一个词是什么例如输入BOS进入GPT输出潮水输入BOS潮水输出退了输入BOS潮水退了输出就以此类推920请务必阅读正文之后的信息披露和法律声明行业专题传媒图12GPT模型结构资料来源AlecRadfordetalImprovingLanguageUnderstandingbyGenerativePre-Training德邦研究所GPT-1与BERT类似分为预训练和微调的两阶段模型属于半监督学习模型GPT-2在GPT的基础上进行改进通过模型扩容并学习更多数据实现了零样本学习Zero-shotLearningGPT-2将Transformer模型参数扩容堆叠的层数增加到48层从而可以保存更多的语言学知识可学习参数量达到了15B同时GTP-2使用了超过800万个互联网网页合计40GB的文本数据进行预训练这些数据覆盖主题广并对数据的质量也进行了筛选因此训练出的模型具有更好的通用性基于对大量优质样本学习GPT-2可直接通过无监督的方式去完成下游任务不需要下游任务的任何标注信息因此基本实现了训练一个模型可在多个任务中使用GPT-3结构在GPT-2之上继续进行改进一是使用了更大的数据量并扩大了模型GPT-3数据量达到45TB约为GPT-2的1000倍可学习参数达到175B约为GPT-2的100倍二是GPT-3不再追求零样本学习而是通过小样本学习Few-shotLearning获得更好的训练效果后续对下游任务开放微调以获得更出色的表现不同于传统基于下游任务的微调模式GPT-3将例子直接作为模型输入给GPT读过这些例句它自动知道怎么解接下来的问题2021年12月14日GPT-3对下游用户开放了微调微调后的GPT-3准确性大幅提高例如在解小学数学问题时准确性提高2到4倍图13GPT-3将例子直接作为模型输入图14FewShot较ZeroShot在模型增大后表现提升更显著资料来源TomBBrownetalLanguageModelsareFew-ShotLearners资料来源TomBBrownetalLanguageModelsareFew-ShotLearners德邦研究所德邦研究所1020请务必阅读正文之后的信息披露和法律声明行业专题传媒231ChatGPT趋近人类价值观及意图有望进一步商业化ChatGPT是OpenAI使用RLHFReinforcementLearningfromHumanFeedback训练出的模型是从GPT-35系列中的模型进行微调的RLHF基于人类的反馈调整模型一定程度上解决了AIAlignment人工智能对齐的问题即要求AI系统的目标和人类的价值观与意图保持一致图15GPT-35的进化树图16RLHF工作原理资料来源PaulChristianoetalDeepReinforcementLearningfromHuman资料来源符尧拆解追溯GPT-35各项能力的起源德邦研究所Preferences德邦研究所参考李宏毅教授给出的解读ChatGPT的模型学习方法与InstructGPT类似分为四个阶段第一阶段学习文字接龙例如输入你好通过GPT后输出美GPT每一次的输出可能都是不同的因为在网络上的语句中你好后面有多种接法例如你好高你好吗而输出结果是遵循概率分布的高频组合出现的概率较高第二阶段由人类老师引导文字接龙的方向即找人来思考想问GPT的问题并人工提供正确答案不需要穷尽所有问题只需要告诉GPT人类的偏好第三阶段生成奖励模型RewardModel来模仿人类老师的喜好例如输入台湾最高的山是哪座进入GPT输出可能有两个结果输出一是玉山输出二是谁来告诉我呀两个回答都可以与问题衔接但是人类的偏好是输出一因此RewardModel给两个输出排序时输出一是高于输出二第四阶段使用奖励模型作为奖励函数近端策略优化PPO算法微调策略通过调整参数获得最大的奖励图17ChatGPT的训练模式资料来源OpenAI德邦研究所1120请务必阅读正文之后的信息披露和法律声明行业专题传媒ChatGPT的应用包括但不限于问题解答包括解释代码块的作用求解数学方程式写作文本调试和修复包括更正代码错误语际翻译总结文本并检测文本中的关键词分类提出建议等图18ChatGPT能够进行对话甚至能完成撰写代码资料来源量子位德邦研究所ChatGPT月度用户已破亿正在逐步探索商业化途径根据UBS统计数据显示ChatGPT上线2个月后月度用户数量破1亿根据SimilarWeb数据截至1月30日过去28天内日独立访客数已接近1300万2023年2月1日OpenAI推出付费订阅项目ChatGPTPlus价格为20月目前面向美国用户付费服务包括在高峰时段也可常规访问ChatGPT更快的响应以及优先访问新功能和改进与此同时ChatGPT将继续提供免费访问此外OpenAI还将很快推出ChatGPTAPI积极探索低成本计划商业计划和数据包的选项以提高产品的可用性图19ChatGPT上线2个月后月度用户数量破1亿图20OpenAI推出付费订阅项目ChatGPTPlus价格20月资料来源yahoofinanceUBS德邦研究所资料来源OpenAI德邦研究所3基于大模型的主流生成模型赋予了AI创造力AIGC的快速发展归功于生成算法领域的技术积累其中包含了生成对抗网络GAN变微分自动编码器VAE标准化流模型NFs自回归模型AR能量模型和扩散模型DiffusionModel等1220请务必阅读正文之后的信息披露和法律声明行业专题传媒图21不同生成模型之间的区别资料来源LilianWengWhatareDiffusionModels德邦研究所31GAN是基于生成与对抗提出的生成模型2014年IanJGoodfellow提出了GAN是一种深度神经网络架构其核心思想是生成与对抗GAN网络结构包含两个模型一个是生成模型GeneratorG另一个是判别模型DiscriminatorD生成模型通过输入的数据生成图像判别模型工作主要是负责判断生成模型所生成的图像是人工绘制还是AI生成以画人像为例第一代G1不知道如何画因此生成的图像模糊第一代D1学习到判断的方法是图片是否有眼睛第二代G2会生成眼睛以骗过D1第二代D2又学习到可以用是否有嘴巴来判别由此第三代G3会生成嘴巴以此类推直到最后当判别模型分辨不出生成结果是否真实的时候判别概率为05模型达到纳什平衡点即为最理想的状态图22GAN的基本思想图23训练后的GAN生成案例资料来源IanJGoodfellowetalGenerativeAdversarialNets德邦研究资料来源李宏毅Generation德邦研究所所GAN是生成模型的一大突破相比传统的深度神经网络能产生更好的生成样本但是仍需解决应用中的问题一是解决训练不稳定问题GAN模型的相互博弈过程容易造成训练不稳定使得训练难以收敛二是缓解GAN的模式坍塌modelcollapse即生成样本大量重复相似它会造成训练结果冗余生成图像质量差样本单一等问题32扩散模型更接近人的思维模式实现了跨模态应用扩散模型DiffusionModel最早是2015年由JaschaSohl-Dickstein等人提出的2020年JonathanHo等人发表了DenoisingDiffusionProbabilistic1320请务必阅读正文之后的信息披露和法律声明行业专题传媒Models之后引发众多关注与GAN等模型最大区别在于扩散模型是基于马尔科夫链通过学习噪声来生成数据扩散模型通过正向扩散过程进行学习并通过逆扩散过程实现生成扩散过程中正向扩散过程是从真实图像X0不断学习噪声变换成纯高斯噪声的图片XT即一个马尔科夫链模型需要通过逆扩散过程进行生成XT通过沿着马尔科夫链向后遍历可以重新生成新的数据X0图24DiffusionModel基于马尔科夫链通过学习噪声来生成数据资料来源AssemblyAIJonathanHoetalDenoisingDiffusionProbabilisticModels德邦研究所扩散模型的生成逻辑相比其他的模型更接近人的思维模式本质上扩散模型的工作原理是通过连续添加高斯噪声来破坏训练数据然后通过反转这个噪声过程来学习恢复数据训练后可以通过简单地将随机采样的噪声传递给学习的去噪过程来生成数据相比于其他模型扩散模型的优势在于生成的图像质量更高且无需通过对抗性训练这使得其训练的效率有所提升同时扩散模型还具有可扩展性和并行性321扩散模型实现了从文本到图像的跨模态应用基于扩散模型的示例架构包括OpenAI的GLIDE和DALLE2谷歌的ImagenStabilityAI的StableDiffusion等GLIDEGuidedLanguagetoImageDiffusionforGenerationandEditing是OpenAI推出的文本引导图像生成模型GLIDE的训练步骤为首先使用文本条件扩散模型作为基本模型进行预训练利用到了Transformer对文本进行编码使得文本可以对图像进行引导然后再对模型进行微调实现无分类器引导保留文本引导图像生成的同时也可执行无条件图像生成GLIDE还支持通过文本作为提示prompt对图像进行修复例如将人像中的头发抹去提示中输入红发男子GLIDE会对人像的头发进行修复图25GLIDE可以进行文本到图像的生成图26GLIDE可以执行图像修复1420请务必阅读正文之后的信息披露和法律声明行业专题传媒资料来源AlexNicholetalGLIDETowardsPhotorealisticImageGeneration资料来源AlexNicholetalGLIDETowardsPhotorealisticImageGenerationandEditingwithText-GuidedDiffusionModels德邦研究所andEditingwithText-GuidedDiffusionModels德邦研究所DALLE2是OpenAI于2022年4月发布的系统DALLE2系统背后的模型称为unCLIP使用CLIP作为图文预训练模型获得文本描述和图像的嵌入再通过扩散模型的思路构建生成过程CLIP是OpenAI发布的一个多模态模型基于大量图像和文本对上训练可用于查找最能代表图像的文本片段或查找给定文本查询的最合适图像DALLE2生成的图像分辨率较DALLE和GLIDE提高了4倍图27unCLIP模型示意图图28DALLE2的生成案例资料来源AdityaRameshetalHierarchicalText-ConditionalImage资料来源AdityaRameshetalHierarchicalText-ConditionalImageGenerationwithCLIPLatents德邦研究所GenerationwithCLIPLatents德邦研究所谷歌于2022年6月发布的Imagen利用了大型Transformer语言模型在理解文本方面的能力以及扩散模型在高保真图像生成方面的能力Imagen的工作模式为在用户输入文本要求后条件扩散模型将文本嵌入映射6464的图像中Imagen进一步利用文本条件超分辨率扩散模型对6464的图像进行升采样为256256再从256256升到10241024图29Image的架构示意图图30Image的生成案例资料来源ChitwanSahariaetalPhotorealisticText-to-ImageDiffusion资料来源ChitwanSahariaetalPhotorealisticText-to-ImageDiffusionModelswithDeepLanguageUnderstanding德邦研究所ModelswithDeepLanguageUnderstanding德邦研究所StableDiffusion是StabilityAI发布的文本到图像模型目前已更新到20版本StableDiffusion的生成速度较快在几秒钟内便可创造出艺术作品20版本更新了文本转图片扩散模型Text-to-ImageDiffusionModels并加入了超分辨率扩散模型Super-resolutionUpscalerDiffusionModels可以生成分辨率为2048x2048甚至更高的图像同时引入了图像深度扩散模型Depth-to-ImageDiffusionModel扩展了图像到图像功能1520请务必阅读正文之后的信息披露和法律声明行业专题传媒图31StableDiffusion生成效果图32StableDiffusion20引入了图像深度扩散模型资料来源StabilityAI德邦研究所资料来源StabilityAI德邦研究所4人工智能由单模态智能向多种模态融合方向发展对人工智能而言要更为精准和综合的观察并认知现实世界就需要尽可能向人类的多模态能力靠拢将这种能力被称为多模态学习Multi-modalLearningMML建立统一的跨场景多任务的多模态基础模型或将成为人工智能发展的主流趋势之一Transformer架构的跨界应用成为跨模态学习的重要开端之一Transformer架构的核心是Self-Attention机制使其能够有效提取长序列特征将视觉的区域特征和文本特征序列相匹配CLIP模型的出现成为跨模态生成应用的一个重要节点图像编码器和文本编码器以对比方式进行联合训练能够链接文本和图片自CLIP出现后CLIP其他模型在跨模态生成领域成为一种较为通用的做法2022年微软提出的BEiT-3多模态基础模型在视觉-语言任务处理上具备出色表现包括视觉问答图片描述生成和跨模态检索等同时能够更加轻松地完成多模态编码和处理不同的下游任务语音视觉和多模态预训练模型将加速人工智能向通用基础模型方向演进在这个演进过程中深度学习与强化学习相互促进发展融合大量行业知识模型将具备在不断变化的环境中快速适应的灵活性基础模型不再局限于其传统用法有望在其他模态的应用中发挥出新的潜质例如通常用于游戏的强化学习PPOProximalPolicyOptimization也被应用到了NLP领域的ChatGPT中5AIGC技术不断发展有望带来更多商业化价值1月17日微软CEO纳德拉在世界经济论坛上表示微软正在迅速推进OpenAI的工具商业化计划将包括ChatGPTDALL-E等人工智能工具整合进微软旗下的所有产品中并将其作为平台供其他企业使用包括且不限于Bing搜索引擎MicrosoftOfficeAzure云服务Teams聊天程序等来自IT之家1月23日微软公司在官方博客宣布已与OpenAI扩大合作伙伴关系作为两家公司合作伙伴关系的第三阶段微软将向OpenAI进行一项为期多年价值数十亿美元的投资以加速其在人工智能AI领域的技术突破未来值得关注的技术要素包括长文本生成开放式文本生成NeRF模型扩散模型跨模态大型预训练模型支持的模态数据类型模态对齐架构设计支持的下游应用小样本学习及自监督算法强化学习及环境学习等1620请务必阅读正文之后的信息披露和法律声明行业专题传媒表2国外主要AIGC预训练模型一览表公司预训练模型应用参数量领域BERT语言理解与生成4810亿NLPLaMDA对话系统-NLP谷歌PaLM语言理解与生成推理代码生成5400亿NLPlmagen语言理解与图像生成110亿多模态Parti语言理解与图像生成200亿多模态Florence视觉识别64亿CV微软Turing-NLG语言理解生成170亿NLPOPT-175B语言模型1750亿NLPFacebookM2M-100100种语言互译150亿NLPGato多面手的智能体12亿多模态DeepMindGopher语言理解与生成2800亿NLPAlphaCode代码生成414亿NLPGPT3语言理解与生成推理等1750亿NLPCLIPDALL-E图像生成跨模态检索120亿多模态OpenAlCodex代码生成120亿NLPChatGPT语言理解与生成推理等-NLP英伟达Megatron-TurningNLG语言理解与生成推理5300亿NLPStabilityAIStableDiffusion语言理解与图像生成-多模态资料来源AIGC发展趋势报告2023德邦研究所根据量子位短期内有望较明显爆发的技术场景包括闲聊式文本生成个性化营销文本富情感及细节TTSTextToSpeech拼凑式视频生成基于文本的AI绘画语音复刻等图33AIGC相关技术场景及成熟度分类资料来源量子位德邦研究所1720请务必阅读正文之后的信息披露和法律声明行业专题传媒6投资建议把握AIGC技术催化和商业落地的投资机会技术发展有望促进生产效率提升并进一步创造新的消费和需求有利于文娱内容和互联网行业在AIGC和ChatGPT方面我们建议持续关注技术发展和应用情况把握技术催化和商业化落地带来的投资机会1具备AIGC和ChatGPT的技术探索和应用的公司百度集团-SW商汤-W万兴科技拓尔思等2具有海量内容素材且具有AIGC探索布局的图片文字音乐视频内容及平台公司腾讯控股阅文集团美图公司视觉中国中文在线汉仪股份昆仑万维天娱数科风语筑等表3部分公司在AIGC领域的布局截至202326港股公司总市值PEPS证券代码证券简称主要研究领域相关应用布局亿港元TTMTTM深度学习开源框架飞浆PaddlePaddle百度集团-9888HK389581528SW全栈AI基础设施百度AI大底座文心大模型NLPCV跨模态生物计算及各AI应用场景全覆盖的大模型种行业大模型AI基础设施SenseCore商汤AI大装置0020HK商汤-W1004-52192CV2D3D关键点捕捉3D关键点驱动肖像风-格化图像视频编辑虚拟穿戴数字人AI实验室覆盖CVNLP机器学习强化学-习等方面研究腾讯云TI平台一站式机器学习生态服务平台涵盖数据预处理模型训练评估预测全流程人工智能服务平台连接云边端设备算法和数据提供全栈式AI应用开发部署管理等功0700HK腾讯控股3601618459能AI平台服务腾讯智能对话平台开放腾讯核心智能对话系统技术提供人机交互应用开发最佳体验IP虚拟人提供IP角色授权与多模态交互方案打造能听会说的AI智能形象音视频字幕平台为企业和个人提供多语言音视频字幕转写翻译编辑与压制一站式服务联合微软亚洲互联网工程院开启AI赋能网络文0772HK阅文集团NLP40334741学1357HK美图公司CV美图秀秀上新AI绘画功能108-50950A股公司总市值PEPS证券代码证券简称主要研究领域相关应用布局亿元TTMTTM旗下首款AIGC产品万兴AI绘画将开启公测300624SZ万兴科技CV55180649Filmora万兴喵影PixsoTRS小思智能问答机器人语义智能技术平台智300229SZ拓尔思NLP147589139拓昆仑天工旗下模型包括天工巧绘SkyPaint300418SZ昆仑万维图像音乐文本编程等多模态内容生成能力天工乐府SkyMusic天工妙笔SkyText天工智码232263650SkyCode发售数轮AIGC数字藏品与百度旗下的AI作画平台文心一格达成战略合作协议赋能创作者和版权000681SZ视觉中国CV1181429178保护AIGC方式创造图片内容平台场景逻辑顺且仍在大力投入AI布局AI文字辅助创作功能已推出并在17k小说网面向所有作者开放AI辅助绘画功能已推出Al主300364SZ中文在线NLPCV等89-108671播实现低成本2高效优质的内容生产通过Al驱动复活3D模型虚拟数字人301270SZ汉仪股份字体生成AI造字39559171升级发布MetaSurfing-元享智能云平台在原002354SZ天娱数科多模态智能算法等92-834848有功能基础上纳入AIGC功能模块公司在虚拟展厅虚拟数字人虚拟场景以及数字艺术创作领域均有结合AI人工智能技术的探索与603466SH风语筑CV数字人等应用有效提升了数字创意三维设计与3D内容89147345创作的效率和独特性现阶段上述探索仍集中在AI生成艺术AI辅助内容创意与生产等领域资料来源各公司官网各公司公告Wind同花顺等德邦研究所注CVComputerVision计算机视觉1820请务必阅读正文之后的信息披露和法律声明行业专题传媒7风险提示技术发展不及预期监管政策变化知识产权相关问题等1920请务必阅读正文之后的信息披露和法律声明行业专题传媒信息披露分析师与研究助理简介马笑华中科技大学硕士2022年加入德邦证券传媒互联网海外首席分析师行业全覆盖5年多二级研究经验2年产业战略投资咨询经验曾任新时代证券TMT组长传媒计算机首席分析师此前担任过管理咨询顾问战略研究员投资经理等岗位2018年东方财富百佳分析师传媒团队第一名2020年wind金牌分析师分析师声明本人具有中国证券业协会授予的证券投资咨询执业资格以勤勉的职业态度独立客观地出具本报告本报告所采用的数据和信息均来自市场公开信息本人不保证该等信息的准确性或完整性分析逻辑基于作者的职业理解清晰准确地反映了作者的研究观点结论不受任何第三方的授意或影响特此声明投资评级说明1Table投资评级的比较和评级标准RatingDescription类别评级说明以报告发布后的6个月内的市场表买入相对强于市场表现20以上现为比较标准报告发布日后6个股票投资评增持相对强于市场表现520月内的公司股价或行业指数的级中性相对市场表现在-55之间波动涨跌幅相对同期市场基准指数的涨减持相对弱于市场表现5以下跌幅2市场基准指数的比较标准优于大市预期行业整体回报高于基准指数整体水平10以上A股市场以上证综指或深证成指为基行业投资评中性预期行业整体回报介于基准指数整体水平-10与10之间准香港市场以恒生指数为基准美级国市场以标普500或纳斯达克综合指弱于大市预期行业整体回报低于基准指数整体水平10以下数为基准法律声明本报告仅供德邦证券股份有限公司以下简称本公司的客户使用本公司不会因接收人收到本报告而视其为客户在任何情况下本报告中的信息或所表述的意见并不构成对任何人的投资建议在任何情况下本公司不对任何人因使用本报告中的任何内容所引致的任何损失负任何责任本报告所载的资料意见及推测仅反映本公司于发布本报告当日的判断本报告所指的证券或投资标的的价格价值及投资收入可能会波动在不同时期本公司可发出与本报告所载资料意见及推测不一致的报告市场有风险投资需谨慎本报告所载的信息材料及结论只提供特定客户作参考不构成投资建议也没有考虑到个别客户特殊的投资目标财务状况或需要客户应考虑本报告中的任何意见或建议是否符合其特定状况在法律许可的情况下德邦证券及其所属关联机构可能会持有报告中提到的公司所发行的证券并进行交易还可能为这些公司提供投资银行服务或其他服务本报告仅向特定客户传送未经德邦证券研究所书面授权本研究报告的任何部分均不得以任何方式制作任何形式的拷贝复印件或复制品或再次分发给任何其他人或以任何侵犯本公司版权的其他方式使用所有本报告中使用的商标服务标记及标记均为本公司的商标服务标记及标记如欲引用或转载本文内容务必联络德邦证券研究所并获得许可并需注明出处为德邦证券研究所且不得对本文进行有悖原意的引用和删改根据中国证监会核发的经营证券业务许可德邦证券股份有限公司的经营范围包括证券投资咨询业务2020请务必阅读正文之后的信息披露和法律声明
|
相关行业报告
|
||||||||||||||||||||||||||
