溯源GPT发展:2018年开启自然语言处理模型新一轮发展热潮
复盘2017-2022年出现的自然语言处理模型,我们认为,2017年出现的Transformer模型为GPT的出现奠定了基础。2018年由OpenAI提出的GPT-1开启了新一轮自然语言模型发展的热潮。2018年,出现的主要自然语言模型包括GPT-1、ELMo、ULMFiT和BERT等。其中,GPT-1模型的单向训练特点,使得其特别适合文本生成类型的任务。ELMo为双向训练模型,更善于解决NLP中的一词多义问题。ULMFiT是一种适用于NLP中的迁移学习模型,更适合文本分类任务。除OpenAI外,Facebook、微软和谷歌等也在同步推进AI的相关研究。 GPT-1:基于Transformer架构,在文本生成领域表现突出 架构上,GPT-1基于Transformer架构,但是仅保留了架构中的解码器(Decoder)部分。训练步骤上,分为两个阶段,1)无监督预训练:采用多层Transformer模型的解码器为语言模型,进行基于大文本语料库的高容量无监督学习;2)有监督微调:当下游的问题具有结构化特征,例如有序的句子对或文档、问题和答案的三元组,首先将其转换成特定的序列结构,再根据针对性的数据集进行微调训练。GPT-1在自然语言推理、问题回答、语义相似性和文本分类等方面,性能均优于绝大多数相似模型。 GPT-1 vs ELMO/ULMFiT:不同模型擅长不同的任务类型 我们对2018年出现的其他主要NLP模型进行拆解分析。架构上,EMLo不同于GPT-1的Transformer架构,采用了双向的LSTM语言模型,由一个前向和一个后向语言模型构成,ULMFiT则采用了3层LSTM架构。擅长任务上,GPT-1采用单向架构,仅使用单词的上文进行预测,因此模型计算速度更快,更适合文本生成类的任务。ELMo改进了传统的词嵌入方法,结合上下文对多义词在当前语境的含义做出判断,解决了NLP中的一词多义问题。ULMFiT是一种可以应用NLP中任何任务的迁移学习模型,专门用于文本分类任务。 OpenAI持续在人工智能训练领域发力 2018年6月,OpenAI发表论文《Improving Language Understanding byGenerative Pre-Training》,提出生成式预训练概念,标志着GPT-1的诞生。此外,OpenAI在人工智能训练领域持续保持研究,涉及机器学习、AI安全、物理机器人训练、游戏AI训练、图像生成等内容。例如,在游戏AI训练领域,搭建游戏强化学习研究平台—Gym Retro,组建神经网络战队OpenAIfive并打败人类选手;在训练物理机器人方面,使用与OpenAIFive相同的通用强化学习算法训练了自由度为24的类人机器手。 Facebook、微软和谷歌等巨头积极布局人工智能领域 Facebook、微软和谷歌等互联网巨头同样重视AI领域投入。2018年,Facebook AIResearch小组使用无监督机器翻译支持更多可翻译语言;升级Pytorch深度学习开源框架;部署了Rosetta的机器学习系统。微软搭建Microsoft AIPlatform人工智能平台;推出Project Brainwave,利用芯片级FPGA技术实现的人工智能推理引擎。谷歌推出用于NLP的BERT;推出谷歌助理Google Duplex;推动其开源机器学习框架TensorFlow,并支持更多人工智能应用;推出AutoML,自动构建和训练机器学习模型。 风险提示:宏观经济波动,下游需求不及预期。本报告内容均基于客观信息整理,不构成投资建议。 研究报告全文:证券研究报告计算机GPT产业复盘2018GPT问世华泰研究计算机增持维持2023年2月14日中国内地专题研究研究员谢春生溯源GPT发展2018年开启自然语言处理模型新一轮发展热潮SACNoS0570519080006xiechunshenghtsccomSFCNoBQZ938862129872036复盘2017-2022年出现的自然语言处理模型我们认为2017年出现的Transformer模型为GPT的出现奠定了基础2018年由OpenAI提出的联系人袁泽世PhDGPT-1开启了新一轮自然语言模型发展的热潮2018年出现的主要自然SACNoS0570122080053yuanzeshihtsccom语言模型包括GPT-1ELMoULMFiT和BERT等其中GPT-1模型的862128972228单向训练特点使得其特别适合文本生成类型的任务ELMo为双向训练模型更善于解决NLP中的一词多义问题ULMFiT是一种适用于NLP中的行业走势图迁移学习模型更适合文本分类任务除OpenAI外Facebook微软和谷歌等也在同步推进AI的相关研究计算机沪深3006GPT-1基于Transformer架构在文本生成领域表现突出3架构上GPT-1基于Transformer架构但是仅保留了架构中的解码器Decoder部分训练步骤上分为两个阶段1无监督预训练采用12多层Transformer模型的解码器为语言模型进行基于大文本语料库的高容21量无监督学习2有监督微调当下游的问题具有结构化特征例如有序30的句子对或文档问题和答案的三元组首先将其转换成特定的序列结构Feb-22Jun-22Oct-22Feb-23再根据针对性的数据集进行微调训练在自然语言推理问题回答GPT-1资料来源Wind华泰研究语义相似性和文本分类等方面性能均优于绝大多数相似模型GPT-1vsELMOULMFiT不同模型擅长不同的任务类型我们对2018年出现的其他主要NLP模型进行拆解分析架构上EMLo不同于GPT-1的Transformer架构采用了双向的LSTM语言模型由一个前向和一个后向语言模型构成ULMFiT则采用了3层LSTM架构擅长任务上GPT-1采用单向架构仅使用单词的上文进行预测因此模型计算速度更快更适合文本生成类的任务ELMo改进了传统的词嵌入方法结合上下文对多义词在当前语境的含义做出判断解决了NLP中的一词多义问题ULMFiT是一种可以应用NLP中任何任务的迁移学习模型专门用于文本分类任务OpenAI持续在人工智能训练领域发力2018年6月OpenAI发表论文ImprovingLanguageUnderstandingbyGenerativePre-Training提出生成式预训练概念标志着GPT-1的诞生此外OpenAI在人工智能训练领域持续保持研究涉及机器学习AI安全物理机器人训练游戏AI训练图像生成等内容例如在游戏AI训练领域搭建游戏强化学习研究平台GymRetro组建神经网络战队OpenAIfive并打败人类选手在训练物理机器人方面使用与OpenAIFive相同的通用强化学习算法训练了自由度为24的类人机器手Facebook微软和谷歌等巨头积极布局人工智能领域Facebook微软和谷歌等互联网巨头同样重视AI领域投入2018年FacebookAIResearch小组使用无监督机器翻译支持更多可翻译语言升级Pytorch深度学习开源框架部署了Rosetta的机器学习系统微软搭建MicrosoftAIPlatform人工智能平台推出ProjectBrainwave利用芯片级FPGA技术实现的人工智能推理引擎谷歌推出用于NLP的BERT推出谷歌助理GoogleDuplex推动其开源机器学习框架TensorFlow并支持更多人工智能应用推出AutoML自动构建和训练机器学习模型风险提示宏观经济波动下游需求不及预期本报告内容均基于客观信息整理不构成投资建议免责声明和披露以及分析师声明是报告的一部分请务必一起阅读1计算机正文目录GPT发展之2017Transformer架构为GPT奠定基础3TransformerGPT模型的基础3自注意力机制是Transformer的核心理念4GPT发展之2018GPT-1诞生开启NLP新发展热潮6GPT-1确定生成式预训练模型基本路线8GPT-1基于Transformer的预训练微调半监督模型8模型特点无监督训练有监督微调8论文结论在多个下游任务中取得优于整体的结果10GPT-2vsELMoULMFiT各类模型有各自擅长的领域12ELMo解决NLP中的一词多义问题12ULMFiT专用于文本分类任务13GPT-1vsTransformerELMoULMFiT14GPT-1vsTransformer14GPT-1vsELMovsULMFiT15风险提示15免责声明和披露以及分析师声明是报告的一部分请务必一起阅读2计算机GPT发展之2017Transformer架构为GPT奠定基础TransformerGPT模型的基础Transformer模型是GPT模型的基础2017年6月GoogleBrain在神经信息处理系统大会NeurIPS发表论文Attentionisallyouneed首次提出了基于自我注意力机制self-attention来提高训练速度的Transformer模型将其用于自然语言处理此前自然语言处理领域的主流模型是循环神经网络RNNrecurrentneuralnetworkRNN能更好地处理有先后顺序的数据但在处理较长序列时存在模型不稳定过早停止有效训练训练时间过长等问题而Transformer模型能够同时并行进行数据计算和模型训练训练时长更短且训练得出的模型具有可解释性Transformer是一种基于注意力机制的编码器-解码器Encoder-Decoder模型Transformer模型的核心思想是使用多头注意力机制实现不同位置之间的跨越关系计算Transformer模型可以完全并行化不需要递归或循环也不需要在训练过程中预测序列的长度因此可以大大加快训练速度Transformer模型中的编解码器各有6个相同的堆栈组成其中Encoder由两层组成一层是多头自我注意机制另一层为前馈网络Decoder除了自我注意机制和前馈网络外还插入了第三个子层实现对编码器堆栈输出的多头关注GoogleBrain团队使用了多种公开的语言数据集来训练Transformer模型共设置6500万个可调参数模型在翻译准确度英语成分句法分析等各项评分上达到了当时的业内最好水平成为当时最先进的大型语言模型LargeLanguageModelLLM常用于输入法和机器翻译图表1Transformer模型中的encoer-decoder架构图表2Transformer模型架构输出概率归一化指数函数输出线性化向量相加归一化编码器解码器前馈神经网络编码器解码器向量相加归一化向量相加归一化多头自注意力编码器解码器前馈神经网络编码器解码器向量相加归一化向量相加归一化编码器解码器带掩模的多头自注意力层多头自注意力编码器解码器位置编码输入位置编码输入向量输出向量资料来源Attentionisallyouneed华泰研究资料来源Attentionisallyouneed华泰研究Transformer模型解决了人工标注繁和训练速度慢的问题通常训练深度学习模型必须使用大规模人工标记的数据集合成本极高Transformer模型采用Mask机制通过遮挡已有句段中的部分内容训练AI进行填空不仅省去了人工标注成本而且可以利用互联网上大量的文章网页等信息作为训练资源此外Transformer模型的多头注意力机制能够实现并行计算在硬件资源足够多的情况下能够不断提高计算速度免责声明和披露以及分析师声明是报告的一部分请务必一起阅读3计算机图表3Transformer模型中的Mask机制图表4Transformer模型能够进行并行计算IIamIama串行计算Iamastudent问题世界上最深的海沟是马里亚纳海沟MASK并行计算II诗句天生我才必有用千金散尽还复来MASKamam文章TobeornottobethatisMASKaquestionaastudentstudent资料来源Freebuf华泰研究资料来源Freebuf华泰研究自注意力机制是Transformer的核心理念注意力机制帮助机器在学习过程中聚焦在重要信息上深度学习中的注意力机制从本质上讲和人类的选择性视觉注意力机制类似核心目标是从众多信息中选择出对当前任务目标更关键的信息忽略大多不重要的信息图表5人类的注意力机制深色代表注意力聚焦点资料来源CSDN华泰研究注意力模型可以用QueryKey和Value模型进行描述本质上Attention机制是对Source中元素的Value值进行加权求和而Query和Key用来计算对应Value的权重系数以大脑读图为例Value可以理解为人眼视网膜对整张图片信息的原始捕捉不受注意力所影响Key与Value相关联KeyValue数据对是图片原始信息所对应的关键性提示信息读者大脑有意识地向图片获取信息即发起了一次Query包含了读者的意图等信息在一次读图过程中Query与Key之间计算出每个Key对应Value的权重系数得到最具有吸引力的部分然后对Value进行加权求和即得到了最终的AttentionValue数值免责声明和披露以及分析师声明是报告的一部分请务必一起阅读4计算机图表6Attention机制的本质思想Key1Key2Key3Key4AttentionQueryValueValue1Value2Value3Value4Source资料来源CSDN华泰研究Attention机制的具体计算过程包含两个步骤1根据Query和Key计算权重系数2根据权重系数对Value进行加权求和其中过程一又可以细分为两个阶段第一个阶段根据Query和Key计算两者的相似性或者相关性第二个阶段对第一阶段的原始分值进行归一化处理图表7三阶段计算Attention过程Key1Key2Key3Key4阶QueryFQKFQKFQKFQK段1s1s2s3s4类SoftMax归一化阶段3a1a2a3a4阶段3AttentionValue1Value2Value3Value4Value资料来源CSDN华泰研究Transformer的自注意力机制是特殊情况下的注意力机制在一般任务的Encoder-Decoder框架中输入Source和输出Target内容是不一样的例如对于英-中机器翻译来说Source是英文句子Target是对应的翻译出的中文句子注意力机制发生在Target的元素Query和Source中的所有元素之间而自注意指的不是Target和Source之间的注意力机制而是Source内部元素之间或者Target内部元素之间发生的注意力机制也可以理解为TargetSource这种特殊情况下的注意力计算机制具体计算过程相同只是计算对象发生变化自注意力机制更容易捕获句子中长距离的相互依赖的特征且对于增加计算的并行性也有直接帮助作用免责声明和披露以及分析师声明是报告的一部分请务必一起阅读5计算机GPT发展之2018GPT-1诞生开启NLP新发展热潮2018年GPT-1诞生开启了新一轮NLP研究的热潮我们以GPT的不断迭代和发展为主线对2017-2022年出现过的主要自然语言处理NLP模型进行了梳理2018年出现的主要自然语言模型包括GPT-1ELMoULMFiT和BERTBERT相关论文于2019年更新故不在本报告讨论范围其中GPT-1模型的单向训练特点使得其特别适合文本生成类型的任务为ChatGPT的成功奠定基础ELMo为双向训练模型更善于解决NLP中的一词多义问题ULMFiT是一种适用于NLP中的迁移学习模型更适合文本分类任务图表82017-2022年主要自然语言模型梳理GPT-1GPT-2T-NLGGPT-3CodexLaMDAMT-NLGInstructGPT2018620192202022020520218202212022120223117亿15亿170亿1750亿120亿1370亿5300亿13亿PaLMchatGPTGopherTransformerELMoBERTXLMXLNetRoBERTaELECTRALongformer20224202211201762018220181020191201962019720203202042021125400亿20亿065亿094亿355亿665亿355亿355亿335亿2800亿AlphaCodeALBERTDistilBERTDeBERTaULMFiT20222201812019920191020206235亿066亿技术架构Transformer解码器Transformer编码器T5BARTBigBirdM2M10020191020191020207202010Transformer解码器编码器110亿39亿120亿150亿其他架构201720182019202020212022参数量资料来源各公司官网arxiv论文华泰研究OpenAI发布了GPT-1并持续在人工智能训练领域发力2018年6月论文ImprovingLanguageUnderstandingbyGenerativePre-Training发表标志着GPT-1的诞生此外2018年OpenAI还在机器学习AI安全物理机器人训练游戏AI训练图像生成等领域持续保持研究和投入不断精进训练模型图表9OpenAI在2018年的相关布局1月5月10月将其进行深度学习研究运行的发布了最大的人工智能训练中使提出迭代放大AI安全技术仍处Kubernetes节点扩展到2500个用的计算量分析报告2012年-于研究早期但未来可能是可扩建立系统通过让神经网络自动2018年计算量增长率30万倍展的AI安全方法识别单词所指的对象提高了实以上开发了基于预测的方法RND体消歧数据集的性能发布完整版游戏强化学习研究平用于鼓励强化学习代理通过好奇台GymRetro心探索环境并在游戏蒙特祖2月6月马复仇记中超过人类平均表现通过教学进行可解释的机器学习鼓励人工智能通过对人类有意义论文ImprovingLanguage的例子相互学习UnderstandingbyGenerative11月预测恶意行为者如何滥用人工智Pre-Training发表标志着开发了基于能量的模型可以快GPT-1的诞生能技术并指出如何预防和减轻速学习识别和生成概念的实例威胁由五个神经网络组成的战队发布了在深度强化学习教育资openAI迎来新的捐赠者马斯克OpenAIfive在Dota2游戏中击源SpinningUp离开董事会败业余人类团队发布训练环境CoinRun来量化发布个模拟机器人环境和一个87月强化学习算法的泛化能力基线实现用来训练物理机器人发布可逆生成模型Glow扩展的工作模型了之前的可逆生成模型工作并3月简化了体系结构模型可以生成逼真的高分辨率图像支持高效12月发布可扩展的元学习算法采样并可用于操作数据的属性提出梯度噪声尺度以预测神经网Reptile是最短下降算法在元学特征络训练在广泛任务上的并行性习设置中的应用训练了一只有24个自由度的类人4月机器手能够灵巧的操纵物体训练系统名为Dactyl使用与进化策略梯度2018418OpenAIFive相同的通用强化学EPG实现对新任务的快速习算法和代码训练资料来源OpenAI官网华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读6计算机2018年Facebook微软和谷歌也持续推进AI相关研究与应用1FacebookFacebookAIResearch小组使用无监督机器翻译通过减少对标记训练数据的依赖支持更多可翻译语言升级了Pytorch深度学习开源框架并开发了新手支持接口发布开源的社区驱动的框架Glow支持机器学习的硬件加速部署了Rosetta的机器学习系统每天从超过十亿个公共图像和视频帧中提取文本并使用文本识别模型一起理解文本和图像的上下文2微软搭建MicrosoftAIPlatform人工智能平台帮助开发人员更容易地构建和部署人工智能应用程序推出ProjectBrainwave利用芯片级FPGA技术实现的人工智能推理引擎专为深度学习而设计发布帮助残疾人士改善生活的人工智能计划AIforAccessibility积极投入人工智能在医疗保健领域的发展3谷歌推出BERTBidirectionalEncoderRepresentationsfromTransformers自然语言处理模型在多种自然语言处理任务中取得了先进性能推出GoogleDuplex让谷歌助理模拟人类语音对话继续推动其开源机器学习框架TensorFlow并支持更多人工智能应用推出AutoML自动构建和训练机器学习模型积极投入人工智能在医疗保健领域的发展通过AIforSocialGood计划推动人工智能在社会公益领域的应用免责声明和披露以及分析师声明是报告的一部分请务必一起阅读7计算机GPT-1确定生成式预训练模型基本路线GPT-1基于Transformer的预训练微调半监督模型GPT-1是预训练微调相结合的语言理解任务半监督模型GPT全称生成式预训练GenerativePre-trainingGPT于2018年6月由OpenAI在论文ImprovingLanguageUnderstandingbyGenerativePre-Training中提出从架构上看GPT-1基于Transformer架构但是仅保留了架构中的解码器Decoder部分图表10GPT-1的架构Transformer架构GPT-1架构文本预测文本分类TextTaskPredictionClassifierLayerNorm归一化层FeedForward前馈神经网络12LayerNorm归一化层带掩模MaskedMulti自注意力层SelfAttentionTextPositionEmbed文本位置向量矩阵资料来源ImprovingLanguageUnderstandingbyGenerativePre-Training华泰研究模型特点无监督训练有监督微调GPT-1的训练过程分为无监督训练和有监督微调GPT-1的训练过程分为两个阶段第一阶段为非监督预训练阶段即在大型文本语料库上学习高容量语言模型第二阶段为监督微调阶段即在第一阶段训练的基础上将参数调整为受监督的目标任务进行进一步优化1第一阶段采用多层Transformer模型的解码器Decoder为语言模型进行基于大文本语料库的高容量无监督学习2第二阶段在微调时若输入的问题具有结构化特征例如有序的句子对或文档问题和答案的三元组则需要首先将问题转化成特定的序列模块再进行训练例如对于文本蕴涵任务将前提和假设序列相连接并在中间插入分隔符对于相似性任务则将两个需要比较的句子按照不同顺序排列分别进行处理后再做比较对于更复杂的问题回答和常识推理任务则需要将文本问题和可能的答案分别连接成不同序列并对所有序列做独立的模型处理将结果归一化得到可能答案的输出分布免责声明和披露以及分析师声明是报告的一部分请务必一起阅读8计算机图表11GPT-1架构以及用于微调不同任务的输入转换模块ClassificationStartTextExtractTransformerLinear分类任务EntailmentStartPremiseDelimHypothesisExtractTransformerLinear推理任务StartText1DelimText2ExtractTransformerSimilarityLinear相似性任务StartText2DelimText1ExtractTransformerStartContextDelimAnswer1ExtractTransformerLinearMultipleChoiceStartContextDelimAnswer2ExtractTransformerLinear问答任务StartContextDelimAnswerNExtractTransformerLinear资料来源ImprovingLanguageUnderstandingbyGenerativePre-Training华泰研究无监督训练采用大数据集有监督微调采用针对任务的数据集在无监督训练阶段采用了12层解码器Decoder堆叠的Transformer模型共包含12个掩蔽自注意力头maskedself-attentionhead训练数据集方面采用BooksCorpus数据集该数据集包括7000多本来自风格不同的未出版书籍内含长段的连续文本也可使用备选数据集1BWordBenchmark在无监督训练阶段提高解码器的层数能够有效提高训练效果在有监督微调阶段可根据不同任务类型选择不同的数据集图表12GPT-1在有监督微调阶段使用的部分数据集任务数据集自然语言推理SNLIMultiNLIQuestionNLIRTESciTail问题解答RACEStoryCloze句子相似性MSRParaphraseCorpusQuoraQuestionPairsSTSBenchmark分类StanfordSentimentTreebank-2CoLA资料来源ImprovingLanguageUnderstandingbyGenerativePre-Training华泰研究图表13提高解码器的层数能够有效提高无监督训练阶段的训练效果资料来源ImprovingLanguageUnderstandingbyGenerativePre-Training华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读9计算机论文结论在多个下游任务中取得优于整体的结果在有监督微调阶段GPT-1在多个下游应用数据集的训练中均取得优于整体的结果在自然语言推理问题回答语义相似性和文本分类方面共测试了12个数据集GPT-1在其中的9个取得了领先于现有方法的结果此外无论训练数据是如STS-B57k训练示例的小数据集还是如SNLI550k训练实例的大数据集GPT-1均能发挥较好的性能GPT-1在自然语言推理上的性能领先于同时期其他方法1自然语言推理也称为识别文本蕴涵包括阅读一对句子并从蕴涵矛盾或中性之一判断它们之间的关系五个不同来源的数据集上进行评估包括图像字幕SNLI转录演讲通俗小说和政府报告MNLI维基百科文章QNLI科学考试SciTail或新闻文章RTE我们的方法在五个数据集中的四个数据集上显著优于基线与之前的最佳结果相比MNLISciTailQNLI和SNLI的绝对改进分别高达15558和06模型能够更好地推理多个句子并处理语言歧义方面的问题图表14自然语言推理任务实验结果对比方法MNLI-mMNLI-mmSNLISciTailQNLIRTEESIMELMo5x--893---CAFE5x802790893---StochasticAnswerNetwork3x806801----CAFE787779885833GenSen714713--823592Multi-taskBiLSTMAttn722721--823617GPT-1821814899883881560注表中数值为精度值越高代表效果越好资料来源ImprovingLanguageUnderstandingbyGenerativePre-Training华泰研究GPT-1在问题解答和常识推理上具有有效处理长距离上下文的能力GPT-1在训练问题解答时使用了RACE数据集和StoryCloze测试RACE数据集由英语段落和中高考中的相关问题组成与CNN或SQuaD数据集相比该数据集包含更多推理类型问题能够很好的训练模型处理长距离上下文的能力StoryClozeTest故事完形测试涉及从两个选项中选择多句故事的正确结尾训练结果表明GPT-1在RACE数据集和StoryCloze测试上均分别超过对比方法最高分的57和89证明了GPT-1能有效处理长距离上下文图表15问题回答和常识推理任务实验结果对比方法StoryClozeRACE-mRACE-hRACEval-LS-skip765---HiddenCoherenceModel776---DynamicFusionNet9x-556494512BiAttentionMRU9x-602504533GPT-1865629574590注表中数值为精度值越高代表效果越好资料来源ImprovingLanguageUnderstandingbyGenerativePre-Training华泰研究GPT-1在处理语义相似性问题时表现突出语义相似性或意译检测任务指的是预测两个句子在语义上是否相等其难点在于识别概念改写理解否定和处理句法歧义等GPT-1在训练该能力时使用的数据集包括MicrosoftParaphrase语料库MRPC从新闻来源收集Quora问题对QQP数据集和语义文本相似性基准STS-B训练结果表明GPT-1在处理语义相似性问题性能优异尤其是在STS-B和QQP数据集上表现突出QQP相关的性能比单任务BiLSTMELMoAttn绝对提高absoluteimprovement了42免责声明和披露以及分析师声明是报告的一部分请务必一起阅读10计算机图表16语义相似性任务实验结果对比方法MRPCSTSBpcQQPSparsebytemLSTM---TF-KLD860--ECNUmixedensemble-810-Single-taskBiLSTMELMoAttn802555661Multi-taskBiLSTMELMoAttn835728633GPT-1823820703注pc表示皮尔逊相关性资料来源ImprovingLanguageUnderstandingbyGenerativePre-Training华泰研究GPT-1在处理文本分类任务时同样具有较为先进的性能GPT-1在训练文本分类任务时选取语言可接受性语料库CoLA斯坦福情绪树库SST-2和通用语言理解评估GLUE基准CoLA能够评估句子是否符合语法并且能够测试被训模型的固有语言偏见情况SST-2则是一项标准的二进制分类任务GLUE基准是用于培训评估和分析自然语言理解系统的资源集合训练结果表明GPT-1在CoLA上的得分远高于现有方法在GLUE上的结果超过现有方法在SST-2上的精度也达到了领先的水平图表17文本分类任务实验结果对比方法CoLAmcSST-2accGLUESparsebytemLSTM-932-TF-KLD---ECNUmixedensemble---Single-taskBiLSTMELMoAttn350902648Multi-taskBiLSTMELMoAttn189916689GPT-1454913728注pc表示皮尔逊相关性资料来源ImprovingLanguageUnderstandingbyGenerativePre-Training华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读11计算机GPT-2vsELMoULMFiT各类模型有各自擅长的领域ELMo解决NLP中的一词多义问题ELMo是一种预训练语言模型解决了NLP中的一词多义问题ELMo全称EmbeddingsfromLanguageModels于2018年由Peters等人在论文Deepcontextualizedwordrepresentations中提出ELMo提出的动机是为了解决一词多义的问题传统的词嵌入wordembedding方法如word2vec在训练完成后每个单词的表示的意思会被固定下来这就导致一词多义的单词会在不同的语境中被误读而ELMo可以动态的更新wordembedding并结合上下文语境即做出正确选择图表18ELMo可以用于解决一词多义问题传统词嵌入ELMo句子1JobswastheCEOofApple苹果吃的苹果公司句子2HefinallyatetheApple苹果吃的苹果吃的资料来源DeepContextualizedWordRepresentations华泰研究ELMo是双向的LSTM语言模型ELMo使用的是双向LSTMLongshort-termmemory是一种特殊的循环神经网络语言模型由一个前向和一个后向语言模型构成ELMO的本质思想是事先用语言模型在一个大的语料库上学习词的wordembedding此时多义词仍无法区分随后利用训练数据的上下文信息来获得适合当前语境的wordembedding再将ELMo当成特征拼接到具体的有监督NLP模型的词向量输入或最高层上图表19ELMo模型结构资料来源CSDN华泰研究ELMo能够在多个NLP任务上提高输出结果NLP任务包括问题解答SQuAD文本蕴涵SNLI语义角色标签SRL共指消解Coref命名实体提取NER情绪分析SST-5首先根据每个任务搭建模型的baseline然后在每个任务中加入ELMo模型得到的新结果比原结果均有提高并且最后的结果都超过了之前的最好结果SOTA免责声明和披露以及分析师声明是报告的一部分请务必一起阅读12计算机图表20ELMo能够在多个NLP任务上提高输出结果任务之前最好的结果SOTABaseline基线ELMobaseline提高绝对值相对值SQuADLiuetal201784481185847249SNLIChenetal20178868808870170758SRLHeetal201781781484632172CorefLeeetal20176726727043298NERPetersetal201791930199015922201020621SST-5McCannetal2017537514547053368资料来源DeepContextualizedWordRepresentations华泰研究ULMFiT专用于文本分类任务ULMFiT是一种预训练语言模型专门用于文本分类任务ULMFiT全称UniversalLanguageModelFine-tuning通用语言模型微调于2018年由Howard在论文UniversalLanguageModelFine-tuningforTextClassification中提出ULMFiT是一种可以应用NLP中任何任务的迁移学习模型采用3层LSTM架构ULMFiT在大型通用域语料库中预先训练语言模型并在目标任务上对其进行微调其特点在于1适用于不同文档大小数量和标签类型的任务2使用单一的架构和训练过程3不需要定制特征工程或预处理4不需要额外的域内文档或标签ULMFiT包含通用域LM预训练目标任务LM微调和目标任务分类器微调1通用域LM预训练在通用领域语料库上训练LM以捕获不同层中语言的一般特征ULMFiT使用包括28595篇预处理的维基百科文章和103亿个单词进行模型预处理只需预处理一次即可满足下游模型的性能和收敛性2目标任务LM微调使用区分微调Discr和倾斜三角学习率STLR对目标任务数据进行微调以学习任务特定特征在实际使用中即使用于预训练的通用域数据足够多样化也可能存在无法覆盖目标任务数据的情况因此需要根据目标任务的数据微调LM在预训练的基础上目标任务LM微调能够较快收敛在微调过程中ULMFiT在每一层使用了不同的学习率learningrate3目标任务分类器微调分类器使用逐步解冻gradualunfreezingDiscr和STRR对目标任务进行微调保留低级表示并调整高级表示Discr和STRR与第二步目标任务LM微调中使用的方法相同为了避免微调时幅度过大ULMFiT提出了逐步解冻的理念即从最后一层开始逐步解冻模型然后微调未冻结层以此类推直到微调所有层或最后一次迭代时收敛图表21ULMFiT使用的三个阶段1语言模型预训练2语言模型微调2分类器微调资料来源UniversalLanguageModelFine-tuningforTextClassification华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读13计算机ULMFiT在问题情感和主题等多个数据集上错误率与可比算法相比更低训练使用的文本分类数据集共有6个分为问题情感和主题三个种类在每个数据集下均选取了具有代表性的模型进行训练并错误率结果进行对比结果发现ULMFiT模型在6个代表性文本分类数据集中均达到了最好效果并在大多数数据集上减少了18-24的误差图表22文本分类使用的数据集情况数据集类型类别数训练示例数TREC-6问题Question655kIMDb情感Sentiment225kYelp-bi情感Sentiment2560kYelp-full情感Sentiment5650kAG主题Topic4120kDBpedia主题Topic14560k资料来源UniversalLanguageModelFine-tuningforTextClassification华泰研究图表23文本分类数据集的测试错误率情况数值为错误率数据集模型IMDbTREC-6AGDBpediaYelp-biYelp-fullCoVe8242----oh-LSTM59-----Virtual59-----TBCNN-40----LSTM-CNN-39----Char-levelCNN--9511554883795CNN--6570842903239DPCNN--6870882643058ULMFiT46365010802162998资料来源UniversalLanguageModelFine-tuningforTextClassification华泰研究GPT-1vsTransformerELMoULMFiTGPT-1vsTransformer我们从架构训练过程和训练参数量上对GPT-1和Transformer模型进行对比1架构上GPT-1源于Transformer但在架构上舍弃了编码器EncoderGPT-1基于Transformer并在其基础上进行了简化只保留了解码器Decoder由于GPT仅使用单词的上文预测单词单向从而使模型更简单计算速度更快更适合处理自然语言生成任务NLG为日后ChatGPT实时聊天即时反馈的功能做好了铺垫2训练过程上GPT-1对预训练数据进行了有监督的微调GPT-1的预训练模型是在连续的文本序列进行的因此在实际应用中如果输入内容为结构化问题如有序的句子对或文档问题和答案的三元组则需要根据输入的不同内容进行微调例如对于文本蕴涵任务需要任务微调为前提和假设序列相连并在中间插入分隔符令牌的形式3参数量上Transformer模型的参数量通常比GPT-1多GPT-1在训练过程中其参数量达到了117亿Transformer模型的参数量取决于模型的结构任务和数据集大小但通常其训练参数量比GPT-1更多免责声明和披露以及分析师声明是报告的一部分请务必一起阅读14计算机GPT-1vsELMovsULMFiTGPT-1EMLo和ULMFiT均是在2018年提出的自然语言处理中常见的预训练模型但其在架构擅长的任务等方面均有不同1架构上GPT-1采用的是单向Transformer架构且仅保留了编码器EMLo采用的是双向的LSTM语言模型由一个前向和一个后向语言模型构成ULMFiT则采用了3层LSTM架构其中Transformer提取特征的能力强于LSTM若采用双向的Transformer作为提取器或能进一步提高EMLo模型的性能2擅长的任务上GPT-1采用单向的架构仅使用单词的上文进行预测因此模型计算速度更快更适合文本生成类的任务ELMo改进了传统的词嵌入wordembedding方法采用动态更新的方式结合上下文对多义词在当前语境的含义做出判断解决了NLP中的一词多义问题ULMFiT是一种可以应用NLP中任何任务的迁移学习模型专门用于文本分类任务3使用方法上GPT-1和ULMFiT通常可以独立使用而ELMo作为一种wordembedding方法常被当成特征拼接到具体的有监督NLP模型的词向量输入或最高层上以提高和改善现有NLP模型的输出结果图表24提及公司列表公司代码公司简称MSFTUS微软GOOGLUS谷歌METAUSMetaFacebook未上市OpenAI资料来源Bloomberg华泰研究风险提示宏观经济波动若宏观经济波动产业变革及新技术的落地节奏或将受到影响宏观经济波动还可能对IT投资产生负面影响从而导致整体行业增长不及预期下游需求不及预期若下游数字化需求不及预期相关的数字化投入增长或慢于预期致使行业增长不及预期本报告内容均基于客观信息整理不构成投资建议免责声明和披露以及分析师声明是报告的一部分请务必一起阅读15计算机免责声明分析师声明本人谢春生兹证明本报告所表达的观点准确地反映了分析师对标的证券或发行人的个人意见彼以往现在或未来并无就其研究报告所提供的具体建议或所表迖的意见直接或间接收取任何报酬一般声明及披露本报告由华泰证券股份有限公司已具备中国证监会批准的证券投资咨询业务资格以下简称本公司制作本报告所载资料是仅供接收人的严格保密资料本报告仅供本公司及其客户和其关联机构使用本公司不因接收人收到本报告而视其为客户本报告基于本公司认为可靠的已公开的信息编制但本公司及其关联机构以下统称为华泰对该等信息的准确性及完整性不作任何保证本报告所载的意见评估及预测仅反映报告发布当日的观点和判断在不同时期华泰可能会发出与本报告所载意见评估及预测不一致的研究报告同时本报告所指的证券或投资标的的价格价值及投资收入可能会波动以往表现并不能指引未来未来回报并不能得到保证并存在损失本金的可能华泰不保证本报告所含信息保持在最新状态华泰对本报告所含信息可在不发出通知的情形下做出修改投资者应当自行关注相应的更新或修改本公司不是FINRA的注册会员其研究分析师亦没有注册为FINRA的研究分析师不具有FINRA分析师的注册资格华泰力求报告内容客观公正但本报告所载的观点结论和建议仅供参考不构成购买或出售所述证券的要约或招揽该等观点建议并未考虑到个别投资者的具体投资目的财务状况以及特定需求在任何时候均不构成对客户私人投资建议投资者应当充分考虑自身特定状况并完整理解和使用本报告内容不应视本报告为做出投资决策的唯一因素对依据或者使用本报告所造成的一切后果华泰及作者均不承担任何法律责任任何形式的分享证券投资收益或者分担证券投资损失的书面或口头承诺均为无效除非另行说明本报告中所引用的关于业绩的数据代表过往表现过往的业绩表现不应作为日后回报的预示华泰不承诺也不保证任何预示的回报会得以实现分析中所做的预测可能是基于相应的假设任何假设的变化可能会显著影响所预测的回报华泰及作者在自身所知情的范围内与本报告所指的证券或投资标的不存在法律禁止的利害关系在法律许可的情况下华泰可能会持有报告中提到的公司所发行的证券头寸并进行交易为该公司提供投资银行财务顾问或者金融产品等相关服务或向该公司招揽业务华泰的销售人员交易人员或其他专业人士可能会依据不同假设和标准采用不同的分析方法而口头或书面发表与本报告意见及建议不一致的市场评论和或交易观点华泰没有将此意见及建议向报告所有接收者进行更新的义务华泰的资产管理部门自营部门以及其他投资业务部门可能独立做出与本报告中的意见或建议不一致的投资决策投资者应当考虑到华泰及或其相关人员可能存在影响本报告观点客观性的潜在利益冲突投资者请勿将本报告视为投资或其他决定的唯一信赖依据有关该方面的具体披露请参照本报告尾部本报告并非意图发送发布给在当地法律或监管规则下不允许向其发送发布的机构或人员也并非意图发送发布给因可得到使用本报告的行为而使华泰违反或受制于当地法律或监管规则的机构或人员本报告版权仅为本公司所有未经本公司书面许可任何机构或个人不得以翻版复制发表引用或再次分发他人无论整份或部分等任何形式侵犯本公司版权如征得本公司同意进行引用刊发的需在允许的范围内使用并需在使用前获取独立的法律意见以确定该引用刊发符合当地适用法规的要求同时注明出处为华泰证券研究所且不得对本报告进行任何有悖原意的引用删节和修改本公司保留追究相关责任的权利所有本报告中使用的商标服务标记及标记均为本公司的商标服务标记及标记中国香港本报告由华泰证券股份有限公司制作在香港由华泰金融控股香港有限公司向符合证券及期货条例及其附属法律规定的机构投资者和专业投资者的客户进行分发华泰金融控股香港有限公司受香港证券及期货事务监察委员会监管是华泰国际金融控股有限公司的全资子公司后者为华泰证券股份有限公司的全资子公司在香港获得本报告的人员若有任何有关本报告的问题请与华泰金融控股香港有限公司联系免责声明和披露以及分析师声明是报告的一部分请务必一起阅读16计算机香港-重要监管披露华泰金融控股香港有限公司的雇员或其关联人士没有担任本报告中提及的公司或发行人的高级人员有关重要的披露信息请参华泰金融控股香港有限公司的网页httpswwwhtsccomhkstockdisclosure其他信息请参见下方美国-重要监管披露美国在美国本报告由华泰证券美国有限公司向符合美国监管规定的机构投资者进行发表与分发华泰证券美国有限公司是美国注册经纪商和美国金融业监管局FINRA的注册会员对于其在美国分发的研究报告华泰证券美国有限公司根据1934年证券交易法修订版第15a-6条规定以及美国证券交易委员会人员解释对本研究报告内容负责华泰证券美国有限公司联营公司的分析师不具有美国金融监管FINRA分析师的注册资格可能不属于华泰证券美国有限公司的关联人员因此可能不受FINRA关于分析师与标的公司沟通公开露面和所持交易证券的限制华泰证券美国有限公司是华泰国际金融控股有限公司的全资子公司后者为华泰证券股份有限公司的全资子公司任何直接从华泰证券美国有限公司收到此报告并希望就本报告所述任何证券进行交易的人士应通过华泰证券美国有限公司进行交易美国-重要监管披露分析师谢春生本人及相关人士并不担任本报告所提及的标的证券或发行人的高级人员董事或顾问分析师及相关人士与本报告所提及的标的证券或发行人并无任何相关财务利益本披露中所提及的相关人士包括FINRA定义下分析师的家庭成员分析师根据华泰证券的整体收入和盈利能力获得薪酬包括源自公司投资银行业务的收入华泰证券股份有限公司其子公司和或其联营公司及或不时会以自身或代理形式向客户出售及购买华泰证券研究所覆盖公司的证券衍生工具包括股票及债券包括衍生品华泰证券研究所覆盖公司的证券衍生工具包括股票及债券包括衍生品华泰证券股份有限公司其子公司和或其联营公司及或其高级管理层董事和雇员可能会持有本报告中所提到的任何证券或任何相关投资头寸并可能不时进行增持或减持该证券或投资因此投资者应该意识到可能存在利益冲突评级说明投资评级基于分析师对报告发布日后6至12个月内行业或公司回报潜力含此期间的股息回报相对基准表现的预期A股市场基准为沪深300指数香港市场基准为恒生指数美国市场基准为标普500指数具体如下行业评级增持预计行业股票指数超越基准中性预计行业股票指数基本与基准持平减持预计行业股票指数明显弱于基准公司评级买入预计股价超越基准15以上增持预计股价超越基准515持有预计股价相对基准波动在-155之间卖出预计股价弱于基准15以上暂停评级已暂停评级目标价及预测以遵守适用法规及或公司政策无评级股票不在常规研究覆盖范围内投资者不应期待华泰提供该等证券及或公司相关的持续或补充信息免责声明和披露以及分析师声明是报告的一部分请务必一起阅读17计算机法律实体披露中国华泰证券股份有限公司具有中国证监会核准的证券投资咨询业务资格经营许可证编号为91320000704041011J香港华泰金融控股香港有限公司具有香港证监会核准的就证券提供意见业务资格经营许可证编号为AOK809美国华泰证券美国有限公司为美国金融业监管局FINRA成员具有在美国开展经纪交易商业务的资格经营业务许可编号为CRD298809SEC8-70231华泰证券股份有限公司南京北京南京市建邺区江东中路228号华泰证券广场1号楼邮政编码210019北京市西城区太平桥大街丰盛胡同28号太平洋保险大厦A座18层邮政编码100032电话862583389999传真862583387521电话861063211166传真861063211275电子邮件ht-rdhtsccom电子邮件ht-rdhtsccom深圳上海深圳市福田区益田路5999号基金大厦10楼邮政编码518017上海市浦东新区东方路18号保利广场E栋23楼邮政编码200120电话8675582493932传真8675582492062电话862128972098传真862128972068电子邮件ht-rdhtsccom电子邮件ht-rdhtsccom华泰金融控股香港有限公司香港中环皇后大道中99号中环中心58楼5808-12室电话852-3658-6000传真852-2169-0770电子邮件researchhtsccomhttpwwwhtsccomhk华泰证券美国有限公司美国纽约公园大道280号21楼东纽约10017电话212-763-8160传真917-725-9702电子邮件Huataihtsc-uscomhttpwwwhtsc-uscom版权所有2023年华泰证券股份有限公司免责声明和披露以及分析师声明是报告的一部分请务必一起阅读18
|
相关行业报告
|
||||||||||||||||||||||||||
