研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 华泰证券-计算机行业GPT产业复盘(20-21):走向应用-230219
上传日期:   2023/2/19 大小:   3171KB
格式:   pdf  共21页 来源:   华泰证券
评级:   增持 作者:   谢春生
行业名称:   计算机
下载权限:   此报告为加密报告
溯源GPT发展:20-21年参数量继续加大,应用于代码生成领域
  2019年问世的GPT-2,证明了大训练参数量和数据集能获得很好的训练结果,明确了GPT发展的大容量路线,并开始尝试泛化能力更强的zero-shot学习(零次学习)。在此基础上,2020年5月,OpenAI发表论文《LanguageModels are Few-Shot Learners》推出GPT-3,将模型参数量提高到1750亿,达到GPT系列模型的最大规模,训练数据集大小超570GB。此外,GPT-3将GPT-2采用的zero-shot更换为few-shot,进一步提高了模型的训练效果。2021年,基于GPT-3,OpenAI推出通用代码生成模型Codex。竞争对手微软和谷歌也于2020年分别提出了T-NLG和ELECTRA模型。
  GPT发展之2020:模型参数提升到1750亿
  GPT-3模型延续了GPT-2模型“更多训练数据+更大的网络参数可以有效地提升模型的泛化能力”的理念,其特点在于:1)与GPT2采用几乎同样的架构,模型参数由GPT-2的15亿增加到1750亿,提升超100倍。2)与GPT-2一样舍弃了针对不同任务进行的微调,转而用few-shot来实现下游任务,兼顾了训练效果与成本。3)GPT-3训练数据集为多种数据集的混合,包括Common Crawl以及质量更高的WebText2、Wikipedia,大小超570GB。
  GPT发展之2021:在代码生成领域的应用—Codex
  Codex是在GPT-3上基于GitHub公开代码进行微调的代码生成模型。OpenAI从Github上搜集了5400万个公共软件库代码,集合而成大小159GB的代码训练数据集。Codex即是参数量12B的GPT-3基于该数据集微调得到的模型。在进行模型评估时,OpenAI构造了HumanEval数据集,包含164原创的、手工设计的编程问题。与类似的代码生成模型相比,120亿参数的Codex准确率最高可达72.31%,性能优异。
  T-NLG追求大规模,ELECTRA注重训练效率
  微软T-NLG问世时是规模最大的自然语言生成模型,训练参数达170亿,能够完成开放式文本任务、直接生成问题答案、输出文档摘要等任务,并在许多NLP任务上均优于当时的SOTA技术。其演化版本MT-NLG参数达5300亿,再次刷新NLP模型规模记录。谷歌ELECTRA模型基于替换token检测任务训练得到,更注重提高预训练效率而非参数规模。参数规模最小的14MELECTRA-Small训练结果能够超过模型规模更大的GPT-1模型。
  模型对比:GPT-2 vs T-NLG/ELECTRA
  (M)T-NLG和GPT相比,最大特点在于模型参数量巨大,其中的逻辑在于微软和合作方NVIDIA分别在软件和硬件上更具优势,有利于发展大规模模型。ELECTRA与GPT-3的区别主要在架构和训练策略上。1)架构上:GPT-3采用的是Transformer的解码器架构,ELECTRA是Transformer编码器架构。2)策略上:ELECTRA坚持了小型模型的道路,通过改善预训练方法来提高效果,不追求大规模的训练参数,同样获得了性能优异的模型。
  风险提示:宏观经济波动,下游需求不及预期。本报告内容均基于客观信息整理,不构成投资建议。
  
  
研究报告全文:证券研究报告计算机GPT产业复盘20-21走向应用华泰研究计算机增持维持2023年2月19日中国内地专题研究研究员谢春生溯源GPT发展20-21年参数量继续加大应用于代码生成领域SACNoS0570519080006xiechunshenghtsccomSFCNoBQZ9388621298720362019年问世的GPT-2证明了大训练参数量和数据集能获得很好的训练结果明确了GPT发展的大容量路线并开始尝试泛化能力更强的zero-shot联系人袁泽世PhD学习零次学习在此基础上2020年5月OpenAI发表论文LanguageSACNoS0570122080053yuanzeshihtsccomModelsareFew-ShotLearners推出GPT-3将模型参数量提高到1750862128972228亿达到GPT系列模型的最大规模训练数据集大小超570GB此外GPT-3将GPT-2采用的zero-shot更换为few-shot进一步提高了模型的训练效果行业走势图2021年基于GPT-3OpenAI推出通用代码生成模型Codex竞争对手微软和谷歌也于2020年分别提出了T-NLG和ELECTRA模型计算机沪深3003GPT发展之2020模型参数提升到1750亿6GPT-3模型延续了GPT-2模型更多训练数据更大的网络参数可以有效地提升模型的泛化能力的理念其特点在于1与GPT2采用几乎同样的16架构模型参数由GPT-2的15亿增加到1750亿提升超100倍2与25GPT-2一样舍弃了针对不同任务进行的微调转而用few-shot来实现下游34任务兼顾了训练效果与成本3GPT-3训练数据集为多种数据集的混合Feb-22Jun-22Oct-22Feb-23包括以及质量更高的大小超CommonCrawlWebText2Wikipedia570GB资料来源Wind华泰研究GPT发展之2021在代码生成领域的应用CodexCodex是在GPT-3上基于GitHub公开代码进行微调的代码生成模型OpenAI从Github上搜集了5400万个公共软件库代码集合而成大小159GB的代码训练数据集Codex即是参数量12B的GPT-3基于该数据集微调得到的模型在进行模型评估时OpenAI构造了HumanEval数据集包含164原创的手工设计的编程问题与类似的代码生成模型相比120亿参数的Codex准确率最高可达7231性能优异T-NLG追求大规模ELECTRA注重训练效率微软T-NLG问世时是规模最大的自然语言生成模型训练参数达170亿能够完成开放式文本任务直接生成问题答案输出文档摘要等任务并在许多NLP任务上均优于当时的SOTA技术其演化版本MT-NLG参数达5300亿再次刷新NLP模型规模记录谷歌ELECTRA模型基于替换token检测任务训练得到更注重提高预训练效率而非参数规模参数规模最小的14MELECTRA-Small训练结果能够超过模型规模更大的GPT-1模型模型对比GPT-2vsT-NLGELECTRAMT-NLG和GPT相比最大特点在于模型参数量巨大其中的逻辑在于微软和合作方NVIDIA分别在软件和硬件上更具优势有利于发展大规模模型ELECTRA与GPT-3的区别主要在架构和训练策略上1架构上GPT-3采用的是Transformer的解码器架构ELECTRA是Transformer编码器架构2策略上ELECTRA坚持了小型模型的道路通过改善预训练方法来提高效果不追求大规模的训练参数同样获得了性能优异的模型风险提示宏观经济波动下游需求不及预期本报告内容均基于客观信息整理不构成投资建议免责声明和披露以及分析师声明是报告的一部分请务必一起阅读1计算机正文目录GPT发展之20-21参数量继续加大应用于代码生成领域3GPT发展之2020模型参数提升到1750亿4GPT-3模型参数达1750亿few-shot进一步提高性能4模型特点大参数量大训练集few-shot4特点一架构基本不变参数量大大增加4特点二采用few-shot学习完成下游任务6特点三预训练数据集达570GB以上7论文结论Few-shot在多种NLP数据集上实现了较好性能8GPT发展之2021代码生成领域的应用Codex9Codex基于GPT-3的代码生成工具9模型对比GPT-2vsT-NLGELECTRA11T-NLG问世时最大规模的自然语言生成模型11MT-NLG与NVIDIA合作推出5300亿参数模型12对比MT-NLG相比GPT-3更注重利用软硬件上的优势14ELECTRA注重提高预训练效率的小而美模型15对比ELECTRA相比GPT-3更注重小规模更有效的预训练17总结2020-2021年是GPT发展的关键阶段17风险提示18免责声明和披露以及分析师声明是报告的一部分请务必一起阅读2计算机GPT发展之20-21参数量继续加大应用于代码生成领域20-21年GPT-3模型参数量达到1750亿并在代码生成领域成功应用2019年问世的GPT-2证明了更大的训练参数量和数据集能获得很好的训练结果明确了GPT发展的大容量路线并开始尝试泛化能力更强的zero-shot学习零次学习在此基础上2020年5月OpenAI发表论文LanguageModelsareFew-ShotLearners推出GPT-3将模型参数量提高到1750亿达到GPT系列模型的最大规模训练数据集大小超570GB此外将GPT-2采用的zero-shot更换为few-shot进一步提高了模型的训练效果2021年基于GPT-3OpenAI推出通用代码生成模型Codex微软与谷歌也分别提出了自然语言处理模型T-NLG和ELECTRAT-NLG与GPT-2同样采用Transformer解码器架构其最大特点在于训练参数远高于同时期的其他模型得益于微软在软件和算力资源上的优势ELECTRA最大特点在于不再追求大规模的参数转而通过提高预训练效率来训练小而美的模型图表12017-2022年主要自然语言模型梳理GPT-1GPT-2T-NLGGPT-3CodexLaMDAMT-NLGInstructGPT2018620192202022020520218202212022120223117亿15亿170亿1750亿120亿1370亿5300亿13亿PaLMchatGPTGopherTransformerELMoBERTXLMXLNetRoBERTaELECTRALongformer20224202211201762018220181020191201962019720203202042021125400亿20亿065亿094亿355亿665亿355亿355亿335亿2800亿AlphaCodeALBERTDistilBERTDeBERTaULMFiT20222201812019920191020206235亿066亿技术架构Transformer解码器Transformer编码器T5BARTBigBirdM2M10020191020191020207202010Transformer解码器编码器110亿39亿120亿150亿其他架构201720182019202020212022参数量模型名称GPT-3T-NLGMT-NLGELECTRA模型架构解码器Decoder解码器Decoder编码器Encoder参数量15亿170亿5300亿最小14M最大175M充分利用微软和NVIDIA的软硬件比GPT-2更大的参数量更大的训反其道而行通过更有效率的预训资源采用远超同期模型的更大参核心理念练数据集以及采用few-shot练大大缩小模型训练参数数量资料来源各公司官网各模型论文华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读3计算机GPT发展之2020模型参数提升到1750亿GPT-3模型参数达1750亿few-shot进一步提高性能GPT-3将训练参数量扩大到1750亿2020年5月OpenAI发表论文LanguageModelsareFew-ShotLearners提出GPT-3模型GPT-3模型的参数量达1750亿是GPT史上最大的参数规模在GPT-2的zero-shotlearning零次学习基础上GPT-3在zero-shotone-shot一次学习和few-shot少量学习通常10-100次方面均进行了评估取得了较好的训练结果例如GPT-3在zeroonefew-shot设置下CoQA测试阅读理解能力分别达到815840850F1F1分数是统计学中用来衡量二分类模型精确度的一种指标值越大意味着模型越好在在zeroonefew-shot设置下TriviaQA测试闭卷问答能力分别达到643680712的准确度部分结果甚至超过微调模型OpenAI指出GPT-3也可以在传统的微调设置中进行评估GPT-3模型延续了GPT-2模型更多训练数据更大的网络参数可以有效地提升模型的泛化能力的理念将模型参数提升到新高度同时与GPT-2一样舍弃了针对不同任务进行的微调转而用few-shot来实现下游任务兼顾了训练效果与成本图表2LanguageModelsareFew-ShotLearners论文标志GPT-3问世2020年5月论文LanguageModelsareFew-ShotLearners标志着GPT-3模型问世采用few-shot学习模型参数达到前所未有的1750亿资料来源LanguageModelsareFew-ShotLearners华泰研究模型特点大参数量大训练集few-shot特点一架构基本不变参数量大大增加GPT-3延续了GPT-2的大容量发展路线GPT-2已经证明通过更多的训练数据更大的网络参数能够让模型具备zero-shot学习能力并取得了一定的效果由此确立了GPT模型向更大容量演进的发展路线GPT-3延续了这一路线将模型参数由GPT-2的15亿增加到1750亿提升幅度超100倍图表3GPT模型演进路径GPT-31750亿参数量大于570GB预训练数据量15亿参数量40GB预训练数据量GPT-3117亿参数量GPT-25GB预训练数据量GPT-1GPT-3模型基于GPT-2的大容量路线进一步将模型参数扩大超100倍达1750亿大容量扩展的技术发展路径达到顶峰资料来源OpenAI官网华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读4计算机GPT-3共有8种不同参数大小的模型GPT-3特指规模1750亿的模型OpenAI共搭建了8种GPT-3模型主要区别在于参数规模和架构层数参数规模从小到大分为125M350M760M13B27B67B130B和1750B通常GPT-3专指参数量为1750B即1750亿的模型不同模型架构上的区别包括模型层数nlayer每层中的单元数dmodel每个注意力头的维度dhead等图表4GPT-3的8种不同大小模型的参数资料来源LanguageModelsareFew-ShotLearners华泰研究大训练参数能明显提高GPT-3模型准确性从上下文学习能力训练结果准确率来看对于GPT-3模型当模型参数量较低时模型准确率较低例如参数量13B的模型准确率不超过10当模型参数提升10倍至13B时最高准确率接近30当模型参数达到最大175B时准确率最高接近70进一步验证了GPT-2大容量路线的正确性图表5大训练参数显著提高GPT-3准确率资料来源LanguageModelsareFew-ShotLearners华泰研究GPT-3和GPT2采用几乎同样的架构GPT-3和GPT-2模型和架构基本相同包括修改后的初始化预归一化和可逆标记化唯一区别在于将transformer中注意力模式替换成了类似SparseTransformer的稀疏注意力模式免责声明和披露以及分析师声明是报告的一部分请务必一起阅读5计算机图表6GPT-3采用和GPT-2同样的架构资料来源LanguageModelsareFew-ShotLearners华泰研究特点二采用few-shot学习完成下游任务Few-shot取代zero-shot训练效果得到进一步加强GPT-2模型中在下游训练时采用zero-shot学习理念在执行各类子任务时不给任何样例属于较为极端的情况虽然在GPT-2在某些测试中取得了不错的效果但在一些任务上结果不达预期因此OpenAI引入了few-shot即对于特定任务仅给予少量的样例10-100个没有任何梯度更新或微调任务和few-shot示例均通过与模型的文本交互指定从多种训练基准综合训练结果来看few-shot能够取得比zero-shot更好的准确度图表7Zero-shotone-shot和few-shot随着模型参数增加准确度越来越高注图中为多种训练基准综合的结果资料来源LanguageModelsareFew-ShotLearners华泰研究微调zero-shotone-shot和few-shot区别在于给定的任务示例多少1微调常会使用数千到数十万个标记示例微调的主要优点是在许多基准测试上都有很强的性能缺点是每个任务都需要一个新的大型数据集导致模型泛化能力不佳训练质量可能受训练数据集影响GPT-3没有采用微调但原则上能够适用微调2Few-shot指的是在推理时给模型一些任务演示作为条件但不进行权重更新的设置GPT-3给定的few-shot数量为1-100个Few-shot的主要优点是大大减少了对特定于任务的数据的需求并减少了从大而窄的微调数据集中学习过于狭窄的分布的可能性不过其结果往往不如微调3One-shot与Few-shot类似只是仅提供一个任务演示给模型4Zero-shot不提供给模型任何的任务演示只提供描述任务的自然语言指令该方法提供了最大的便利性潜在的稳健性并且不会受训练数据集质量的影响该方法问题在于没有任何预先示例对于人类尚且不易模型实现会更加困难GPT-2采用该方法免责声明和披露以及分析师声明是报告的一部分请务必一起阅读6计算机图表8微调zero-shotone-shot和few-shot比较GPT-3探讨的三种情境学习传统的微调未用于GPT-3该模型只给出任务的自然语言描述来预测答案不执行该模型通过使用大量示例任务的重复梯度更新来训练梯度更新除了任务描述之外模型还能获得任务的单个示例不执行梯度更新除了任务描述之外模型还得到了一些任务示例不执行梯度更新资料来源LanguageModelsareFew-ShotLearners华泰研究特点三预训练数据集达570GB以上GPT-3训练数据集为多种数据集的混合数据集以CommonCrawl为基础其大小为45TB但CommonCrawl数据集的质量低于更精确的数据集为了保证数据集质量一方面对CommonCrawl进行过滤大小压缩到570GB另一方面增加了质量更高的数据集如WebText2Wikipedia等在训练期间数据集的采样并不与其大小成比例而是质量更高的数据集采样频率更高因此CommonCrawl和Books2数据集在训练期间采样次数少于一次其他更高质量的数据集采样次数为2-3次以换取更高质量的训练数据比较来看GPT-1和GPT-2的训练书籍及大小分别为5GB和40GBGPT-3数据集大小超GPT-210倍以上图表9GPT-3训练数据集组合资料来源LanguageModelsareFew-ShotLearners华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读7计算机论文结论Few-shot在多种NLP数据集上实现了较好性能GPT-3在许多NLP数据集上实现了强大的性能GPT-3在包括语言建模翻译问答和完形填空任务以及一些需要动态推理或领域适应的任务例如解读单词在句子中使用新单词或执行3位算术等方面均有不错的表现在阅读理解自然语言推理方面表现一般此外GPT-3可以生成人类评估人员难以区分的新闻文章样本这为ChatGPT优秀的交互式问答表现奠定了基础图表10GPT-3的测试任务及完成情况任务名称训练数据集结果结果评价说明语言建模完形填空和完成任务LanguageModelingClozeandCompletionTasks语言建模PennTreeBankPTB比最好结果state-of-the-artSOAT的困好困惑度是用来评估语言模型优劣的指惑度高15分标其基本思想是给测试集赋予较高概率值的语言模型较好且较小的困惑度意味着模型对新文本有较好的预测作用LAMBADALAMBADAGPT-3显著改善了LAMBADA上的SOTA好测试文本中的长期依赖关系模型被要求预测需要阅读一段上下文的句子的最后一个词HellaSwagHellaSwagGPT-3在one-shot中达到781的准确度较好HellaSwag数据集测试为一个故事或在few-shot设置中达到793的准确度低一组指令选择最佳结局于经过微调的多任务模型ALUM所达到的SOTA856StoryClozeStoryCloze2016zero-shot设置中达到832在few-shot射较好击设置中达到87770次示例比SOTA低41比以前的zero-shot结果提高了大约10闭卷问答NaturalQuestions在TriviaQA数据集上GPT-3的one-shot较好ClosedBookQuestionWebQuestionsTriviaQA与开放域微调SOTA相匹配在其他两个数Answering据集上接近闭卷SOTA性能翻译TranslationWMT14FrEn提供一个示例的情况下结果与之前的工作接好GPT-3在翻译成英语时明显优于之前WMT16DeEn近在few-shot设置下与无监督NMT神的无监督NMT但在其他语言翻译时WMT16RoEn等经网络机器翻译平均性能相近表现欠佳Winograd类型任务WinogradWinogrande在Winograd数据集上GPT-3在zero-shot较好WinogradSchemasChallenge涉及Winograd-StyleTasksone-shot和few-shot设置下分别达到了代词的指定问题883897和886仅比SOAT和人类表现略低在更难的Winogrande数据集上表现一般常识推理PIQAARC和OpenBookQA在PIQA数据集上超过SOTA在其他数据集较好CommonSenseReasoning上仍有差距阅读理解CoQADROPQuAC在CoQA上表现最好在QuAC表现最差一般ReadingComprehensionSQuADv2RACE等整体结果落后于SOATSuperGLUESuperGLUEbenchmarkGPT-3在不同任务中的表现差异很大在一般SuperGLUE是Facebook人工智COPA和ReCoRD上GPT-3实现了接近能研究中心GoogleDeepMind华SOAT的性能在WSC上性能相对较强在盛顿大学以及纽约大学在2019年BoolQMultiRC和RT上性能合理在CB8月共同推出的用于衡量现在高性能上较差语义理解AI的基准测试自然语言推理RTEANLI与SOAT差距较大对于语言模型来说NLI一般NLI关注理解两个句子之间关系的能NaturalLanguageInference仍然是一项非常困难的任务力综合和定性任务GPT-3表现出熟练的中等复杂算术能力文较好SAT是美国大学入学考试SyntheticandQualitative字置乱和操作任务表现一般在SAT类比上Tasks超过大学申请人的平均得分GPT-3能产生人类难以区分的500字左右文章在语法纠正和使用新词上均有不错表现资料来源LanguageModelsareFew-ShotLearners华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读8计算机GPT发展之2021代码生成领域的应用CodexCodex基于GPT-3的代码生成工具Codex是在GPT-3上基于GitHub公开代码进行微调的代码生成模型Codex的模型结构和GPT-3相同OpenAI从Github上搜集了5400万个公共软件库代码集合而成训练数据集包含179GB的Python文件每个文件小于1MB同时过滤了部分可能是自动生成的文件最终的数据集大小为159GBCodex即是参数量12B的GPT-3基于该数据集微调得到的模型在进行模型评估时OpenAI构造了HumanEval数据集包含164原创的手工设计的编程问题避免问题出现在基于GitHub的训练数据集中OpenAI还训练了Codex-S和Codex-DCodex-S基于格式类似HumanEval的SupervisedFine-Tuning有监督微调数据集进行训练训练出的模型效果比Codex更好将SupervisedFine-Tuning数据集中的函数头docstrings函数体格式调换成函数头函数体docstrings格式再微调得到的模型为Codex-D即实现模型根据代码写注释的功能图表11Codex模型家族图谱CodeX1159GB的代码数1据集进行训练2基于格式类似GPT-32HumanEvalCodeX-S的120亿参数SupervisedFine-Tuning数据集进行训练3将SupervisedFine-Tuning数据集3中的函数头docstrings函CodeX-D数体格式调换成函数头函数体docstrings格式资料来源EvaluatingLargeLanguageModelsTrainedonCode华泰研究与类似的代码生成模型相比120亿参数的Codex准确率最高可达7231基于HumanEval评估数据集对比了GPT-NEOGPT-JTabnine等类似的代码生成模型的结果Passk可以解释为评估k个样本中最优的结果Codex的最大版本拥有120亿参数其Pass100达到了7231远大于其余模型的最好结果图表12120亿参数的Codex准确率最高可达7231注k代表每个问题生成k个代码样本资料来源EvaluatingLargeLanguageModelsTrainedonCode华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读9计算机Codex-S的表现性能比Codex更进一步远好于GPT-3从基于HumanEval数据集的通过率看当为每个问题生成单个样本时k1GPT-12B通过率为0Codex解决了288的问题Codex-S解决了377的问题更进一步1每个问题生成100个样本并选择具有最高平均对数概率的样本得到Codex-Smeanlogpreranking2选择通过单元测试的示例得到Codex-Soraclereranking分别解决了高达445和775的问题图表13Codex和Codex-S的性能表现情况资料来源EvaluatingLargeLanguageModelsTrainedonCode华泰研究Codex能基于用户输入的自然语言生成代码从Codex使用界面看用户需要将自己的需求以自然语言的形式描述给模型模型即根据用户意图自动生成相关代码Codex支持用户在同一界面下对输入需求进行修改图表14Codex代码生成界面和使用过程示例导入图片缩小图片裁剪图片移动图片资料来源OpenAI官网华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读10计算机模型对比GPT-2vsT-NLGELECTRAT-NLG问世时最大规模的自然语言生成模型T-NLG问世时是规模最大的自然语言生成模型训练参数达170亿T-NLG图灵自然语言生成是微软的ProjectTuring图灵计划于2022年2月提出其训练参数高达170亿远超同时期的其他自然语言模型T-NLG能够完成开放式文本任务直接生成问题答案输出文档摘要等任务并在许多NLP任务上均优于当时的SOTA技术T-NLG仍采用Transformer架构架构层数为78并以多任务方式训练与GPT-2类似图表15T-NLG成为当时参数最大的语言模型T-NLG175b15b125b10b75bGPT-25bGPT-125b资料来源DeepContextualizedWordRepresentations华泰研究在标准语言任务上T-NLG性能优异基于预训练的T-NLG模型在WikiText-103困惑度数值越低越好和LAMBADA下一个单词预测准确性数值越高越好数据集上与GPT-2和NVIDIA发布的Megatron-LM进行了对比结果显示在两种训练集上T-NLG均取得了最好的结果图表16T-NLG与Mrgatron和GPT-2的表现对比资料来源微软官网华泰研究在问题回答方面T-NLG能够用完整的句子给出直接答案T-NLG将用完整的句子直接回答用户的提问此外T-NLG采取与GPT-2类似的zero-shot学习策略模型仅依靠在预训练期间获得的知识来生成答案能够在没有上下文的情况下进行问题回答免责声明和披露以及分析师声明是报告的一部分请务必一起阅读11计算机图表17T-NLG能够直接用完整的句子和没有上下文的情况下回答问题资料来源微软官网华泰研究在抽象摘要生成方面能为各种文本文档编写类似人类书写的摘要T-NLG能够不通过复制现有内容而是像人类一样进行摘要编写包括电子邮件博客文章Word文档Excel表格和PowerPoint演示文稿为了使T-NLG尽可能多地用于总结不同类型的文本微软在几乎所有公开可用的摘要数据集上以多任务方式微调了T-NLG模型总计约400万个训练实例与之前SOAT对比T-NLG能够在arXivWikiHowBillSum数据集上实现超越并在WikiSum数据集上逼近SOAT图表18T-NLG在无监督的抽象摘要上有良好表现资料来源微软官网华泰研究MT-NLG与NVIDIA合作推出5300亿参数模型MT-NLG是微软与NVIDIA合作推出的自然语言生成模型MT-NLGMegatron图灵自然语言生成模型在T-NLG的基础上将模型参数扩大到5300亿再次刷新了模型规模的记录MT-NLG使用了Transformer的解码器架构模型层数达到105MT-NLG在zeroonefew-shot设置上对现有SOAT模型进行了改进在模型规模和质量方面为大型语言模型设定了新标准MT-NLG能够完成预测阅读理解常识推理自然语言推理词义消歧等任务图表19更大的参数量是高性能自然语言模型的发展趋势资料来源微软官网华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读12计算机MT-NLG的训练数据集是以Pile数据集为基础的多种数据集集合训练集上从Pile训练集中选择了相对质量最高的数据集子集为基础增加了经过滤的CommonCrawlCC快照RealNews和CCStories数据集构建训练数据集时使用模糊重复数据消除保证不同数据集中内容不同使用了基于数据集质量的优先级顺序从训练数据集中移除了下游任务数据避免数据污染图表20用于训练MT-NLG的数据集数据集数据集来源Tokensbillions权重时期EpochsBooks3Piledataset25714315OpenWebText2Piledataset14819336StackExchangePiledataset1165714PubMedAbstractsPiledataset442918WikipediaPiledataset424832GutenbergPG-19Piledataset270909BookCorpus2Piledataset151018NIHExPorterPiledataset030218Pile-CCPiledataset4989405ArXivPiledataset2081402GitHubPiledataset2431602CC-2020-50CommonCrawlCCsnapshot68713005CC-2021-04CommonCrawlCCsnapshot82615705RealNewsRealNews2199011CC-StoriesCommonCrawlCCstories530905资料来源微软官网华泰研究MT-NLG在多个NLP下游任务中取得了优秀结果评估涉及8个任务涵盖5个不同的领域1在文本预测任务LAMBADA中模型预测给定段落的最后一个单词2在阅读理解任务RACE-h和BoolQ中模型根据给定的段落生成问题的答案3在常识推理任务PiQAHellaSwag和Winogrande中每一项任务都需要一些超出语言统计模式的常识知识才能解决4在自然语言推理任务ANLI-R2和HANS中主要针对过去模型的典型失败案例进行评估5在词义消歧任务WiC中评估模型对上下文中多义词的理解能力在以上测试中MT-NLG均取得了不错的准确度在PiQA和LAMBADA上表现突出图表21MT-NLG在LAMBADA的表现上超过了GPT-3资料来源微软官网华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读13计算机图表22MT-NLG在多个NLP下游任务中的准确度任务类别任务Zero-shotOne-shotFew-shot文本预测Lambada076607310872阅读理解BoolQ078208250848阅读理解RACE-h047904840479常识推理PiQA082008100832常识推理HellaSwag080208020824常识推理WinoGrande073007370789自然语言推理ANLI-R2036603970396自然语言推理HANS060706490702词义消歧WiC048605130585资料来源微软官网华泰研究对比MT-NLG相比GPT-3更注重利用软硬件上的优势MT-NLG和GPT相比最大特点在于模型参数量巨大从架构上看MT-NLG和GPT均基于Transformer的解码器架构没有本质区别训练方法上均采用了zero-shotfew-shot等理念我们认为两者最大区别在体现在训练参数量上T-NLG与GPT-2相比参数量从15亿提高到170亿MT-NLG与GPT-3相比参数量从1750亿提高到5300亿我们认为这其中的逻辑在于相比OpenAI微软和NVIDIA在软硬件上更具优势通过充分利用软硬件资源扩大模型训练参数量是其主要手段T-NLG时期微软在技术设施上突破了大模型训练微软指出任何参数超过13亿的模型都无法用单个GPU进行训练即使是32GB内存的GPU因此模型必须在多个GPU之间并行化或拆分微软在软硬件上进行了设置1利用NVIDIADGX-2硬件设置和InfiniBand连接加速GPU之间的通信2应用张量切片在NVIDIAMegatronLM框架上的四个NVIDIAV100GPU上分割模型3使用ZeRO的DeepSpeed降低模型并行度将每个节点的批量大小增加四倍训练时间减少三倍微软DeepSpeed和ZeRO大大提高了模型训练速度DeepSpeed是微软发布的开源库通过提高规模速度成本和可用性极大地推进了大型模型训练最大支持训练1000亿参数模型支持PyTorch与深度学习相关的Python程序库DeepSpeed库的一部分是并行优化器ZeRO零冗余优化器ZeRO消除了数据和模型并行训练中的内存冗余同时保持了低通信量和高计算粒度能够大大减少模型和数据并行所需的资源同时增加可训练的参数数量能够在400个GPU上以超线性加速训练超过100B参数的大型模型实现15Petaflops吞吐量微软指出在如今的硬件条件下ZeRO有可能扩展到超过1万亿的参数图表23微软推出DeepSpeedZeRO加速大模型训练资料来源微软官网华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读14计算机MT-NLG时期微软和NVIDIA联手提供了性能更强的训练基础设施大规模训练基础设施以NVIDIAA100TensorCoreGPU和HDRInfiniBand网络为基础由超级计算集群如NVIDIASelene和MicrosoftAzureNDv4提供足够算力此外软件上基于NVIDIAMegatronLM和微软DeepSpeed创建了高效且可扩展的3D并行系统对于5300亿规模的模型能够使用DeepSpeed的数据并行性扩展到数千个GPU硬件上模型基于NVIDIADGXSuperPOD的Selene超级计算机以混合精度完成每个DGXA100配备8个NVIDIAA10080GBTensorCoreGPU通过NVLink和NVSwitch实现完全连接我们认为OpenAI在2019年7月2023年1月分别得到微软10亿美元和100亿美元的投资并在技术上与微软有更深入的合作未来OpenAI或能借助微软的软件和算力资源优势进一步提升GPT系列产品的性能ELECTRA注重提高预训练效率的小而美模型ELECTRA模型更注重提高预训练效率而非参数规模ELECTRAEfficientlyLearninganEncoderthatClassifiesTokenReplacementsAccurately由谷歌提出其理念是以相对较少的计算量获得更好的结果传统的掩码语言模型MLM预训练方法如BERT通过用MASK替换一些输入token来破坏输入然后训练一个模型来重建原始token通常需要较大的计算量为了提高训练效率较少训练量谷歌基于Transformer的编码器架构提出了更有效的样本预训练任务替换token检测Replacedtokendetection任务并得到了优于MLM的结果图表24替换token检测预训练的性能优于MLM预训练注左图是虚线框的放大视图资料来源ElectraPre-TrainingTextEncodersAsDiscriminatorsRatherThanGenerators华泰研究替换token检测任务由生成器和判别器ELECTRA组成替换token检测任务训练生成器和判别器两个神经网络每个神经网络主要由Transformer编码器组成生成器用来预测被屏蔽token的原始token判别器用来区分数据输出中的token是否被生成器生成的样本替换生成器可以是在token上产生输出分布的任何模型通常使用与判别器联合训练的小型掩码语言模型MLM预训练完成后即可以放弃生成器转而用判别器ELECTRA执行下游任务免责声明和披露以及分析师声明是报告的一部分请务必一起阅读15计算机图表25替换token检测示意图MASK遮盖用生成器生成的示例预测哪些token是原始原始输入一部分token替代MASK内容输入哪些是被替换的生成器判别器资料来源ElectraPre-TrainingTextEncodersAsDiscriminatorsRatherThanGenerators华泰研究ELECTRA的小型大型模型均有良好表现性能1ELECTRA小型模型与其他使用更多计算和参数的方法相比获得了更高的GLUE通用语言理解评估分数例如得分比可比的BERT-Small模型提高5分甚至超过了更大的GPT-1模型中等大小的ELECTRA-Base性能优于BERT-Base和BERT-Large2ELECTRA大型模型ELECTRA-400K的性能与RoBERTa和XLNet相当且训练缩短到不到14ELECTRA-175M性能超过了大多数模型且需要的预训练计算更少图表26GLUE开发集中的小型模型比较资料来源ElectraPre-TrainingTextEncodersAsDiscriminatorsRatherThanGenerators华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读16计算机图表27GLUE开发集中的大型模型比较资料来源ElectraPre-TrainingTextEncodersAsDiscriminatorsRatherThanGenerators华泰研究对比ELECTRA相比GPT-3更注重小规模更有效的预训练ELECTRA与GPT-3的区别主要在架构和训练策略上1架构上GPT-3采用的是Transformer的解码器架构而ELECTRA采用的是Transformer的编码器架构2策略上从GPT-2开始OpenAI确定了GPT的大容量路线模型参数和训练数据集大小均不断上升GPT-3的参数从GPT-2的15B提高到了175B而ELECTRA坚持了小型模型的道路通过改善预训练方法来提高效果其中ELECTRA-Small参数仅14M最大的ELECTRA参数仅175M远小于GPT-2和GPT-3总结2020-2021年是GPT发展的关键阶段我们认为2020-2021年是GPT发展的关键阶段1模型演变上2020年OpenAI提出的GPT-3延续了GPT-2的大容量路线一方面训练参数量从GPT-2的15亿提升到1750亿规模大大增加另一方面训练数据集从40GB提升到超570GB此外针对GPT-2采用zero-shot学习无法较好应对部分下游任务的情况GPT-3采用了few-shot学习方法对于下游任务不做梯度更新和微调任务和few-shot示例均通过与模型的文本交互指定取得了比zero-shot更好的训练结果2模型应用上2021年基于GPT-3OpenAI发布了代码生成工具Codex该模型是在参数量120亿的GPT-3基础上基于代码数据集微调得到该代码数据集由OpenAI从Github上搜集的5400万个公共软件库代码集合而成包含179GB的Python文件每个文件小于1MB同时过滤了部分可能是自动生成的文件剩下的数据集大小为159GBCodex能基于用户输入的自然语言生成代码准确率最高可达7231同时期微软和谷歌分别发布了T-NLG和ELECTRA模型这两种模型采用了相反的训练策略T-NLG注重构建大模型提升训练结果ELECTRA注重提高与训练效率并缩小模型规模T-NLG问世时是规模最大的自然语言生成模型训练参数达170亿能够完成开放式文本任务直接生成问题答案输出文档摘要等任务并在许多NLP任务上均优于当时的SOTA技术其演化版本MT-NLG参数达5300亿再次刷新NLP模型规模记录ELECTRA模型基于替换token检测任务训练得到参数规模最小的14MELECTRA-Small训练结果能够超过模型规模更大的GPT-1模型训练效率得到较大提高图表28提及公司列表公司代码公司简称MSFTUS微软GOOGLUS谷歌未上市OpenAI资料来源Bloomberg华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读17计算机风险提示宏观经济波动若宏观经济波动产业变革及新技术的落地节奏或将受到影响宏观经济波动还可能对IT投资产生负面影响从而导致整体行业增长不及预期下游需求不及预期若下游数字化需求不及预期相关的数字化投入增长或慢于预期致使行业增长不及预期本报告内容均基于客观信息整理不构成投资建议免责声明和披露以及分析师声明是报告的一部分请务必一起阅读18计算机免责声明分析师声明本人谢春生兹证明本报告所表达的观点准确地反映了分析师对标的证券或发行人的个人意见彼以往现在或未来并无就其研究报告所提供的具体建议或所表迖的意见直接或间接收取任何报酬一般声明及披露本报告由华泰证券股份有限公司已具备中国证监会批准的证券投资咨询业务资格以下简称本公司制作本报告所载资料是仅供接收人的严格保密资料本报告仅供本公司及其客户和其关联机构使用本公司不因接收人收到本报告而视其为客户本报告基于本公司认为可靠的已公开的信息编制但本公司及其关联机构以下统称为华泰对该等信息的准确性及完整性不作任何保证本报告所载的意见评估及预测仅反映报告发布当日的观点和判断在不同时期华泰可能会发出与本报告所载意见评估及预测不一致的研究报告同时本报告所指的证券或投资标的的价格价值及投资收入可能会波动以往表现并不能指引未来未来回报并不能得到保证并存在损失本金的可能华泰不保证本报告所含信息保持在最新状态华泰对本报告所含信息可在不发出通知的情形下做出修改投资者应当自行关注相应的更新或修改本公司不是FINRA的注册会员其研究分析师亦没有注册为FINRA的研究分析师不具有FINRA分析师的注册资格华泰力求报告内容客观公正但本报告所载的观点结论和建议仅供参考不构成购买或出售所述证券的要约或招揽该等观点建议并未考虑到个别投资者的具体投资目的财务状况以及特定需求在任何时候均不构成对客户私人投资建议投资者应当充分考虑自身特定状况并完整理解和使用本报告内容不应视本报告为做出投资决策的唯一因素对依据或者使用本报告所造成的一切后果华泰及作者均不承担任何法律责任任何形式的分享证券投资收益或者分担证券投资损失的书面或口头承诺均为无效除非另行说明本报告中所引用的关于业绩的数据代表过往表现过往的业绩表现不应作为日后回报的预示华泰不承诺也不保证任何预示的回报会得以实现分析中所做的预测可能是基于相应的假设任何假设的变化可能会显著影响所预测的回报华泰及作者在自身所知情的范围内与本报告所指的证券或投资标的不存在法律禁止的利害关系在法律许可的情况下华泰可能会持有报告中提到的公司所发行的证券头寸并进行交易为该公司提供投资银行财务顾问或者金融产品等相关服务或向该公司招揽业务华泰的销售人员交易人员或其他专业人士可能会依据不同假设和标准采用不同的分析方法而口头或书面发表与本报告意见及建议不一致的市场评论和或交易观点华泰没有将此意见及建议向报告所有接收者进行更新的义务华泰的资产管理部门自营部门以及其他投资业务部门可能独立做出与本报告中的意见或建议不一致的投资决策投资者应当考虑到华泰及或其相关人员可能存在影响本报告观点客观性的潜在利益冲突投资者请勿将本报告视为投资或其他决定的唯一信赖依据有关该方面的具体披露请参照本报告尾部本报告并非意图发送发布给在当地法律或监管规则下不允许向其发送发布的机构或人员也并非意图发送发布给因可得到使用本报告的行为而使华泰违反或受制于当地法律或监管规则的机构或人员本报告版权仅为本公司所有未经本公司书面许可任何机构或个人不得以翻版复制发表引用或再次分发他人无论整份或部分等任何形式侵犯本公司版权如征得本公司同意进行引用刊发的需在允许的范围内使用并需在使用前获取独立的法律意见以确定该引用刊发符合当地适用法规的要求同时注明出处为华泰证券研究所且不得对本报告进行任何有悖原意的引用删节和修改本公司保留追究相关责任的权利所有本报告中使用的商标服务标记及标记均为本公司的商标服务标记及标记中国香港本报告由华泰证券股份有限公司制作在香港由华泰金融控股香港有限公司向符合证券及期货条例及其附属法律规定的机构投资者和专业投资者的客户进行分发华泰金融控股香港有限公司受香港证券及期货事务监察委员会监管是华泰国际金融控股有限公司的全资子公司后者为华泰证券股份有限公司的全资子公司在香港获得本报告的人员若有任何有关本报告的问题请与华泰金融控股香港有限公司联系免责声明和披露以及分析师声明是报告的一部分请务必一起阅读19计算机香港-重要监管披露华泰金融控股香港有限公司的雇员或其关联人士没有担任本报告中提及的公司或发行人的高级人员有关重要的披露信息请参华泰金融控股香港有限公司的网页httpswwwhtsccomhkstockdisclosure其他信息请参见下方美国-重要监管披露美国在美国本报告由华泰证券美国有限公司向符合美国监管规定的机构投资者进行发表与分发华泰证券美国有限公司是美国注册经纪商和美国金融业监管局FINRA的注册会员对于其在美国分发的研究报告华泰证券美国有限公司根据1934年证券交易法修订版第15a-6条规定以及美国证券交易委员会人员解释对本研究报告内容负责华泰证券美国有限公司联营公司的分析师不具有美国金融监管FINRA分析师的注册资格可能不属于华泰证券美国有限公司的关联人员因此可能不受FINRA关于分析师与标的公司沟通公开露面和所持交易证券的限制华泰证券美国有限公司是华泰国际金融控股有限公司的全资子公司后者为华泰证券股份有限公司的全资子公司任何直接从华泰证券美国有限公司收到此报告并希望就本报告所述任何证券进行交易的人士应通过华泰证券美国有限公司进行交易美国-重要监管披露分析师谢春生本人及相关人士并不担任本报告所提及的标的证券或发行人的高级人员董事或顾问分析师及相关人士与本报告所提及的标的证券或发行人并无任何相关财务利益本披露中所提及的相关人士包括FINRA定义下分析师的家庭成员分析师根据华泰证券的整体收入和盈利能力获得薪酬包括源自公司投资银行业务的收入华泰证券股份有限公司其子公司和或其联营公司及或不时会以自身或代理形式向客户出售及购买华泰证券研究所覆盖公司的证券衍生工具包括股票及债券包括衍生品华泰证券研究所覆盖公司的证券衍生工具包括股票及债券包括衍生品华泰证券股份有限公司其子公司和或其联营公司及或其高级管理层董事和雇员可能会持有本报告中所提到的任何证券或任何相关投资头寸并可能不时进行增持或减持该证券或投资因此投资者应该意识到可能存在利益冲突评级说明投资评级基于分析师对报告发布日后6至12个月内行业或公司回报潜力含此期间的股息回报相对基准表现的预期A股市场基准为沪深300指数香港市场基准为恒生指数美国市场基准为标普500指数具体如下行业评级增持预计行业股票指数超越基准中性预计行业股票指数基本与基准持平减持预计行业股票指数明显弱于基准公司评级买入预计股价超越基准15以上增持预计股价超越基准515持有预计股价相对基准波动在-155之间卖出预计股价弱于基准15以上暂停评级已暂停评级目标价及预测以遵守适用法规及或公司政策无评级股票不在常规研究覆盖范围内投资者不应期待华泰提供该等证券及或公司相关的持续或补充信息免责声明和披露以及分析师声明是报告的一部分请务必一起阅读20
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1