ChatGPT:三个阶段打造智能对话交互式AI模型
ChatGPT从诞生到现在,经历了三个大版本阶段演进。2018年,生成式预训练模型GPT-1诞生,引入有监督的微调训练。2019年,GPT-2以增加模型通用性为目标,移除GPT-1的微调,以更大的参数量和多任务训练,进行zero-shot学习;2020年,GPT-3用few-shot代替zero-shot,并将训练参数增加到1750亿,再次提高模型表现性能。2022年,InstructGPT引入基于人类反馈的强化学习(RLHF),在GPT-3基础上进行奖励训练,以13亿训练参数实现了更好的模型性能。2022年11月,基于InstructGPT,OpenAI正式推出对话交互式模型ChatGPT,5天时间突破了100万用户。 GPT-1阶段:开启生成式预训练模型时代 GPT-1基于Transformer架构,仅保留了架构中的解码器(Decoder)部分。GPT-1的训练过程包括预训练和微调两个阶段。1)阶段一:预训练采用内含长段连续文本的BooksCorpus数据集,进行高容量无监督学习。2)阶段二:在做下游任务时,首先根据任务类型将其转换为不同的输入形式,再针对不用类型任务用特定训练集进行微调训练。GPT-1的参数量为1.17亿GPT-1在常识推理、问题回答、文本蕴涵等任务上分别比对比方法进步了8.9%、5.7%和1.5%。 GPT-2阶段:无监督训练替代有监督训练 GPT-2通过海量数据和庞大的模型参数训练出更为通用的模型,无需经过特定的数据集训练也能解决各类问题,即zero-shot learning(零次学习),从而提高模型的泛化能力。GPT-2在架构上与GPT-1基本保持相同,预训练阶段与GPT-1方法一致,采用了更大的数据集WebText。处理下游任务时,以无监督的训练方式进行zero-shot学习,通过增加prompt文本提示的方式提示模型具体任务类型。GPT-2的参数量增加到15亿。GPT-2在命名实体识别、阅读理解等任务上表现优异,在部分任务上不及预期。 GPT-3阶段:性能不断突破,开启商业探索 GPT-3在GPT-2架构基础上,舍弃极端的zero-shot,采用few-shot理念,对于特定任务给予少量(10-100个)样例。GPT-3最大训练参数量为1750亿,训练结果准确度随着few-shot样例的增加有明显提高。基于GPT-3,OpenAI发布了Codex和InstructGPT。Codex是通用代码生成模型,能够将自然语言转换为代码,支持十几种编程语言。InstructGPT在GPT-3基础上通过RLHF训练奖励模型来进一步优化训练结果,仅用13亿参数量即可实现更符合人类需求的输出。此外,2020年6月,OpenAI开始对外提供接入GPT-3服务的API,并按照模型类型进行收费,开启商业探索第一步。 ChatGPT阶段:各大互联网厂商争相推出类似产品 2022年11月,基于InstructGPT,OpenAI发布了以对话方式交互的ChatGPT。ChatGPT训练方法与InstructionGPT基本相同,区别仅在于在微调时基于InstructGPT而非GPT-3。随着ChatGPT用户的增多,OpenAI推出了按月订阅的ChatGPTPlus服务,开启第二次商业尝试。国内外互联网厂商纷纷跟进,微软发布基于ChatGPT的新版Bing,谷歌发布Bard对标ChatGPT;百度宣布推出类ChatGPT应用“文心一言”,京东推出智能人机对话平台ChatJD,阿里宣布公司正在研发“阿里版”ChatGPT,网易有道和360也表示推出类ChatGPT应用。 风险提示:宏观经济波动,下游需求不及预期。本报告内容均基于客观信息整理,不构成投资建议。 研究报告全文:证券研究报告计算机GPT产业梳理GPT-1到ChatGPT华泰研究计算机增持维持2023年2月14日中国内地专题研究研究员谢春生ChatGPT三个阶段打造智能对话交互式AI模型SACNoS0570519080006xiechunshenghtsccomSFCNoBQZ938862129872036ChatGPT从诞生到现在经历了三个大版本阶段演进2018年生成式预训练模型GPT-1诞生引入有监督的微调训练2019年GPT-2以增加模联系人袁泽世PhD型通用性为目标移除GPT-1的微调以更大的参数量和多任务训练进SACNoS0570122080053yuanzeshihtsccom行zero-shot学习2020年GPT-3用few-shot代替zero-shot并将训练862128972228参数增加到1750亿再次提高模型表现性能2022年InstructGPT引入基于人类反馈的强化学习RLHF在GPT-3基础上进行奖励训练以13行业走势图亿训练参数实现了更好的模型性能2022年11月基于InstructGPTOpenAI正式推出对话交互式模型ChatGPT5天时间突破了100万用户计算机沪深3006GPT-1阶段开启生成式预训练模型时代3GPT-1基于Transformer架构仅保留了架构中的解码器Decoder部分GPT-1的训练过程包括预训练和微调两个阶段1阶段一预训练采用内12含长段连续文本的BooksCorpus数据集进行高容量无监督学习2阶段21二在做下游任务时首先根据任务类型将其转换为不同的输入形式再针30对不用类型任务用特定训练集进行微调训练GPT-1的参数量为117亿Feb-22Jun-22Oct-22Feb-23在常识推理问题回答文本蕴涵等任务上分别比对比方法进步了GPT-1资料来源Wind华泰研究8957和15GPT-2阶段无监督训练替代有监督训练GPT-2通过海量数据和庞大的模型参数训练出更为通用的模型无需经过特定的数据集训练也能解决各类问题即zero-shotlearning零次学习从而提高模型的泛化能力GPT-2在架构上与GPT-1基本保持相同预训练阶段与GPT-1方法一致采用了更大的数据集WebText处理下游任务时以无监督的训练方式进行zero-shot学习通过增加prompt文本提示的方式提示模型具体任务类型GPT-2的参数量增加到15亿GPT-2在命名实体识别阅读理解等任务上表现优异在部分任务上不及预期GPT-3阶段性能不断突破开启商业探索GPT-3在GPT-2架构基础上舍弃极端的zero-shot采用few-shot理念对于特定任务给予少量10-100个样例GPT-3最大训练参数量为1750亿训练结果准确度随着few-shot样例的增加有明显提高基于GPT-3OpenAI发布了Codex和InstructGPTCodex是通用代码生成模型能够将自然语言转换为代码支持十几种编程语言InstructGPT在GPT-3基础上通过RLHF训练奖励模型来进一步优化训练结果仅用13亿参数量即可实现更符合人类需求的输出此外2020年6月OpenAI开始对外提供接入GPT-3服务的API并按照模型类型进行收费开启商业探索第一步ChatGPT阶段各大互联网厂商争相推出类似产品2022年11月基于InstructGPTOpenAI发布了以对话方式交互的ChatGPTChatGPT训练方法与InstructionGPT基本相同区别仅在于在微调时基于InstructGPT而非GPT-3随着ChatGPT用户的增多OpenAI推出了按月订阅的ChatGPTPlus服务开启第二次商业尝试国内外互联网厂商纷纷跟进微软发布基于ChatGPT的新版Bing谷歌发布Bard对标ChatGPT百度宣布推出类ChatGPT应用文心一言京东推出智能人机对话平台ChatJD阿里宣布公司正在研发阿里版ChatGPT网易有道和360也表示推出类ChatGPT应用风险提示宏观经济波动下游需求不及预期本报告内容均基于客观信息整理不构成投资建议免责声明和披露以及分析师声明是报告的一部分请务必一起阅读1计算机正文目录ChatGPT三个阶段打造智能对话交互式AI模型3GPT-1阶段开启生成式预训练模型时代4GPT-1在Transformer架构基础上引入微调训练4GPT-2阶段无监督训练替代有监督训练5GPT-2取消微调用更大参数和数据集进行zero-shot学习5OpenAI得到微软注资关注技术滥用问题6GPT-3阶段性能不断突破开启商业探索7GPT-3模型参数达1750亿few-shot进一步提高性能7对外提供GPT-3API开启商业模式探索8CodeX基于GPT-3的代码生成工具9InstructGPT人类反馈强化学习技术加持下的最强GPT-310ChatGPT阶段各大互联网厂商争相推出类似产品12ChatGPT以对话方式交互的进化版InstructGPT12ChatGPTPlus商业模式二次探索13微软继续加注OpenAI推出基于ChatGPT的新版Bing13各大互联网厂商均表示将推出类ChatGPT产品14风险提示14免责声明和披露以及分析师声明是报告的一部分请务必一起阅读2计算机ChatGPT三个阶段打造智能对话交互式AI模型ChatGPT从诞生到现在经历了三个大版本阶段的演进1GPT-1阶段2018年6月OpenAI发表论文ImprovingLanguageUnderstandingbyGenerativePre-Training标志着GPT-1的诞生论文首次提出生成式预训练概念基于Transformer架构的解码器搭建训练模型训练过程包括预训练和微调两个阶段模型参数量为117亿2GPT-2阶段2019年2月论文LanguageModelsareUnsupervisedMultitaskLearners发布GPT-2诞生GPT-2取消了GPT-1中的有监督微调阶段将其变成了无监督的模型采用更大的参数和多任务multitask学习进行预训练提高了模型面对未知任务时的推理能力zero-shot零次学习GPT-2-训练参数量为15亿3GPT-3阶段2020年5月OpenAI发表论文LanguageModelsareFew-ShotLearners提出GPT-3模型GPT-2模型中的zero-shot在某些任务上性能不及预期因此OpenAI在GPT-3中提出了few-shot少量10-100个样本学习提高了模型的表现性能在模型参数量上从GPT-2的15亿提升到1750亿2021年8月OpenAI推出基于GPT-3的通用编程模型Codex可以将自然语言转换翻译解释和重构为代码2022年3月OpenAI将基于人类反馈的强化学习RLHF技术引入GPT-3通过奖励reward机制进一步训练模型提高模型性能和准确度InstructGPT诞生InstructGPT训练参数量仅13亿与GPT-3的1750亿相比大大减少能给出更符合人类思维的输出结果4ChatGPT阶段2022年11月OpenAI正式推出了对话交互式的ChatGPT本质上ChatGPT和InstructionGPT为同代产品只是在InstructGPT的基础上增加了聊天功能同时向公众开放使用产生更多有效标注数据ChatGPT上线5天便突破100万用户目前微软已整合ChatGPT推出新版浏览器EDGE和搜索引擎Bing谷歌也发布了对标产品Bard此外国内厂商如百度京东阿里等也宣布进军ChatGPT行业图表1从GPT-1到ChatGPT演进路线20186-2019220192-2020720207-202211202211-GPT-1GPT-2GPT-3ChatGPTGPT-1GPT-2GPT-3CodexInstructGPTchatGPT2018620192202052021820223202211117亿15亿1750亿120亿13亿20亿主线参数量微软投资10亿美元提供GPT-3API对GPT-3进行微调发布GPT-3和Codex新版更新了2021年提出第一次商业探索以改善模型本支持编辑内容或将内的embedding在文本先后发布参数为124M容插入现有文本搜索代码搜索和355M774M的小中基于GPT-2架构开发人员现可以根据句子相似性任务上大模型证明语言模型在图自己的数据对通过为个不GPT-3CodexAPI70性能更好像补全和采样上同进行微调同应用程序提供各种用例对774M参数GPT-2语样有不错的效果支持OpenAI和微软扩大言模型进行了微调训练像人类一GPT-3合作伙伴关系向微软提供GPT-3样使用基于文本的web训练评论写作模型支线发布参数大小为15B探讨协助人类监督的ChatGPTPlus服务的模型许可可用于微软浏览器并通过训练AIAI产品和服务奖励模型提高准确性应用前景推出售价20美元和有用性月是又一次商业超个应用程序300探索接入GPT-3的API在API中引入文本和代平均每天生成45亿码embedding将文微软整合ChatGPT单词本等内容转变创数字推出新版Bing序列资料来源OpenAI官网arxiv论文华泰研究我们将对GPT的每个发展阶段进行详细复盘和模型拆解对技术和理念进行溯源免责声明和披露以及分析师声明是报告的一部分请务必一起阅读3计算机GPT-1阶段开启生成式预训练模型时代GPT-1在Transformer架构基础上引入微调训练GPT-1仅保留了Transformer架构的解码器部分从架构上看GPT-1基于Transformer架构但是仅保留了架构中的解码器部分其中解码器共有12层layer整个模型相比Transformer更加简单训练速度更快GPT-1更擅长自然语言处理生成类任务图表2GPT-1的架构Transformer架构GPT-1架构文本预测文本分类TextTaskPredictionClassifierLayerNorm归一化层FeedForward前馈神经网络12LayerNorm归一化层带掩模MaskedMulti自注意力层SelfAttentionTextPositionEmbed文本位置向量矩阵资料来源ImprovingLanguageUnderstandingbyGenerativePre-Training华泰研究GPT-1的训练过程包括预训练和微调两个阶段1第一阶段采用多层Transformer模型的解码器Decoder为语言模型进行基于大文本语料库的高容量无监督学习2第二阶段在做下游任务时当输入的问题具有结构化特征例如有序的句子对或文档问题和答案的三元组首先将不同类的问题转换为不同的输入形式再针对不同任务采用不同数据集进行微调训练GPT-1训练的参数量为117亿预训练阶段采用BooksCorpus数据集该数据集包括7000多本来自风格不同的未出版书籍内含长段的连续文本微调阶段则根据不同任务类型选择数据集训练结果上看GPT-1在常识推理问题回答文本蕴涵等任务上分别比对比方法进步了8957和15图表3GPT-1架构以及用于微调不同任务的输入转换模块ClassificationStartTextExtractTransformerLinear分类任务EntailmentStartPremiseDelimHypothesisExtractTransformerLinear推理任务StartText1DelimText2ExtractTransformerSimilarityLinear相似性任务StartText2DelimText1ExtractTransformerStartContextDelimAnswer1ExtractTransformerLinearMultipleChoiceStartContextDelimAnswer2ExtractTransformerLinear问答任务StartContextDelimAnswerNExtractTransformerLinear资料来源ImprovingLanguageUnderstandingbyGenerativePre-Training华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读4计算机GPT-2阶段无监督训练替代有监督训练GPT-2取消微调用更大参数和数据集进行zero-shot学习GPT-2用更大的训练集尝试zero-shot学习有监督的NLP模型如GPT-1能取得不错的效果原因在于其针对单个特定任务使用大量有标注数据进行训练当任务目标分布发生变化时则可能会失效即模型的泛化能力不够强GPT-2希望通过海量数据和庞大的模型参数训练出更为通用的模型无需经过特定的数据集训练也能解决各类问题即zero-shotlearning零次学习提高模型的泛化能力为了达到这一目的GPT-2采用了涵盖800万网页40GB大小的数据集WebText进行预训练并将模型参数量最大提升到15亿模型层数从GPT-1的12提升为48图表4zero-shot学习示意图所见类别数据属性特征斑马特征描述斑马预测器这是斑马资料来源CSDN华泰研究GPT-2在架构上与GPT-1基本保持相同在处理下游问题时取消了微调架构上GPT-2的结构类似于GPT-1模型仍然使用单向的Transformer模型只做了局部修改将归一化层移到输入位置在最后一个自注意力块之后加了一层归一化等训练步骤上预训练阶段与GPT-1方法基本相同使用了更大参数的Transformer以及覆盖范围广质量更高的数据集WebText采用多任务学习保证训练出的模型有更好的通用性在具体处理下游任务时GPT-2放弃任何训练和微调尝试zero-shot学习在这种情况下为了使模型能识别任务的具体目标GPT-2使用一种新的输入形态增加prompt文本提示例如翻译训练示例可以写成序列翻译成法语英语文本法语文本阅读理解训练示例可以写成回答问题文档问题答案在WebText数据集下随着GPT-2模型参数规模的扩大其zero-shot学习能力更强且优于部分已有模型图表5GPT-2解决zero-shot任务能力随着参数规模增加而提高阅读理解翻译摘要问题回答资料来源LanguageModelsareUnsupervisedMultitaskLearners华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读5计算机图表6GPT-2与GPT-1架构对比GPT-1架构GPT-2架构文本预测文本分类文本预测文本分类TextTaskTextTaskPredictionClassifierPredictionClassifierLayerNorm归一化层LayerNorm归一化层TransformerFeedForward前馈神经网络12FeedForward前馈神经网络LayerNorm归一化层LayerNorm归一化层12带掩模MaskedMulti自注意力层SelfAttentionMaskedMulti带掩模SelfAttention自注意力层TextPositionEmbedLayerNorm文本位置向量矩阵归一化层TextPositionEmbed文本位置向量矩阵资料来源LanguageModelsareUnsupervisedMultitaskLearners华泰研究GPT-2在多个下游任务中表现出色例如在8种语言模型任务中仅通过zero-shot学习GPT-2在7种任务中超过了最优水平在儿童图书测试的命名实体识别任务中超过最优水平7在文本长期依赖性建模能力测试数据集LAMBADA上GPT-2将困惑度从998降到了86在阅读理解任务中GPT-2超过了3个基线模型在法译英任务中GPT-2在zero-shot学习的基础上超过了大多数的无监督方法略逊于有监督的方法在文本总结任务中的效果接近有监督的模型OpenAI得到微软注资关注技术滥用问题微软向OpenAI投资10亿美元并提供独家云支持2019年7月微软向OpenAI投资10亿美元帮助OpenAI构建人工通用智能AGI此外微软作为OpenAI的独家云提供商与OpenAI合作开发MicrosoftAzure中的软硬件平台并考虑将其扩展到AGI以及共同开发新的AzureAI超级计算技术OpenAI出于对技术滥用问题的考虑分阶段发布GPT-2完整版OpenAI出于对技术滥用问题的考虑在GPT-2诞生后并未发布完整版的训练模型2019年2月OpenAI发布了124M参数的小型GPT-2模型5月发布355M参数的中型GPT-2模型8月发布774亿参数的GPT-2模型直到2019年11月作为GPT-2分阶段发布的最终模型版本OpenAI发布了15亿参数GPT-2以及代码和模型权重在此过程中OpenAI还使用各种任务的人类反馈对774M参数GPT-2语言模型进行了微调提高了模型在部分任务上的表现免责声明和披露以及分析师声明是报告的一部分请务必一起阅读6计算机GPT-3阶段性能不断突破开启商业探索GPT-3模型参数达1750亿few-shot进一步提高性能Few-shot取代zero-shot训练效果得到进一步加强GPT-2模型中在下游训练时采用zero-shot理念在执行各类子任务时不给任何样例属于较为极端的情况虽然在GPT-2在某些测试中取得了不错的效果但在一些任务上结果不达预期因此OpenAI引入了few-shot即对于特定任务仅给予少量的样例10-100个和GPT-2一样不做微调处理仅通过与模型的文本交互来指定任务和few-shot从多种训练基准训练结果看few-shot能够取得比zero-shot更好的准确度结果图表7Zero-shotone-shot和few-shot随着模型参数增加准确度越来越高注图中为多种训练基准综合的结果资料来源LanguageModelsareFew-ShotLearners华泰研究GPT-3架构基本不变最大训练参数达1750亿GPT-2模型已经验证在大参数和大数据集预训练模型后即使采用zero-shot也能取得较好的训练效果因此GPT-3延续这一思想采用了8种不同大小的训练模型最小参数量为125亿最大为1750亿在架构上GPT-3与GPT-2基本保持一致将Transformer从48层提升到96层图表8GPT-3的8种不同大小模型的参数模型名称参数量批量大小学习率资料来源LanguageModelsareFew-ShotLearners华泰研究GPT-3训练数据集为多种数据集的混合数据集以CommonCrawl为基础其大小为45TB但CommonCrawl数据集的质量低于更精确的数据集为了保证数据集质量一方面对CommonCrawl进行过滤大小压缩到570GB另一方面增加了质量更高的数据集如WebText2Wikipedia等在训练期间数据集的采样不与其大小成比例而是质量更高的数据集采样频率更高因此CommonCrawl和Books2数据集在训练期间采样次数少于一次其他更高质量的数据集采样次数为2-3次以换取更高质量的训练数据免责声明和披露以及分析师声明是报告的一部分请务必一起阅读7计算机图表9GPT-3训练数据集组合数量在训练组合每3000亿tokens经历的数据集tokens中的权重epochs资料来源LanguageModelsareFew-ShotLearners华泰研究在大训练参数few-shot的加持下GPT-3准确性得到极大提高从训练结果准确度来看对于GPT-3模型当模型参数量较低时如13亿随着few-shot样例的增加准确度提升并不明显但是当模型参数大小达到1750亿时few-shot样例的增加会带来准确度较为明显的提升在大训练参数和few-shot的加持下GPT-3准确性提高明显图表10大参数few-shot大幅提高GPT-3准确度资料来源LanguageModelsareFew-ShotLearners华泰研究对外提供GPT-3API开启商业模式探索OpenAI发布API开启首次商业尝试并授权给微软2020年6月OpenAI开始对外提供能够接入GPT-3服务的API并提供通用的文本输入文本输出界面支持英语任务其他厂商可以请求访问并将API集成到产品中按不同模型类型收费API的优势在于1GPT-3模型庞大需要大量的专业知识来开发和部署运行成本非常高API能让小型企业和组织更容易实现访问2API模型便于控制下游应用防止技术滥用2020年9月OpenAI将GPT-3授权给微软微软可以将其用于自己的产品和服务同时不会影响其他应用通过API继续访问GPT-3模型截至2021年5月共有超过300个应用程序通过API提供GPT-3支持的搜索对话文本完成和其他高级AI功能图表11OpenAIAPI价格模型类型细分价格美元模型类型细分训练价格美元使用价格美元图像模型1024x1024002张微调模型Ada00004千字符00016千字符512x5120018张Babbage00006千字符00024千字符256x2560016张Curie00030千字符00120千字符语言模型Ada00004千字符Davinci00300千字符01200千字符Babbage00005千字符Curie00020千字符模型类型细分价格美元Davinci00200千字符嵌入模型Ada00004千字符资料来源OpenAI官网华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读8计算机CodeX基于GPT-3的代码生成工具Codex是基于GPT-3在代码生成上的应用2021年8月OpenAI发布Codex通用代码生成模型能够将自然语言转换为代码Codex是GitHubCopilot的主要构建块支持PythonJavaScriptGoPerlPHPRubySwift和TypeScript等十几种编程语言Codex可以通过OpenAIAPI使用在初始阶段提供免费服务图表12Codex代码生成界面资料来源OpenAI官网华泰研究Codex代码生成能力显著优于GPT-3Codex的训练数据包含自然语言和来自公共数据源中的数十亿行源代码其中包括GitHub库中的公开代码Codex拥有14KB的Python代码内存而GPT-3只有4KB这就使得它在执行任务的过程中可以涵盖三倍于GPT-3的上下文信息Codex的最大版本拥有120亿参数准确率达到了7231图表13120亿参数的Codex准确率可达7231资料来源EvaluatingLargeLanguageModelsTrainedonCode华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读9计算机InstructGPT人类反馈强化学习技术加持下的最强GPT-3InstructGPT在GPT-3的基础上引入基于人类反馈的强化学习RLHF技术强化学习通过奖励Reward机制来指导模型训练奖励机制可以视为传统模训练机制的损失函数奖励的计算要比损失函数更灵活和多样例如AlphaGO的奖励是对局的胜负代价是奖励计算不可导不能直接拿来做反向传播强化学习的思路是通过对奖励的大量采样来拟合损失函数从而实现模型的训练类似的人类反馈也不可导也可以作为强化学习的奖励从而产生基于人工反馈的强化学习图表14人工反馈的强化学习的基本原理人类奖励预测反馈预测的奖励观察强化学习算法环境行动资料来源CSDN华泰研究InstructGPT的训练流程包括有监督微调奖励模型训练和强化学习架构上InstructGPT与GPT-3基本相同训练过程包括1利用人类的标注数据demonstrationdata对GPT-3进行有监督训练首先OpenAI设计了包含大量提示样本的promptdataset给出了不同类的任务描述其次委托标注团队对promptdataset进行标注本质就是人工回答问题最后用标注过的数据集微调GPT-3得到SFT模型监督微调该模型具备了最基本的预测能力2通过RLHF的思路训练奖励模型RM首先用SFT模型去回答promptdataset某个问题通过收集4个不同的SFT输出获取4个回答其次利用人工对4个回答的好坏进行标注和排序排序的结果用来训练奖励模型RM让RM模型理解人类偏好3通过训练好的RM模型和PPO算法优化SFT模型策略再次让SFT模型去回答promptdataset某个问题通过近端策略优化ProximalPolicyOptimizationPPO算法产生输出然后不再借助人工评估结果好坏而是利用阶段2训练的RM模型去对SFT模型的预测结果进行打分排序即用AI训练AI该阶段可以循环多次通过以上步骤训练出的结果一方面能够尽可能地对齐AlignmentGPT的输出与对用户友好的语言逻辑微调出用户友好型GPT另一方面人工反馈的引入帮助模型更好的理解人类思维和意图训练结果更符合人类的需求免责声明和披露以及分析师声明是报告的一部分请务必一起阅读10计算机图表15InstructGPT训练步骤第一步第二步第三步收集描述性数据并训练一个有监督收集比较性数据并训练一个奖励用PPO强化学习算法通过奖励模型优的策略模型化策略从数据库从数据库中从prompt数据promptprompt中取样并得到向一个6岁智力的模型解释强另外取样库中取样化学习示例写一段关于的故事向一个6岁智力的模型数个模型的回答解释强化学习AB回答A回答BCD由人类训练师回答CPPO撰写期望的输回答D出值对行为给出奖励与惩罚由人类训练师对策略给出回答示例很久以前回答进行排序DCAB收集的数据用奖励模型对回答打来以监督学习分RM的方式微调收集的数据用来GPT-3模型训练我们的奖励用奖励通过PPO算模型DCAB法优化策略资料来源Traininglanguagemodelstofollowinstructionswithhumanfeedback华泰研究训练参数与GPT-3相比降低了超100倍InstructGPT训练参数最大为13亿与GPT-3的1750亿相比减少了100倍之多且InstructGPT输出的训练结果更符合人类的要求InstructGPT证明了对人类反馈进行微调是使语言模型与人类意图保持一致的重要发展方向且基于RLHF的训练方法能够大大减少对模型参数量的要求提高训练速度降低训练成本此外由于InstructGPT是在GPT-3基础上做的微调且涉及了人工标注数据集总量并不大总计77K其中涉及人工的为46K图表16InstructGPT的结果更受用户欢迎资料来源OpenAI官网华泰研究图表17InstructGPT训练数据集情况大小代表prompt提示次数SFT数据RM数据PPO数据分离来源大小分离来源大小分离来源大小资料来源Traininglanguagemodelstofollowinstructionswithhumanfeedback华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读11计算机ChatGPT阶段各大互联网厂商争相推出类似产品ChatGPT以对话方式交互的进化版InstructGPTChatGPT模型能够以对话方式进行交互对话方式使ChatGPT能够回答后续问题承认错误质疑不正确的前提和拒绝不适当的请求ChatGPT同样基于RLHF理念从训练步骤上看ChatGPT训练方法与InstructionGPT基本相同区别仅在于在第一步利用人类标注数据进行有监督训练时InstructGPT基于GPT-3而ChatGPT基于InstructGPT图表18ChatGPT训练过程第一步第二步第三步收集描述性数据并训练一个有监收集比较性数据并训练一个奖励用PPO强化学习算法通过奖励模型督的策略模型优化策略从数据库从数据库中从prompt数据promptprompt中取样并得到向一个6岁智力的模型解释强另外取样库中取样示例写一段关于的故事向一个6岁智力的模型数个模型的回答化学习解释强化学习AB回答A回答B由有监督的策略初CD始化PPO模型由人类训练师回答CPPO撰写期望的输回答D出值对行为给出奖励与惩罚由人类训练师对策略给出回答示例很久以前回答进行排序DCAB收集的数据用奖励模型对回答打来以监督学习分RM的方式微调收集的数据用来GPT-35模型训练我们的奖励用奖励通过PPO算模型DCAB法优化策略资料来源OpenAI官网华泰研究图表19ChatGPT使用界面资料来源OpenAI官网华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读12计算机ChatGPTPlus商业模式二次探索OpenAI推出ChatGPTPlus服务支持按月订阅随着ChatGPT用户数激增当网站负荷过高时普通用户可能存在无法访问的情况且ChatGPT响应速度会受影响ChatGPT推出了Plus会员服务收费标准为20美元月Plus用户可以享受1当网站负荷过高时有优先访问权2ChatGPT响应速度更快3能第一时间体验新版功能这是OpenAI继推出API后第二次在商业模式上的探索我们认为技术变现是推动技术进步的重要方式随着OpenAI推出的模型参数量复杂度增加单次训练成本不断提高OpenAI通过探索技术的商业变现模式能够更好的支持其技术发展未来或将推出更多的付费服务图表20ChatGPTPlus服务服务负载低时可用服务高负载可用标准响应速度更快的响应速度定期模型更新优先体验新特性资料来源OpenAI官网华泰研究微软继续加注OpenAI推出基于ChatGPT的新版Bing微软继续对OpenAI投资100亿美元并扩大技术应用2023年1月23日微软以290亿美元的估值继续向OpenAI投资约100亿美元获得OpenAI49的股权微软将OpenAI的技术融入其大部分软件中例如微软在其Azure云中推出了一套OpenAI工具和服务允许Azure客户访问OpenAI的GPT和DALL-E工具在搜索引擎Bing中发布了图像生成器以及新的Designer图形设计工具由OpenAIDALL-E提供支持PowerApps软件中支持GPT-3的工具发布基于OpenAI的Codex模型的代码建议工具GitHubCopilot等此外微软正在准备将OpenAI的语言AI技术引入WordPowerPoint和Outlook等应用程序未来微软或将增加对专业超级计算系统部署的投资以加速OpenAI研究进度发布基于ChatGPT的新版Bing2023年2月8日微软发布基于ChatGPT的新版EDGEl浏览器和Bing搜索引擎这是是微软与OpenAI技术最新结合的产品在提供传统搜索内容的同时用户可以与搜索引擎进行对话交流获得更全面的答案图表21集成ChatGPT的Bing资料来源微软官网华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读13计算机各大互联网厂商均表示将推出类ChatGPT产品谷歌发布ChatGPT对标竞品BardBard由谷歌的大型语言模型LaMDA对话应用语言模型提供支持LaMDALanguageModelforDialogueApplications是谷歌于2021年5月的GoogleIO大会上提出的人工智能系统对话应用语言模型具有1370亿参数略少于GPT-3远多于13亿参数的InstructGPTLaMDA可以利用外部知识源专注于生成对话类似ChatGPT其目的不是提供信息搜索而是通过对自然语言问题的回答来帮助用户解决问题图表22谷歌Bard回答问题示例资料来源谷歌官网华泰研究国内互联网厂商纷纷推出类ChatGPT产品2023年2月7日百度宣布推出类ChatGPT应用自然语言处理大模型新项目文心一言预计三月份面向公众开放2月10日京东云旗下言犀人工智能应用平台宣布将推出产业版ChatGPT智能人机对话平台ChatJD预计参数量达千亿级聚焦零售金融两个垂直行业领域2月8日阿里巴巴宣布公司正在研发阿里版ChatGPT目前处于内测阶段同日网易有道宣布公司未来或将推出ChatGPT同源技术产品应用场景围绕在线教育360也表示正计划尽快推出类ChatGPT技术的试用版本应用图表23提及公司列表公司代码公司简称MSFTUS微软GOOGLUS谷歌未上市OpenAIBIDUUS百度JDUS京东BABAUS阿里巴巴9999HK网易601360CH360资料来源Bloomberg华泰研究风险提示宏观经济波动若宏观经济波动产业变革及新技术的落地节奏或将受到影响宏观经济波动还可能对IT投资产生负面影响从而导致整体行业增长不及预期下游需求不及预期若下游数字化需求不及预期相关的数字化投入增长或慢于预期致使行业增长不及预期本报告内容均基于客观信息整理不构成投资建议免责声明和披露以及分析师声明是报告的一部分请务必一起阅读14计算机免责声明分析师声明本人谢春生兹证明本报告所表达的观点准确地反映了分析师对标的证券或发行人的个人意见彼以往现在或未来并无就其研究报告所提供的具体建议或所表迖的意见直接或间接收取任何报酬一般声明及披露本报告由华泰证券股份有限公司已具备中国证监会批准的证券投资咨询业务资格以下简称本公司制作本报告所载资料是仅供接收人的严格保密资料本报告仅供本公司及其客户和其关联机构使用本公司不因接收人收到本报告而视其为客户本报告基于本公司认为可靠的已公开的信息编制但本公司及其关联机构以下统称为华泰对该等信息的准确性及完整性不作任何保证本报告所载的意见评估及预测仅反映报告发布当日的观点和判断在不同时期华泰可能会发出与本报告所载意见评估及预测不一致的研究报告同时本报告所指的证券或投资标的的价格价值及投资收入可能会波动以往表现并不能指引未来未来回报并不能得到保证并存在损失本金的可能华泰不保证本报告所含信息保持在最新状态华泰对本报告所含信息可在不发出通知的情形下做出修改投资者应当自行关注相应的更新或修改本公司不是FINRA的注册会员其研究分析师亦没有注册为FINRA的研究分析师不具有FINRA分析师的注册资格华泰力求报告内容客观公正但本报告所载的观点结论和建议仅供参考不构成购买或出售所述证券的要约或招揽该等观点建议并未考虑到个别投资者的具体投资目的财务状况以及特定需求在任何时候均不构成对客户私人投资建议投资者应当充分考虑自身特定状况并完整理解和使用本报告内容不应视本报告为做出投资决策的唯一因素对依据或者使用本报告所造成的一切后果华泰及作者均不承担任何法律责任任何形式的分享证券投资收益或者分担证券投资损失的书面或口头承诺均为无效除非另行说明本报告中所引用的关于业绩的数据代表过往表现过往的业绩表现不应作为日后回报的预示华泰不承诺也不保证任何预示的回报会得以实现分析中所做的预测可能是基于相应的假设任何假设的变化可能会显著影响所预测的回报华泰及作者在自身所知情的范围内与本报告所指的证券或投资标的不存在法律禁止的利害关系在法律许可的情况下华泰可能会持有报告中提到的公司所发行的证券头寸并进行交易为该公司提供投资银行财务顾问或者金融产品等相关服务或向该公司招揽业务华泰的销售人员交易人员或其他专业人士可能会依据不同假设和标准采用不同的分析方法而口头或书面发表与本报告意见及建议不一致的市场评论和或交易观点华泰没有将此意见及建议向报告所有接收者进行更新的义务华泰的资产管理部门自营部门以及其他投资业务部门可能独立做出与本报告中的意见或建议不一致的投资决策投资者应当考虑到华泰及或其相关人员可能存在影响本报告观点客观性的潜在利益冲突投资者请勿将本报告视为投资或其他决定的唯一信赖依据有关该方面的具体披露请参照本报告尾部本报告并非意图发送发布给在当地法律或监管规则下不允许向其发送发布的机构或人员也并非意图发送发布给因可得到使用本报告的行为而使华泰违反或受制于当地法律或监管规则的机构或人员本报告版权仅为本公司所有未经本公司书面许可任何机构或个人不得以翻版复制发表引用或再次分发他人无论整份或部分等任何形式侵犯本公司版权如征得本公司同意进行引用刊发的需在允许的范围内使用并需在使用前获取独立的法律意见以确定该引用刊发符合当地适用法规的要求同时注明出处为华泰证券研究所且不得对本报告进行任何有悖原意的引用删节和修改本公司保留追究相关责任的权利所有本报告中使用的商标服务标记及标记均为本公司的商标服务标记及标记中国香港本报告由华泰证券股份有限公司制作在香港由华泰金融控股香港有限公司向符合证券及期货条例及其附属法律规定的机构投资者和专业投资者的客户进行分发华泰金融控股香港有限公司受香港证券及期货事务监察委员会监管是华泰国际金融控股有限公司的全资子公司后者为华泰证券股份有限公司的全资子公司在香港获得本报告的人员若有任何有关本报告的问题请与华泰金融控股香港有限公司联系免责声明和披露以及分析师声明是报告的一部分请务必一起阅读15计算机香港-重要监管披露华泰金融控股香港有限公司的雇员或其关联人士没有担任本报告中提及的公司或发行人的高级人员有关重要的披露信息请参华泰金融控股香港有限公司的网页httpswwwhtsccomhkstockdisclosure其他信息请参见下方美国-重要监管披露美国在美国本报告由华泰证券美国有限公司向符合美国监管规定的机构投资者进行发表与分发华泰证券美国有限公司是美国注册经纪商和美国金融业监管局FINRA的注册会员对于其在美国分发的研究报告华泰证券美国有限公司根据1934年证券交易法修订版第15a-6条规定以及美国证券交易委员会人员解释对本研究报告内容负责华泰证券美国有限公司联营公司的分析师不具有美国金融监管FINRA分析师的注册资格可能不属于华泰证券美国有限公司的关联人员因此可能不受FINRA关于分析师与标的公司沟通公开露面和所持交易证券的限制华泰证券美国有限公司是华泰国际金融控股有限公司的全资子公司后者为华泰证券股份有限公司的全资子公司任何直接从华泰证券美国有限公司收到此报告并希望就本报告所述任何证券进行交易的人士应通过华泰证券美国有限公司进行交易美国-重要监管披露分析师谢春生本人及相关人士并不担任本报告所提及的标的证券或发行人的高级人员董事或顾问分析师及相关人士与本报告所提及的标的证券或发行人并无任何相关财务利益本披露中所提及的相关人士包括FINRA定义下分析师的家庭成员分析师根据华泰证券的整体收入和盈利能力获得薪酬包括源自公司投资银行业务的收入华泰证券股份有限公司其子公司和或其联营公司及或不时会以自身或代理形式向客户出售及购买华泰证券研究所覆盖公司的证券衍生工具包括股票及债券包括衍生品华泰证券研究所覆盖公司的证券衍生工具包括股票及债券包括衍生品华泰证券股份有限公司其子公司和或其联营公司及或其高级管理层董事和雇员可能会持有本报告中所提到的任何证券或任何相关投资头寸并可能不时进行增持或减持该证券或投资因此投资者应该意识到可能存在利益冲突评级说明投资评级基于分析师对报告发布日后6至12个月内行业或公司回报潜力含此期间的股息回报相对基准表现的预期A股市场基准为沪深300指数香港市场基准为恒生指数美国市场基准为标普500指数具体如下行业评级增持预计行业股票指数超越基准中性预计行业股票指数基本与基准持平减持预计行业股票指数明显弱于基准公司评级买入预计股价超越基准15以上增持预计股价超越基准515持有预计股价相对基准波动在-155之间卖出预计股价弱于基准15以上暂停评级已暂停评级目标价及预测以遵守适用法规及或公司政策无评级股票不在常规研究覆盖范围内投资者不应期待华泰提供该等证券及或公司相关的持续或补充信息免责声明和披露以及分析师声明是报告的一部分请务必一起阅读16计算机法律实体披露中国华泰证券股份有限公司具有中国证监会核准的证券投资咨询业务资格经营许可证编号为91320000704041011J香港华泰金融控股香港有限公司具有香港证监会核准的就证券提供意见业务资格经营许可证编号为AOK809美国华泰证券美国有限公司为美国金融业监管局FINRA成员具有在美国开展经纪交易商业务的资格经营业务许可编号为CRD298809SEC8-70231华泰证券股份有限公司南京北京南京市建邺区江东中路228号华泰证券广场1号楼邮政编码210019北京市西城区太平桥大街丰盛胡同28号太平洋保险大厦A座18层邮政编码100032电话862583389999传真862583387521电话861063211166传真861063211275电子邮件ht-rdhtsccom电子邮件ht-rdhtsccom深圳上海深圳市福田区益田路5999号基金大厦10楼邮政编码518017上海市浦东新区东方路18号保利广场E栋23楼邮政编码200120电话8675582493932传真8675582492062电话862128972098传真862128972068电子邮件ht-rdhtsccom电子邮件ht-rdhtsccom华泰金融控股香港有限公司香港中环皇后大道中99号中环中心58楼5808-12室电话852-3658-6000传真852-2169-0770电子邮件researchhtsccomhttpwwwhtsccomhk华泰证券美国有限公司美国纽约公园大道280号21楼东纽约10017电话212-763-8160传真917-725-9702电子邮件Huataihtsc-uscomhttpwwwhtsc-uscom版权所有2023年华泰证券股份有限公司免责声明和披露以及分析师声明是报告的一部分请务必一起阅读17
|
相关行业报告
|
||||||||||||||||||||||||||
