研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 华泰证券-计算机行业GPT产业复盘(2022):推出ChatGPT-230219
上传日期:   2023/2/19 大小:   2809KB
格式:   pdf  共19页 来源:   华泰证券
评级:   增持 作者:   谢春生
行业名称:   计算机
下载权限:   此报告为加密报告
溯源GPT发展:2022年ChatGPT面世,LLM里程碑式胜利
  梳理GPT系列模型的演进过程,可以看到2022年是GPT系列模型围绕GPT-3、GPT-3.5加速版本迭代的重要节点,2022年11月,ChatGPT成功面世,成为历史上用户增长最快的消费者应用。与Google、FaceBook等公司不同,OpenAI从初代模型GPT-1开始,始终贯彻只有解码器(Decoder-only)的技术路径,2018-2022年GPT系列模型几乎按照每年一代的速度,不断迭代升级。我们认为,2022年ChatGPT的成功,是OpenAI公司GPT系列模型的阶段性胜利,也是大语言模型LLM的里程碑式胜利,后续围绕LLM的技术升级、应用拓展有望加速开启,AI产业发展或将提速。
  ChatGPT:引入人类反馈,模型训练SFT、RM、PPO三步走
  ChatGPT、InstructGPT分别是基于GPT-3.5、GPT-3微调得到的新版本模型,其核心目标是实现模型输出与人类预期的需求对齐(alignment),人类反馈强化学习RLHF成为模型需求对齐的重要技术支持。ChatGPT、InstructGPT的模型训练主要包括三步:1)有监督微调SFT:通过指示学习对模型进行有监督微调;2)奖励模型RM训练:借助人工标注员对模型输出进行排序,反馈训练得到奖励模型,此步是人类反馈的重要体现;3)近段策略优化PPO强化学习:通过监督学习策略生成PPO模型,优化、迭代原有模型参数。总结来看,RLHF让模型输出更加符合用户预期。
  ChatGPTVSInstructGPT:核心是基础大模型的不同
  对比ChatGPT与InstructGPT的训练方法,可以发现,两者的训练方法基本一致,核心区别在于InstructGPT、ChatGPT分别基于GPT-3、GPT-3.5进行模型微调。与GPT-3相比,GPT-3.5增加了代码训练与指示微调:1)代码训练(Code-training):让GPT-3.5模型具备更好的代码生成与代码理解能力,同时间接拥有了复杂推理能力;2)指示微调(Instruction-tuning):让GPT-3.5模型具备更好的泛化能力,同时模型的生成结果更加符合人类的预期。作为基于GPT-3.5的模型微调产物,ChatGPT具备更好的问答能力,更加遵循人类的价值观。
  OpenAIVSGoogle:OpenAI贯彻Decoder-only路径,技术集大成者
  通过梳理Google与OpenAI在LLM领域的布局,可以看到,OpenAI具备两大突出特点:1)贯彻Decoder-only技术路线:从GPT-1到ChatGPT,OpenAI的LLM均采用Decoder-only架构,单一架构的持续深耕与模型参数的不断扩大,让OpenAI的GPT系列模型具备强大的学习能力与文本生成能力;2)技术集大成者:ChatGPT的发展不仅得益于GPT模型参数、训练数据的持续优化,也得益于各类LLM新技术的融会贯通,OpenAI博采众长,加速Instruction-tuning、RLHF、思维链等新技术在GPT系列模型中的深度应用,ChatGPT是现有技术的集大成者。
  风险提示:宏观经济波动;下游需求不及预期;本报告内容均基于客观信息整理,不构成投资建议。
  
研究报告全文:证券研究报告计算机GPT产业复盘2022推出ChatGPT华泰研究计算机增持维持2023年2月19日中国内地专题研究研究员谢春生溯源GPT发展2022年ChatGPT面世LLM里程碑式胜利SACNoS0570519080006xiechunshenghtsccomSFCNoBQZ938862129872036梳理GPT系列模型的演进过程可以看到2022年是GPT系列模型围绕GPT-3GPT-35加速版本迭代的重要节点2022年11月ChatGPT成联系人袁泽世PhD功面世成为历史上用户增长最快的消费者应用与GoogleFaceBookSACNoS0570122080053yuanzeshihtsccom等公司不同OpenAI从初代模型GPT-1开始始终贯彻只有解码器862128972228Decoder-only的技术路径2018-2022年GPT系列模型几乎按照每年一代的速度不断迭代升级我们认为2022年ChatGPT的成功是OpenAI行业走势图公司GPT系列模型的阶段性胜利也是大语言模型LLM的里程碑式胜利后续围绕LLM的技术升级应用拓展有望加速开启AI产业发展或将提速计算机沪深3003ChatGPT引入人类反馈模型训练SFTRMPPO三步走6ChatGPTInstructGPT分别是基于GPT-35GPT-3微调得到的新版本模型其核心目标是实现模型输出与人类预期的需求对齐alignment人类16反馈强化学习RLHF成为模型需求对齐的重要技术支持ChatGPT25InstructGPT的模型训练主要包括三步1有监督微调SFT通过指示学34习对模型进行有监督微调2奖励模型RM训练借助人工标注员对模型Feb-22Jun-22Oct-22Feb-23输出进行排序反馈训练得到奖励模型此步是人类反馈的重要体现3资料来源Wind华泰研究近段策略优化PPO强化学习通过监督学习策略生成PPO模型优化迭代原有模型参数总结来看RLHF让模型输出更加符合用户预期ChatGPTVSInstructGPT核心是基础大模型的不同对比ChatGPT与InstructGPT的训练方法可以发现两者的训练方法基本一致核心区别在于InstructGPTChatGPT分别基于GPT-3GPT-35进行模型微调与GPT-3相比GPT-35增加了代码训练与指示微调1代码训练Code-training让GPT-35模型具备更好的代码生成与代码理解能力同时间接拥有了复杂推理能力2指示微调Instruction-tuning让GPT-35模型具备更好的泛化能力同时模型的生成结果更加符合人类的预期作为基于GPT-35的模型微调产物ChatGPT具备更好的问答能力更加遵循人类的价值观OpenAIVSGoogleOpenAI贯彻Decoder-only路径技术集大成者通过梳理Google与OpenAI在LLM领域的布局可以看到OpenAI具备两大突出特点1贯彻Decoder-only技术路线从GPT-1到ChatGPTOpenAI的LLM均采用Decoder-only架构单一架构的持续深耕与模型参数的不断扩大让OpenAI的GPT系列模型具备强大的学习能力与文本生成能力2技术集大成者ChatGPT的发展不仅得益于GPT模型参数训练数据的持续优化也得益于各类LLM新技术的融会贯通OpenAI博采众长加速Instruction-tuningRLHF思维链等新技术在GPT系列模型中的深度应用ChatGPT是现有技术的集大成者风险提示宏观经济波动下游需求不及预期本报告内容均基于客观信息整理不构成投资建议免责声明和披露以及分析师声明是报告的一部分请务必一起阅读1计算机正文目录GPT发展之2022ChatGPT成功面世LLM里程碑式胜利3ChatGPTInstructGPT增加人类反馈强化学习RLHF4优化目标从提示学习到指示学习聚焦需求对齐alignment4训练过程三步走实现人工反馈强化学习5步骤一有监督微调SFT训练6步骤二奖励模型RewardModelRM训练8步骤三近端策略优化PPO强化学习9论文结论RLHF是GPT需求对齐的重要支撑10ChatGPTVSInstructGPT核心是基础大模型的不同11演化从GPT-3到GPT-35基础大模型能力再升级11对比增加代码训练与指示微调GPT-35具备三大优势12OpenAIVSGoogleOpenAI贯彻Decoder-only路径技术集大成者14特点一贯彻Decoder-only技术路径14特点二LLM相关技术集大成者14总结厚积薄发ChatGPT引发AI产业范式革命16风险提示16免责声明和披露以及分析师声明是报告的一部分请务必一起阅读2计算机GPT发展之2022ChatGPT成功面世LLM里程碑式胜利2022年是OpenAI公司GPT系列模型演进的重要节点2022年11月OpenAI发布生成式对话机器人ChatGPT上线仅2个月月活用户数已突破1亿成为历史上用户增长最快的消费者应用回顾大语言模型LargeLanguageModelLLM的发展历史可以发现与GoogleFaceBook等公司不同OpenAI从GPT-1开始始终贯彻Decoder-only的技术路径2018-2022年GPT系列模型几乎按照每年一代的速度不断升级迭代我们认为2022年ChatGPT的成功面世是LLM里程碑式的胜利未来围绕LLM的技术升级应用拓展有望加速开启2022年OpenAI加速GPT模型的版本迭代ChatGPT融合多技术优势通过梳理GPT系列模型的演进过程可以看到2022年是GPT系列模型围绕GPT-3GPT-35加速版本迭代的年份2022年3月基于GPT-3微调的InstructGPT发布验证了人类反馈强化学习RLHF对模型输出对齐alignment的重要作用2022年4-6月基于CodexInstructGPTOpenAI加速迭代形成GPT-35模型2022年11月基于GPT-35微调的ChatGPT发布成为Instruction-tuningRLHF思维链等LLM相关技术的集大成者我们认为ChatGPT是OpenAI基于GPT系列模型的阶段性成果未来随底层大模型的持续拓展AI产业发展或将提速图表12017-2022年基于Transformer的LLM梳理及2022年GPT模型的版本迭代资料来源OpenAI官网Google官网CSDN华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读3计算机ChatGPTInstructGPT增加人类反馈强化学习RLHF优化目标从提示学习到指示学习聚焦需求对齐alignment从模型微调到提示学习再到指示学习GPT模型零次学习能力不断提升2022年论文FinetunedLanguageModelsAreZero-ShotLearners提出指示学习Instruction-tuning思想以提升模型的零次学习能力对比来看1模型微调Fine-tuning以GPT-1为代表需要大量的微调数据集样本特定模型解决特定任务2提示学习Prompt-learning以GPT-3为代表需要少量的微调数据样本模型小样本学习few-shotLearning能力更强3指示学习Instruction-learning以FLANInstructGPTChatGPT为代表模型通过下游多类型任务的指示微调零次学习zero-shotLearning能力更强同时提示学习与指示学习均为一个模型解决多类任务图表2模型微调Fine-tuning提示学习Prompt-learning指示学习Instruction-tuning对比资料来源FinetunedLanguageModelsareZero-shotLearnersJasonWei2022华泰研究聚焦模型输出与人类需求对齐引入人类反馈强化学习GPT系列模型发展至GPT-3已经在翻译问答摘要等任务上取得了良好的性能研究者开始更加关注模型生成内容的有用性Helpful真实性Honest无害性Harmless希望实现模型输出内容与人类偏好内容的需求对齐alignment为提升模型的3H特性从InstructGPT开始InstructGPTChatGPT均引入人类反馈强化学习ReinforcementLearningfromHumanFeedbackRLHF实现基于人类反馈的模型微调让模型输出更符合人类期待图表3InstructGPT的3H优化目标资料来源TraininglanguagemodelstofollowinstructionswithhumanfeedbackLongOuyang2022华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读4计算机人类反馈可作为强化学习的奖励通过引入语言模型微调可使模型输出与人类需求对齐从技术原理来看强化学习通过奖励Reward机制来指导模型训练奖励机制可视为传统训练机制的损失函数同时奖励的计算要比损失函数更灵活多样例如AlphaGO的奖励是对局的胜负代价是奖励计算不可导不能直接用来做反向传播强化学习的思路是通过对奖励的大量采样来拟合损失函数从而实现模型的训练类似的人类反馈也不可导也可以作为强化学习的奖励从而产生基于人类反馈的强化学习图表4人类反馈强化学习RLHF基本原理资料来源DeepReinforcementLearningfromHumanPreferencesPaulFChristiano2017华泰研究训练过程三步走实现人工反馈强化学习ChatGPT与InstructGPT的训练方法基本一致了解ChatGPT与InstructGPT的优化目标之后我们需要进一步梳理模型的具体训练过程对比论文Traininglanguagemodelstofollowinstructionswithhumanfeedback2022中的InstructGPT训练方法与OpenAI官方发布的ChatGPT训练方法我们看到ChatGPT与InstructGPT的训练方法基本一致区别在于InstructGPTChatGPT分别基于GPT-3GPT-35进行模型微调考虑到ChatGPT尚未有官方论文发布我们以InstructGPT论文为基准对InstructGPT的训练过程进行了详细梳理具体可分为有监督微调奖励模型训练PPO强化学习三个步骤图表5ChatGPT与InstructGPT的训练方法基本一致注图中蓝色部分为InstructGPT训练示意粉色部分为ChatGPT训练示意资料来源OpenAI官网TraininglanguagemodelstofollowinstructionswithhumanfeedbackLongOuyang2022华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读5计算机步骤一有监督微调SFT训练使用人工标注数据对GPT-3进行有监督微调Supervisedfine-tuningSFT训练由于GPT-3是基于提示学习的生成模型因此SFT模型的数据集也是由提示-答复对组成的样本为实现模型从提示学习向指示学习跨越OpenAI采用人工编写多类别提示的方法对GPT-3模型进行有监督微调首先OpenAI委托标注员40人标注团队人工设计了包含三类内容简单任务few-shot任务基于用户需求的任务的提示样本promptdataset其次委托标注团队对promptdataset进行标注本质上是人工回答问题由此构成提示-答复对数据集最后用标注过的数据集微调GPT-3得到SFT模型图表6有监督微调SFT训练过程示意图资料来源IllustratingReinforcementLearningfromHumanFeedbackRLHFNathanLanmbert2022华泰研究SFT数据集数据量较小数据质量多样性更加重要根据InstructGPT论文中提供的数据显示SFT数据集一部分来自使用OpenAI的PlayGround的API用户另一部分来自OpenAI雇佣的40名标注员labeler其中训练数据大小仅约为13K来自标注员的数据约为113K来自API用户的数据约为14K考虑到InstructGPT是在GPT-3的基础上进行模型微调GPT-3已经具备较好的文本生成能力SFT数据集的质量多样性对于提升模型性能来说更为重要图表7有监督微调SFT数据集来源及大小资料来源TraininglanguagemodelstofollowinstructionswithhumanfeedbackLongOuyang2022华泰研究1数据多样性以InstructGPT论文披露的奖励模型RM数据集为例未披露SFT数据集任务分类占比RM数据集包括文本生成开放式问答头脑风暴对话改写摘要分类等10类任务任务类型多样且占比不同以RM数据集为推测依据SFT数据集作为初始种子数据集为提升模型的泛化能力通常具备更好的数据多样性免责声明和披露以及分析师声明是报告的一部分请务必一起阅读6计算机图表8奖励模型RM数据集分类占比分类其他封闭式问答改写3437总结摘要对话428头脑风暴11开放式问答文本生成1246资料来源TraininglanguagemodelstofollowinstructionswithhumanfeedbackLongOuyang2022华泰研究2数据质量作为初始的种子数据集SFT数据集大部分数据来自标注团队而非API数据采样因此SFT数据集具有更好的数据质量同时OpenAI在标注团队的人员组成上充分考虑了性别身份国籍年龄学历等因素的差异性图表9标注团队按性别分类图表10标注团队按国籍分类5其他55菲律宾654孟加拉5女美国445阿尔巴尼亚22加拿大5哥伦比亚印度男乌拉圭5017津巴布韦22巴西资料来源Traininglanguagemodelstofollowinstructionswithhuman资料来源TraininglanguagemodelstofollowinstructionswithhumanfeedbackLongOuyang2022华泰研究feedbackLongOuyang2022华泰研究图表11标注团队按年龄分类图表12标注团队按学历分类11硕士3711518-24高中1025-342635-4445-5455-6447大学53资料来源Traininglanguagemodelstofollowinstructionswithhuman资料来源TraininglanguagemodelstofollowinstructionswithhumanfeedbackLongOuyang2022华泰研究feedbackLongOuyang2022华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读7计算机步骤二奖励模型RewardModelRM训练通过RLHF的思路训练奖励模型这一阶段的主要目标在于借助标注员的人工反馈训练出更符合人类意愿的奖励模型为监督策略建立评价标准训练奖励模型的过程同样可以分为三步1任务采样抽样出一个prompt问题及SFT模型的k个输出结果2结2果排序标注员将这k个结果按质量好坏排序形成组训练数据对samplereward2pairs3RM训练使用组训练数据对samplerewardpairs训练奖励模型让奖励模型更加理解人类偏好图表13奖励模型RM训练过程示意图资料来源IllustratingReinforcementLearningfromHumanFeedbackRLHFNathanLanmbert2022华泰研究两两对比最大化更喜欢和更不喜欢的差值为了更加清晰地理解此轮步骤中排序和训练我们针对InstructGPT论文介绍的方法进行了更为通俗的解释针对一个Prompt任务SFT模型输出k个结果排序过程即对这k个结果进行两两对比并根据结2果的好坏进行排序为了让RM更好地学习人类偏好可先通过组分别计算loss损失函2数值再将组结果求和取均值损失函数的目标是最大化更喜欢的结果和更不喜欢的结果之间的差值通过loss函数的梯度回传RM模型逐渐学会给更喜欢的结果打高分给更不喜欢的结果打低分从而实现了人类偏好的模仿图表14Loss损失函数拆解资料来源TraininglanguagemodelstofollowinstructionswithhumanfeedbackLongOuyang2022华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读8计算机步骤三近端策略优化PPO强化学习通过训练好的RM模型和近端策略优化PPO算法优化SFT模型策略近端策略优化ProximalPolicyOptimizationPPO是一种强化学习算法核心思路在于将PolicyGradient中On-policy的训练过程转化为Off-policy即将在线学习转化为离线学习具体来说就是再次让SFT模型去回答promptdataset某个问题通过PPO算法产生输出然后不再借助人工评估结果好坏而是利用步骤二训练的RM模型去对SFT模型的预测结果进行打分排序即用AI训练AI此阶段可以循环多次从而得到参数质量更好的模型图表15近端策略优化PPO强化学习示意图资料来源IllustratingReinforcementLearningfromHumanFeedbackRLHFNathanLanmbert2022华泰研究人类反馈主要体现在RM阶段总结来看InstructGPT以及ChatGPT的训练过程可概括为首先通过人工标注数据promptdataset对原始模型V0GPT-3或GPT-35进行有监督微调得到模型V1其次让模型V1对一个prompt进行多个输出并通过人工进行输出结果排序并训练奖励模型RM最后继续训练模型V1给定一个prompt得到输出后由奖励模型RM继续完成打分反复迭代后得到最终的InstructGPT或ChatGPT人类标注员参与SFT训练与RM训练两个过程其中人类反馈主要体现在RM阶段图表16人工主要参与SFTRM人类反馈主要体现在RM阶段资料来源TraininglanguagemodelstofollowinstructionswithhumanfeedbackLongOuyang2022华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读9计算机论文结论RLHF是GPT需求对齐的重要支撑RLHF有效优化了模型输出输出结果更加符合人类意愿InstructGPT论文中分别训练了13亿60亿1750亿三个参数规模的InstructGPT模型实验证明13亿参数规模的InstructGPT模型PPO-ptx在多场景下的输出效果均优于1750亿参数规模GPT-3模型人类反馈强化学习RLHF方法的引入一方面能够尽可能地对齐AlignmentGPT的输出让GPT具备对用户更加友好的语言逻辑微调出用户友好型GPT另一方面人工反馈的引入帮助模型更好的理解人类思维和意图训练结果更符合人类的需求图表17InstructGPT更好地实现了模型输出与人类需求对齐08模型07输出优06先于175GPT05BSFTBGPTprompted04SFT模型03PPO的PPO-ptx频率02010013B6B175B资料来源TraininglanguagemodelstofollowinstructionswithhumanfeedbackLongOuyang2022华泰研究模型的3H特性显著提升输出内容更有用更真实更无害为了衡量InstructGPT模型的有用性Helpful真实性Honest无害性Harmless是否得到改善InstructGPT论文在公开可用的数据集上使用现有指标对比了InstructGPT与GPT-3的模型性能与GPT-3相比根据TruthfulQA指标InstructGPT产生的模仿性错误更少根据RealToxicity指标InstructGPT输出的毒性更小根据API提示分布进行人工评估发现InstructGPT更少地编造事实幻觉并生成更合适的输出总结来看InstructGPT模型输出内容的有用性真实性无害性均得到一定程度的提升图表18InstructGPT模型的有用性真实性无害性显著提升注毒性致幻性得分越低越好真实性适当性等分越高越好资料来源TraininglanguagemodelstofollowinstructionswithhumanfeedbackLongOuyang2022华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读10计算机ChatGPTVSInstructGPT核心是基础大模型的不同演化从GPT-3到GPT-35基础大模型能力再升级训练方法基本一致核心区别是基础大模型的不同对比OpenAI官网介绍的ChatGPT训练方法与InstructGPT论文介绍的InstructGPT训练方法两者的训练方法基本一致核心区别在于InstructGPTChatGPT分别基于GPT-3GPT-35进行模型微调为了充分理解ChatGPT与InstructGPT的能力差异我们梳理了从GPT-3到GPT-35发展过程1GPT-3元年20202020年7月OpenAI发表论文LanguageModelsareFew-ShotLearners开启GPT-3元年与GPT-2相比GPT-3进一步扩大模型参数与训练数据量并用few-shot取代zero-shot模型泛化能力得到进一步提升2GPT-3系列202108-2022032021年8月论文EvaluatingLargeLanguageModelsTrainedonCode发表基于GPT-3进行代码训练微调得到Codex通用代码生成模型对应OpenAIAPI中的code-cushman-0012022年3月论文Traininglanguagemodelstofollowinstructionswithhumanfeedback发表基于GPT-3模型经过SFT训练RM训练PPO强化学习得到InstructGPT模型其中SFT部分对应了OpenAIAPI中的davinci-instruct-betatext-davinci-0013GPT-35系列202204-202262022年4月兼具语言模型代码训练指示微调的code-davinci-002模型面世仍称其为Codex对应OpenAIAPI中的code-davinci-0022022年5-6月基于code-davinci-002的有监督指令微调supervisedinstructiontuned模型text-davinci-002发布此次指令微调降低了模型的上下文学习能力但增强了模型的零次学习能力4ChatGPT时代2022112022年11月基于text-davinci-002进行RLHF指令微调的两种变体模型出现分别为text-davinci-003ChatGPT其中text-davinci-003恢复了text-davinci-002中丢失的部分上下文学习能力同时得益于RLHF进一步改进了零次学习能力ChatGPT则具备了建模对话历史的能力图表19GPT3及GPT35系列模型演进路径资料来源HowdoesGPTObtainitsAbilityTracingEmergentAbilitiesofLanguageModelstotheirSourcesYaoFu2022华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读11计算机对比增加代码训练与指示微调GPT-35具备三大优势与GPT-3相比GPT-35增加代码训练Code-training与指示微调Instruction-tuning根据上文对GPT-3及GPT-35系列模型的发展梳理不难看出以code-davinci-002用于代码生成text-davinci-002用于文本生成为代表的GPT-35模型与GPT-3模型相比增加了代码训练指示微调两个训练步骤1代码训练经过前期的代码训练GPT-35模型具备更好的代码生成与代码理解能力同时间接拥有了使用思维链进行复杂推理的能力2指示微调经历Instruction-tuningGPT-35具备更好的模型泛化能力同时模型的生成结果更加符合人类的预期图表20与GPT-3相比GPT-35增加代码训练与指示微调资料来源TraininglanguagemodelstofollowinstructionswithhumanfeedbackLongOuyang2022华泰研究GPT-35具备三大优势ChatGPT实现优势融合基于模型训练的持续优化与GPT-3相比GPT-35具备三大优势更强的复杂推理能力更好的人类指令响应更全面的文本代码生成能力作为基于GPT-35的模型微调产物ChatGPT实现了Code-trainingInstruction-tuningRLHF等训练的优势整合我们针对ChatGPT优势进行能力溯源1预训练大模型ChatGPT具备的语言生成能力基础世界知识上下文学习能力等基本能力均来源于基于Transformer的模型预训练大量知识的存储能力依托于庞大的模型参数GPT-3模型参数为1750亿2代码训练ChatGPT具备较好的代码生成与代码理解能力同时具备执行复杂推理的能力主要得益于代码训练Code-training的引入初代GPT-3未进行过专门的代码训练因此在代码生成理解方面能力相对较差同时推理思维链能力也较差因此可以判断代码训练是ChatGPT上述能力的重要来源免责声明和披露以及分析师声明是报告的一部分请务必一起阅读12计算机3人类反馈强化学习ChatGPT具备更好的问答能力同时可以拒绝不当的问题拒绝知识范围之外的问题这些在对话问答上的突出表现得益于人类反馈强化学习RLHF的训练让ChatGPT更加遵循人类的价值观同时拥有了建模对话历史增加对话信息量等能力图表21ChatGPT优势能力溯源资料来源HowdoesGPTObtainitsAbilityTracingEmergentAbilitiesofLanguageModelstotheirSourcesYaoFu2022华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读13计算机OpenAIVSGoogleOpenAI贯彻Decoder-only路径技术集大成者ChatGPT领先发布OpenAI打开大语言模型新局面2022年11月30日ChatGPT正式上线仅花费5天时间用户数超100万据Similarweb数据显示2023年1月ChatGPT平均每天约有1300万独立访客面对ChatGPT的领先发布与热烈反响2022年2月8日Google在发布会上开启对话机器人Bard首秀相较于ChatGPT的突出表现Bard的表现则稍显逊色2022年2月15日Google首席执行官桑达尔皮查伊SundarPichai呼吁员工进行Bard的内部测试优化Decoder-only技术博采众长两大特点助力ChatGPT成功面世通过梳理2017年起Google与OpenAI在LLM领域的布局可以看到OpenAI具备两大突出特点1贯彻Decoder-only技术路线从GPT-1到ChatGPTOpenAI的LLM均采用Decoder-only架构单一架构领域的持续深耕与模型参数的不断扩大让OpenAI的GPT系列模型具备强大的学习能力与文本生成能力2技术集大成者ChatGPT的发展不仅得益于GPT模型参数训练数据的持续优化也得益于各类LLM新技术的融会贯通OpenAI博采众长加速新技术在GPT系列模型中的深度应用图表22OpenAI与Google在LLM领域的布局2017年6月-2023年2月注红框内浅粉色高亮的三种预训练语言模型是2019年三类典型模型资料来源OpenAI官网Google官网CSDN华泰研究特点一贯彻Decoder-only技术路径Decoder-only具备文本生成优势OpenAI深耕布局OpenAI自2018年的GPT-1起在模型架构上始终坚持Decoder-only的技术路径得益于Decoder-only架构在文本生成上的天然性优势具体分析可参考华泰计算机2023年2月14日发布的报告GPT产业复盘2019大容量路线ChatGPT在对话翻译等文本生成任务中更具优势对比来看Google2018年2019年推出的BERTT5分别采用Encoder-onlyEncoder-Decoder技术方案直至2021年10月推出的FLAN模型才采用Decoder-only方案特点二LLM相关技术集大成者ChatGPT是LLM领域的技术集大成者从ChatGPT的技术路径演进过程来看其底层技术可视为TransformerPrompt-LearningInstruction-tuningRLHFPPO思维链的融合1Tansformer2017年6月Google发布论文AttentionIsAllYouNeed提出Transformer模型免责声明和披露以及分析师声明是报告的一部分请务必一起阅读14计算机2RLHF2017年7月DeepMindGoogle旗下人工智能企业与OpenAI联合发布论文DeepReinforcementLearningfromHumanPreferences提出人类反馈强化学习RLHF方法3PPO2017年8月OpenAI发表论文ProximalPolicyOptimizationAlgorithms提出对TRPO算法的改进PPO算法4Prompt-Learning2020年7月OpenAI发布论文LanguageModelsareFew-ShotLearner开启基于Prompt的NLP新学习范式的研究热潮5Instruction-tuning2021年9月Google发布论文FinetunedLanguageModelsareZero-shotLearners提出指示微调Instruction-tuning方法6思维链2022年4月Google发布论文PathwaysAsynchronousDistributedDataflowforML提出PathwaysLanguageModelPaLM模型并提出思维链Chain-of-ThoughtPrompting技术从各项技术的提出时间和提出者来看ChatGPT融合的各项技术不仅由OpenAI公司独立提出还包括GoogleDeepMind等公司的研究成果OpenAI博采众长广泛实现了先进技术与GPT模型的有机融合这也成为ChatGPT优势能力的重要来源图表23ChatGPT实现多项技术融合资料来源Google官网OpenAI官网华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读15计算机总结厚积薄发ChatGPT引发AI产业范式革命我们认为2022年是GPT系列模型厚积薄发的阶段性胜利之年基于GPT-35微调产生的ChatGPT在模型演变与模型应用上均有较大突破1模型演变上ChatGPT是基于GPT-35大模型微调生成的专注对话式生成的语言模型其本质上是GPT系列模型多年来厚积薄发的产物GPT系列模型从2018到2020年沿着大模型参数多训练数据的方向持续演进到GPT-3时代已经具备了较强的模型泛化能力2022年GPT-35GPT-3经过代码训练指示微调的产物成为新一代大模型基础基于GPT-35的强大文本生成能力OpenAI进一步引入Instruction-tuningRLHF等技术迭代生成ChatGPT模型我们认为ChatGPT模型的成功具有重要的引导意义单一大模型或为未来AI训练主流方向2模型应用上相比过去的AI产品ChatGPT在应用领域商业化等层面呈现出新的特点应用领域方面ChatGPT属于生成式AI相比于分析型AIChatGPT不局限于已有的内容在文艺创作代码处理营销等众多创造性场景内有更为突出的表现商业化方面ChatGPT在商业化方面彰显出强于以往AI应用的潜力一方面得益于用户数快速增长另一方面得益于微软为代表的科技巨头支持风险提示宏观经济波动若宏观经济波动产业变革及新技术的落地节奏或将受到影响宏观经济波动还可能对IT投资产生负面影响从而导致整体行业增长不及预期下游需求不及预期若下游数字化需求不及预期相关的数字化投入增长或慢于预期致使行业增长不及预期本报告内容均基于客观信息整理不构成投资建议图表24提及公司列表公司代码公司简称GOOGLUS谷歌未上市OpenAI未上市DeepMind资料来源Bloomberg华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读16计算机免责声明分析师声明本人谢春生兹证明本报告所表达的观点准确地反映了分析师对标的证券或发行人的个人意见彼以往现在或未来并无就其研究报告所提供的具体建议或所表迖的意见直接或间接收取任何报酬一般声明及披露本报告由华泰证券股份有限公司已具备中国证监会批准的证券投资咨询业务资格以下简称本公司制作本报告所载资料是仅供接收人的严格保密资料本报告仅供本公司及其客户和其关联机构使用本公司不因接收人收到本报告而视其为客户本报告基于本公司认为可靠的已公开的信息编制但本公司及其关联机构以下统称为华泰对该等信息的准确性及完整性不作任何保证本报告所载的意见评估及预测仅反映报告发布当日的观点和判断在不同时期华泰可能会发出与本报告所载意见评估及预测不一致的研究报告同时本报告所指的证券或投资标的的价格价值及投资收入可能会波动以往表现并不能指引未来未来回报并不能得到保证并存在损失本金的可能华泰不保证本报告所含信息保持在最新状态华泰对本报告所含信息可在不发出通知的情形下做出修改投资者应当自行关注相应的更新或修改本公司不是FINRA的注册会员其研究分析师亦没有注册为FINRA的研究分析师不具有FINRA分析师的注册资格华泰力求报告内容客观公正但本报告所载的观点结论和建议仅供参考不构成购买或出售所述证券的要约或招揽该等观点建议并未考虑到个别投资者的具体投资目的财务状况以及特定需求在任何时候均不构成对客户私人投资建议投资者应当充分考虑自身特定状况并完整理解和使用本报告内容不应视本报告为做出投资决策的唯一因素对依据或者使用本报告所造成的一切后果华泰及作者均不承担任何法律责任任何形式的分享证券投资收益或者分担证券投资损失的书面或口头承诺均为无效除非另行说明本报告中所引用的关于业绩的数据代表过往表现过往的业绩表现不应作为日后回报的预示华泰不承诺也不保证任何预示的回报会得以实现分析中所做的预测可能是基于相应的假设任何假设的变化可能会显著影响所预测的回报华泰及作者在自身所知情的范围内与本报告所指的证券或投资标的不存在法律禁止的利害关系在法律许可的情况下华泰可能会持有报告中提到的公司所发行的证券头寸并进行交易为该公司提供投资银行财务顾问或者金融产品等相关服务或向该公司招揽业务华泰的销售人员交易人员或其他专业人士可能会依据不同假设和标准采用不同的分析方法而口头或书面发表与本报告意见及建议不一致的市场评论和或交易观点华泰没有将此意见及建议向报告所有接收者进行更新的义务华泰的资产管理部门自营部门以及其他投资业务部门可能独立做出与本报告中的意见或建议不一致的投资决策投资者应当考虑到华泰及或其相关人员可能存在影响本报告观点客观性的潜在利益冲突投资者请勿将本报告视为投资或其他决定的唯一信赖依据有关该方面的具体披露请参照本报告尾部本报告并非意图发送发布给在当地法律或监管规则下不允许向其发送发布的机构或人员也并非意图发送发布给因可得到使用本报告的行为而使华泰违反或受制于当地法律或监管规则的机构或人员本报告版权仅为本公司所有未经本公司书面许可任何机构或个人不得以翻版复制发表引用或再次分发他人无论整份或部分等任何形式侵犯本公司版权如征得本公司同意进行引用刊发的需在允许的范围内使用并需在使用前获取独立的法律意见以确定该引用刊发符合当地适用法规的要求同时注明出处为华泰证券研究所且不得对本报告进行任何有悖原意的引用删节和修改本公司保留追究相关责任的权利所有本报告中使用的商标服务标记及标记均为本公司的商标服务标记及标记中国香港本报告由华泰证券股份有限公司制作在香港由华泰金融控股香港有限公司向符合证券及期货条例及其附属法律规定的机构投资者和专业投资者的客户进行分发华泰金融控股香港有限公司受香港证券及期货事务监察委员会监管是华泰国际金融控股有限公司的全资子公司后者为华泰证券股份有限公司的全资子公司在香港获得本报告的人员若有任何有关本报告的问题请与华泰金融控股香港有限公司联系免责声明和披露以及分析师声明是报告的一部分请务必一起阅读17计算机香港-重要监管披露华泰金融控股香港有限公司的雇员或其关联人士没有担任本报告中提及的公司或发行人的高级人员有关重要的披露信息请参华泰金融控股香港有限公司的网页httpswwwhtsccomhkstockdisclosure其他信息请参见下方美国-重要监管披露美国在美国本报告由华泰证券美国有限公司向符合美国监管规定的机构投资者进行发表与分发华泰证券美国有限公司是美国注册经纪商和美国金融业监管局FINRA的注册会员对于其在美国分发的研究报告华泰证券美国有限公司根据1934年证券交易法修订版第15a-6条规定以及美国证券交易委员会人员解释对本研究报告内容负责华泰证券美国有限公司联营公司的分析师不具有美国金融监管FINRA分析师的注册资格可能不属于华泰证券美国有限公司的关联人员因此可能不受FINRA关于分析师与标的公司沟通公开露面和所持交易证券的限制华泰证券美国有限公司是华泰国际金融控股有限公司的全资子公司后者为华泰证券股份有限公司的全资子公司任何直接从华泰证券美国有限公司收到此报告并希望就本报告所述任何证券进行交易的人士应通过华泰证券美国有限公司进行交易美国-重要监管披露分析师谢春生本人及相关人士并不担任本报告所提及的标的证券或发行人的高级人员董事或顾问分析师及相关人士与本报告所提及的标的证券或发行人并无任何相关财务利益本披露中所提及的相关人士包括FINRA定义下分析师的家庭成员分析师根据华泰证券的整体收入和盈利能力获得薪酬包括源自公司投资银行业务的收入华泰证券股份有限公司其子公司和或其联营公司及或不时会以自身或代理形式向客户出售及购买华泰证券研究所覆盖公司的证券衍生工具包括股票及债券包括衍生品华泰证券研究所覆盖公司的证券衍生工具包括股票及债券包括衍生品华泰证券股份有限公司其子公司和或其联营公司及或其高级管理层董事和雇员可能会持有本报告中所提到的任何证券或任何相关投资头寸并可能不时进行增持或减持该证券或投资因此投资者应该意识到可能存在利益冲突评级说明投资评级基于分析师对报告发布日后6至12个月内行业或公司回报潜力含此期间的股息回报相对基准表现的预期A股市场基准为沪深300指数香港市场基准为恒生指数美国市场基准为标普500指数具体如下行业评级增持预计行业股票指数超越基准中性预计行业股票指数基本与基准持平减持预计行业股票指数明显弱于基准公司评级买入预计股价超越基准15以上增持预计股价超越基准515持有预计股价相对基准波动在-155之间卖出预计股价弱于基准15以上暂停评级已暂停评级目标价及预测以遵守适用法规及或公司政策无评级股票不在常规研究覆盖范围内投资者不应期待华泰提供该等证券及或公司相关的持续或补充信息免责声明和披露以及分析师声明是报告的一部分请务必一起阅读18计算机法律实体披露中国华泰证券股份有限公司具有中国证监会核准的证券投资咨询业务资格经营许可证编号为91320000704041011J香港华泰金融控股香港有限公司具有香港证监会核准的就证券提供意见业务资格经营许可证编号为AOK809美国华泰证券美国有限公司为美国金融业监管局FINRA成员具有在美国开展经纪交易商业务的资格经营业务许可编号为CRD298809SEC8-70231华泰证券股份有限公司南京北京南京市建邺区江东中路228号华泰证券广场1号楼邮政编码210019北京市西城区太平桥大街丰盛胡同28号太平洋保险大厦A座18层邮政编码100032电话862583389999传真862583387521电话861063211166传真861063211275电子邮件ht-rdhtsccom电子邮件ht-rdhtsccom深圳上海深圳市福田区益田路5999号基金大厦10楼邮政编码518017上海市浦东新区东方路18号保利广场E栋23楼邮政编码200120电话8675582493932传真8675582492062电话862128972098传真862128972068电子邮件ht-rdhtsccom电子邮件ht-rdhtsccom华泰金融控股香港有限公司香港中环皇后大道中99号中环中心58楼5808-12室电话852-3658-6000传真852-2169-0770电子邮件researchhtsccomhttpwwwhtsccomhk华泰证券美国有限公司美国纽约公园大道280号21楼东纽约10017电话212-763-8160传真917-725-9702电子邮件Huataihtsc-uscomhttpwwwhtsc-uscom版权所有2023年华泰证券股份有限公司免责声明和披露以及分析师声明是报告的一部分请务必一起阅读19
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1