本文通过深度原理分析,力求帮助读者较全面地了解GPT-4使用的AI技术
GPT-4是OpenAI本周推出的多模态大规模预训练模型,能够输入文本和图像,回答文本内容。关于模型的实现原理,OpenAI在报告“GPT-4 TechnicalReport”中提到,GPT-4使用了基于Transformer的多模态模型、提示学习、RLHF(基于人类反馈的强化学习)等技术,但并未涉及更多细节。本着知其然更要知其所以然的态度,本文系统整理了已发表的相关研究论文并进行深度原理分析,力求帮助读者较全面地了解GPT-4使用的AI技术。 中证1000增强组合上周超额收益-0.32%,今年超额收益3.81% 截至2023年3月17日,中证1000增强组合相对中证1000上周超额收益为-0.32%,今年以来超额收益为3.81%。模型2018年初回测以来相对中证1000年化超额收益率为25.59%,年化跟踪误差为8.25%,信息比率为3.10,超额收益最大回撤为6.75%,超额收益Calmar比率为3.79。 文本FADT组合今年绝对收益12.79%,相对中证500超额7.36% 截至2023年3月17日,文本FADT组合上周绝对收益-3.17%,今年以来绝对收益12.79%,相对中证500超额收益7.36%。组合自2009年初回测以来年化收益率42.44%,年化超额收益率32.94%,夏普比率1.44。 文本FADT_BERT组合今年绝对收益16.72%,相对中证500超额11.28% 截至2023年3月17日,文本FADT_BERT组合上周绝对收益-1.71%,今年以来绝对收益为16.72%,相对中证500超额收益11.28%。组合自2009年初回测以来年化收益率45.11%,相对中证500超额年化收益率34.98%,组合夏普比率1.56。 机构调研选股相对中证500上周超额收益-1.15%,今年超额收益3.34% 截至2023年3月17日,机构调研选股组合相对中证500上周超额收益为-1.15%,今年以来超额收益为3.34%。模型回测以来年化收益率为28.13%,相对中证500年化超额收益率为21.71%,信息比率为2.06,超额收益最大回撤为14.42%。 GAT+residual模型上周超额收益-0.89%,今年以来超额收益-1.32% 截至2023年3月17日,GAT+residual模型上周超额收益为-0.89%,今年以来超额收益为-1.32%。模型2011年初回测以来年化超额收益率为15.85%,年化跟踪误差为5.84%,信息比率为2.71,超额收益最大回撤为7.97%,超额收益Calmar比率为1.99。 风险提示:目前OpenAI尚未公布GPT-4具体实现原理,本文利用已发表的相关研究论文对GPT-4原理进行分析,可能与实际的GPT-4原理存在差距。通过人工智能模型构建选股策略是历史经验的总结,存在失效的可能。人工智能模型可解释程度较低,使用须谨慎。 研究报告全文:证券研究报告金工GPT-4使用了哪些前沿AI技术华泰研究研究员林晓明SACNoS0570516010001linxiaominghtsccom2023年3月19日中国内地量化投资周报SFCNoBPY4218675582080134研究员何康PhD本文通过深度原理分析力求帮助读者较全面地了解GPT-4使用的AI技术SACNoS0570520080004hekanghtsccomGPT-4是OpenAI本周推出的多模态大规模预训练模型能够输入文本和图SFCNoBRB318862128972039像回答文本内容关于模型的实现原理在报告OpenAIGPT-4Technical研究员李子钰Report中提到GPT-4使用了基于Transformer的多模态模型提示学习SACNoS0570519110003liziyuhtsccomRLHF基于人类反馈的强化学习等技术但并未涉及更多细节本着知SFCNoBRV7438675523987436其然更要知其所以然的态度本文系统整理了已发表的相关研究论文并进行联系人陈伟深度原理分析力求帮助读者较全面地了解GPT-4使用的AI技术SACNoS0570121070169chenwei018440htsccom862128972228中证1000增强组合上周超额收益-032今年超额收益381截至2023年3月17日中证1000增强组合相对中证1000上周超额收益为-032今年以来超额收益为381模型2018年初回测以来相对中证1000年化超额收益率为2559年化跟踪误差为825信息比率为310超额收益最大回撤为675超额收益Calmar比率为379文本FADT组合今年绝对收益1279相对中证500超额736截至2023年3月17日文本FADT组合上周绝对收益-317今年以来绝对收益1279相对中证500超额收益736组合自2009年初回测以来年化收益率4244年化超额收益率3294夏普比率144文本FADTBERT组合今年绝对收益1672相对中证500超额1128截至2023年3月17日文本FADTBERT组合上周绝对收益-171今年以来绝对收益为1672相对中证500超额收益1128组合自2009年初回测以来年化收益率4511相对中证500超额年化收益率3498组合夏普比率156机构调研选股相对中证500上周超额收益-115今年超额收益334截至2023年3月17日机构调研选股组合相对中证500上周超额收益为-115今年以来超额收益为334模型回测以来年化收益率为2813相对中证500年化超额收益率为2171信息比率为206超额收益最大回撤为1442GATresidual模型上周超额收益-089今年以来超额收益-132截至2023年3月17日GATresidual模型上周超额收益为-089今年以来超额收益为-132模型2011年初回测以来年化超额收益率为1585年化跟踪误差为584信息比率为271超额收益最大回撤为797超额收益Calmar比率为199风险提示目前OpenAI尚未公布GPT-4具体实现原理本文利用已发表的相关研究论文对GPT-4原理进行分析可能与实际的GPT-4原理存在差距通过人工智能模型构建选股策略是历史经验的总结存在失效的可能人工智能模型可解释程度较低使用须谨慎免责声明和披露以及分析师声明是报告的一部分请务必一起阅读1金工研究正文目录GPT-4使用了哪些前沿AI技术4预训练自然语言模型的奠基者Transformer5OpenAI的前三代GPT模型6GPT模型6GPT-2和GPT-3模型7InstructGPT和ChatGPT使用RLHF训练人机对话模型8步骤1利用人类标注的对话数据对GPT-35进行有监督训练微调9步骤2利用人类标注的对话打分数据训练一个打分模型9步骤3使用强化学习PPO算法继续微调模型10测试结果分析11中证1000增强组合表现跟踪12FADT选股组合近期表现跟踪13文本FADTBERT选股组合近期表现跟踪15机构调研选股组合表现跟踪17图神经网络选股策略近期表现18风险提示19免责声明和披露以及分析师声明是报告的一部分请务必一起阅读2金工研究图表目录图表1GPT系列模型的发展路径4图表2GPT4原理概况及参考模型4图表3Transformer模型的结构5图表4三代GPT模型的结构6图表5Zero-shotOne-shotFew-shot与微调的对比7图表6使用RLHF训练ChatGPT的三个步骤8图表7利用人类标注的对话数据对GPT-35进行有监督训练微调9图表8利用人类标注的对话打分数据训练一个打分模型9图表9使用强化学习PPO算法继续微调模型10图表10InstructGPT的测试结果分析11图表11中证1000增强组合超额收益表现12图表12中证1000增强组合月度超额收益2018-01-02至2023-03-17基准为中证1000指数12图表13中证1000增强组合回测绩效2018-01-02至2023-03-17基准为中证1000指数12图表14Forecastadjtxt因子分层回测净值13图表15Forecastadjtxt因子分层回测超额净值基准中证50013图表16FADT增强组合净值回测期20090123-2023031713图表17FADT增强组合相对中证500净值回测期20090123-2023031714图表18FADT增强组合分年度业绩基准中证500回测期20090123-2023031714图表19FADT增强组合分月度业绩14图表20文本FADTBERT增强组合净值回测期20090123-2023031715图表21文本FADTBERT增强组合相对中证500净值回测期20090123-2023031715图表22文本FADTBERT增强组合分年度业绩基准中证500回测期20090123-2023031716图表23文本FADTBERT增强组合分月度业绩16图表24机构调研选股组合净值17图表25机构调研选股组合的超额收益17图表26机构调研选股组合回测绩效2013-08-30至2023-03-17基准为中证500指数17图表27机构调研选股组合逐年收益率2013-08-30至2023-03-17基准为中证500指数17图表28GATresidual模型超额收益表现18图表29GATresidual模型月度超额收益2011-01-04至2023-03-17基准为中证500指数18图表30GATresidual模型回测绩效2011-01-04至2023-03-17基准为中证500指数18图表31GATresidual模型合成因子累计RankIC和加权RankIC19图表32GATresidual模型合成因子评价指标2011-01-04至2023-03-1719图表33GATresidual网络结构19免责声明和披露以及分析师声明是报告的一部分请务必一起阅读3金工研究GPT-4使用了哪些前沿AI技术2023年3月14日OpenAI推出了GPT-4模型向多模态通用人工智能迈出更坚实的一步具体来讲GPT-4之前的模型都是语言模型GPT-4则升级为语言图像的多模态模型能够输入文本和图像回答文本内容本文通过深度的原理分析力求帮助读者较全面地了解GPT-4使用的AI技术下图是GPT系列模型的发展路径图表1GPT系列模型的发展路径资料来源华泰研究考虑到竞争格局和大型模型的安全影响OpenAI并未披露GPT-4的大小硬件数据集构建训练方法等细节只发表了一篇技术报告来介绍模型在各种任务上的性能但GPT-4并非一天建成的我们依然可以通过已发表的相关研究论文来了解GPT-4使用的AI技术下图整理了GPT4原理概况及参考模型图表2GPT4原理概况及参考模型资料来源华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读4金工研究我们还整理了相关论文的名称供读者参考列示如下GPT模型和提示学习1GPT2018Improvinglanguageunderstandingbygenerativepre-training2GPT-22019Languagemodelsareunsupervisedmultitasklearners3GPT-32020Languagemodelsarefew-shotlearners4GPT-42023GPT-4TechnicalReportTransformer多模态模型1Transformer2017AttentionIsAllYouNeed2ViT2020AnImageisWorth16x16WordsTransformersforImageRecognitionatScaleTransformer3CLIP2021LearningTransferableVisualModelsFromNaturalLanguageSupervision4KOSMOS-12023LanguageIsNotAllYouNeedAligningPerceptionwithLanguageModelsRLHF基于人类反馈的强化学习1PPO2017Proximalpolicyoptimizationalgorithms2InstructGPT2022Traininglanguagemodelstofollowinstructionswithhumanfeedback接下来我们将对以上部分研究进行更深入的介绍预训练自然语言模型的奠基者Transformer2017年Google在其论文AttentionIsAllYouNeed中提出了Transformer架构Transformer在传统的CNN和RNN体系之外开创了一种完全基于注意力机制的网络架构非常适合于自然语言处理任务Transformer的提出启发了后续预训练语言模型的出现Google在2018年开发的BERT模型就是借鉴了Transformer的编码器模块而OpenAI的GPT模型则借鉴了Transformer的解码器模块图表3Transformer模型的结构资料来源AttentionIsAllYouNeed华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读5金工研究OpenAI的前三代GPT模型20182020年OpenAI陆续推出了三代GPT模型每一代模型的规模和参数量逐渐增大GPT-3的参数量已达1750亿个模型在各类自然语言下游任务中的表现也越来越好为了方便对比我们将三代模型的结构和参数展示在下方图表中图表4三代GPT模型的结构资料来源OpenAI华泰研究GPT模型2018年OpenAI在论文ImprovingLanguageUnderstandingbyGenerativePreTraining中提出了GPT模型GPT是单向表征的自回归语言模型主要用来处理语言生成任务其多头注意力模块为MaskedMulti-HeadAttention通过掩码的遮盖在预测一个单词时只会用到前面已经生成的单词而无信息的泄露GPT是典型的无监督预训练有监督微调的两阶段模型先在没有标注的数据集中进行预训练再在有标注的特定下游任务数据集上微调在预训练阶段对于一个含有大量单词的语料库1GPT使用极大化似然函数来进行优化1log1是预测时所用到的单词的个数是用于预测的模型我们定义1为输入的个单词的编码序列为词嵌入映射矩阵为位置嵌入矩阵L表示堆叠的Block层数则GPT的预训练流程可以按如下方法公式化0transformerblock1123softmax预训练完成后需要使用少量带标注的下游任务数据对模型进行微调免责声明和披露以及分析师声明是报告的一部分请务必一起阅读6金工研究GPT-2和GPT-3模型从GPT-2开始OpenAI逐渐抛弃了无监督预训练有监督微调的方式尝试训练一种不需要进行下游任务微调就能处理各种自然语言任务的模型并且认为随着模型参数量的不断增大模型容纳的知识和可应对的任务会越来越多语言模型应该往大模型的方向发展GPT-2相比GPT的变化主要包含1参见图表3GPT-2中Transformer层的内部结构相比GPT有一定变化2GPT-2的Transformer层数增多参数量达到了15亿个3GPT-2开创性地引入了Zero-shot技术即模型在大规模参数下学习到了海量文本中的知识不需要再针对下游任务微调只需要将要做的任务也作为一个提示词和文本一起输入预训练好的模型就可以完成这个任务遗憾的是因为基于Zero-shot的训练方式难度很大GPT-2在很多下游任务上的表现还不够好但从开创性来讲GPT-2无疑是一个优秀的研究为GPT-3的诞生做好了准备2020年OpenAI在论文LanguageModelsareFew-ShotLearners提出了GPT-3GPT-3在多项任务上的表现超出了GPT-2GPT-3相比GPT-2的变化主要包含1参见图表3GPT-3中Transformer层的内部结构和GPT-2一致但层数达到96层参数数量达到1750亿个2GPT-3吸取了GPT-2的经验教训在使用Zero-shot技术的同时还引入了相对容易的One-shot和Few-shot技术提示学习下方将英语cheese翻译成法语的例子形象说明了Zero-shotOne-shotFew-shot与微调的对比图表5Zero-shotOne-shotFew-shot与微调的对比资料来源LanguageModelsareFew-ShotLearners华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读7金工研究微调模型会根据每个微调样本example1example2exampleN产生梯度更新模型参数微调完成之后将英语cheese翻译成法语Zero-shot模型预测阶段给模型提供一个任务提示TranslateEnglishtoFrench并加上要翻译的单词cheese也就是告诉模型需要做的是翻译任务这个过程中不会有梯度更新One-shot模型预测阶段给模型提供一个任务提示TranslateEnglishtoFrench并加上要翻译单词cheese的同时增加一个翻译示例seaotterloutredemer也就是告诉模型需要做的是翻译任务并且有一个参考示例这个过程中不会有梯度更新Few-shot模型预测阶段给模型提供一个任务提示TranslateEnglishtoFrench并加上要翻译单词cheese的同时增加多个翻译示例也就是告诉模型需要做的是翻译任务并且有多个参考示例这个过程中不会有梯度更新可以看出Zero-shotOne-shot和Few-shot更接近人类在面对各类语言问题时的思考模式即人类只需要提示和少量示例就能回答各类语言问题对于Zero-shot由于没有提供示例是最有挑战的即使是人类有时也难以仅依赖任务描述而没有示例的情况下理解一个任务InstructGPT和ChatGPT使用RLHF训练人机对话模型InstructGPT和ChatGPT都是GPT模型在人机对话方面的应用延伸目的是使得机器的回答尽可能向人类的逻辑和意图看齐Alignment二者都使用了基于人类反馈的强化学习ReinforcementLearningfromHumanFeedbackRLHF进行训练由于ChatGPT的论文尚未发布我们将主要参照InstructGPT的论文Traininglanguagemodelstofollowinstructionswithhumanfeedback来介绍RLHF的训练过程下图展示了使用RLHF训练ChatGPT的三个步骤分别是1利用人类标注的对话数据对GPT-35进行有监督训练微调2利用人类标注的对话打分数据训练一个打分模型模型能评价机器回答的质量高低3利用步骤2中打分模型得到奖励函数使用强化学习继续对步骤1中的模型微调图表6使用RLHF训练ChatGPT的三个步骤资料来源OpenAI华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读8金工研究接下来我们将对三个步骤进行详细介绍步骤1利用人类标注的对话数据对GPT-35进行有监督训练微调步骤1较为简单即利用人类标注的对话数据对GPT-35进行有监督训练微调得到SFTSupervisedfine-tuning模型对话数据中包含的任务类型较为全面包括文本分类信息抽取文本生成或重写问答等等在InstructGPT的论文中该步骤使用的数据量为13000条左右这实际上是一个规模较小的数据因此可以考虑使用文本增强AugmentedText的方法扩充这些数据图表7利用人类标注的对话数据对GPT-35进行有监督训练微调资料来源HuggingFaceRLHF华泰研究步骤2利用人类标注的对话打分数据训练一个打分模型步骤2如下图所示图表8利用人类标注的对话打分数据训练一个打分模型资料来源HuggingFaceRLHF华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读9金工研究步骤2需要按照以下流程进行1将大量的问题文本输入给微调过的SFT模型得到回答2人工按照某些标准对回答进行排序标准可以是回答的可读性无害性正确性等等3需要注意的是人工排序并不是给出1234这样的排序数值因为直接打分很容易受主观影响而是给出DCAB这样的相对强弱4使用人工排序的结果训练一个打分模型RewardModel模型能评价一条回答的质量高低在InstructGPT的论文中训练打分模型使用了如下的pairwise排序损失函数1losslog2其中是一个提问针对有K论文中K9个回答从中任选两个回答和是打分模型对的评分即两个回答的得分差值log则把得分差值转换为Logistic损失最后把Logistic损失求均值并取相反数就得到lossInstructGPT的论文中步骤2总共使用了33000条人工标注的样本来训练步骤3使用强化学习PPO算法继续微调模型步骤3如下图所示图表9使用强化学习PPO算法继续微调模型资料来源HuggingFaceRLHF华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读10金工研究步骤3使用强化学习对SFT模型继续进行微调需要按照以下流程进行1向模型输入问题文本例如Adogis步骤1的SFT模型给出回答afurrymammal使用强化学习微调的模型给出回答mansbestfriend2计算两个回答之间的KL散度来评价它们的相似程度以KL散度作为惩罚项目的是使得两个模型差异不要太大3将强化学习微调的模型回答mansbestfriend输入第2步中的打分模型得到打分4设置强化学习的奖励函数使用PPO算法对模型进行微调在InstructGPT的论文中奖励函数设置为objectiveloglog其中代表PPO微调的模型代表SFT微调的模型则是未微调的预训练模型log即KL散度超参数和控制KL散度和未微调的预训练模型的影响若0则得到模型命名为PPO模型若0则得到模型命名为PPO-ptx模型整个奖励函数的含义是在最大化打分的情况下控制和的差异并且引入未微调模型来增强整体模型的鲁棒性5随着强化学习的不断训练就能逐渐微调模型使得回答质量越来越接近人类的期望水平测试结果分析InstructGPT的测试结果包含了很多值得注意的信息我们将逐个展开分析下图的横轴为模型大小纵轴为模型相对于基准模型的胜率基准模型是对1750亿参数的GPT-3微调得到的模型SFT图表10InstructGPT的测试结果分析资料来源Traininglanguagemodelstofollowinstructionswithhumanfeedback华泰研究1从上图可知PPO和PPO-ptx的表现最好显著优于SFTPPO和PPO-ptx之间没有显著的优劣之分2引入人工标注的数据进行RLHF训练对模型指标的提升是非常显著的模型大小只有13亿的PPO表现远优于模型大小达到1750亿的GPT3上图5个模型的指标都随着模型大小的增大而增大且并未出现见顶的迹象这可能说明继续增大模型规模还有进一步提升的空间语言大模型的潜力还有进一步挖掘的可能免责声明和披露以及分析师声明是报告的一部分请务必一起阅读11金工研究中证1000增强组合表现跟踪华泰金工中证1000增强组合构建方法如下1因子包含估值成长财务质量技术预期深度学习因子等2因子合成模型Boosting模型3组合构建方式控制行业和市值暴露个股权重偏离上限为1成分股权重占比为80周频调仓交易费用为单边千分之二截至2023年3月17日中证1000增强组合相对中证1000上周超额收益为-032今年以来超额收益为381模型2018年初回测以来相对中证1000年化超额收益率为2559年化跟踪误差为825信息比率为310超额收益最大回撤为675超额收益Calmar比率为379图表11中证1000增强组合超额收益表现超额收益回撤右轴累积超额收益左轴250-520-1015-1510-2005-2500-30201712201812201912202012202112202212资料来源朝阳永续Wind华泰研究图表12中证1000增强组合月度超额收益2018-01-02至2023-03-17基准为中证1000指数1月2月3月4月5月6月7月8月9月10月11月12月年超额收益2018年-024167715067162278548-060360324401-00720292019年03830737936128218906115425511711411333002020年-210-076356-221-095029132483298-003223-2069332021年093592502089098198-31722543301030079242732022年757045149-041341-082034551-011-02048719321032023年003188112381资料来源朝阳永续Wind华泰研究图表13中证1000增强组合回测绩效2018-01-02至2023-03-17基准为中证1000指数年化超额收年化跟踪误超额收益最相对基准月调仓双边换年化收益率年化波动率夏普比率最大回撤益率差大回撤信息比率Calmar比率胜率手率中证1000增强组合247124471013091255982567531037977423232中证1000-0942414-0044228资料来源朝阳永续Wind华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读12金工研究FADT选股组合近期表现跟踪华泰金工研报人工智能57文本FADT选股2022-07-01我们在分析师盈利预测调整的场景下对相关研报的标题和摘要进行情感分析构建了forecastadjtxt因子并基于该因子的多头端基础股票池进行增强构建top25的主动量化选股组合FADTforecast-adjust-textportfolio截至2023年3月17日FADT组合上周绝对收益为-317今年以来绝对收益为1279相对中证500超额收益736自2009年初回测以来年化收益率4244相对中证500超额年化收益3294组合夏普比率144图表14Forecastadjtxt因子分层回测净值图表15Forecastadjtxt因子分层回测超额净值基准中证500分层120分层16分层218分层2分层分层31635分层4分层414分层54分层512分层6分层6分层710分层7分层83分层88分层9分层6分层1029分层10412002009-01-232009-11-202010-09-132011-07-142012-05-152013-03-112014-01-072014-11-042015-08-252016-06-232017-04-202018-02-072018-12-062019-10-082020-07-312021-05-312022-03-252023-01-182009-11-202010-09-132011-07-142012-05-152013-03-112014-01-072014-11-042015-08-252016-06-232017-04-202018-02-072018-12-062019-10-082020-07-312021-05-312022-03-252023-01-182009-01-23资料来源朝阳永续Wind华泰研究资料来源朝阳永续Wind华泰研究图表16FADT增强组合净值回测期20090123-20230317最大回撤右轴增强组合回测净值中证500净值1400120-20100-408060-6040-80200-100200920102011201220132014201520162017201820192020202120222023资料来源朝阳永续Wind华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读13金工研究图表17FADT增强组合相对中证500净值回测期20090123-20230317超额最大回撤右轴相对中证500净值50045-540-1035-1530-2025-2520-3015-3510-405-450-502013-01-232020-01-232010-01-232011-01-232012-01-232014-01-232015-01-232016-01-232017-01-232018-01-232019-01-232021-01-232022-01-232023-01-232009-01-23资料来源朝阳永续Wind华泰研究图表18FADT增强组合分年度业绩基准中证500回测期20090123-20230317时间年化区间收益率年化区间超额收益年化波动率最大回撤夏普比率卡玛比率200910996-02932112115342520201053443970290816821843182011-2018247125202804-080-07220123155309926902486117127201310111698227521358367745201441500442397144017328820151427664884861520429427420161020237431942442032042201714421513180215250800952018-2505164929163293-086-07620197369363925491577289467202010458740131571624331644202171765059233710643076752022373240427642311013016202303171279736成立以来4244329429635204144082资料来源Wind朝阳永续华泰研究图表19FADT增强组合分月度业绩1月2月3月4月5月6月7月8月9月10月11月12月200919144966574411512-1947881104914186052010-559605437277-364-418190013064131091124-3292011-198965-478-557-301360659-092-1444849-201-12692012-1461365-594636707295-237243022-007-1637211820131143653-1842741798-9761558861944-30912960962014764-153-4920488425935615601187035747-986201521311366277918762518-1282-993-1618-843246210658262016-2671-3862258-087245868145416-152301328-46320170901001063-325-680717337348290142-364-0712018-214-093443077182-560185-915-179-1127201-542201917821341007-202-471471479055582557-06486420205261154-615135393718761347802-329143-0364662021027066089306105312086381065-41919114260862022-10641176-724-96219951086363-308-864-161549-3282023968544-247资料来源Wind朝阳永续华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读14金工研究文本FADTBERT选股组合近期表现跟踪华泰金工研报人工智能62再探文本FADT选股2022-10-28中我们对盈利预测调整场景下的文本因子进行升级构建了forecastadjusttxtbert因子并基于该因子的多头端基础股票池进行增强构建top25的主动量化选股组合文本FADTBERTforecast-adjust-textportfolioBERT版截至2023年3月17日文本FADTBERT组合上周绝对收益为-171今年以来绝对收益为1672相对中证500超额收益1128自2009年初回测以来年化收益率4511相对中证500超额年化收益3498组合夏普比率156图表20文本FADTBERT增强组合净值回测期20090123-20230317最大回撤右轴增强组合回测净值中证500净值1800160140-20120-4010080-606040-80200-100200920102011201220132014201520162017201820192020202120222023资料来源朝阳永续Wind华泰研究图表21文本FADTBERT增强组合相对中证500净值回测期20090123-20230317超额最大回撤右轴相对中证500净值70060-1050-204030-3020-40100-50200920102011201220132014201520162017201820192020202120222023资料来源朝阳永续Wind华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读15金工研究图表22文本FADTBERT增强组合分年度业绩基准中证500回测期20090123-20230317时间年化区间收益率年化区间超额收益年化波动率最大回撤夏普比率卡玛比率200914754195234471891428780201058484526297920981962792011-1871265024642601-076-07220123403333526042306131148201311088787628551224388906201441640772210126718832920151250155534659472226826520161125234529172197039051201734503673177910231943372018-1644295726732902-062-05720199890558725411465389675202010501735930551640344640202130621573237615191292022022-918165627272274-034-0402023031716721128成立以来4511349828844722156096资料来源Wind朝阳永续华泰研究图表23文本FADTBERT增强组合分月度业绩1月2月3月4月5月6月7月8月9月10月11月12月200921368774609381326-1238581118415124722010083408294372020-78917421069451705214-0992011-275717-436-309-741328325036-1104796-092-12062012-5081279-640565270038-495464100-060-1062198120131120431159-1231317-135477351439138712630262014449-0541186401786007323471211-016440-066201513821155171612473178-1252-1359-1132381187167214012016-2043-0431890212332852270780085421293-3362017-204439202-220-439726-217430316175-6043262018074-036368-142149-974-083-292-123-741082-197201929016981308-467-7143113585064321380679052020556976-632104135211641819859-663-359-4611392021634545699395515905-077-115-194743714-0072022-785798-896-720879938-141-098-997152787-41720231380463-198资料来源Wind朝阳永续华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读16金工研究机构调研选股组合表现跟踪参考华泰金工报告利用文本和反转改进机构调研选股202329机构调研选股组合构建方法如下1将研报文本因子和一致预期EPS季度环比变化率因子标准化后等权合成在每个调仓日剔除合成因子排名后10的股票2在第1步筛选的股票中计算过去60个交易日个股相对中证500的累积超额收益在每个调仓日剔除超额收益排名前60的股票3在第2步筛选的股票中按照过去60个交易日调研次数排序选取前30只股票作为策略持仓股票的权重为log调研次数4策略在每月第一个交易日以当日vwap价格调仓交易成本为双边千分之三策略基准为中证500截至2023年3月17日机构调研选股组合相对中证500上周超额收益为-115今年以来超额收益为334模型回测以来年化收益率为2813相对中证500年化超额收益率为2171信息比率为206超额收益最大回撤为1442图表24机构调研选股组合净值图表25机构调研选股组合的超额收益策略净值中证500净值超额收益回撤右轴累积超额收益左轴1260105-584-1063-1542-2021-2500-30201308201408201508201608201708201808201908202008202108202208201608201408201508201708201808201908202008202108202208201308资料来源Wind朝阳永续华泰研究资料来源Wind朝阳永续华泰研究图表26机构调研选股组合回测绩效2013-08-30至2023-03-17基准为中证500指数年化超额收年化跟踪误超额收益最相对基准月调仓双边换年化收益率年化波动率夏普比率最大回撤益率差大回撤信息比率Calmar比率胜率手率机构调研选股组合281328980974595217110551442206151657911023中证50057225430226520资料来源朝阳永续Wind华泰研究图表27机构调研选股组合逐年收益率2013-08-30至2023-03-17基准为中证500指数2013年收益2014年收益2015年收益2016年收益2017年收益2018年收益2019年收益2020年收益2021年收益2022年收益2023年收益率率率率率率率率率率率机构调研选股组合1478393317434-966-390-2249654940934210-564864中证50045039014312-1778-020-3332263820871558-2031543资料来源Wind朝阳永续华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读17金工研究图神经网络选股策略近期表现华泰金工研报人工智能55图神经网络选股的进阶之路2022-04-11将残差图注意力网络GATresidual应用于中证500指数增强组合构建我们将定期跟踪该模型表现模型以半衰加权mse为损失函数半衰期为075组合为周度换仓单次换仓单边换手率上限为15回测交易费率单边千分之二选股因子测试流程等细节请参见原文截至2023年3月17日GATresidual模型上周超额收益为-089今年以来超额收益为-132模型2011年初回测以来年化超额收益率为1585年化跟踪误差为584信息比率为271超额收益最大回撤为797超额收益Calmar比率为199图表28GATresidual模型超额收益表现50025超额收益最大回撤右轴累计超额收益400203001520010100500-100-5-200-102014-01-042021-07-042011-07-042012-01-042012-07-042013-01-042013-07-042014-07-042015-01-042015-07-042016-01-042016-07-042017-01-042017-07-042018-01-042018-07-042019-01-042019-07-042020-01-042020-07-042021-01-042022-01-042022-07-042023-01-042011-01-04资料来源朝阳永续Wind华泰研究图表29GATresidual模型月度超额收益2011-01-04至2023-03-17基准为中证500指数1月2月3月4月5月6月7月8月9月10月11月12月年超额收益2011年35110601211706012410-04151512012年35071813151214151105-02351922013年14052522-0705-0748100623-041482014年08-0427042311-1702-0918-07-27282015年340610-080453-3047454737403202016年511530032656-2013-021719-172052017年-0710-03100422-0636151221121312018年-05121918131803-10251224-051312019年1002-0628-022110181216-04-081032020年-31-042723062512282131-17401702021年14-1504582521130519-11-05221592022年220503132016193101-2826251622023年0104-19-13资料来源朝阳永续Wind华泰研究图表30GATresidual模型回测绩效2011-01-04至2023-03-17基准为中证500指数Calmar比年化超额收年化跟踪误信息比超额收益超额收益相对基准月年化双边换年化收益率年化波动率夏普比率最大回撤率益率差率最大回撤Calmar比率胜率手率GATresidualwmse178926110694853037158558427179719977551614资料来源朝阳永续Wind华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读18金工研究图表31GATresidual模型合成因子累计RankIC和加权RankIC35累计RankIC累计加权RankIC3025201510502012-07-042015-01-042019-07-042011-07-042012-01-042013-01-042013-07-042014-01-042014-07-042015-07-042016-01-042016-07-042017-01-042017-07-042018-01-042018-07-042019-01-042020-01-042020-07-042021-01-042021-07-042022-01-042022-07-042023-01-042011-01-04资料来源朝阳永续Wind华泰研究图表32GATresidual模型合成因子评价指标2011-01-04至2023-03-17IC均RankIC加权IC加权RankICICIRRankICIR加权加权Top组精Bottom组Top组年化Bottom组年化多空对冲年化基准收值均值均值均值ICIRRankICIR确率精确率收益率收益率收益率益率GATresidual771958647870075089063082554559062376-24782427687资料来源朝阳永续Wind华泰研究图表33GATresidual网络结构资料来源华泰研究风险提示目前OpenAI尚未公布GPT-4具体实现原理本文利用已发表的相关研究论文对GPT-4原理进行分析可能与实际的GPT-4原理存在差距通过人工智能模型构建选股策略是历史经验的总结若市场规律改变存在失效的可能人工智能模型可解释程度较低归因较困难使用须谨慎免责声明和披露以及分析师声明是报告的一部分请务必一起阅读19金工研究免责声明分析师声明本人林晓明何康李子钰兹证明本报告所表达的观点准确地反映了分析师对标的证券或发行人的个人意见彼以往现在或未来并无就其研究报告所提供的具体建议或所表迖的意见直接或间接收取任何报酬一般声明及披露本报告由华泰证券股份有限公司已具备中国证监会批准的证券投资咨询业务资格以下简称本公司制作本报告所载资料是仅供接收人的严格保密资料本报告仅供本公司及其客户和其关联机构使用本公司不因接收人收到本报告而视其为客户本报告基于本公司认为可靠的已公开的信息编制但本公司及其关联机构以下统称为华泰对该等信息的准确性及完整性不作任何保证本报告所载的意见评估及预测仅反映报告发布当日的观点和判断在不同时期华泰可能会发出与本报告所载意见评估及预测不一致的研究报告同时本报告所指的证券或投资标的的价格价值及投资收入可能会波动以往表现并不能指引未来未来回报并不能得到保证并存在损失本金的可能华泰不保证本报告所含信息保持在最新状态华泰对本报告所含信息可在不发出通知的情形下做出修改投资者应当自行关注相应的更新或修改本公司不是FINRA的注册会员其研究分析师亦没有注册为FINRA的研究分析师不具有FINRA分析师的注册资格华泰力求报告内容客观公正但本报告所载的观点结论和建议仅供参考不构成购买或出售所述证券的要约或招揽该等观点建议并未考虑到个别投资者的具体投资目的财务状况以及特定需求在任何时候均不构成对客户私人投资建议投资者应当充分考虑自身特定状况并完整理解和使用本报告内容不应视本报告为做出投资决策的唯一因素对依据或者使用本报告所造成的一切后果华泰及作者均不承担任何法律责任任何形式的分享证券投资收益或者分担证券投资损失的书面或口头承诺均为无效除非另行说明本报告中所引用的关于业绩的数据代表过往表现过往的业绩表现不应作为日后回报的预示华泰不承诺也不保证任何预示的回报会得以实现分析中所做的预测可能是基于相应的假设任何假设的变化可能会显著影响所预测的回报华泰及作者在自身所知情的范围内与本报告所指的证券或投资标的不存在法律禁止的利害关系在法律许可的情况下华泰可能会持有报告中提到的公司所发行的证券头寸并进行交易为该公司提供投资银行财务顾问或者金融产品等相关服务或向该公司招揽业务华泰的销售人员交易人员或其他专业人士可能会依据不同假设和标准采用不同的分析方法而口头或书面发表与本报告意见及建议不一致的市场评论和或交易观点华泰没有将此意见及建议向报告所有接收者进行更新的义务华泰的资产管理部门自营部门以及其他投资业务部门可能独立做出与本报告中的意见或建议不一致的投资决策投资者应当考虑到华泰及或其相关人员可能存在影响本报告观点客观性的潜在利益冲突投资者请勿将本报告视为投资或其他决定的唯一信赖依据有关该方面的具体披露请参照本报告尾部本报告并非意图发送发布给在当地法律或监管规则下不允许向其发送发布的机构或人员也并非意图发送发布给因可得到使用本报告的行为而使华泰违反或受制于当地法律或监管规则的机构或人员本报告版权仅为本公司所有未经本公司书面许可任何机构或个人不得以翻版复制发表引用或再次分发他人无论整份或部分等任何形式侵犯本公司版权如征得本公司同意进行引用刊发的需在允许的范围内使用并需在使用前获取独立的法律意见以确定该引用刊发符合当地适用法规的要求同时注明出处为华泰证券研究所且不得对本报告进行任何有悖原意的引用删节和修改本公司保留追究相关责任的权利所有本报告中使用的商标服务标记及标记均为本公司的商标服务标记及标记中国香港本报告由华泰证券股份有限公司制作在香港由华泰金融控股香港有限公司向符合证券及期货条例及其附属法律规定的机构投资者和专业投资者的客户进行分发华泰金融控股香港有限公司受香港证券及期货事务监察委员会监管是华泰国际金融控股有限公司的全资子公司后者为华泰证券股份有限公司的全资子公司在香港获得本报告的人员若有任何有关本报告的问题请与华泰金融控股香港有限公司联系免责声明和披露以及分析师声明是报告的一部分请务必一起阅读20
|
相关研报
|
||||||||||||||||||||||
