研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 国金证券-Alpha掘金系列之五:如何利用ChatGPT挖掘高频选股因子?-230404
上传日期:   2023/4/5 大小:   2209KB
格式:   pdf  共19页 来源:   国金证券
评级:   -- 作者:   高智威
下载权限:   无限制-登录即可下载
ChatGPT模型介绍及原理解析
  GPT(Generative Pre-trained Transformer)是一种大语言模型(LLM),能够学习大量文本数据,并推断出文本中词语之间的关系。ChatGPT能够进行连续对话,综合上下文内容进行交流,能完成翻译、撰写邮件、代码等任务。该模型相较于传统LSTM模型的改进之处在于其引用了Transformer模型,对输入数据的不同部分给予不同权重。
  ChatGPT之所以能够获得如此高的智能水平,参数数量提升所带来的涌现现象(Scaling Law)和加入RLHF(人类反馈的强化学习)所带来的对于人类偏好理解的提升起到了重要作用。RLHF训练共分为3步,首先聘请40名标注员对指令进行标注,对模型进行微调。然后对模型的不同输出结果进行排序,使其更符合人类预期,并利用排序结果训练一个打分模型(Reward Model)。最终采样新的指令作为输入数据,根据打分模型进一步优化模型的输出结果。结合打分模型训练,得到最终的ChatGPT模型。
  ChatGPT提示工程介绍及使用指南
  提示工程(Prompt Engineering)主要用于开发和优化语言模型中的提示,有效地将ChatGPT用于各种应用和研究主题。掌握并应用好提示工程的技能,不仅能够提高使用人工智能系统的准确性和效率,也能够降低成本并提升使用体验。最基本的提示公式包括角色、任务及指令三个部分,其主要目的在于使模型对于所需要的回答类型和回答方式有一定的指向性。提示的内容越详尽、精确,模型能够给出的回答更能符合我们的预期,从而更便捷得到我们需要的结果。除标准的提示公式外,也有多种针对不同任务类型的提示方式。一种独特的提示方式为思维链提示(Chain-of-Thought Prompting),其主要思路为将一个复杂问题拆分成多个步骤,引导模型逐步思考并进行纠偏,最终得到需要的结果。
  ChatGPT因子挖掘实战
  ChatGPT在量化研究领域同样拥有广泛的使用前景,我们以最常见的因子挖掘作为测试场景,考察模型经过一定的提示后,能否给出符合需求的结果。在中低频领域,ChatGPT给出了价和量的变异系数因子,我们利用5日滚动数据构建因子并进行周度调仓测试。发现因子IC指标表现较好,但多头组超额收益较低,难以成功构建投资策略。
  另外,我们令ChatGPT模型尝试利用高频数据构建出独特因子,并限定其数据使用范围为委托价和委托量。模型经过一定指导后给出了买卖盘力量因子,经过测试发现买卖盘力量差异因子在日频上表现优异,多头年化超额收益率达到17.29%,但因子衰减速度较快。为符合交易实际,我们针对买盘和卖盘力量因子分别降至周频进行测试,发现虽然因子整体多空单调性一般,但多头组合表现尚可,多头年化超额收益率分别为9.77%和10.20%。最终,我们利用相对表现较好的卖盘力量因子构建中证1000指数增强策略。发现在单边千分之二的手续费率下,策略的年化超额收益率为7.17%,信息比率为0.57。
  此外我们对于ChatGPT代码能力进行测试,发现针对常用的量化研究所需框架、函数等能较准确的给出结果,但使用时需要注意代码细节,确保其符合实际需求。对模型所给代码进行微调可以大幅提升研究效率。
  风险提示
  1、ChatGPT模型具有一定的随机性,在部分情况下可能回答错误,不符合用户需求与认知,并影响到用户判断。
  2、以上因子测试结果通过历史数据统计、建模和测算完成,在政策、市场环境发生变化时模型存在失效的风险。
  3、策略依据一定的假设通过历史数据回测得到,当交易成本提高或其他条件改变时,可能导致策略收益下降甚至出现亏损。
研究报告全文:GPTGenerativePre-trainedTransformer是一种大语言模型LLM能够学习大量文本数据并推断出文本中词语之间的关系ChatGPT能够进行连续对话综合上下文内容进行交流能完成翻译撰写邮件代码等任务该模型相较于传统LSTM模型的改进之处在于其引用了Transformer模型对输入数据的不同部分给予不同权重ChatGPT之所以能够获得如此高的智能水平参数数量提升所带来的涌现现象ScalingLaw和加入RLHF人类反馈的强化学习所带来的对于人类偏好理解的提升起到了重要作用RLHF训练共分为3步首先聘请40名标注员对指令进行标注对模型进行微调然后对模型的不同输出结果进行排序使其更符合人类预期并利用排序结果训练一个打分模型RewardModel最终采样新的指令作为输入数据根据打分模型进一步优化模型的输出结果结合打分模型训练得到最终的ChatGPT模型提示工程PromptEngineering主要用于开发和优化语言模型中的提示有效地将ChatGPT用于各种应用和研究主题掌握并应用好提示工程的技能不仅能够提高使用人工智能系统的准确性和效率也能够降低成本并提升使用体验最基本的提示公式包括角色任务及指令三个部分其主要目的在于使模型对于所需要的回答类型和回答方式有一定的指向性提示的内容越详尽精确模型能够给出的回答更能符合我们的预期从而更便捷得到我们需要的结果除标准的提示公式外也有多种针对不同任务类型的提示方式一种独特的提示方式为思维链提示Chain-of-ThoughtPrompting其主要思路为将一个复杂问题拆分成多个步骤引导模型逐步思考并进行纠偏最终得到需要的结果ChatGPT在量化研究领域同样拥有广泛的使用前景我们以最常见的因子挖掘作为测试场景考察模型经过一定的提示后能否给出符合需求的结果在中低频领域ChatGPT给出了价和量的变异系数因子我们利用5日滚动数据构建因子并进行周度调仓测试发现因子IC指标表现较好但多头组超额收益较低难以成功构建投资策略另外我们令ChatGPT模型尝试利用高频数据构建出独特因子并限定其数据使用范围为委托价和委托量模型经过一定指导后给出了买卖盘力量因子经过测试发现买卖盘力量差异因子在日频上表现优异多头年化超额收益率达到1729但因子衰减速度较快为符合交易实际我们针对买盘和卖盘力量因子分别降至周频进行测试发现虽然因子整体多空单调性一般但多头组合表现尚可多头年化超额收益率分别为977和1020最终我们利用相对表现较好的卖盘力量因子构建中证1000指数增强策略发现在单边千分之二的手续费率下策略的年化超额收益率为717信息比率为057此外我们对于ChatGPT代码能力进行测试发现针对常用的量化研究所需框架函数等能较准确的给出结果但使用时需要注意代码细节确保其符合实际需求对模型所给代码进行微调可以大幅提升研究效率1ChatGPT模型具有一定的随机性在部分情况下可能回答错误不符合用户需求与认知并影响到用户判断2以上因子测试结果通过历史数据统计建模和测算完成在政策市场环境发生变化时模型存在失效的风险3策略依据一定的假设通过历史数据回测得到当交易成本提高或其他条件改变时可能导致策略收益下降甚至出现亏损敬请参阅最后一页特别声明1金融工程专题报告内容目录一ChatGPT模型介绍及原理解析411大语言模型与模型演进历程412ChatGPT模型表现优异背后的逻辑5二ChatGPT提示工程介绍及使用指南521Prompt提示公式622提示工程分类723思维链提示Chain-of-ThoughtPrompting8三ChatGPT因子挖掘实战1031周频变异系数因子构建与测试结果1032高频买卖盘力量因子构建与测试结果1233ChatGPT代码输出测试因子测试与组合优化15四总结17风险提示18图表目录图表1ChatGPT模型演进历程4图表2RLHF人类反馈的强化学习过程示意图5图表3ChatGPT生成因子示例16图表4ChatGPT生成因子示例27图表5ChatGPT生成因子示例37图表6提示工程分类示例及说明7图表7ChatGPT情感分析示例18图表8ChatGPT情感分析示例28图表9A因子IC指标示例18图表10B因子IC指标示例28图表11ChatGPT思维链提示示例19图表12ChatGPT思维链提示示例29图表13ChatGPT思维链提示示例39图表14ChatGPT思维链提示示例410图表15ChatGPT思维链提示示例510图表16ChatGPT生成因子示例410敬请参阅最后一页特别声明2金融工程专题报告图表17ChatGPT变异系数因子IC指标周频11图表18ChatGPT变异系数因子多空组合净值周频11图表19ChatGPT变异系数因子多空组合指标周频11图表20ChatGPT高频因子挖掘示例112图表21ChatGPT高频因子挖掘示例212图表22ChatGPT买卖盘力量因子IC指标日频13图表23ChatGPT买卖盘力量因子多空组合净值日频13图表24ChatGPT买卖盘力量因子多空组合指标日频13图表25ChatGPT买卖盘力量因子多头组合净值周频14图表26ChatGPT买卖盘力量因子多空组合指标周频14图表27基于ChatGPT买卖盘力量因子的中证1000指数增强策略表现15图表28基于ChatGPT买卖盘力量因子的中证1000指数增强策略指标15图表29ChatGPT因子测试框架代码示例116图表30ChatGPT因子测试框架代码示例216图表31ChatGPT组合优化代码示例117图表32ChatGPT组合优化代码示例217敬请参阅最后一页特别声明3金融工程专题报告在前期系列报告中我们利用高频数据已经构建出了一系列表现优异的选股因子本篇报告作为Alpha掘金系列的第五篇同时也是ChatGPT量化研究系列的第一篇将使用ChatGPT探索其在量化研究领域的表现经过测试发现模型经过一定的引导能够挖掘出具有一定创新性的高频因子最终得到了ChatGPT买卖盘力量因子在将因子降至周频后成功构建出了能够满足机构投资者要求的中证1000指数增强策略11大语言模型与模型演进历程ChatGPT全名ChatGenerativePre-trainedTransformer是由人工智能研究实验室OpenAI在2022年11月30日发布的一款AI聊天程序一经发布便在全球开启了一波ChatGPT热潮短短2个月内用户数已过亿该模型是一款人工智能技术驱动的自然语言处理工具使用的是GPT-35架构的千亿参数大语言能够进行连续对话综合上下文内容进行交流的自然语言处理NLP模型并通过强化学习进行训练从而理解人类的语言来进行对话甚至能完成撰写邮件视频脚本文案翻译代码写论文等任务ChatGPT也是迄今为止AI大模型最接近商用落地的成果输出内容非常接近人类的常识认知需求和价值观这项新的科技革命正在持续升温所覆盖的范围在新媒体编程教育医疗广告电商平台等各行各业然而针对二级市场投资研究领域ChatGPT模型能带来怎样的变革相关研究较少本文将从量化研究领域为读者带来该模型的使用方法和效果演示GPTGenerativePre-trainedTransformer作为一种大语言模型LLM能够学习大量文本数据并推断出文本中词语之间的关系随着过去几年计算能力的不断发展输入数据集和参数空间parameterspace的不断增加LLM的能力也在不断提升语言模型的一项基本任务是预测一句话中的单个词或根据上文推断下文传统的LSTMLongShort-TermMemory模型在处理这类问题时存在两大缺陷模型对于文本中不同词无法区分出重要程度的差异即无法让某些词比其他词的权重更高该模型对于长距离的信息不能有效提取和记忆导致了大量信息丢失2017年论文AttentionisAllYouNeed中Transformer的引入有效解决了上述问题它通过跟踪序列数据中的关系来学习上下文并学习语句的含义利用自注意力机制Self-attentionmechanism给予输入数据的不同部分赋予不同权重这一革新让LLM拥有了更大的成长空间同时也能够处理更大的数据集2018年6月发布的GPT-1模型就已经开始使用Transformer模型该模型包括了编码器和解码器结构参数数量大约为117亿个2019年2月GPT-2模型的参数数量已经达到15亿在自然语言处理领域取得了非常显著的进展GPT-3模型的参数数量高达1750亿成为当时最先进的自然语言处理领域的最先进模型2023年3月发布的GPT-4模型将传统的文本输入拓展到了图片同时它的理解能力也得到了显著提升在处理复杂问题时表现出了更高的准确性和洞察力图表1ChatGPT模型演进历程来源OntheComparabilityofPre-trainedLanguageModelsMatthias2020EvaluatingLargeLanguageModelsTrainedonCodeMarkChen2021OpenAIBFT智能机器人研究公众号国金证券研究所敬请参阅最后一页特别声明4金融工程专题报告12ChatGPT模型表现优异背后的逻辑ChatGPT拥有如此高度的智能水平背后有着多重因素的共同作用包括随着参数数量提升带来的涌现现象scalinglaw加入RLHF人类反馈的强化学习所带来的对于人类偏好理解的提升等都给模型提供了较强的提升作用RLHF是一种用于增强语言模型性能的技术利用关系网络和潜在因子来增强模型的表示能力和泛化能力这种方式可以帮助其更好地理解和学习文本中的语义关系和结构生成更加准确和流畅的文本其训练基本步骤如下从大量的包含人类真实意图的指令集合中采样聘请40名标注人员对这些指令进行标注标注完成后在ChatGPT中对模型进行微调再次从指令集中采样作为输入数据从ChatGPT35中得到多个不同结果聘请标注员对这些输出的好坏顺序进行标注得到输出顺序后训练一个打分模型rewardmodel使得模型输出结果更能贴近人类最需要的答案获得打分模型后从指令集合中采样新的指令作为输入数据根据打分模型进一步优化模型的输出结果结合打分模型训练得到最终的ChatGPT模型图表2RLHF人类反馈的强化学习过程示意图来源httpsopenaicomblogchatgpt国金证券研究所在这种训练模式下AI逐步具备了一些常识自GPT-2开始只需给模型投喂一些示例就能使其举一反三给出需要的结果基本的训练模式分类包括Zero-shotlearning指的是模型在没有经过训练数据的情况下可以利用已有的知识和推理能力完成新任务例如在翻译任务中如果模型训练过英文到法语的翻译任务它可以无需训练来处理英文到德语的翻译任务One-shotlearning指的是模型在只有一组训练数据的情况下可以学习并完成任务例如在人脸识别中如果只提供一张某人的照片模型可以学习识别该人的所有照片Few-shotlearning指的是模型在只有少量训练数据的情况下可以学习并完成任务例如在自然语言推理中如果只提供很少的相关语料模型可以学习理解和推理其他类似语料的能力因此ChatGPT由于巨大的参数量和大量的预训练拥有极强的学习能力可以在不同的任务中做到足够出色的表现大语言模型能够处理的任务极其广泛人类与其交流的灵活度和自由度也达到了空前的高度然而如何正确与其对话进行合适的提示对于获取最终需要的结果至关重要提示工程PromptEngineering作为一门新兴学科主要用于开发和优化语言模型中的提示有效地将ChatGPT用于各种应用和研究主题掌握并应用好提示工程的技能不仅能够提高使用人工智能系统的准确性和效率也能够降低成本并提升使用体验对于研究人员而言也有助于更好地理敬请参阅最后一页特别声明5金融工程专题报告解模型的能力和局限性通过交互和提示更加方便准确地使ChatGPT给出我们需要的结果21Prompt提示公式提示工程的核心是通过设计和提供有效提示或起始短语指导ChatGPT语言模型的文本生成一般的提示工程通常由以下3个元素组成角色模型在本文生成任务中应扮演的角色任务对模型需要生成的内容进行清晰简介的叙述指令在生成文本时应遵循的指令提示公式一般形式为作为一个角色按照这些指示生成任务指令如希望ChatGPT充当客服的角色完成日常的客户答疑等场景需求则提示公式可以为作为一名客服人员请生成客户询问的回复这些回复应当专业准确简洁限制提示方式的一个重要作用在于这种方式能够向模型灌输一种角色并且起到约束行为的作用从而能使模型按照人类的期望完成回答此外我们可以为模型设置更具体化的角色以满足我们的要求如我们需要模型能给出一个足够专业的回答时可以针对角色部分稍加修饰以使模型的回复更具针对性针对指令部分我们也可以完善丰富提示信息进一步限制模型的回答范围从而更便捷得到我们需要的结果如作为一名资深的量化研究员请给出一个你认为行之有效的选股因子该因子必须具有原创性具有较强的逻辑支撑且因子也应当有出色的业绩表现图表3ChatGPT生成因子示例1来源ChatGPT国金证券研究所以此为基础我们可以进一步限定因子类别构建方式和使用数据最终得到一个符合我们基本需要的因子在下图示例中我们将提示的指令部分进行拓展针对其回答中可能存在的偏差进行限制从而大大提升了因子的有效性敬请参阅最后一页特别声明6金融工程专题报告图表4ChatGPT生成因子示例2图表5ChatGPT生成因子示例3来源ChatGPT国金证券研究所来源ChatGPT国金证券研究所可以看出经过详细的严格的限制后模型已经能给出一些基本符合要求的因子在示例2中模型不仅正确使用了逐笔成交数据中的字段且根据提示中的限制条件给出了使用计算均值的方法将因子进行降频的操作示例3中因子的构建方式可以明显看出模型参考了一些现有文献和研究结果在其已有知识的基础上进行一定变形组合得到了新的选股因子22提示工程分类除标准化的提示工程之外我们可以使用多种类型的提示方式使模型完成不同类型任务满足用户的各类需求图表6提示工程分类示例及说明提示类型提示示例提示类型说明将一些新信息与关于特定主题的现有知识知识生成提示使用模型里预先存在的知识生成新的信息或回答问题结合生成新的知识请对以下产品评论进行情感分析并将其分类为积情感分析提示让模型判断一段输入文本的情感色彩或态度极消极或中立插入评论使用强化学习将以下文本文本从插入语言通过向模型提供一组输入和奖励并允许其根据所接受的强化学习提示翻译为插入语言奖励调整行为从而让模型从过去的行为中学习对抗性提示生成难以被分类为具有插入情感情感的文本让模型生成的文本难以生成与所需一致的文本来源国金证券研究所针对其中情感分析类型我们截取了两段不同的新闻热点以供模型识别发现由于神经网络模型本身具有一定的随机性当输入文本没有特别明确的情感词时模型给出的结果会有出一定的不确定性但整体而言仍能保证一定的准确率敬请参阅最后一页特别声明7金融工程专题报告图表7ChatGPT情感分析示例1图表8ChatGPT情感分析示例2来源每日经济新闻ChatGPT国金证券研究所来源e公司公众号ChatGPT国金证券研究所23思维链提示Chain-of-ThoughtPromptingWeietal2022发现利用思维链Chainofthought能够极大提升大语言模型在处理复杂逻辑问题上的表现通过简单的思维链提示的方式就能大大提升一些通用任务符号化的推理任务和算数任务的准确率这种提示方式一般采用分步骤思考的方式thinkstepbystep进行引导模型将中间推导过程展现出来一般而言思维链提示更多用于数学推理提升的演示此处我们提供示例说明思维链提示的方式也能让模型对于量化研究领域提升其回答效果我们知道IC指标秩相关系数作为一种因子评价方式被广泛使用仍存在一些明显的漏洞对于两个相同IC值得因子若其因子值与收益率的相关性在不同区间范围内有着明显的差异可能会导致使用该因子在投资时实际效果会大打折扣如下图所示我们给出了两个因子值排序和对应收益率的一一对应关系两因子的IC值分别为022和025然而由图可知A因子虽然IC值相对较低但多头表现较好而B因子虽IC值相对较高但多头组却表现最差这一现象会使得根据因子进行实际投资时得到与IC指标截然相反的效果图表9A因子IC指标示例1图表10B因子IC指标示例2141412121010886644220002468100246810-2-2-4-4来源国金证券研究所来源国金证券研究所一般而言根据分组赋予IC不同权重多头组权重更高求得加权IC是一个比较直接的解决方案接下来我们利用思维链提示的方式引导ChatGPT模型思考判断其能否准确意识到这一问题并根据此问题得出改进解决方案敬请参阅最后一页特别声明8金融工程专题报告图表11ChatGPT思维链提示示例1来源ChatGPT国金证券研究所我们首先尝试了直接询问ChatGPT有什么方式可以改进IC指标发现其回答在不经适当引导的情况下很难给出我们思考的问题和改进角度图表12ChatGPT思维链提示示例2图表13ChatGPT思维链提示示例3来源ChatGPT国金证券研究所来源ChatGPT国金证券研究所敬请参阅最后一页特别声明9金融工程专题报告图表14ChatGPT思维链提示示例4图表15ChatGPT思维链提示示例5来源ChatGPT国金证券研究所来源ChatGPT国金证券研究所可以看出经过我们的初步提示ChatGPT已经认识到我们关注的IC指标存在的问题并及时给出了一个解决方案每组内分别计算IC值再将所有组内的相关系数求均值得到横截面IC值但其逻辑思维能力仍有一定漏洞我们直接指出后成功得到了想要的解决方式计算加权平均IC来改进IC指标以反映不同组对整体IC值的贡献程度但由于其对于股票市场A股的做空限制可能认识不足我们进一步提示后ChatGPT最终给出了应当给做多组赋予更高权重的回答但需要注意的是ChatGPT被训练时接受了海量的文本和数据其处理实际问题时仍存在一些生搬硬套的现象需要不断提示纠正由以上案例可以说明ChatGPT在量化研究领域展现出了一定的实用价值我们此处以常见的因子挖掘作为研究方向考察经过一定程度的提示prompt模型是否能给出符合需求的结果31周频变异系数因子构建与测试结果首先我们在中低频上维度上对ChatGPT的因子挖掘能力进行测试此处考虑基于量价数据让ChatGPT模型给出一些独特原创的因子图表16ChatGPT生成因子示例4来源ChatGPT国金证券研究所该因子在收盘价和成交量两个领域分别计算其变异系数并相乘得到一个综合的选股因子用来衡量股票的波动性和敬请参阅最后一页特别声明10金融工程专题报告流动性此外我们考虑对因子进行适当变形将两者变异系数相除得到新的变异系数因子LI2VLI利用日频的量价数据取过去5天的价格和成交量变异系数进行计算对该因子进行构建LIVLI2LIVLI我们同样在2016年至2022年8月的区间范围内中证1000指数成份股上进行测试以周度频率进行调仓每周初开盘价作为买入价格每周最后一个交易日收盘价作为卖出价格因子的IC指标如下初步来看四个因子IC的T值均大于2IC均值从279至536不等可以说明价格和成交量的波动率均为越低越好基本符合低波动异象的情况图表17ChatGPT变异系数因子IC指标周频因子平均值标准差最小值最大值风险调整后ICT统计量LI-5361225-47764304-044-807VLI-279683-34601819-041-753LIxVLI-529909-33493376-058-1074LI2VLI-3111224-35954906-025-469来源ChatGPTWind国金证券研究所我们根据十分位组合构建出了因子的多空组合净值此处展示了多空净值曲线和几个关键指标图表18ChatGPT变异系数因子多空组合净值周频2181614121080604020201614201714201814201914202014202114202214LIVLILIxVLILI2VLI来源ChatGPTWind国金证券研究所图表19ChatGPT变异系数因子多空组合指标周频因子年化收益率波动率夏普比率最大回撤多头组合年化超额收益率LI83516420513143-109VLI8409750862004275LIxVLI88912460712758074敬请参阅最后一页特别声明11金融工程专题报告因子年化收益率波动率夏普比率最大回撤多头组合年化超额收益率LI2VLI20615870133514074来源ChatGPTWind国金证券研究所从净值曲线可以看出除LI2VLI因子外其余因子的多空曲线走势较为平稳不过对于我们更关注的多头组合年化超额收益率发现虽然因子的IC指标整体表现较好但多头表现欠佳因子单调性整体不够明显其中较高的VLI因子多头年化超额收益率为275多头夏普比率为01732高频买卖盘力量因子构建与测试结果利用高频数据构建选股因子作为目前市场关注度较高的一个领域拥挤度相对较低且利用此类数据所能挖掘到的因子往往与传统因子有一定的独立性我们此处限定ChatGPT在高频领域进行挖掘使用思维链提示的方式探究模型的创新性和逻辑性水平此处首先限定因子的数据使用范围即结合高频数据里独有的委托量和委托价进行构建并限制因子必须有一定的原创性在经过一定程度的引导后得到了买卖盘力量因子图表20ChatGPT高频因子挖掘示例1图表21ChatGPT高频因子挖掘示例2来源ChatGPT国金证券研究所来源ChatGPT国金证券研究所由此我们根据模型所给出的因子构建方式利用已有的A股tick数据进行构建并进行因子测试使用与前期系列报告中相似的处理方式对每只股票每天的3秒快照数据分别求出前十档的买入委托价买入委托量和卖出委托价卖出委托量最终每个交易日求出均值得到买盘力量卖盘力量和买卖盘力量差异因子此处买卖盘力量差异因子我们考虑到逻辑合理性需要做标准化以做到横截面可比因此构建过程中我们对因子进行了修正BVol1priceSVol1price敬请参阅最后一页特别声明12金融工程专题报告我们首先对因子进行了日频调仓的测试测试时间范围为2016年1月-2022年8月股票范围为所有中证1000指数成份股以次日开盘价作为买入价格测试结果如下图表22ChatGPT买卖盘力量因子IC指标日频因子平均值标准差最小值最大值风险调整后ICT统计量BForce-0241551-52364469-002-061SForce-1021439-52614227-007-287BSForce113649-21022637017700来源ChatGPT上交所深交所Wind国金证券研究所可以看出在日频的调仓频率下表现相对较好的是卖盘力量因子SForce和买卖盘力量差异因子BSForce两者的T统计量均大于2IC均值也在1以上我们根据十分位组合构建出了因子的多空净值此处展示了多空净值曲线和一些关键指标图表23ChatGPT买卖盘力量因子多空组合净值日频9876543210201614201714201814201914202014202114202214BforceSforceBSForce来源ChatGPT上交所深交所Wind国金证券研究所图表24ChatGPT买卖盘力量因子多空组合指标日频因子年化收益率波动率夏普比率最大回撤多头组合年化超额收益率BForce1874194709635251117SForce40618880223871657BSForce37008214514881729来源ChatGPT上交所深交所Wind国金证券研究所从多空组合的表现来看虽然买盘力量因子的IC值不如卖盘力量因子显著但其多空组合差异更明显多头也有1117的年化超额收益多空力量因子由于其综合考虑了两个方向的因子并衡量了买卖盘力量失衡的特点相较于单一方向的因子有明显提高多空夏普比率为451多头年化超额收益率为1729可以说明利用ChatGPT所给方式日内tick数据中的委托价和委托量所构建的买盘力量卖盘力量能够有效预测次日的股票横截面收益率差异考虑到日频调仓的成本过高对于实际投资的盈利水平影响较大难以获得实际收益我们此处进一步将因子降为周频测试其效果在中证1000指数成份股上每周第一个交易日的开盘价成交进行测试由于买卖盘力量差异因子BSForce衰减速度过快在第二天基本已经失效我们此处仅使用卖盘力量和卖盘力量因子进行降频测试其测试效果如下敬请参阅最后一页特别声明13金融工程专题报告图表25ChatGPT买卖盘力量因子多头组合净值周频3252151050201614201714201814201914202014202114202214市场BForceSforce来源ChatGPT上交所深交所Wind国金证券研究所图表26ChatGPT买卖盘力量因子多空组合指标周频因子年化收益率波动率夏普比率最大回撤多头组合年化超额收益率BForce65220780313881977SForce827206604037181020来源ChatGPT上交所深交所Wind国金证券研究所两个因子在降为周频后虽然多空单调性一般但多头组合表现尚可多头年化超额收益率分别为977和1020多头夏普比率分别为048和049说明使用ChatGPT所给方式构建买盘力量和卖盘力量因子表现具有一定的持续性但由于两因子的相关性较高我们不再考虑做因子合成直接使用表现较好的卖盘力量因子SForce构建中证1000指数增强策略策略回测期为2016年1月至2022年8月以每周第一个交易日的开盘价买入进行周频调仓每次对前5的股票等权买入以中证1000指数为基准进行比较在单边千分之二的手续费率下测试结果如下敬请参阅最后一页特别声明14金融工程专题报告图表27基于ChatGPT买卖盘力量因子的中证1000指数增强策略表现1816141210806040202016110201711020181102019110202011020211102022110ChatGPT买卖盘力量增强策略中证1000指数超额净值来源ChatGPT上交所深交所Wind国金证券研究所图表28基于ChatGPT买卖盘力量因子的中证1000指数增强策略指标统计指标ChatGPT买卖盘力量增强策略中证1000指数年化收益率365-289年化波动率27692409夏普比率013-012最大回撤53785511双边换手率周度1272年化超额收益率717跟踪误差1252信息比率057超额最大回撤2116来源ChatGPT上交所深交所Wind国金证券研究所可以看出ChatGPT买卖盘力量因子在2016和2017年表现相对较差但后续年份基本都表现出了较高的超额收益多头年化超额收益率为717信息比率为057且因子的换手率相对较低双边的周度换手率均值为1272可以为现有的多因子组合提供一定的提升空间33ChatGPT代码输出测试因子测试与组合优化值得一提的是ChatGPT不仅在文字数学和表格类回答形式能给用户较好的反馈其同样也可以直接输出代码从而帮助我们减少在量化研究中的代码工作量同时也能为不熟悉编程的研究员提供很好的快速上手机会因子测试作为因子量化研究中必不可少的重要环节有着相对固定和成熟的框架我们此处尝试令ChatGPT写出一个因子测试框架以观察其代码编写能力敬请参阅最后一页特别声明15金融工程专题报告图表29ChatGPT因子测试框架代码示例1图表30ChatGPT因子测试框架代码示例2来源ChatGPT国金证券研究所来源ChatGPT国金证券研究所由上图可以看出由于经过大量数据文献代码等海量知识的训练ChatGPT模型已经能较完整的写出一个因子测试框架包括了我们所需要的基本功能如IC值指标计算十分组测试等然而细究发现我们推测由于其所接受到的训练大部分来自于海外文献和海外代码在因子测试的常用操作中与国内业界常用做法并不相符在经过指导纠正后模型也未能准确地将我们的提示理解可能已经陷入了其知识盲区最终的IC和年化收益率计算方式未能正确提供相应代码因此若需使用ChatGPT实现代码输出以提升效率需格外注意其细节处理方式是否符合我们预期在个别情况下可能会出现一些bug仍需我们手动处理同时由于代码能否正常运行与我们的数据源格式有很大关系我们仍需将数据源调整为ChatGPT代码所默认的格式或者修改相关数据处理代码以获得正常结果综上我们更建议对于一些并不熟悉的函数和模型可以快速使用ChatGPT帮助我们了解其基本用法和思路在敬请参阅最后一页特别声明16金融工程专题报告ChatGPT所给代码的基础上进行修正从而大大提升研究效率我们以组合优化为例令ChatGPT分别写出了使用均值方差模型进行最大化夏普和使用Black-Litterman模型的组合优化代码可以看出ChatGPT比较准确地给出了相关库和函数的基本用法有助于研究员快速掌握学习并进行修正调试使用图表31ChatGPT组合优化代码示例1图表32ChatGPT组合优化代码示例2来源ChatGPT国金证券研究所来源ChatGPT国金证券研究所通过研究测试我们发现ChatGPT作为一种大语言模型在量化研究领域也能提供很多不同形式的解决方案从量化研究的概念和知识到挖掘创新性高频因子和输出代码等工作都能在一定程度上提升研究人员的工作效率帮助提供疑问解答和创新思路都能取得令人满意的效果我们利用一定的提示工程方法和技巧对ChatGPT加以引导和限制发现模型能够结合其本身训练得到的知识加以改进创新最终得到基本符合我们需求的高频因子我们对ChatGPT买卖盘力量因子进行构建并测试发现在日度的调仓频率下买卖盘力量差异因子多头年化超额收益率达到1729最大回撤为488考虑交易实际我们将因子进行降频在周度的调仓频率下买卖盘力量因子依然有10左右的多头年化超额收益率为考虑手续费对因子盈利性产生的影响我们利用该因子构建了中证1000指数敬请参阅最后一页特别声明17金融工程专题报告增强策略在2016年1月至2022年8月期间手续费率为单边千分之二的情况下策略的年化超额收益率为717信息比率为057作为一个具有相对独特数据来源的高频因子ChatGPT买卖盘力量因子可以为现有的多因子组合提供一定的提升空间最后我们测试了ChatGPT输出代码的能力发现其对于量化研究常用的框架函数都能基本掌握但在一些细节问题上仍然需要我们进行纠正微调因此对于一些并不熟悉的函数和模型可以快速使用ChatGPT帮助我们了解其基本用法和思路并在所给代码的基础上进行修正从而大大提升研究效率1ChatGPT模型具有一定的随机性在部分情况下可能回答错误不符合用户需求与认知并影响到用户判断2以上因子测试结果通过历史数据统计建模和测算完成在政策市场环境发生变化时模型存在失效的风险3策略依据一定的假设通过历史数据回测得到当交易成本提高或其他条件改变时可能导致策略收益下降甚至出现亏损敬请参阅最后一页特别声明18金融工程专题报告特别声明国金证券股份有限公司经中国证券监督管理委员会批准已具备证券投资咨询业务资格形式的复制转发转载引用修改仿制刊发或以任何侵犯本公司版权的其他方式使用经过书面授权的引用刊发需注明出处为国金证券股份有限公司且不得对本报告进行任何有悖原意的删节和修改本报告的产生基于国金证券及其研究人员认为可信的公开资料或实地调研资料但国金证券及其研究人员对这些信息的准确性和完整性不作任何保证本报告反映撰写研究人员的不同设想见解及分析方法故本报告所载观点可能与其他类似研究报告的观点及市场实际情况不一致国金证券不对使用本报告所包含的材料产生的任何直接或间接损失或与此有关的其他任何损失承担任何责任且本报告中的资料意见预测均反映报告初次公开发布时的判断在不作事先通知的情况下可能会随时调整亦可因使用不同假设和标准采用不同观点和分析方法而与国金证券其它业务部门单位或附属机构在制作类似的其他材料时所给出的意见不同或者相反本报告仅为参考之用在任何地区均不应被视为买卖任何证券金融工具的要约或要约邀请本报告提及的任何证券或金融工具均可能含有重大的风险可能不易变卖以及不适合所有投资者本报告所提及的证券或金融工具的价格价值及收益可能会受汇率影响而波动过往的业绩并不能代表未来的表现客户应当考虑到国金证券存在可能影响本报告客观性的利益冲突而不应视本报告为作出投资决策的唯一因素证券研究报告是用于服务具备专业知识的投资者和投资顾问的专业产品使用时必须经专业人士进行解读国金证券建议获取报告人员应考虑本报告的任何意见或建议是否符合其特定状况以及若有必要咨询独立投资顾问报告本身报告中的信息或所表达意见也不构成投资法律会计或税务的最终操作建议国金证券不就报告中的内容对最终操作建议做出任何担保在任何时候均不构成对任何人的个人推荐在法律允许的情况下国金证券的关联机构可能会持有报告中涉及的公司所发行的证券并进行交易并可能为这些公司正在提供或争取提供多种金融服务本报告并非意图发送发布给在当地法律或监管规则下不允许向其发送发布该研究报告的人员国金证券并不因收件人收到本报告而视其为国金证券的客户本报告对于收件人而言属高度机密只有符合条件的收件人才能使用根据证券期货投资者适当性管理办法本报告仅供国金证券股份有限公司客户中风险评级高于C3级含C3级的投资者使用本报告所包含的观点及建议并未考虑个别客户的特殊状况目标或需要不应被视为对特定客户关于特定证券或金融工具的建议或策略对于本报告中提及的任何证券或金融工具本报告的收件人须保持自身的独立判断使用国金证券研究报告进行投资遭受任何损失国金证券不承担相关法律责任若国金证券以外的任何机构或个人发送本报告则由该机构或个人为此发送行为承担全部责任本报告不构成国金证券向发送本报告机构或个人的收件人提供投资建议国金证券不为此承担任何责任此报告仅限于中国境内使用国金证券版权所有保留一切权利上海北京深圳电话021-60753903电话010-85950438电话0755-83831378传真021-61038200邮箱researchbjgjzqcomcn传真0755-83830558邮箱researchshgjzqcomcn邮编100005邮箱researchszgjzqcomcn邮编201204地址北京市东城区建内大街26号邮编518000地址上海浦东新区芳甸路1088号新闻大厦8层南侧地址中国深圳市福田区中心四路1-1号紫竹国际大厦7楼嘉里建设广场T3-2402敬请参阅最后一页特别声明19
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1