研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 浙商证券-AI前沿跟踪系列(一):基于人机互动和大语言模型的因子挖掘平台-230918
上传日期:   2023/9/20 大小:   1097KB
格式:   pdf  共12页 来源:   浙商证券
评级:   -- 作者:   陈冀
下载权限:   此报告为加密报告
Saizhuo Wang、Hang Yuan等人的论文中提出了一种利用大型语言模型进行Alpha因子挖掘的新范式,也为投资机构未来金融科技、数据平台、因子系统等平台未来搭建提供了一种思路。现代金融体系信息传播、获取、响应大有不同,因子效果持续性下降,Alpha因子需要动态评估都对因子挖掘新范式提出了更高的要求。
  基于LLM的Alpha挖掘范式提出
  Saizhuo Wang和Hang Yuan等提出了第三种alpha挖掘范式,即增强人工智能交互以提高alpha研究的效果和效率。基于这种新的范式,构建一个人机交互式alpha挖掘系统Alpha-GPT。该系统利用大型语言模型作为量化研究人员和alpha搜索之间的中介,具有解释用户交易想法、快速总结优秀alpha以及自动修改搜索配置等优势。
  通过LLM实现人机互动增加Alpha挖掘额外知识
  AlphaBot是Alpha-GPT的关键层,它通过四个功能模块自动将量化研究人员的意图/思想转化为LLM查询的领域特定提示和指令,并将其转化为算法Alpha挖掘层能理解的配置,增加Alpha挖掘的额外知识、信息、文献和数据,以提高LLM的性能和准确性。
  通过Alpha-GPT生成更加可解释的因子表达式
  通过Alpha-GPT生成的Alpha表达式和相应的自然语言解释的示例表明,AlphaGPT能够提供适当的Alpha解释,减轻了人类研究人员自行解释这些表达式的负担。
  风险提示
  本报告依据最新前沿论文进行解读评述,若有理解不当请以原始论文表述为准。且本报告为AI应用方法和框架介绍,并不作为有效投资方法建议,仅供参考。
  
研究报告全文:证券研究报告智能配置点评智能配置点评报告日期2023年09月18日基于人机互动和大语言模型的因子挖掘平台AI前沿跟踪系列一核心观点分析师陈冀执业证书号S1230522110001SaizhuoWangHangYuan等人的论文中提出了一种利用大型语言模型进行Alphachenjistockecomcn因子挖掘的新范式也为投资机构未来金融科技数据平台因子系统等平台未来搭相关报告建提供了一种思路现代金融体系信息传播获取响应大有不同因子效果持续性下降Alpha因子需要动态评估都对因子挖掘新范式提出了更高的要求基于LLM的Alpha挖掘范式提出SaizhuoWang和HangYuan等提出了第三种alpha挖掘范式即增强人工智能交互以提高alpha研究的效果和效率基于这种新的范式构建一个人机交互式alpha挖掘系统Alpha-GPT该系统利用大型语言模型作为量化研究人员和alpha搜索之间的中介具有解释用户交易想法快速总结优秀alpha以及自动修改搜索配置等优势通过LLM实现人机互动增加Alpha挖掘额外知识AlphaBot是Alpha-GPT的关键层它通过四个功能模块自动将量化研究人员的意图思想转化为LLM查询的领域特定提示和指令并将其转化为算法Alpha挖掘层能理解的配置增加Alpha挖掘的额外知识信息文献和数据以提高LLM的性能和准确性通过Alpha-GPT生成更加可解释的因子表达式通过Alpha-GPT生成的Alpha表达式和相应的自然语言解释的示例表明Alpha-GPT能够提供适当的Alpha解释减轻了人类研究人员自行解释这些表达式的负担风险提示本报告依据最新前沿论文进行解读评述若有理解不当请以原始论文表述为准且本报告为AI应用方法和框架介绍并不作为有效投资方法建议仅供参考httpwwwstockecomcn112请务必阅读正文之后的免责条款部分智能配置点评正文目录1因子挖掘平台简述42Alpha-GPT用户接口框架43平台架构与技术挑战631AlphaBot层632Alpha挖掘算法层833用于加速Alpha计算的技术94针对Alpha-GPT的实验95结论106参考文献11httpwwwstockecomcn212请务必阅读正文之后的免责条款部分智能配置点评图表目录图1Alpha挖掘范式演化4图2Alpha-GPT的工作流程5图3Alpha-GPT用户界面5图4Alpha-GPT系统架构6图5Alpha-GPT因子挖掘不同阶段回测曲线10图6Alpha-GPT生成的可解释Alpha因子示例10表1Alpha-GPT样本外Top-20IC搜索加强前后对比9httpwwwstockecomcn312请务必阅读正文之后的免责条款部分智能配置点评1因子挖掘平台简述寻找交易alpha旨在寻找一种具有预测超额回报或风险能力的金融信号或函数传统的alpha挖掘方法有两种范式第一种是手动建模通过将量化研究人员对金融市场的理念和直觉转化为公式化的alpha并通过回测实验证明其有效性和显著性从而改进alpha的性能第二种是通过搜索算法如遗传编程等寻找alpha但由于搜索空间巨大计算密集度很高然而这两种方法都存在一些共同的缺点比如难以找到精确简明的公式化表达理解和解释大量的alpha以及设计和修改算法参数和搜索配置等为了解决这些问题SaizhuoWang和HangYuan等2023提出了第三种alpha挖掘范式即增强人工智能交互以提高alpha研究的效果和效率基于这种新的范式构建一个人机交互式alpha挖掘系统Alpha-GPT该系统利用大型语言模型作为量化研究人员和alpha搜索之间的中介具有解释用户交易想法快速总结优秀alpha以及自动修改搜索配置等优势图1Alpha挖掘范式演化资料来源arXiv230800016v1q-finCP1浙商证券研究所整理2Alpha-GPT用户接口框架Alpha-GPT的研究人员在论文中介绍了基于大语言模型的人机互动因子挖掘平台的用户接口UI它由三个主要组件组成会话管理器对话框和Alpha挖掘仪表板对话框用户将他们的交易想法和思路输入到对话框中作为回应生成的种子alphaalpha搜索进展alpha挖掘的最终报告以及生成的alpha的表现都被组织成系统消息提供全面的反馈用户可以分析结果并为alpha挖掘提供进一步的指导这个对话会一直持续到找到有效的alpha为止挖掘会话管理器Alpha-GPT采用基于会话的用户界面通过会话管理器存储过去的交互历史记录这些会话还用于组织用户生成的数据以进一步提升系统的性能Alpha挖掘仪表板在右半部分仪表板用于显示和分析alpha挖掘的结果它为用户提供了会话的更详细描述实验监控显示了alpha挖掘实验的进展和当前系统负载以及会话过程中生成的所有历史alpha如果选择了特定的alpha它的表现将在分析面板上进1SaizhuoWangHangYuanLeonZhouLionelMNiHeung-YeungShumJianGuoAlpha-GPTHuman-AIInteractiveAlphaMiningforQuantitativeInvestment2023Julhttpwwwstockecomcn412请务必阅读正文之后的免责条款部分智能配置点评行绘制和可视化可用的绘图功能包括遗传编程的世代间适应度曲线单个alpha的回测曲线以及IC分布和信号衰减等其他附加分析此外Alpha仪表板还包括一键存储和部署功能可以进一步应用和下游分析图2Alpha-GPT的工作流程资料来源arXiv230800016v1q-finCP作者及篇名同图1浙商证券研究所整理图3Alpha-GPT用户界面资料来源arXiv230800016v1q-finCP作者及篇名同图1浙商证券研究所整理httpwwwstockecomcn512请务必阅读正文之后的免责条款部分智能配置点评3平台架构与技术挑战图4展示了作者提出的交互式Alpha挖掘范式的系统框架通过从Alpha-GPT的架构设计中提炼和抽象得出各个模块还是充满细节和技术挑战图4Alpha-GPT系统架构资料来源arXiv230800016v1q-finCP作者及篇名同图1浙商证券研究所整理31AlphaBot层AlphaBot是Alpha-GPT的关键层它在人工智能与人类交互中扮演了调解者的角色具体而言该层包括四个功能模块1知识编译器自动将量化研究人员的意图思想转化为LLM查询的领域特定提示和指令2LLM为主流大型语言模型如GPT-4提供API或本地部署选项3思想解编器将LLM的自然语言输出转化为算法Alpha挖掘层能理解的配置4知识库整合了关于Alpha挖掘的额外知识信息文献和数据以提高LLM的性能和准确性在像Alpha挖掘这样的领域专属任务中许多用户请求中会包含只能在金融领域中找到的术语在没有进一步的上下文的情况下传统的LLM无法理解输入背后的含义这就需要知识编译器模块的介入利用LLM的上下文学习能力该模块通过提供额外的上下文和澄清提示中的关键词来增强原始用户请求例如youareaquantresearcherdevelopingformulaicalphas这样的具体短语有助于将可能的回答范围缩小到更适合因子挖掘的答案httpwwwstockecomcn612请务必阅读正文之后的免责条款部分智能配置点评由于Alpha表达式必须以一定的格式才能有效提示中还有一个部分列出了表达式的每个可能组成部分以及如何利用它的解释例如high1D股票的最高日内价格这个补充帮助LLM将用户意图与可以实现该目标的特定功能相关联并确保输出结果有效由于这些术语适用于更广泛的金融领域提示的这一部分也在思想解编器中用于防止产生幻觉这样的模块是为了允许用户以自然语言进行请求而不涉及不确定性目前有两种主要利用LLM的方式各有其特点在线请求许多公司通过API提供对其预建的大型语言模型的访问这些产品按一定数量的标记收取名义金额并包括GPTClaude和Bard等在线请求的一个优点是实时响应和即时访问总之AlphaBot层是Alpha-GPT中的关键层起到了人工智能与人类交互的调解者角色其中的知识编译器模块用于加强用户请求的语境理解和提示而大型语言模型模块用于提供LLM的API或本地部署选项API的好处是它提供了易用性并消除了对计算能力的需求本地部署可以从头开始开发LLM这样可以更加定制化地控制模型的功能可以对特定数据集进行预训练以使其适应特定的目的这包括通过学习相关文件进行领域微调并通过人工反馈进行强化学习然而这需要大量的计算能力来训练和更新这些模型在alphamining中LLM的响应与期望的输出结构之间存在明显差距具体来说这些差距可以从以下几个方面的挑战来总结将自然语言转换为结构化数据需要将LLM的响应从自然语言转换为结构化数据对于每个LLM的响应消息需要从其原始输出中提取一个表达式块列表每个表达式块都遵循一定的组织方式例如其简称表达式和一段自然语言描述令牌大小限制由于大多数最先进的LLM都采用基于Transformer的架构和自注意力机制输入序列长度令牌数的限制通常是一个非常常见的问题这样LLM的输入和输出都有长度的上限这可能会导致两个问题1不能将完整的对话历史记录发送给LLM因为它会超出输入令牌大小的限制2单个LLM的响应大小受限这意味着每个消息只能获取有限数量的表达式为了解决这些问题作者提出了一个迭代的LLM推理过程使用基于正则表达式的解析器来解析LLM的输出对于每个LLM生成的alpha对其进行语法和语义上的正确性验证作者采用抽象语法树解析器进行语法检查对于语义正确性使用模拟数据和运行时上下文来评估这个表达式是否会抛出任何异常在实践中正确的alpha比例可能很低每轮只有10个alpha中的4个是正确的这使得alpha生成过程低效同时由于对话历史记录被附加到LLM的输入中这些不正确的表达式也可能影响后续的生成过程因此采用迭代的修正过程提示LLM重新生成不正确的alpha此外为了解决令牌大小限制的问题在每一轮中动态检查是否超出了令牌大小限制如果是则会对输入消息进行截断和重新组织以减少令牌数如上所述在少样本上下文学习中需要一个支持有效检索与交易想法相关的示例的外部存储在Alpha-GPT中作者设计了一个协议来组织来自多个来源的内容这些来源包括现有的alpha表达式集合和金融文献当用户提出请求时知识库对该查询进行编码并找到可以作为示例并合并到提示中的类似文档httpwwwstockecomcn712请务必阅读正文之后的免责条款部分智能配置点评32Alpha挖掘算法层该层在Alpha-GPT中提供搜索增强功能具体而言它通过接收AlphaBot的搜索命令和配置利用种子Alpha来改进它们并将最合适的Alpha推送回AlphaBot它由四个模块组成算法式Alpha搜索模块根据AlphaBot的命令生成Alpha候选项评估和回测模块从这些候选项中选择合格的AlphaAlpha选择模块根据特定的预测目标例如对未来10天回报的贡献进一步修剪这些Alpha最终的Alpha由Alpha部署模块一键部署以确保在线交易期间的实时计算的平滑性和正确性Alpha搜索增强目前在行业中使用最广泛的Alpha搜索算法是遗传编程GP它从一些Alpha种子开始根据评分函数的适应性通过随机交叉和突变子树选择树形表达的Alpha候选项然而GP目前存在三个问题1过拟合对于量化交易来说极其危险可以通过在GP迭代中加入样本外评估减少函数复杂度的拟合正则化和迭代的早停等策略来减轻这个问题这些方法有助于确保Alpha在训练数据之外具有良好的泛化能力提高其可靠性2Alpha多样性的丧失可能导致投资风险的聚集和累积并增加回报的不确定性可以通过在GP的迭代过程中强制执行更多的约束来实现Alpha多样性并有助于发现对不断变化的市场条件具有韧性的稳健Alpha因子3GP容易生成无效的Alpha例如0和-5或者两个具有不兼容单位的值的求和例如成交量收盘价可以通过整合数学规则单位一致性规则和金融领域特定规则的规则库来调节Alpha表达式的生成评估和回测评估Alpha最直接的方法是通过回测来揭示Alpha在投资策略中的具体表现然而这个过程引入了三个重要的挑战1引入未来信息回测时来自更远时间点的信息可能对结果的准确性产生灾难性的影响为了减轻这个问题使用时间戳为每个输入数据分配一个时间标签这种技术可以更准确地复制市场条件并验证测试结果从而增强Alpha评估的可靠性2交易成本的估计常规的粗粒度回测无法准确衡量交易成本这对于短期Alpha至关重要为了解决这个问题作者使用更详细的数据例如订单簿级数据进行基于模拟的回测并使用交易匹配规则模拟交易成本和市场价格对Alpha的影响从而能够在微观结构水平上对Alpha进行建模3计算成本Alpha挖掘所需的计算能力也是相当大的在计算加速层中解决了这个问题Alpha选择Alpha选择模块通过以下方式进一步进行选择过程1去重和去相关性新的Alpha需要与现有的Alpha不同但是计算大量Alpha之间的成对相似性可能是耗时的算法如KD-树局部敏感哈希LSH或近似最近邻ANN可以快速确定每个潜在Alpha与池中其他Alpha的最大相关性2重要性评分虽然一个Alpha的信息系数IC分数和回测可能反映了其个体表现但在实际情况下多个Alpha在投资策略中组合在一起这些指标不能准确反映它们在更大集合中的表现一组IC分数较低的Alpha可能会优于由最高分Alpha组成的子集因此重要性评分技术如ShapleyAdditiveexplanationsSHAP和LocalInterpretableModel-agnosticExplanationsLIME可以衡量这种贡献并全面理解Alpha之间的相互关系Alpha部署在这个模块中需要正确管理三个关键方面以确保在线交易期间的平滑和正确的实时计算1依赖管理这涉及维护和监督所有Alpha数据之间的依赖关系以确保顺序计算和问题的可追溯性2流-批一体化实时交易和历史回测之间的不一致是不可接受的通过采用Kappa架构可以维护一个统一的实时处理层从而以相同的方式处理所有数据消除Alpha生成过程中批处理和流处理之间的不一致性3自动Alphahttpwwwstockecomcn812请务必阅读正文之后的免责条款部分智能配置点评验证这用于验证所有系统维护的Alpha监控数据质量并识别差异这种持续验证确保部署的Alpha的可靠性及时性和准确性33用于加速Alpha计算的技术包括流算法StreamingAlgorithms矢量化计算VectorizedComputationSIMD和SIMT等并行计算技术内存优化MemoryOptimization数据分区DataPartitioning多线程计算Multithreading以及利用GPU加速计算GPUAcceleration等方法这些技术可大幅提高Alpha计算的效率特别适用于处理金融数据等大规模数据集的计算任务4针对Alpha-GPT的实验作者对Alpha-GPT进行了多方面的实验旨在验证以下研究问题RQ1Alpha-GPT能否生成与输入的交易想法一致的表达式RQ2算法性Alpha挖掘层对LLM的种子Alpha的增强效果如何RQ3用户能否有效地与Alpha-GPT进行交互指导挖掘过程RQ4Alpha-GPT能否成功解释Alpha表达式背后的交易想法实验设置包括数据和运算符使用股票市场的日间成交量-价格数据包括基本的K线图数据开盘价最高价最低价收盘价加权平均价格VWAP和行业数据还包括19个基本运算符包括时间序列运算横截面运算分组运算和基本元素运算知识库对于每个Alpha首先将其分解成子表达式并解释它们然后解释这些子表达式的组合形成整个交易想法文档嵌入通过Faiss进行索引需要注意的是仅在生成与交易想法相吻合的Alpha表达式时使用外部存储器LLM和适配器为了进行自然语言交互使用OpenAI的聊天完成API基于gpt-35-turbo-16k-0613模型基础对于知识检索中使用的嵌入模型使用OpenAI的text-ada-embedding-002API嵌入维度为1536LLM一次生成一批Alpha并将被要求纠正具有语法或语义错误的AlphaAlpha搜索和评估通过遗传规划模型搜索Alpha其中适应度评分由信息系数IC定义评估这些Alpha在样本外的指标如IC年回报率夏普比率等上的表现表1Alpha-GPT样本外Top-20IC搜索加强前后对比TrendShapeRSIMomentumMeanReversionFlowofFundsDiscrepancyBeforesearch001151000995001109000951001130000952enhanceAftersearch002256002190002527002763002187002160enhance资料来源arXiv230800016v1q-finCP作者及篇名同图1浙商证券研究所整理httpwwwstockecomcn912请务必阅读正文之后的免责条款部分智能配置点评实验结果包括想法-公式一致性Alpha-GPT能够生成与用户给定的交易想法一致的公式Alpha通过示例展示了基于给定交易想法生成的Alpha表达式并展示了它们与K线图中的模式的对应关系验证了生成的Alpha正确捕捉了交易想法搜索增强通过算法性Alpha挖掘层的搜索增强显著提高了Alpha-GPT的表现通过对7个不同的交易想法进行搜索增强前后的Alpha样本外IC进行比较可以看出搜索增强对Alpha-GPT的性能提升非常重要人工智能交互通过人工智能交互生成的Alpha的回测曲线显示在图中回测是在2012年至2021年的美国股票数据上进行的经过几轮搜索增强和用户交互后生成的Alpha的回测表现显著提高Alpha解释通过Alpha-GPT生成的Alpha表达式和相应的自然语言解释的示例表明Alpha-GPT能够提供适当的Alpha解释减轻了人类研究人员自行解释这些表达式的负担图5Alpha-GPT因子挖掘不同阶段回测曲线图6Alpha-GPT生成的可解释Alpha因子示例资料来源arXiv230800016v1q-finCP作者及篇名同图1浙商证券资料来源arXiv230800016v1q-finCP作者及篇名同图1浙商证券研究所整理研究所整理5结论在SaizhuoWangHangYuan等人的论文中提出了一种利用大型语言模型进行Alpha因子挖掘的新范式也为投资机构未来金融科技数据平台因子系统等平台未来搭建提供了一种思路这一点我们认为可能为机构量化投资平台的演进打开一片新天地主要基于以下几点我们认为量化因子平台新范式重构的必要性越来越强信息获取传播响应的需要互联网时代的今天信息传播速度市场响应节奏都远远快于过去及时可靠的因子分析平台的重构迫在眉睫低频因子似乎并不需要一个快捷的平台然后舆情系统实时价量分析都给量化平台提出了新要求因子稳定性下降越来越多的投资者运用各种非线性技术进行盈利模式挖掘比如利用深度学习GP模型等合成因子或生成因子表达式然而非线性模型最大的缺点在于稳定性较差同样架构的模型可能在同一时点由于训练后参数的差异得到完全相反的研判httpwwwstockecomcn1012请务必阅读正文之后的免责条款部分智能配置点评观点而这种对立模式的博弈往往使得市场容易在原本可能形成一致逻辑的点上形成短暂的矛盾导致过去可能持续性更好的因子有效性衰减较快Alpha因子需动态认识因子稳定性下降使得获取长期稳定Alpha的因子难度提升动态地捕捉当前最为有效的Alpha因子成为当下因子量化投资的重要课题很多机构选择周度月度季度地重新评价其因子库中各个因子的有效性和收益贡献然而金融市场的动态性决定了因子有效性的动态变化并没有稳定的周期性规律因子动量的持续性也难以测度量化投资者更多是在后验信息的基础上不断地更新和调整对于因子库中因子有效性的跟踪观测Alpha-GPT就提供了一种动态形成因子跟踪的范式当然投资者也可使用类似BeyesianEstimationReinforcementLearning等方法对因子盈利模型进行动态评价6参考文献1SaizhuoWangHangYuanLeonZhouLionelMNiHeung-YeungShumJianGuoAlpha-GPTHuman-AIInteractiveAlphaMiningforQuantitativeInvestment2023Julhttpwwwstockecomcn1112请务必阅读正文之后的免责条款部分智能配置点评股票投资评级说明以报告日后的6个月内证券相对于沪深300指数的涨跌幅为标准定义如下1买入相对于沪深300指数表现20以上2增持相对于沪深300指数表现10203中性相对于沪深300指数表现1010之间波动4减持相对于沪深300指数表现10以下行业的投资评级以报告日后的6个月内行业指数相对于沪深300指数的涨跌幅为标准定义如下1看好行业指数相对于沪深300指数表现10以上2中性行业指数相对于沪深300指数表现1010以上3看淡行业指数相对于沪深300指数表现10以下我们在此提醒您不同证券研究机构采用不同的评级术语及评级标准我们采用的是相对评级体系表示投资的相对比重建议投资者买入或者卖出证券的决定取决于个人的实际情况比如当前的持仓结构以及其他需要考虑的因素投资者不应仅仅依靠投资评级来推断结论法律声明及风险提示本报告由浙商证券股份有限公司已具备中国证监会批复的证券投资咨询业务资格经营许可证编号为Z39833000制作本报告中的信息均来源于我们认为可靠的已公开资料但浙商证券股份有限公司及其关联机构以下统称本公司对这些信息的真实性准确性及完整性不作任何保证也不保证所包含的信息和建议不发生任何变更本公司没有将变更的信息和建议向报告所有接收者进行更新的义务本报告仅供本公司的客户作参考之用本公司不会因接收人收到本报告而视其为本公司的当然客户本报告仅反映报告作者的出具日的观点和判断在任何情况下本报告中的信息或所表述的意见均不构成对任何人的投资建议投资者应当对本报告中的信息和意见进行独立评估并应同时考量各自的投资目的财务状况和特定需求对依据或者使用本报告所造成的一切后果本公司及或其关联人员均不承担任何法律责任本公司的交易人员以及其他专业人士可能会依据不同假设和标准采用不同的分析方法而口头或书面发表与本报告意见及建议不一致的市场评论和或交易观点本公司没有将此意见及建议向报告所有接收者进行更新的义务本公司的资产管理公司自营部门以及其他投资业务部门可能独立做出与本报告中的意见或建议不一致的投资决策本报告版权均归本公司所有未经本公司事先书面授权任何机构或个人不得以任何形式复制发布传播本报告的全部或部分内容经授权刊载转发本报告或者摘要的应当注明本报告发布人和发布日期并提示使用本报告的风险未经授权或未按要求刊载转发本报告的应当承担相应的法律责任本公司将保留向其追究法律责任的权利浙商证券研究所上海总部地址杨高南路729号陆家嘴世纪金融广场1号楼25层北京地址北京市东城区朝阳门北大街8号富华大厦E座4层深圳地址广东省深圳市福田区广电金融中心33层上海总部邮政编码200127上海总部电话862180108518上海总部传真862180106010浙商证券研究所httpswwwstockecomcnhttpwwwstockecomcn1212请务必阅读正文之后的免责条款部分
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1