研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 方正证券-探遗传规划因子挖掘:基于LLM增强的遗传规划框架——机器学习选股系列研究之四-260921
上传日期:   2026/9/21 大小:   3265KB
格式:   pdf  共25页 来源:   方正证券
评级:   -- 作者:   曹春晓
下载权限:   此报告为加密报告
在前序报告《基于Dask计算图的遗传规划高频因子挖掘框架——机器学习选股系列研究之二》中,我们基于遗传规划库gplearn与分布式计算库dask进行深度重构,实现日频与分钟频数据混合输入的高频因子自动化挖掘框架。然而,传统的遗传规划方法在因子挖掘中面临两个结构性瓶颈——表达式膨胀与语义失范,前者指表达式树在代际间不断增长、结构日益繁复,而适应度并未获得相应比例的提升;后者则更为隐蔽,遗传规划的搜索本质上是语法驱动的,只要表达式在语法上合法即可进入下一代,然而语法合法并不等同于语义合理,因子可能在样本内IC表现良好,但表达式却缺乏经济逻辑支撑,在样本外面临较高的失效风险。
  近年来,大语言模型(LLM)凭借其知识整合、语义理解与代码生成推理能力被引入量化金融领域。大语言模型能够扮演“具备金融领域知识的量化分析师”角色,按语义逻辑构建因子,而非像传统遗传规划那样在参数空间中盲目搜索。已有研究如LLMGP尝试用大语言模型替代传统遗传规划中的遗传算子;LLEGO进一步加入了适应度引导交叉与多样性引导变异两种机制;AlphaJungle跳出传统GP框架,将因子挖掘建模为MCTS驱动的树形搜索过程,并构建多维度打分体系;CogAlpha提出七层21智能体认知架构,将因子挖掘从“单点生成”升级为“多视角并行探索”;QuantaAlpha将每次因子挖掘的全流程建模为一条完整“轨迹”,在轨迹层级实施变异与交叉,实现经验积累与定向进化。上述研究表明,将大语言模型的认知推理能力与遗传规划的符号搜索能力相结合,已成为因子挖掘领域的重要演进方向。
  基于上述研究基础,本报告构建了一个LLM-GP混合驱动因子挖掘框架。该框架以gplearn为演化底座,在初始化、变异与精英修剪三个关键环节分别嵌入LLM能力:初始化阶段采用LLM-GP混合策略,兼顾GP的符号空间覆盖广度与LLM的金融语义引导深度;变异阶段将LLM语义变异作为第五种变异算子,与原生四种变异方式并行竞争,实现随机探索与语义精炼的分工互补;精英修剪阶段引入TEDE(Trigger-Evaluate-Decide-Execute)四阶段剪枝机制,利用LLM对精英个体的表达式树进行语义审查与结构精简。上述三处改造将LLM的介入程度统一收归超参数控制,使框架在质量、效率与多样性之间具备可调节的工程灵活性。实验结果表明,混合策略在因子质量上接近纯LLM水平,运行时间较纯LLM大幅缩短,同时在种群多样性方面显著优于纯LLM方案,验证了该框架在质量、效率与多样性三者之间取得有效平衡。
  基于上述框架,本文盘点了挖掘出来的20个低相关性的LLMGP因子,各因子RankIC均值、多空对冲收益等指标均表现稳健。近三年单因子5日Rank IC平均为6.14%,ICIR平均为1.95,多空组合年化收益率平均为30.96%,信息比率平均为2.02。
  风险提示:
  本报告基于历史数据分析,历史规律未来可能存在失效的风险;市场可能发生超预期变化;各驱动因子受环境影响可能存在阶段性失效的风险。
  
相关研报
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1