研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 长江证券-神经因子挖掘(五)——强化学习混频Multi-Step DQN择时策略-250626
上传日期:   2025/6/26 大小:   1728KB
格式:   pdf  共23页 来源:   长江证券
评级:   -- 作者:   覃川桃
下载权限:   此报告为加密报告
强化学习为量化投资带来新思路,解决传统模型痛点
  传统的量化投资方法,尤其是预测股票收益率的模型,虽然有效但存在明显局限。它们往往只能间接优化最终的投资目标(如年化收益、风险控制),如通过预测收益率或排序来间接提升策略。而且,构建投资组合通常分好多步(找因子、合成因子、优化组合),步骤之间不够连贯,有时预测指标提升了,实际组合表现却没改善。此外,像资产择时(判断买卖时机)这种问题,可用的历史数据量相对选股少得多,传统模型很容易“死记硬背”历史(过拟合),学不到真正有用的规律。
  强化学习(RL)提供了一种新范式。它直接让行为主体(智能体)在模拟的市场环境(环境)中学习交易策略(动作),目标就是最大化投资回报(奖励)。这种“边做边学”的方式,可以直接优化我们关心的最终收益和风险指标,并有可能将因子挖掘、信号生成和组合构建整合到一个连续的决策流程中,从而有效缓解传统方法的前两个主要痛点。
  DQN算法是构建择时策略的有效工具,其核心在于学习“最优动作价值”
  在众多强化学习算法中,深度Q网络(DQN)被证明较为适合像单一资产择时这样的任务。DQN的核心思想是教会模型一个关键能力:评估在特定市场状况(状态)下,采取不同交易动作(如做多、做空、空仓)的“潜在未来总回报”(称为最优动作价值函数Q*)。简单说,就是让模型学会判断:“在当前这种市场环境下,选择买、卖或平仓,哪个未来可能赚得最多?” 
  为了训练这个DQN模型,可以采用了几个关键技巧:1)目标网络:使用一个稍滞后更新的Q网络来计算目标值,防止模型自我欺骗导致估值过高;2)ε-贪婪策略:让小部分时间随机尝试新动作,避免模型只走老路错过更好机会;3)经验回放:把过去的交易经验储存起来并打乱顺序反复学习,这样更高效且能打破数据的时间关联性。
  Multi-Step DQN择时策略潜力巨大,多步优化提升效果
  将DQN应用于中证1000指数的日频择时。模型输入融合了日频和分钟频数据,以捕捉更丰富的市场信息。实际测试结果较为有效。信号有效:模型发出的做多和做空信号,其预测的未来收益统计特征(如胜率、盈亏比)都显示出正向预测能力。策略表现优异:构建的多空策略(可做多做空)、纯多头策略和纯空头策略均显著跑赢了基准(一直持有)。其中,多空策略年化收益高达64.9%(优化后达79.4%),空头策略则展现出更优的风险控制能力(回撤小,夏普、卡玛比率高)。多步DQN效果更佳:采用考虑未来多步奖励的改进版DQN(Multi-Step DQN)后,信号质量(做多做空更均衡,指标提升)和策略表现(各策略年化收益进一步提高,风险控制指标如夏普、卡玛比率也改善)都得到了显著优化。这印证了调整未来收益评估机制(减少单步评估偏差)的有效性。
  风险提示
  1、深度学习模型训练过程中有随机性,可能导致预测结果有误差;
  2、模型总结的市场规律是基于历史数据的,存在失效风险;
  3、日频交易策略回测结果仅供参考;
  4、数据处理细节上的差异对策略有一定的影响。
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1