>> 长江证券-神经因子挖掘(五)——强化学习混频Multi-Step DQN择时策略-250626
| 上传日期: |
2025/6/26 |
大小: |
1728KB |
| 格式: |
pdf 共23页 |
来源: |
长江证券 |
| 评级: |
-- |
作者: |
覃川桃 |
| 下载权限: |
此报告为加密报告 |
|
|
强化学习为量化投资带来新思路,解决传统模型痛点 传统的量化投资方法,尤其是预测股票收益率的模型,虽然有效但存在明显局限。它们往往只能间接优化最终的投资目标(如年化收益、风险控制),如通过预测收益率或排序来间接提升策略。而且,构建投资组合通常分好多步(找因子、合成因子、优化组合),步骤之间不够连贯,有时预测指标提升了,实际组合表现却没改善。此外,像资产择时(判断买卖时机)这种问题,可用的历史数据量相对选股少得多,传统模型很容易“死记硬背”历史(过拟合),学不到真正有用的规律。 强化学习(RL)提供了一种新范式。它直接让行为主体(智能体)在模拟的市场环境(环境)中学习交易策略(动作),目标就是最大化投资回报(奖励)。这种“边做边学”的方式,可以直接优化我们关心的最终收益和风险指标,并有可能将因子挖掘、信号生成和组合构建整合到一个连续的决策流程中,从而有效缓解传统方法的前两个主要痛点。 DQN算法是构建择时策略的有效工具,其核心在于学习“最优动作价值” 在众多强化学习算法中,深度Q网络(DQN)被证明较为适合像单一资产择时这样的任务。DQN的核心思想是教会模型一个关键能力:评估在特定市场状况(状态)下,采取不同交易动作(如做多、做空、空仓)的“潜在未来总回报”(称为最优动作价值函数Q*)。简单说,就是让模型学会判断:“在当前这种市场环境下,选择买、卖或平仓,哪个未来可能赚得最多?” 为了训练这个DQN模型,可以采用了几个关键技巧:1)目标网络:使用一个稍滞后更新的Q网络来计算目标值,防止模型自我欺骗导致估值过高;2)ε-贪婪策略:让小部分时间随机尝试新动作,避免模型只走老路错过更好机会;3)经验回放:把过去的交易经验储存起来并打乱顺序反复学习,这样更高效且能打破数据的时间关联性。 Multi-Step DQN择时策略潜力巨大,多步优化提升效果 将DQN应用于中证1000指数的日频择时。模型输入融合了日频和分钟频数据,以捕捉更丰富的市场信息。实际测试结果较为有效。信号有效:模型发出的做多和做空信号,其预测的未来收益统计特征(如胜率、盈亏比)都显示出正向预测能力。策略表现优异:构建的多空策略(可做多做空)、纯多头策略和纯空头策略均显著跑赢了基准(一直持有)。其中,多空策略年化收益高达64.9%(优化后达79.4%),空头策略则展现出更优的风险控制能力(回撤小,夏普、卡玛比率高)。多步DQN效果更佳:采用考虑未来多步奖励的改进版DQN(Multi-Step DQN)后,信号质量(做多做空更均衡,指标提升)和策略表现(各策略年化收益进一步提高,风险控制指标如夏普、卡玛比率也改善)都得到了显著优化。这印证了调整未来收益评估机制(减少单步评估偏差)的有效性。 风险提示 1、深度学习模型训练过程中有随机性,可能导致预测结果有误差; 2、模型总结的市场规律是基于历史数据的,存在失效风险; 3、日频交易策略回测结果仅供参考; 4、数据处理细节上的差异对策略有一定的影响。
|
|