研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 民生证券-量化专题报告-StockFormer:基于Transformer的强化学习模型探究-240730
上传日期:   2024/7/30 大小:   2322KB
格式:   pdf  共23页 来源:   民生证券
评级:   -- 作者:   叶尔乐
下载权限:   此报告为加密报告
强化学习通过训练智能体直接输出投资决策。强化学习是一种机器学习方法,通过与环境的交互来训练智能体,使其在不同状态下采取能够最大化累积奖励的行动。在强化学习中,智能体(Agent)通过与环境的互动不断学习,通过奖励和惩罚来调整其策略,以便在长期内获得最大回报。在股票市场中,强化学习可以通过市场状态的输入,不断调整交易策略,最大化长期的投资回报。强化学习在金融领域中的应用主要在状态输入,奖励函数及优化算法三个方面进行了创新。
  SAC强化学习加入多项改进以避免模型过拟合。在SAC中,价值网络是一个双Q网络(Double DQN),即使用两个独立的Q网络的同时对目标函数进行估计,在目标值计算时选择最小的一个,从而降低Q值的高估风险,防止模型陷入局部最优或者过拟合。此外,SAC在策略优化过程中引入了熵正则化项,熵正则化项的引入使得策略在早期阶段保持一定的随机性,避免策略网络和价值网络的学习模式过于重合以陷入局部最优,从而提高整体的策略探索能力。对于熵正则项,SAC还引入了自适应熵系数α,通过优化熵系数来自动调整策略的探索程度,使得模型能够根据当前的训练情况动态调整探索与开发的平衡。
  StockFormer模型利用Transformer深度学习进行预测并优化交易决策。Siyu Gao等人在2023年IJCAI上发表的论文StockFormer: LearningHybrid Trading Machines with Predictive Coding中采用SAC强化学习作为基础框架,并采用了3个Transformer模型分别预测市场相关状态,短期收益状态与长期收益状态作为强化学习的输入状态。然后在SAC强化学习中将3个隐状态进行合成,在组合状态空间中优化交易决策。利用沪深300成分股做训练,取得了优于基线Transformer模型的效果。
  深度学习+强化学习较深度学习+组合优化收益弹性更高。我们将Transformer模型作为本篇研究中的基模型构建Transformer因子的指数增强组合,再与Transformer+SAC强化学习算法形成对照。在Transformer模型中,我们采用日频行情与20个日频技术因子作为输入,预测个股周度收益排序作为因子,构建的指数增强组合2019年以来在中证1000内年化收益17.2%,超额收益13.8%,信息比率2.36,表现稳定。在StockFormer模型中,我们替换奖励函数为超额收益-跟踪误差-交易费用,并修改前3个Transformer模型,输出每日交易行为与持仓,策略年化收益32.7%,超额收益29.1%,信息比率2.57,超额收益波动率较大,但主要为上行波动,模型总体好于Transformer的指数增强组合。对策略持仓进行风格分析,发现模型对于市场主线识别能力较强,通过风格择时带来一定超额收益。
  风险提示:量化模型基于历史数据,市场未来可能发生变化,策略模型有失效可能。
  
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1