随着各家机构量化因子库的不断完善,人工因子的挖掘逐渐遇到瓶颈。此外,因子拥挤度提升和策略同质化的现象导致传统因子多头收益率的降低。基于机器学习的非线性模型用于因子挖掘的算法逐渐受到重视。本文将基于量价数据和不同的模型探讨机器学习生成Alpha因子的表现。
本文基于截面模型MLP、GBDT和时序模型GRU构建因子生成模型。在引入截面特征序列后截面模型与时序模型的因子学习能力基本处于同一水平。 引入Attention机制后GRU生成的因子表现没有明显提高。可能是由于模型复杂度的提升,需要更多的样本数据和训练轮数来学习量价特征。 基于GBDT的截面模型因子,在全A成分股内,RankIC为10.66%,ICIR为1.14(未年化),分20组的多头对冲年化收益率为29.84%;基于GRU的时序模型因子在全A成分股中,RankIC为11.3%,ICIR达到1.06(未年化),分20组的多头对冲年化收益率为28.83% 模型集成后的得到得集成因子相比于单个模型得到的因子表现提升较为明显。集成因子与常见因子的相关性整体较低。集成因子相比于单个模型的因子RankIC提升到11.9%,ICIR达到1.13(未年化),多头收益率提高到33.11%。 基于集成因子构建的TOP100策略的绝对收益表现良好,除2018年外,在单边换手率约束为40%以上时,绝对年化收益率显著为正。 集成学习模型因子与常见风格因子整体相关性较低,在流动性和残差波动率风格上有一定的暴露。风格中性化后集成因子的多头收益率有所下降,但Alpha选股仍然显著。 沪深300周频指增策略年化超额收益率为13.00%,信息比率为4.13,年化跟踪误差为3.15% 中证500周频指增策略年化超额收益率为14.14%,信息比率为2.26,年化跟踪误差为6.23%; 中证1000周频指增策略年化超额收益率为20.13%,信息比率为3.07,跟踪误差为6.55% 风险提示:量化策略基于历史数据统计,模型存在失效的可能性。 研究报告全文:证券研究报告量化深度报告2023年10月25日多模型集成量价Alpha策略量化选股策略AI系列研究之二随着各家机构量化因子库的不断完善人工因子的挖掘逐渐遇到瓶颈此外因子拥挤度提升和策略同质化的现象导致传统因子多头收益率的降低基于机器学习的非线性模型用于因子挖掘的算法逐渐受到重视本文将基于量价数据和不同的模型探讨机器学习生成Alpha因子的表现本文基于截面模型MLPGBDT和时序模型GRU构建因子生成模型在引入截面特征序列后截面模型与时序模型的因子学习能力基本处于同一水平引入Attention机制后GRU生成的因子表现没有明显提高可能是由于模型复杂度的提升需要更多的样本数据和训练轮数来学习量价特征基于GBDT的截面模型因子在全A成分股内RankIC为1066ICIR为114未年化分20组的多头对冲年化收益率为2984基于GRU的时序模型因子在全A成分股中RankIC为113ICIR达到106未年化分20组的多头对冲年化收益率为2883模型集成后的得到得集成因子相比于单个模型得到的因子表现提升较为明显集成因子与常见因子的相关性整体较低集成因子相比于单个模型的因子RankIC提升到119ICIR达到113未年化多头收益率提高到3311基于集成因子构建的TOP100策略的绝对收益表现良好除2018年外在任瞳S1090519080004单边换手率约束为40以上时绝对年化收益率显著为正rentongcmschinacomcn集成学习模型因子与常见风格因子整体相关性较低在流动性和残差波动率周靖明S1090519080007风格上有一定的暴露风格中性化后集成因子的多头收益率有所下降但zhoujingmingcmschinacomcnAlpha选股仍然显著周游S1090523070015沪深300周频指增策略年化超额收益率为1300信息比率为413年化zhouyou4cmschinacomcn跟踪误差为315中证500周频指增策略年化超额收益率为1414信息比率为226年化跟踪误差为623中证1000周频指增策略年化超额收益率为2013信息比率为307跟踪误差为655风险提示量化策略基于历史数据统计模型存在失效的可能性敬请阅读末页的重要说明量化深度报告正文目录一时序神经网络与其他截面学习模型411多层感知机MLP412梯度提升树GBDT513时序神经网络RNN6二基于日线量价数据生成Alpha721数据集和模型设定说明722不同模型生成的Alpha表现分析1023模型相关性分析与模型集成1124TOP100策略分析13三指数增强策略构建1431沪深300指数增强策略1532中证500指数增强策略1633中证1000指数增强策略17四总结18图表目录图1多层感知机MLP基础网络结构4图2基于MLP的Alpha学习模型4图3XGBoost单次迭代学习流程5图4LightGBM和XGBoost决策树的生长算法对比5图5循环神经网络示意图6图6GRU单元结构图6图7LSTM单元结构图6图8数据集划分说明8图9GRU量价因子模型结构图9图10AGRU量价因子模型结构图9图11不同模型分组对冲年化收益全A20组10图12不同模型多头相对净值全A20组10图13不同模型因子的平均两两相关系数走势11敬请阅读末页的重要说明2量化深度报告图14RankIC走势及累计IC全A周频12图15集成因子分组对冲年化收益全A20组12图16集成因子分组对冲净值全A20组12图17常见因子中性化以后的集成因子RankIC走势及累计IC全A周频13图18中性化集成因子分组对冲年化收益全A20组13图19中性化后集成因子分组对冲净值全A20组13图20沪深300策略净值走势图双边换手率20费后15图21中证500策略净值走势图双边换手率40费后16图22中证1000策略净值走势图双边换手率60费后17表1梯度下降vs梯度提升5表2数据集相关固定参数说明7表3MLP量价因子模型参数说明8表4GBDT量价因子模型参数说明8表5GRUAGRU量价因子模型参数说明9表6全A成分股中不同模型的因子表现10表7其他成分股内因子表现10表8不同模型间的平均截面相关系数11表9不同成分股中的集成因子表现11表10集成因子与常见风格因子的平均截面相关性12表11TOP100策略分年度绝对收益表现汇总14表12沪深300指数增强分年度表现绝对收益15表13沪深300指数增强分年度表现超额收益15表14中证500指数增强分年度表现绝对收益16表15中证500指数增强分年度表现超额收益16表16中证1000指数增强分年度表现绝对收益17表17中证1000指数增强分年度表现超额收益17敬请阅读末页的重要说明3量化深度报告一时序神经网络与其他截面学习模型11多层感知机MLP多层感知机MLP是最常用的神经网络组件之一通常作为复杂神经网络的特征整合层例如卷积神经网络CNN及其衍生模型MLP通常出现在这些网络的输出端以整合隐含层学习到的特征MLP的结构较为简单通常由多层全连接层和激活函数构成模型的复杂度由隐含层层数和隐藏层神经元个数决定一个2层MLP的数学模型可以表示为HXWb11OHWb22其中X为输入样本数据矩阵W为权重矩阵b为偏置向量H为隐藏层输出O为输出向量为激活函数通常为ReLUSigmoid等非线性函数隐藏层与模型的拟合能力的简单经验关系1当隐藏层为0时神经网络只能表示线性可分的函数2当隐藏层为2时可以表示任何一个有限空间到另一个有限空间的连续映射3当隐藏层大于3时额外的隐藏层可以学习复杂的特征描述自动特征工程隐藏层神经元个数的经验设计公式NsNhNNio其中Ns为样本个数Ni为输入神经元个数即特征维度No为输出层神经元个数为2至10的固定常数隐藏层层数和隐藏层神经元个数的选择通常是经验性的在训练集训练模型的过程中固定迭代次数随着隐藏层数和隐藏层神经元个数增加训练集Loss无法显著下降则停止增加模型复杂度图1多层感知机MLP基础网络结构图2基于MLP的Alpha学习模型资料来源招商证券资料来源招商证券在确定隐藏层层数和隐藏层神经元个数后模型的表达能力基本确定为加快模型的收敛速度通常会在激活函数之前加入BatchNormal层来防止隐藏层输入的方差变化过大导致收敛困难在前期报告中我们利用MLP和常见基本面因子和量价因子构建了非线性Alpha模型相比于线性基准Alpha模型有显著的表现提升证明了在Alpha模型中引入非线性确实有助于提升盈利模型的表现敬请阅读末页的重要说明4量化深度报告12梯度提升树GBDT梯度提升树在业务场景中也是非常重要的一类机器学习模型一直以来在各类数据分析大赛的高分方案中基本都能看到基于GBDT的模型的身影相比于多层感知机MLP这类神经网络梯度提升树GBDT的优点主要有1对样本特征维度的数量级不敏感2更适合处理表格类型的数据3模型的可解释性显著更高4相同硬件资源下训练速度显著更快因此在各类处理表格数据类型的数据分析场景中梯度提升树总能获得不错的表现GBDT结合了GradientBoosting算法和树模型训练过程和决策过程与神经网络存在明显的区别其训练迭代过程可以表述为fxfxTxmmm1NargminLyfxTxmimiimm1i1其中Txm为第m个弱分类器通常为CART决策树在第m次迭代的过程中通过经验风险最小化获得对决策树T的参数估计m在上述通用的Boosting框架下GradientBoosting每次迭代拟合的目标为样本相对于原始目标的负梯度fxLmfffm1表1梯度下降vs梯度提升方法优化空间迭代算法损失函数梯度下降参数空间wwLm1mwwwLlyfxiiwmm1梯度提升函数空间ffLLlyfxm1mfffimim1资料来源招商证券梯度提升GradientBoosting和梯度下降GradientDescent有异曲同工之妙前者在参数空间Rw迭代F后者在函数空间R迭代两者优化函数的fxm的方向均为损失函数的负梯度方向图3XGBoost单次迭代学习流程图4LightGBM和XGBoost决策树的生长算法对比资料来源招商证券XGBoostAScalableTreeBoosting资料来源招商证券SystemGBDT的工程化实现主要包括XGBoostLightGBM等与原始的GBDT算法不同XGBoost和LightGBM敬请阅读末页的重要说明5量化深度报告在单步迭代的过程使用了二阶导的信息比原始GBDT算法更快此外这些工程实现在FeatureSplittingLeafGrowingMissingHandling和DataParalleling都有不同形式的优化可以参考相关文献这里不再赘述MLP和GBDT均为截面学习模型在没有特征工程的前提下无法提取时序信息在基于MLP和GBDT的因子生成算法中通常将时序上所有时间点的样本看作同一分布的样本忽略了时间序列的信息13时序神经网络RNN循环神经网络RNN通常也被称为时序神经网络可以看作为多个时间截面的MLP通过时序状态H传递时序信息单个时间步t的数学模型如下HXWHWbttxhthhh1OHWbtthqq其中XWb分别为样本矩阵权重矩阵和偏置为激活函数通常为tanhO为输出图5循环神经网络示意图资料来源招商证券DiveintoDeepLearning随着RNN序列的增加梯度消失和梯度爆炸的问题不可避免这限制了其对长期依赖关系的建模能力为了解决这个问题提出了改进的RNN模型例如长短期记忆网络LSTM和门控循环单元GRU它们引入了门控机制来控制记忆状态的更新改善了对长序列的建模能力GRU相比于LSTM将门控机制中的遗忘门和输入门合并为一个更新门研究Chungetal2014表明GRU相比于LSTM通常能够获得相同的模型性能但计算速度更快因此本文中以GRU作为时序神经网络的基础模型图6GRU单元结构图图7LSTM单元结构图资料来源招商证券DiveintoDeepLearning资料来源招商证券DiveintoDeepLearningGRU的单个时间步t的数学模型如下敬请阅读末页的重要说明6量化深度报告RXttxrthrrWHWb1ZXttxzthzzWHWb1HXtWRHWbtanhtxhtthhh1HZHZHtttt11t其中Rt为重置门Zt为更新门为Hadamard积GRU一定程度地缓解了梯度爆炸和梯度消失的问题提高了模型学习长序列的能力MLP和GBDT为截面学习模型而RNN模型可以看作为引入了时序信息的MLP理论上来说RNN这类时序模型作为Alpha生成模型相比于截面模型能够有更好的表现在下一个章节中本文将以日线级别的量价数据作为数据集进一步探究时序和截面模型在量价Alpha生成算法中的表现差异二基于日线量价数据生成Alpha21数据集和模型设定说明本章基于日线级别的量价数据来探讨不同模型的Alpha学习能力日线量价数据包括OPENHIGHLOWCLOSEVWAPVOLUME六个字段数据集从2011年10月1日开始到2023年8月1日训练集股票池包括全A股票剔除上市不满三个月STST和停牌的股票此外MLP和GBDT为截面模型为了能够一定程度上学习历史信息对截面收益率的影响本文增加了与GRU序列长度相同数量的量价特征即PRICE0PRICE-1PRICE-N1成交量同理为了保证可交易性以及所学习到的因子换手率能够有一定的降低这里采用次日间隔10天的VWAP价格收益率作为训练label因为最终实现的指数增强策略以周频调仓过高的因子换手率会显著侵蚀策略的收益同时为了与交易情景对应batch的定义为交易日截面的所有股票作为batch即训练的过程中batch大小随时间变化分析因子分组收益率以及策略实现均按周一为调仓日并持仓一周其他固定设置如下表2数据集相关固定参数说明名称参数说明股票池全A股票剔除上市不满三个月STST停牌的股票数据集日线量价数据预测labelT1日至T11日复权日内VWAP价格收益率调仓周期每周一按照上一个交易日的因子生成持仓信息因子预处理3倍MAD截断zscore标准化缺失值填充为0Label预处理Label截面zscore标准化对比基准沪深300中证500中证1000Batch定义一个交易截面上所有的股票为一个batch数据划分20111001-20230801滚动训练模式在训练集中划分最后252个交易日作为验证集测试集为最近2个季度每半年训练一次资料来源招商证券不同时期市场风格的不同会显著影响Alpha的结构为了最终学习到的Alpha能够适应最近区间的市场风格这里采用滚动训练的方式同时考虑到原始数据集长度的问题训练前期训练集长度稍短这里采用训练集随时间拓展的构建方式即随着时间推移训练集的长度不断增加验证集和测试集的长度保持不变同时为了防止信息泄露剔除训练集验证集测试集相邻的10天样本数据敬请阅读末页的重要说明7量化深度报告图8数据集划分说明资料来源招商证券MLP的参数主要包括学习率隐藏层隐藏层神经元个数等具体参数设置如表3所示表3MLP量价因子模型参数说明名称参数说明学习率1e-3隐藏层数3隐藏层神经元个数128丢弃率005最大轮数1000早停轮数50Batch大小截面所有股票数损失函数均方误差MSE资料来源招商证券GBDT模型这里采用LightGBM作为基础模型LightGBM的参数如表4所示表4GBDT量价因子模型参数说明名称参数说明学习率1e-2最大树深64最大叶子数512叶子节点大小512列采样率07样本采样07早停轮数50损失函数均方误差MSE资料来源招商证券敬请阅读末页的重要说明8量化深度报告图9GRU量价因子模型结构图资料来源招商证券随着以Transformer为基础的各类模型在NLP领域和众多其他领域大放异彩Attention机制已经在各类模型中广泛运用因此本文在GRU模型的基础上增加基于序列隐藏状态的SelfAttention并与原始GRU模型的输出特征拼接构建了GRUwithAttention模型以下简称AGRUAGRU相比于GRU增加了对隐藏层输出的Attention分数的计算理论上来说可以带来增量的时序信息将隐藏层输出得到的Attention分数与0期的GRU输出拼接到一起进入全连接层最终得到输出图10AGRU量价因子模型结构图资料来源招商证券GRU类的模型的参数主要包括隐藏层层数特征维度序列长度等具体设定如表5所示表5GRUAGRU量价因子模型参数说明名称参数说明学习率1e-3采用可变学习率隐藏层数2特征维度6序列长度30丢弃率01最大轮数200早停轮数20Batch大小截面所有股票数损失函数均方误差MSE资料来源招商证券敬请阅读末页的重要说明9量化深度报告所有模型的数据集参数均按表2中的参数设置由于模型训练的随机性本文所有模型均选取不同的固定随机种子训练三次后在测试集按照三个模型的输出取平均作为因子值22不同模型生成的Alpha表现分析按照上一节中的数据集说明和模型参数本文构建了MLPGBDTGRUAGRU四个因子生成模型本节将重点分析四个模型所生成的因子表现单因子测试均按5日滚动调仓且不考虑费率回测期为20170101至20230801收益率分组为20组多头组TOP组为20组中的第1组空头组为20组中的第20组IC胜率为周度RankIC大于0的比率ICIR为未年化的指标多头收益率为绝对收益率多头夏普为年化指标多头平均换手率为单边换手率表6全A成分股中不同模型的因子表现RankIC均值ICIRIC胜率IC的t值多头收益率多头夏普多头最大回撤多头周均换手率MLP1060106866742142849151-25617660GBDT1066114863545502984157-25427780AGRU1067099844039642667143-17537350GRU1127106887442782883148-21227300资料来源招商证券回溯期20170101-20230801周频图11和图12的对冲基准均为同时期中证全指指数回测期为2017年1月至2023年7月相对净值计算方式为策略净值基准净值-1图11不同模型分组对冲年化收益全A20组图12不同模型多头相对净值全A20组资料来源招商证券资料来源招商证券其他成分股沪深300中证500中证1000的表现如表所示分组数量为10组收益率为年化绝对收益率调仓周期为周频表7其他成分股内因子表现沪深300中证500中证1000模型RankICICIR多头收益率RankICICIR多头收益率RankICICIR多头收益率MLP008106425710093085252401021023046GBDT008307426840092093267901021053446AGRU008106524660093085243801040982981GRU008506725860097089262301091043339资料来源招商证券从测试的结果来看GBDT结合历史量价特征的收益率表现最好GRU模型的单因子RankIC的表现最好各模型在不同的成分股内的因子的多头收益率都表现出较高的水平说明机器学习量价因子模型在各个成分股的敬请阅读末页的重要说明10量化深度报告选股稳定性较高23模型相关性分析与模型集成在上节中本文基于日频量价数据构建了MLPGBDTGRUAGRU四个因子学习模型并检验生成的Alpha在全A沪深300中证500中证1000成分股内的表现GBDT模型在各个成分股内的收益率和ICIR都表现地最好在全A内多头对冲年化收益率达到298ICIR达到114其次是GRU模型GRU模型的RankIC表现好于其他模型在全A成分股中的表现达到了113进一步不同模型之间学习到的因子相关性同样值得关注这里按照每日全A成分股内的因子值计算不同模型因子之间的平均相关性和滚动相关性图13不同模型因子的平均两两相关系数走势平均两两相关性60日移动平均0908508075070650605519-0119-0520-0917-0317-0517-0717-0917-1118-0118-0318-0518-0718-0918-1119-0319-0719-0919-1120-0120-0320-0520-0720-1121-0121-0321-0521-0721-0921-1122-0122-0322-0522-0722-0922-1123-0123-0323-0523-0717-01资料来源招商证券表8不同模型间的平均截面相关系数MLPGBDTAGRUGRUMLP100080072075GBDT080100073075AGRU072073100085GRU075075085100资料来源招商证券从平均相关系数来看GBDT和MLP同属一类截面模型之间的因子相关性较高AGRU和GRU同属时序模型之间的相关性较高MLP模型和AGRU模型的相关最低时序模型和截面模型之间的相关性低于同类型的模型因子从两两模型之间的相关性来看模型间的平均两两相关性有比较明显的上升趋势进一步按照Voting的思路提高整个机器学习Alpha模型的稳定性和收益表现这里Voting的策略按ICIR加权计分ICIR的加权比例计算窗口为过去60个交易日集成因子的表现如下表9不同成分股中的集成因子表现RankIC均值ICIRIC胜率IC的t值多头收益率多头夏普多头最大回撤多头周均换手率沪深300892071762228322820180-17836460中证5001012092832036762768174-14476510中证10001118108874843103386193-10426500全A1190113879244943311156-20407240资料来源招商证券回溯期20170101-20230801周频敬请阅读末页的重要说明11量化深度报告其中沪深300中证500中证1000的分组为10组全A的分组为20组从单因子分析的结果来看按照ICIR加权集成的多模型因子相比于单模型因子的RankIC有一定的提高在全A成分股内从GRU的RankIC为1127提高到1190ICIR与GBDT模型基本相同多头年化收益率从GBDT的2984提高到3311提高了327多头最大回撤次于AGRU模型好于其他模型多头夏普与GBDT基本一致多头周均换手率好于所有单个模型图14RankIC走势及累计IC全A周频0645RankIC累计IC右轴0540350430032502200115010-0117-0718-0119-0519-1123-0717-0317-0517-0917-1118-0318-0518-0718-0918-1119-0119-0319-0719-0920-0120-0320-0520-0720-0920-1121-0121-0321-0521-0721-0921-1122-0122-0322-0522-0722-0922-1123-0123-0323-0517-015-020资料来源招商证券图15集成因子分组对冲年化收益全A20组图16集成因子分组对冲净值全A20组资料来源招商证券资料来源招商证券分组对冲收益率和对冲净值对冲基准为中证全指集成因子分20组的单调性优秀20组多头对冲净值超额收益明显集成因子以量价为基础特征为了分析集成因子与常见风格因子的相关性和Alpha属性可以计算因子与常见风格因子的截面相关性以及分析对常见风格因子中性化后的表现表10集成因子与常见风格因子的平均截面相关性动量beta账面价值比流动性市值残差波动率杠杆成长动量1006-021017031028-003009beta0061-022041-006-002-013005账面价值比-021-0221-032012-034049-006流动性017041-0321-035051-016-003市值031-006012-0351-006025011残差波动率028-002-034051-0061-009002杠杆-003-013049-016025-0091004成长009005-006-0030110020041集成因子-004-008017-033011-044006002资料来源招商证券回测期20170101-20230801敬请阅读末页的重要说明12量化深度报告从截面相关性来看集成因子与残差波动率和流动性的相关性稍高其他风格因子的暴露较小进一步通过中性化可以观察集成因子Alpha的稳定性图17常见因子中性化以后的集成因子RankIC走势及累计IC全A周频常见因子中性化后的集成因子累计IC右轴053004250320021501100517-0318-0720-0722-1117-0517-0717-0917-1118-0118-0318-0518-0918-1119-0119-0319-0519-0719-0919-1120-0120-0320-0520-0920-1121-0121-0321-0521-0721-0921-1122-0122-0322-0522-0722-0923-0123-0323-0523-07-0117-01-020资料来源招商证券图18中性化集成因子分组对冲年化收益全A20组图19中性化后集成因子分组对冲净值全A20组0325022011501q2q4q6q8q1q3q5q7q9q10q12q13q14q15q16q17q18q19q20-01q1105-02017-0118-0119-0120-0121-0122-0123-01-05-03-1-04-15资料来源招商证券资料来源招商证券对常见因子市值估值流动性成长等中性后集成因子的分组单调性有所减弱周均RankIC从119下降到077IC的t值为4429ICIR为111集成因子对常见因子中性化以后选股能力有所减弱但依然十分显著分20组的多头年化收益率为18720组多头的收益率的下降较为明显其他组的收益率下降幅度较小从风格暴露上来看集成因子在流动性因子和残差波动率有一定暴露流动性因子和残差波动率在A股的选股能力较为显著风格中性化后一定程度影响了集成因子的多头选股能力另一方面线性剔除风格一定程度上在模型中引入了设定误差在分20组的情形下影响了中性化后的因子的表现在后续章节中本文将基于集成模型构建不同的策略进一步分析模型在策略中的表现24TOP100策略分析TOP100策略即每次持仓股票数量固定100只股票调仓日按照换仓股票的数量限制N卖出Alpha分数较低的N只股票并买入得分最高的N只股票以保持持仓股票数目不变TOP100策略可以一定程度地反应Alpha模型多头的实际表现并给后续的指数增强策略构建提供收益率换手率风险指标的参考本文中TOP100策略均为周频调仓不考虑费率可根据换手率和交易费率估算其中hsl为周单边换手率约束成交价格为次日VWAP价格敬请阅读末页的重要说明13量化深度报告表11TOP100策略分年度绝对收益表现汇总指标201720182019202020212022-20237全样本年化收益率1377-162136582804303210753737年化1763hsl01最大回撤-761-2399-1218-841-541-1457-256-2399年化收益率1944-707415731482833102135942103hsl02最大回撤-670-1872-1484-851-814-1670-218-1872年化收益率2072-454386537693282114335022294hsl03最大回撤-822-1789-1664-822-1057-1914-198-1914年化收益率2032027404648063525137437262633hsl04最大回撤-817-1559-1623-752-1042-1992-247-1992年化收益率2468089426554763367124838022791hsl05最大回撤-817-1558-1669-732-1036-2054-300-2054年化收益率2790726451958452968154438373036hsl10最大回撤-840-1425-1628-715-1006-1940-312-1940资料来源招商证券从TOP100策略的绝对收益来看单边换手率在40以上收益率变化幅度不大绝对收益最大回撤在换手率大于20时无明显变化2018年策略表现稍弱单边换手率小于40时绝对收益率转负其他年份收益率较为稳定三指数增强策略构建指数增强策略的构建主要包括收益模型和风险模型在本文上一章中构建了基于集成模型的Alpha模型并分析了不同的换手率下全A成分股内TOP100策略的表现在绝大多数年份策略绝对收益率都为正且保持较高水平本章中将基于集成模型构建对应不同指数的指数增强策略指数增强的优化目标为最大化预期收益率中证500和中证1000指数增强策略的风格约束包括市值估值成长等为最大偏离05个标准差行业占比偏离约束为最大偏离003沪深300指数增强策略的风格约束为001个标准差行业占比偏离约束为001跟踪误差约束为年化6换手率约束为双边304050成分股约束为无限制全市场选股优化目标如下maxTwstflbhFwwfhlbhHwwhwwwwlbhbBlbhwbwwtt11Tw1其中为预期收益率w为当前组合权重向量wt为t时刻持仓权重wt1为上一个持仓周期的持仓权重约束1为风格约束用于保证组合的风格偏离不超过下限fl和上限fh约束2为行业偏离约束用于保证组合行业占比的主动偏离不超过下限hl和上限hh约束3为个股权重的相对偏离约束4为成分股占比约束保证成分股数量占比约束5为换手率约束在优化失败时候优先删除该约束保证组合权重能够顺利求解约束6为全额投资约束同时约束w大于0即无卖空限制敬请阅读末页的重要说明14量化深度报告费率设置为买入费率千分之一卖出费率千分之二其他交易设置成交价格为次日复权WVAP价格停牌无法买入卖出涨停无法买入跌停无法卖出dhsl表示双边换手率31沪深300指数增强策略表12沪深300指数增强分年度表现绝对收益指标201720182019202020212022-20237全样本年化收益率5672-138054774195909-12871572年化1655dhsl02最大回撤-253-2178-1137-1164-1311-2280-616-2671年化收益率5984-1058571639771127-124712561600dhsl04最大回撤-241-2023-1119-1155-1164-2359-767-2637年化收益率6100-1119530038791486-140513091402dhsl06最大回撤-266-2158-1157-1120-1071-2554-842-2720资料来源招商证券表13沪深300指数增强分年度表现超额收益指标201720182019202020212022-20237全样本年化收益率278016451163116115091222930年化1300dhsl02最大回撤-158-056-108-160-167-046-121-167年化收益率303220781336991174312766331247dhsl04最大回撤-158-054-107-167-133-067-133-167年化收益率312519931036904211210726861052dhsl06最大回撤-158-108-173-255-105-099-203-255资料来源招商证券图20沪深300策略净值走势图双边换手率20费后动态回撤左轴基准沪深300策略净值超额净值025201713201813201913202013202113202213202313-00022-0004-000615-00081-001-001205-00140-0016-0018-05资料来源招商证券从结果来看沪深300指增策略的表现良好在周双边换手率约束为20的情况下取得了最高的超额年化收益率随着换手率的提高超额年化收益率有所下降且最大回撤提高说明交易费用侵蚀了因子收益率敬请阅读末页的重要说明15量化深度报告32中证500指数增强策略表14中证500指数增强分年度表现绝对收益指标201720182019202020212022-20237全样本年化收益率1026-1248435127632990-6092955年化1308dhsl02最大回撤-1029-2296-1710-1066-844-2371-337-2371年化收益率1628-813431231623454-39828841462dhsl04最大回撤-1014-1983-1815-1060-871-2317-432-2317年化收益率1953-472463135373832-22331551597dhsl06最大回撤-1060-1973-1856-1088-873-2235-388-2235资料来源招商证券表15中证500指数增强分年度表现超额收益指标201720182019202020212022-20237全样本年化收益率1535325841593451123151904年化1286dhsl02最大回撤-260-101-532-369-561-198-309-713年化收益率2313381844911081006231618611414dhsl04最大回撤-197-138-480-324-365-228-312-676年化收益率21564094434972856207620731444dhsl06最大回撤-210-106-416-346-450-217-320-729资料来源招商证券图21中证500策略净值走势图双边换手率40费后动态回撤左轴基准中证500策略净值超额净值01620171320181320191320201320211320221320231314-00112-0021-0030806-00404-00502-0060-02-007-04-008-06资料来源招商证券中证500指增策略在周双边换手率约束大于40的情况下超额年化收益率年化收益率没有明显提升但最大回撤增大继续提高换手率约束限制无法显著提高年化收益率的表现从上述分析可以看出沪深300和中证500指增策略的换手率约束不宜过高这也对因子的自相关性提出了更高的要求敬请阅读末页的重要说明16量化深度报告33中证1000指数增强策略表16中证1000指数增强分年度表现绝对收益指标201720182019202020212022-20237全样本年化收益率1026-1248435127632990-6092955年化1308dhsl02最大回撤-1029-2296-1710-1066-844-2371-337-2371年化收益率1628-813431231623454-39828841462dhsl04最大回撤-1014-1983-1815-1060-871-2317-432-2317年化收益率1953-472463135373832-22331551597dhsl06最大回撤-1060-1973-1856-1088-873-2235-388-2235资料来源招商证券表17中证1000指数增强分年度表现超额收益指标201720182019202020212022-20237全样本年化收益率33633932101980865620482124年化1713dhsl02最大回撤-140-181-383-391-798-147-318-798年化收益率4102460297611901050231520631877dhsl04最大回撤-140-208-412-296-698-222-330-698年化收益率44915118121615061367253523092013dhsl06最大回撤-140-192-422-371-562-169-361-562资料来源招商证券图22中证1000策略净值走势图双边换手率60费后动态回撤左轴基准中证1000策略净值超额净值025201713201813201913202013202113202213202313-0012-00215-0031-00405-0050-006-05-007-1资料来源招商证券中证1000指增策略受换手率限制的影响明显强于沪深300策略和中证500策略在双边换手率限制提高的过程中超额年化收益率基本呈现一个上升的趋势最大回撤呈现出下降的趋势对于中证1000指增策略适当提高换手率约束可以提高策略的收益表现敬请阅读末页的重要说明17量化深度报告四总结本文利用截面模型MLPGBDT以及时序神经网络GRUAGRU构建了四个基于日频量价数据的量价因子模型本文观察到截面模型在引入历史特征后因子学习能力与时序模型基本处于同一水平GBDT学习到的因子年化收益率最高从模型的平均相关性来看从2017年以来模型之间的相关性有所提升整体来看截面模型和时序模型学习到的因子之间的相关性低于同类型模型之间的相关性通过不同模型的因子60日ICIR的Voting集成之后集成因子的表现有所提升ICIR提高到119全A多头年化收益率提高到3311说明不同模型之间学习到的因子有一定的增量通过分析集成因子与常见因子的相关性发现量价集成因子在流动性和残差波动率上的风格暴露相对较高在其他风格上的暴露较低在剔除了常见风格的影响之后集成因子的多头组收益率有所下降这可能和一定程度的风格暴露有关中性化集成因子的Alpha依然显著最后本文基于集成因子构建了基于沪深300中证500和中证1000的周频指增策略沪深300指数增强策略在低还手限制下费后表现更好中证500策略双边换手率大于04时费后年化收益率提升不明显最大回撤有所提高中证1000在高换手率的情形下能够获得更高的费后年化收益率在双边还手限制为60时候费后年化超额收益率达到2013超额最大回撤-562信息比率307敬请阅读末页的重要说明18量化深度报告参考文献1ChenTHeTBenestyMetalXgboostextremegradientboostingJRpackageversion04-22015141-42KeGMengQFinleyTetalLightgbmAhighlyefficientgradientboostingdecisiontreeJAdvancesinneuralinformationprocessingsystems2017303ZhangALiptonZCLiMetalDiveintodeeplearningJarXivpreprintarXiv21061134220214ChungJGulcehreCChoKHetalEmpiricalevaluationofgatedrecurrentneuralnetworksonsequencemodelingJarXivpreprintarXiv1412355520145HochreiterSSchmidhuberJLongshort-termmemoryJNeuralcomputation1997981735-17806ChungJGulcehreCChoKHetalEmpiricalevaluationofgatedrecurrentneuralnetworksonsequencemodelingJarXivpreprintarXiv1412355520147QinYSongDChenHetalAdual-stageattention-basedrecurrentneuralnetworkfortimeseriespredictionJarXivpreprintarXiv17040297120178BoydSPVandenbergheLConvexoptimizationMCambridgeuniversitypress2004敬请阅读末页的重要说明19量化深度报告分析师承诺负责本研究报告的每一位证券分析师在此申明本报告清晰准确地反映了分析师本人的研究观点本人薪酬的任何部分过去不曾与现在不与未来也将不会与本报告中的具体推荐或观点直接或间接相关评级说明报告中所涉及的投资评级采用相对评级体系基于报告发布日后6-12个月内公司股价或行业指数相对同期当地市场基准指数的市场表现预期其中A股市场以沪深300指数为基准香港市场以恒生指数为基准美国市场以标普500指数为基准具体标准如下股票评级强烈推荐预期公司股价涨幅超越基准指数20以上增持预期公司股价涨幅超越基准指数5-20之间中性预期公司股价变动幅度相对基准指数介于5之间减持预期公司股价表现弱于基准指数5以上行业评级推荐行业基本面向好预期行业指数超越基准指数中性行业基本面稳定预期行业指数跟随基准指数回避行业基本面转弱预期行业指数弱于基准指数重要声明本报告由招商证券股份有限公司以下简称本公司编制本公司具有中国证监会许可的证券投资咨询业务资格本报告基于合法取得的信息但本公司对这些信息的准确性和完整性不作任何保证本报告所包含的分析基于各种假设不同假设可能导致分析结果出现重大不同报告中的内容和意见仅供参考并不构成对所述证券买卖的出价在任何情况下本报告中的信息或所表述的意见并不构成对任何人的投资建议除法律或规则规定必须承担的责任外本公司及其雇员不对使用本报告及其内容所引发的任何直接或间接损失负任何责任本公司或关联机构可能会持有报告中所提到的公司所发行的证券头寸并进行交易还可能为这些公司提供或争取提供投资银行业务服务客户应当考虑到本公司可能存在可能影响本报告客观性的利益冲突本报告版权归本公司所有本公司保留所有权利未经本公司事先书面许可任何机构和个人均不得以任何形式翻版复制引用或转载否则本公司将保留随时追究其法律责任的权利敬请阅读末页的重要说明20
|
相关研报
|
||||||||||||||||||||||
