研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 华泰证券-金工深度研究:九坤Kaggle量化大赛有哪些启示?-230130
上传日期:   2023/1/31 大小:   2269KB
格式:   pdf  共23页 来源:   华泰证券
评级:   -- 作者:   林晓明,何康,李子钰
下载权限:   此报告为加密报告
人工智能系列之64:从九坤Kaggle量化大赛高分方案中寻找借鉴
  本文梳理2022年九坤Kaggle量化大赛高分队伍解决方案,提炼出特征工程、损失函数、交叉验证、模型集成四个主要方向,并应用于华泰人工智能中证500指数增强策略改进。结果表明:(1)特征工程引入均值因子对神经网络有效;(2)CCC损失优于MSE损失和IC损失;(3)时序交叉验证作用不明显;(4)集成神经网络和决策树类模型提升较稳定。对比整合多项改进的模型与基线模型,回测期2011年至2022年内,年化超额收益从14.2%提升至17.0%,信息比率从2.3/2.4提升至2.7。
  多家头部量化机构在Kaggle发布竞赛,九坤竞赛贴近实际量化选股场景
  随着数据科学在线社区日益成熟,越来越多的爱好者投身于网络编程竞赛之中。Kaggle是全球知名的数据科学在线平台之一,Two Sigma、Optiver等头部量化机构曾在Kaggle发布挑战竞赛。国内量化私募九坤投资于2022年1月启动Kaggle竞赛,吸引两千多只队伍参赛。比赛具体任务为基于给定的A股匿名特征,预测股票未来短期收益,最终评价指标为预测收益和真实收益的IC值,属于典型的监督学习问题,和实际量化选股场景较贴近。
  四个改进方向:引入均值因子,引入CCC损失,时序交叉验证,模型集成
  我们梳理九坤Kaggle量化大赛高分队伍解决方案,提炼出四个改进方向。(1)特征工程引入截面上全部股票因子的均值,均值因子可能反映原始因子整体分布的时变特性,是市场环境的一种简单表达。(2)损失函数引入一致性相关系数CCC,可视作IC和MSE的融合,兼顾相关性和距离。(3)采用时序交叉验证选取最优超参数。(4)集成不同类型机器学习模型。以神经网络和XGBoost构建中证500指数增强策略作为基线,测试上述技巧的改进效果。
  均值因子对神经网络有效,加权CCC损失回测表现好,模型集成提升稳定
  四项改进技巧效果各异。特征工程引入的均值因子对神经网络有提升,但削弱了XGBoost模型。损失函数中,MSE表现不突出;IC损失单因子测试表现好,但指增组合回测表现差;CCC损失在单因子测试表现一般,但指增组合回测表现较好;加权均优于等权。交叉验证调参改进不显著,考虑到时间开销大,性价比不高,算力有限前提下,使用经验超参数即可。模型集成提升较稳定,神经网络类和决策树类模型有互补效果。
  讨论:(1)如何使用弱因子;(2)因子合成和组合优化的目标错配问题
  研究发现均值因子对神经网络有效但对XGBoost无效。均值因子属于弱因子,有用但比重不宜过大。XGBoost引入弱因子后,特征采样使原始因子可能被排除在外,从而削弱模型。神经网络可通过预处理缩小取值,有限度地使用弱因子。研究还发现IC损失单因子测试优于MSE损失,但指增组合表现差,本质是因子合成和组合优化的目标错配。IC属于全局统计量,不会侧重于个别头部样本,但这些样本可能对组合优化影响较大。MSE的特点之一是给予极端误差较大惩罚,恰好弥补IC弱点。CCC融合IC和MSE,兼顾共性和个性,是一类理想的损失函数。
  风险提示:人工智能挖掘市场规律是对历史的总结,市场规律在未来可能失效。人工智能技术存在过拟合风险。深度学习模型受随机数影响较大,本文未进行随机数敏感性测试。本文测试的选股模型调仓频率较高,假定以vwap价格成交,忽略其他交易层面因素影响。
  
研究报告全文:证券研究报告金工九坤Kaggle量化大赛有哪些启示华泰研究研究员林晓明SACNoS0570516010001linxiaominghtsccom2023年1月30日中国内地深度研究SFCNoBPY4218675582080134研究员李子钰人工智能系列之64从九坤Kaggle量化大赛高分方案中寻找借鉴SACNoS0570519110003liziyuhtsccom本文梳理2022年九坤Kaggle量化大赛高分队伍解决方案提炼出特征工SFCNoBRV7438675523987436程损失函数交叉验证模型集成四个主要方向并应用于华泰人工智能研究员何康PhD中证500指数增强策略改进结果表明1特征工程引入均值因子对神经SACNoS0570520080004hekanghtsccom网络有效2CCC损失优于MSE损失和IC损失3时序交叉验证作用不SFCNoBRB318862128972039明显4集成神经网络和决策树类模型提升较稳定对比整合多项改进的模型与基线模型回测期2011年至2022年内年化超额收益从142提基于九坤大赛改进策略超额收益表现升至170信息比率从2324提升至27改进策略超额收益最大回撤右轴60030nn基线超额收益最大回撤右轴多家头部量化机构在Kaggle发布竞赛九坤竞赛贴近实际量化选股场景500xgb基线超额收益最大回撤右轴25改进策略累计超额收益40020随着数据科学在线社区日益成熟越来越多的爱好者投身于网络编程竞赛之nn基线累计超额收益300xgb基线累计超额收益15中Kaggle是全球知名的数据科学在线平台之一TwoSigmaOptiver等20010头部量化机构曾在Kaggle发布挑战竞赛国内量化私募九坤投资于2022100500年1月启动Kaggle竞赛吸引两千多只队伍参赛比赛具体任务为基于给-100-5定的A股匿名特征预测股票未来短期收益最终评价指标为预测收益和-200-10真实收益的IC值属于典型的监督学习问题和实际量化选股场景较贴近-300-152012-01-042013-01-042014-01-042015-01-042016-01-042017-01-042018-01-042019-01-042020-01-042021-01-042022-01-04四个改进方向引入均值因子引入CCC损失时序交叉验证模型集成2011-01-04我们梳理九坤Kaggle量化大赛高分队伍解决方案提炼出四个改进方向1注回测期2011-01-04至2022-12-30基准为中证500特征工程引入截面上全部股票因子的均值均值因子可能反映原始因子整体资料来源朝阳永续Wind华泰研究分布的时变特性是市场环境的一种简单表达2损失函数引入一致性相关系数CCC可视作IC和MSE的融合兼顾相关性和距离3采用时序交叉验证选取最优超参数4集成不同类型机器学习模型以神经网络和XGBoost构建中证500指数增强策略作为基线测试上述技巧的改进效果均值因子对神经网络有效加权CCC损失回测表现好模型集成提升稳定四项改进技巧效果各异特征工程引入的均值因子对神经网络有提升但削弱了XGBoost模型损失函数中MSE表现不突出IC损失单因子测试表现好但指增组合回测表现差CCC损失在单因子测试表现一般但指增组合回测表现较好加权均优于等权交叉验证调参改进不显著考虑到时间开销大性价比不高算力有限前提下使用经验超参数即可模型集成提升较稳定神经网络类和决策树类模型有互补效果讨论1如何使用弱因子2因子合成和组合优化的目标错配问题研究发现均值因子对神经网络有效但对XGBoost无效均值因子属于弱因子有用但比重不宜过大XGBoost引入弱因子后特征采样使原始因子可能被排除在外从而削弱模型神经网络可通过预处理缩小取值有限度地使用弱因子研究还发现IC损失单因子测试优于MSE损失但指增组合表现差本质是因子合成和组合优化的目标错配IC属于全局统计量不会侧重于个别头部样本但这些样本可能对组合优化影响较大MSE的特点之一是给予极端误差较大惩罚恰好弥补IC弱点CCC融合IC和MSE兼顾共性和个性是一类理想的损失函数风险提示人工智能挖掘市场规律是对历史的总结市场规律在未来可能失效人工智能技术存在过拟合风险深度学习模型受随机数影响较大本文未进行随机数敏感性测试本文测试的选股模型调仓频率较高假定以vwap价格成交忽略其他交易层面因素影响免责声明和披露以及分析师声明是报告的一部分请务必一起阅读1金工研究正文目录研究导读3九坤Kaggle量化大赛高分方案解析5特征工程5损失函数6交叉验证7模型集成7方法8结果12特征工程13损失函数14交叉验证15模型集成16讨论17均值因子在神经网络和XGBoost间的差异兼谈如何使用弱因子17MSE和IC损失函数的差异兼谈因子合成和组合优化的目标错配问题18总结20参考文献20风险提示20免责声明和披露以及分析师声明是报告的一部分请务必一起阅读2金工研究研究导读得益于数据科学在线社区日益成熟机器学习和大数据的学习门槛逐渐降低全球的爱好者都可以通过在线平台参与编程训练和竞赛项目和顶尖团队进行较量和探讨Kaggle正是影响力较大的平台之一囊括了超过500项竞赛5万个数据库和40万组代码美国白宫斯坦福大学北京大学微软谷歌等机构和企业都曾在Kaggle发布竞赛征集解决方案量化投资和机器学习大数据关系紧密多家量化投资机构也在Kaggle平台发起挑战竞赛发布方不乏WintonTwoSigma等知名对冲基金也包含JaneStreetOptiver等头部做市商项目内容大多是基于资产历史行情新闻数据或匿名特征预测未来收益率或波动率下表整理了Kaggle平台量化投资相关竞赛2022年1月国内量化私募九坤投资也上线Kaggle竞赛受到市场关注2893支队伍参赛最终前10名队伍获得10万美元奖金图表1Kaggle平台量化投资相关竞赛发布时间发布机构竞赛描述网址2015年10月Winton利用股票T-2至T日中行情等数据httpswwwkagglecomcompetitionsthe-winton-stock-m预测T日中至T2日收益率arket-challenge2016年12月TwoSigma利用资产匿名特征预测价格httpswwwkagglecomcompetitionstwo-sigma-financial-modeling2018年9月TwoSigma利用新闻数据预测股票价格httpswwwkagglecomcompetitionstwo-sigma-financial-news2020年11月JaneStreet利用股票匿名特征制定交易策略httpswwwkagglecomcompetitionsjane-street-market-prediction2021年6月Optiver利用股票订单簿数据预测未来10httpswwwkagglecomcompetitionsoptiver-realized-vol分钟波动率atility-prediction2021年11月G-research利用数字货币行情数据预测未来httpswwwkagglecomcompetitionsg-research-crypto-f15分钟的残差收益率orecasting2022年1月九坤投资利用股票匿名特征预测收益率httpswwwkagglecomcompetitionsubiquant-market-pr最大化IC值ediction2022年4月日本交易所集团利用股票行情财报等数据预测httpswwwkagglecomcompetitionsjpx-tokyo-stock-ex未来收益率排序最大化多空组合change-prediction夏普比率资料来源Kaggle华泰研究本文的主题是抄作业九坤Kaggle量化大赛高手云集高分队伍是否有经验值得借鉴我们梳理了部分高分队伍公布的解决方案提炼出有共性的四个方向特征工程损失函数交叉验证和模型集成并应用于中证500指数增强策略的改进结果显示改进策略相比基线策略有稳定提升回测期2011年至2022年内年化超额收益从142提升至170信息比率从2324提升至27测试的改进技巧中神经网络引入均值因子CCC损失模型集成提升作用较显著图表2部分测试模型回测绩效年化收益年化波动夏普比最大回Calmar比年化超额收年化跟踪信息比超额收益最大超额收益Calmar相对基准月年化双边换率率率撤率益率误差率回撤比率胜率手率基线策略nn1594256906250250321424599238133610777081618xgb158226070614694034142262822697014768751626改进策略nnfennwcccxgb185626330704896038170062427393218276391631nnfennwcccxgbcv185726380704946038170363626895417973611631注回测期2011-01-04至2022-12-30基准为中证500指数资料来源朝阳永续Wind华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读3金工研究图表3基于九坤Kaggle量化大赛的改进策略超额收益表现改进策略超额收益最大回撤右轴nn基线超额收益最大回撤右轴60030xgb基线超额收益最大回撤右轴改进策略累计超额收益500nn基线累计超额收益xgb基线累计超额收益25400203001520010100500-100-5-200-10-300-152014-07-042019-07-042011-07-042012-01-042012-07-042013-01-042013-07-042014-01-042015-01-042015-07-042016-01-042016-07-042017-01-042017-07-042018-01-042018-07-042019-01-042020-01-042020-07-042021-01-042021-07-042022-01-042022-07-042011-01-04注回测期2011-01-04至2022-12-30基准为中证500指数展示的改进策略为nnfennwcccxgb资料来源朝阳永续Wind华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读4金工研究九坤Kaggle量化大赛高分方案解析九坤Kaggle量化大赛的具体任务为基于给定的A股匿名特征采用机器学习或深度学习算法预测股票未来短期收益评价指标为预测收益和真实收益的IC值均值属于典型的监督学习问题大赛提供的训练数据超过18GB每条样本为一只股票在一个交易日的数据包含如下字段1timeid时间id为有序数据2investmentid股票id3f0f299300个匿名特征4target预测目标股票未来一段时间的收益率但未公布具体区间图表4九坤Kaggle量化大赛排名靠前方案排名模型架构训练数据特征工程损失函数交叉验证其他15LGBM5TabNet的平train和300个官方提供的特征RMSEKFold均supplementaltrain合并100个按timeid求平均的特征MSEPurgedGroupTimeSeries后的2400000行ICTimeSeriesSplit25LGBM的平均train和300个官方提供的特征RMSEPurgedKFoldAEMLP特征中性化PCA并没supplementaltrain所有100个按timeid求平均的特征IC有起到作用数据300个特征的均值标准差及分位数35个不同随机数种子train和使某些特征随机变为0ICLastKK100200300特征裁剪按timeid分组取平均的Transformer6层最大supplementaltrain所有对序列随机掩码Validation特征按相关性找出来的特征样长度3500的平均数据本筛选和加权LGBMMLP1DCNN效果不如Transformer51个NN4层timeid599的train和QuantileTransformerMSEPurgedKFoldTarget取对数并剔除离群值supplementaltrain所有数据71个LGBMtrain的所有数据从大的特征池中产生900多特征TimeSeriesSplit810个LGBM30个NN300个官方提供的特征1个自制模型的加权平均每个timeid平均的特征其他特征171个NN2层276个官方提供的特征L11个构造的A股市场停牌特征L2注LGBM为LightGBM的缩写NN为神经网络的缩写资料来源Kaggle华泰研究比赛于2022年1月开始7月公布最终成绩部分排名靠前队伍公开了解决方案如上表我们从众多方案中提炼具有共性的技巧从特征工程损失函数交叉验证和模型集成四个方向展开介绍特征工程特征工程是模型搭建前的数据预处理和新特征构造工作特征工程的质量一定程度上决定了预测结果的好坏数据预处理主要包括缺失值填充异常值剔除和标准化新特征的构造则依赖投资者的经验和对市场的理解原始特征可能无法很好反映样本和潜在问题的关系通过引入对原始特征处理和组合后的新特征或可提升模型训练效果九坤量化大赛中原始数据进行了预处理和匿名处理无法基于因子含义构造新特征这给特征构造增加了困难我们发现多数高分队伍都进行了新特征的构造仅有少数方案只使用原始的300维特征第128名队伍都提到了构造按照时间ID取平均的均值因子他们指出均值因子的引入对于模型效果有显著提升具体而言假设f0为某个因子在每个交易日对全部股票的f0求均值即得到该交易日股票的均值因子fmean0该交易日全部股票的fmean0取值相同在交易日间有差异反映f0因子整体分布的时变特性这一操作在传统机器学习中似乎不常见构造一个全部股票取值相同的因子也略显反常但在九坤量化大赛中有效免责声明和披露以及分析师声明是报告的一部分请务必一起阅读5金工研究关于均值因子的有效性和背后的含义我们猜想与其他领域的预测问题相比股票收益率预测有其特殊性未来表现不仅和股票本身特征相关还与市场整体环境如宏观状态市场风格等相关规律存在时变特性因此有必要引入特征刻画市场环境变化均值因子反映原始因子整体分布的时变特性是市场环境的一种简单表达可能具备一定信息量损失函数损失函数决定了模型的优化方向损失函数的选择取决于评价指标下游任务等因素九坤量化大赛的最终评价指标为预测收益和真实收益的Pearson相关系数即IC值衡量预测值和真实值的线性相关程度部分高分队伍直接采用IC值的相反数作为损失函数12211均方误差MSE是回归任务中常用的损失函数之一衡量预测值和真实值间的距离对偏离真实值的预测给予较大惩罚部分高分队伍也采用MSE或RMSEMSE的平方根作为损失函数121总结IC和MSE作为损失函数的优缺点1IC衡量预测值和真实值的相关性优点是和比赛最终的评价指标直接挂钩也是量化机构都会考察的指标不受量纲影响从而在模型间可比缺点是非凸不保证收敛可能导致训练不稳定2MSE衡量预测值和真实值的距离优点是易于计算和求导具有凸性从而保证收敛在数据噪声较小的情况下可作为IC的替代缺点是受数据量纲影响九坤量化大赛的讨论区里有选手提出使用一致性相关系数CCCconcordancecorrelationcoefficient作为IC和MSE的融合同时考虑相关性和距离CCC由LawrenceI-KueiLin在1989年于Biometrics发表的论文Aconcordancecorrelationcoefficienttoevaluatereproducibility中提出22122Pandit和Schuller在2019年于arXiv平台发布的论文Themany-to-manymappingbetweentheconcordancecorrelationcoefficientandthemeansquareerror推导了其等价形式222观察CCC的定义1式分子中的xy代表x和y的Pearson相关系数即IC2式分母包含MSE直观来看分子考虑两组数据的相关性分母对两组数据均值的偏离度进行了惩罚实际使用中可以取CCC的相反数作为损失函数尽管高分队伍未使用CCC损失我们仍可以从讨论区中获得启发免责声明和披露以及分析师声明是报告的一部分请务必一起阅读6金工研究交叉验证交叉验证主要用于选择模型超参数最简单的方式是单次验证即选择固定比例的训练集和验证集常用的方式是K折交叉验证将原始数据分成K份每次使用K-1份训练模型使用剩余1份评价模型对K次评价取平均作为该组超参数的整体评价但K折的缺点是可能使用未来信息第17名队伍均提到该问题并提出使用时序交叉验证我们在人工智能14对抗过拟合从时序交叉验证谈起2018-11-28中介绍过该方法时序交叉验证将原始数据按时间顺序划分为K份第i次验证时使用1至i份训练模型第i1份评价模型避免未来信息使用数据量约是K折交叉验证的一半总的来看时序交叉验证的优点是无未来信息且使用数据量少时间开销低缺点是可能存在欠拟合风险图表5K折交叉验证示意图图表6时序交叉验证示意图资料来源华泰研究资料来源华泰研究模型集成模型集成可以看成机器学习中免费的午餐完美训练单个模型难度很大模型集成通过融合多个子模型实现取长补短为比赛中多数高分队伍采用第1817名集成了多种不同类型的子模型如决策树类模型和神经网络模型第23名集成了多个同类型的子模型尽管投票法Stacking等模型集成方法层出不穷比赛中仍主要采用最简单的等权法高分队伍使用决策树类模型和神经网络模型作为子模型两者有各自优势集成能起到互补效果决策树类模型对于数据的要求相对较低对异常值缺失值和特征间数量级不敏感是在实操中较常用的一类模型神经网络一般要求数据数量级一致不能有缺失值但可以通过批量训练将多个截面的信息一并地输入到模型中自动构造出有效的新特征除上述四项外高分队伍在模型架构上亦有可取之处如第1名采用TabNet第3名采用Transformer但模型本身不是本研究关注的重点故不作进一步测试有少数队伍采用了独特的训练技巧如第3名使某些特征随机变为0第5名对预测目标取对数对特征做分位数转换未指明转换成何种分布上述个性化处理也不在后文讨论之列免责声明和披露以及分析师声明是报告的一部分请务必一起阅读7金工研究方法本研究在现有周频中证500指增模型基础上引入九坤量化大赛中的技巧测试改进效果全部测试模型如下表图表7全部测试模型机器学习模型特征损失函数交叉验证基线nn全连接神经网络42个因子加权mse单次验证仅调迭代次数xgbXGBoost42个因子加权mse单次验证仅调迭代次数特征工程nnfe全连接神经网络42个因子42个均值因子加权mse单次验证仅调迭代次数xgbfeXGBoost42个因子42个均值因子加权mse单次验证仅调迭代次数损失函数nnmse全连接神经网络42个因子mse单次验证仅调迭代次数nnwmse基线全连接神经网络42个因子加权mse单次验证仅调迭代次数nnic全连接神经网络42个因子ic单次验证仅调迭代次数nnwic全连接神经网络42个因子加权ic单次验证仅调迭代次数nnccc全连接神经网络42个因子ccc单次验证仅调迭代次数nnwccc全连接神经网络42个因子加权ccc单次验证仅调迭代次数交叉验证xgbcvXGBoost42个因子加权mse5折时序交叉验证调迭代次数及XGBoost超参数模型集成nnxgb50nn50xgbnnwcccxgb50nnwccc50xgbnnfennwcccxgb25nnfe25nnwccc50xgbnnfennwcccxgbcv25nnfe25nnwccc50xgbcv资料来源华泰研究基线模型为全连接神经网络nn和XGBoostxgb特征为42个常规的基本面和量价因子标签为未来10个交易日收益率在截面上的排序损失函数为加权msewmse以截面上个股收益率排序进行衰减加权交叉验证方法为单次验证以2526个交易日为训练集2522个交易日为验证集25205个交易日为测试集相当于约半年滚动训练一次交叉验证配合早停仅用于确定模型的迭代次数其余超参数均为固定值下面介绍四个方向的改进技巧1特征工程除原始42个因子外增加42个均值因子针对每个原始因子首先进行去极值其次在截面上将因子转换为标准差等于1的分布避免因子间量纲差异的影响随后对截面上全部股票求均值最后整体乘以001突出原始因子作用弱化均值因子影响整体乘以001对模型的影响将在后文讨论2损失函数测试MSEICCCC三类损失函数每类损失又分为等权和加权两种情况其中加权CCC定义为112122121h222XGBoost不便于自定义此类损失函数故测试仅针对全连接神经网络3交叉验证采用5折时序交叉验证结合网格搜索确定XGBoost学习率和最大树深神经网络训练时间开销大故测试仅针对XGBoost同样受限于时间开销本文未测试K折交叉验证网格搜索颗粒度也较粗超参数搜索方式的优化有待进一步研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读8金工研究4模型集成直接对全连接神经网络和XGBoost预测值取均值两类模型等权若神经网络有细分子模型则内部再进行等权平均选股因子模型构建方法及网络结构如下列图表具体细节可参考华泰金工研报人工智能55图神经网络选股的进阶之路2022-04-11图表8选股模型使用的42个因子类别名称计算方式估值bplf1市净率epttm1市盈率TTMocfpttm1净经营性现金流TTMdyr12近252日股息率预期conepsg一致预期EPSFY1近63日增长率conroeg一致预期ROEFY1近63日增长率connpg一致预期归母净利润FY1近63日增长率反转ret5d近5日区间收益率ret1m近21日区间收益率expwgtreturn3m近63日收益率以换手率指数衰减加权波动率std1m收益率近21日标准差vstd1m成交量近21日标准差ivrff3factor1m残差收益率收益率对万得全A市值BP因子收益率回归近21日标准差换手率turn1m换手率近21日均值stdturn1m换手率近21日标准差biasturn1m换手率近21日均值近504日均值日间技术stdret10d收益率近10日标准差stdvol10d成交量近10日标准差stdturn10d换手率近10日标准差corrretclose收益率和收盘价近10日相关系数corrretopen收益率和开盘价近10日相关系数corrrethigh收益率和最高价近10日相关系数corrretlow收益率和最低价近10日相关系数corrretvwap收益率和均价近10日相关系数corrretvol收益率和成交量近10日相关系数corrretturn收益率和换手率近10日相关系数corrvolclose成交量和收盘价近10日相关系数corrvolopen成交量和开盘价近10日相关系数corrvolhigh成交量和最高价近10日相关系数corrvollow成交量和最低价近10日相关系数corrvolvwap成交量和均价近10日相关系数日内技术low2highlowhighvwap2closevwapclosekmidclose-openopenklenhigh-lowopenkmid2close-openhigh-lowkuphigh-greateropencloseopenkup2high-greateropenclosehigh-lowklowlessopenclose-lowopenklow2lessopenclose-lowhigh-lowksft2close-high-lowopenksft22close-high-lowhigh-low资料来源朝阳永续Wind华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读9金工研究图表9选股模型构建方法步骤参数参数值构建股票池股票池全A股剔除上市未满63个交易日个股剔除STST退市整理期个股每个季末截面期在未停牌个股中筛选过去1年日均成交额和日均总市值均排名前60个股构建数据集特征T日42个基本面和量价因子标签T11日相对于T1日vwap收益率因子预处理特征5倍MAD缩尾zscore标准化缺失值填为0不做中性化标签剔除缺失值截面排序数标准化训练流程测试集完整区间2011010420221230训练验证测试集划分训练集2526个交易日验证集2522个交易日测试集126个交易日如第1期训练集2002091020081205验证集2008120820101231测试集2011010420110711第2期训练集2003032520090616验证集2009061720110711测试集2011071220120113特殊处理剔除训练集验证集最后10个交易日样本防止信息泄露设置模型网络结构全连接神经网络全连接神经网络隐单元数64损失函数基准为加权mse测试mseic或ccc采用等权或根据收益率衰减加权batchsize每个交易日的全体股票视作一个batch学习率00001优化器adam早停次数20设置模型模型XGBoostXGBoost损失函数加权mse学习率005交叉验证测试005007501最大迭代次数1000早停次数20最大树深3交叉验证测试357行列采样比例08构建组合基准中证500指数优化目标最大化预期收益组合仓位1个股权重下限0个股偏离权重约束-11行业偏离权重约束-11风格偏离标准差约束-11风格因子对数流通市值预处理5倍MAD缩尾zscore标准化调仓周期每5个交易日单次调仓单边换手率上限15成分股权重约束无回测单边费率0002交易价格vwap特殊处理停牌不买入卖出一字板涨停不买入一字板跌停不卖出其余可交易股票重新分配权重资料来源华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读10金工研究图表10网络结构资料来源华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读11金工研究结果全部测试模型因子评价指标及回测绩效如下列图表核心结论如下1特征工程引入的均值因子对神经网络有提升但削弱了XGBoost2损失函数中MSE表现不突出IC损失单因子测试表现好但指增组合回测表现差CCC损失在单因子测试表现一般但指增组合回测表现较好加权均优于等权3交叉验证调参改进不显著考虑到时间开销大性价比并不高算力有限前提下使用经验超参数即可4模型集成提升较稳定神经网络类和决策树类模型有互补效果图表11全部测试模型合成因子评价指标回测期2011-01-04至2022-12-30IC均RankIC加权IC加权RankIC加权加权Top组精Bottom组Top组年Bottom组年多空对冲年基准收值均值均值均值ICIRRankICIRICIRRankICIR确率精确率化收益率化收益率化收益率益率基线nn851067196083099070090563598247-28126463xgb871136597075095057082565602233-30126763特征工程nnfe851077197083099070091563599255-28326963xgbfe68885176058072044062548578206-21921363损失函数nnmse861116797081102064089566600237-29426663nnwmse基线851067196083099070090563598247-28126463nnic861126697076095059084566601233-29826663nnwic871097298081097068088563600250-29327263nnccc851116597077097059085564602217-30125963nnwccc871097298082097068089562601242-29626963交叉验证xgbcv871126596075094057081564603230-29826463模型集成nnxgb9111572102083102066091568605252-31428363nnwcccxgb8911173100083099068090563603243-30427363nnfennwcccxgb9011373101083100068091565605249-31027963nnfennwcccxgbcv9011373101082099068090565605249-31027963资料来源朝阳永续Wind华泰研究图表12全部测试模型回测绩效回测期2011-01-04至2022-12-30基准为中证500指数年化收益年化波动夏普比最大回Calmar比年化超额收年化跟踪信息比超额收益最大超额收益Calmar相对基准月年化双边换率率率撤率益率误差率回撤比率胜率手率基线nn1594256906250250321424599238133610777081618xgb158226070614694034142262822697014768751626特征工程nnfe1741262506648200361583649244152510477781618xgbfe1279266804849540261137680167123709268061626损失函数nnmse1443259105647440301283587219146508875691644nnwmse基线1594256906250250321424599238133610777081618nnic100323940425290019792652121190404261811432nnwic103223980435271020826589140118507059721421nnccc150825780594850031134458523076417672921635nnwccc170625970664793036154261025398215775001632交叉验证xgbcv158226320604790033142765022064022371531627模型集成nnxgb167825950654829035151559925393616279171620nnwcccxgb175726060674797037159561026292017374311630nnfennwcccxgb185626330704896038170062427393218276391631nnfennwcccxgbcv185726380704946038170363626895417973611631资料来源朝阳永续Wind华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读12金工研究特征工程对比引入均值因子前后的表现神经网络无论在Top组收益还是在指增组合年化超额收益信息比率方面均有显著提升但XGBoost在上述指标均有较大削弱原因可能是XGBoost对均值因子的过度使用具体将在后文探讨图表13特征工程测试模型合成因子评价指标回测期2011-01-04至2022-12-30IC均RankIC均加权IC均加权RankIC加权加权Top组精Bottom组精Top组年化收Bottom组年化多空对冲年化基准收值值值均值ICIRRankICIRICIRRankICIR确率确率益率收益率收益率益率基线nn851067196083099070090563598247-28126463xgb871136597075095057082565602233-30126763特征工程nnfe851077197083099070091563599255-28326963xgbfe68885176058072044062548578206-21921363资料来源朝阳永续Wind华泰研究图表14特征工程测试模型回测绩效回测期2011-01-04至2022-12-30基准为中证500指数年化收益年化波动夏普比最大回Calmar比年化超额收益年化跟踪误信息比超额收益最大回超额收益Calmar比相对基准月胜年化双边换手率率率撤率率差率撤率率率基线nn1594256906250250321424599238133610777081618xgb158226070614694034142262822697014768751626特征工程nnfe1741262506648200361583649244152510477781618xgbfe1279266804849540261137680167123709268061626资料来源朝阳永续Wind华泰研究图表15特征工程测试模型超额收益表现回测期2011-01-04至2022-12-30基准为中证500指数nnfexgbfennxgb5004003002001000-1002012-01-042017-07-042011-07-042012-07-042013-01-042013-07-042014-01-042014-07-042015-01-042015-07-042016-01-042016-07-042017-01-042018-01-042018-07-042019-01-042019-07-042020-01-042020-07-042021-01-042021-07-042022-01-042022-07-042011-01-04资料来源朝阳永续Wind华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读13金工研究损失函数对比神经网络模型MSEICCCC三类损失函数以及等权和多头加权两种方式的表现单因子测试结果可概括为种瓜得瓜种豆得豆IC损失下的IC均值和RankIC均值较高加权IC损失下的加权IC均值和加权RankIC均值较高多头加权损失的Top组收益均高于对应的等权损失但单因子测试和指增组合测试存在错位加权IC损失的单因子多头收益和对冲收益均高于其余损失但指增组合表现却低于除等权IC损失外的其余损失CCC损失的单因子表现不算突出但从指增组合表现看无论是等权和加权均优于对应的MSE和IC损失加权CCC损失的年化超额收益和信息比率较出色图表16损失函数测试模型合成因子评价指标回测期2011-01-04至2022-12-30IC均RankIC加权IC加权RankIC加权加权Top组精Bottom组Top组年化Bottom组年多空对冲年化基准收值均值均值均值ICIRRankICIRICIRRankICIR确率精确率收益率化收益率收益率益率nnmse861116797081102064089566600237-29426663nnwmse基线851067196083099070090563598247-28126463nnic861126697076095059084566601233-29826663nnwic871097298081097068088563600250-29327263nnccc851116597077097059085564602217-30125963nnwccc871097298082097068089562601242-29626963资料来源朝阳永续Wind华泰研究图表17损失函数测试模型回测绩效回测期2011-01-04至2022-12-30基准为中证500指数年化收益年化波动年化超额年化跟踪超额收益超额收益相对基准年化双边率率夏普比率最大回撤Calmar比率收益率误差信息比率最大回撤Calmar比率月胜率换手率nnmse1443259105647440301283587219146508875691644nnwmse基线1594256906250250321424599238133610777081618nnic100323940425290019792652121190404261811432nnwic103223980435271020826589140118507059721421nnccc150825780594850031134458523076417672921635nnwccc170625970664793036154261025398215775001632资料来源朝阳永续Wind华泰研究图表18损失函数测试模型超额收益表现回测期2011-01-04至2022-12-30基准为中证500指数nnwmsennmsennwic500nnicnnwcccnnccc4003002001000-1002011-01-042015-07-042016-01-042012-01-042012-07-042013-01-042013-07-042014-01-042014-07-042015-01-042016-07-042017-01-042017-07-042018-01-042018-07-042019-01-042019-07-042020-01-042020-07-042021-01-042021-07-042022-01-042022-07-042011-07-04资料来源朝阳永续Wind华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读14金工研究交叉验证对比XGBoost模型时序交叉验证调参的表现调参后的模型仅在指增组合超额收益回撤比指标上有显著提升其余重要指标反而略有削弱但交叉验证调参的时间开销近19小时远高于不调参近5分钟在算力有限情况下性价比不高需要说明的是本文采用网格搜索的调参方法效率较低从而导致调参颗粒度较粗糙基于贝叶斯优化的调参方法可以提升搜索效率有待进一步测试图表19交叉验证测试模型合成因子评价指标回测期2011-01-04至2022-12-30IC均RankIC均加权IC加权RankIC加权加权Top组精Bottom组精Top组年化收Bottom组年化多空对冲年化基准收值值均值均值ICIRRankICIRICIRRankICIR确率确率益率收益率收益率益率xgb871136597075095057082565602233-30126763xgbcv871126596075094057081564603230-29826463资料来源朝阳永续Wind华泰研究图表20交叉验证测试模型回测绩效回测期2011-01-04至2022-12-30基准为中证500指数年化收益年化波动夏普比最大回Calmar比年化超额收益年化跟踪误信息比超额收益最大回超额收益Calmar比相对基准月胜年化双边换手率率率撤率率差率撤率率率xgb158226070614694034142262822697014768751626xgbcv158226320604790033142765022064022371531627资料来源朝阳永续Wind华泰研究图表21交叉验证测试模型超额收益表现回测期2011-01-04至2022-12-30基准为中证500指数xgbcvxgb4003002001000-1002014-01-042016-01-042019-07-042011-07-042012-01-042012-07-042013-01-042013-07-042014-07-042015-01-042015-07-042016-07-042017-01-042017-07-042018-01-042018-07-042019-01-042020-01-042020-07-042021-01-042021-07-042022-01-042022-07-042011-01-04资料来源朝阳永续Wind华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读15金工研究模型集成对比模型集成后的表现各集成模型在单因子加权RankIC均值多空收益指增组合年化超额收益信息比率上均有显著提升并且子模型为改进模型后3组的表现优于子模型为原始模型nnxgb对比前述特征工程损失函数交叉验证的技巧模型集成带来的提升幅度更大且效应更稳定图表22模型集成测试模型合成因子评价指标回测期2011-01-04至2022-12-30IC均RankIC加权IC加权RankIC加权加权Top组精Bottom组Top组年Bottom组年多空对冲年基准收值均值均值均值ICIRRankICIRICIRRankICIR确率精确率化收益率化收益率化收益率益率基线nn851067196083099070090563598247-28126463xgb871136597075095057082565602233-30126763模型集成nnxgb9111572102083102066091568605252-31428363nnwcccxgb8911173100083099068090563603243-30427363nnfennwcccxgb9011373101083100068091565605249-31027963nnfennwcccxgbcv9011373101082099068090565605249-31027963资料来源朝阳永续Wind华泰研究图表23模型集成测试模型回测绩效回测期2011-01-04至2022-12-30基准为中证500指数年化收益年化波动夏普比最大回Calmar比年化超额收年化跟踪信息比超额收益最大超额收益Calmar相对基准月年化双边换率率率撤率益率误差率回撤比率胜率手率基线nn1594256906250250321424599238133610777081618xgb158226070614694034142262822697014768751626模型集成nnxgb167825950654829035151559925393616279171620nnwcccxgb175726060674797037159561026292017374311630nnfennwcccxgb185626330704896038170062427393218276391631nnfennwcccxgbcv185726380704946038170363626895417973611631资料来源朝阳永续Wind华泰研究图表24模型集成测试模型超额收益表现回测期2011-01-04至2022-12-30基准为中证500指数nnxgbnnwcccxgbnnfennwcccxgb600nnfennwcccxgbcvnnxgb5004003002001000-1002016-01-042011-07-042012-01-042012-07-042013-01-042013-07-042014-01-042014-07-042015-01-042015-07-042016-07-042017-01-042017-07-042018-01-042018-07-042019-01-042019-07-042020-01-042020-07-042021-01-042021-07-042022-01-042022-07-042011-01-04资料来源朝阳永续Wind华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读16金工研究讨论均值因子在神经网络和XGBoost间的差异兼谈如何使用弱因子特征工程引入均值因子提升神经网络表现但削弱XGBoost表现要弄清此中原因相当于用线性的人脑理解非线性模型的工作机理难度颇大我们尝试从下列角度分析首先我们提出一个假设均值因子属于弱因子有用但比重不宜过大前文提到均值因子是对市场环境的刻画有一定信息量高分队伍的实践也表明该因子有效但我们同时观察到比赛中第12名未使用全部300个匿名特征构建均值因子而是筛选IC前100个特征构建均值因子从数量上比重不高模型对均值因子的使用是有限度的并且从理论上分析选股模型应侧重于个股信息的挖掘市场环境信息只起到辅助作用其次考察XGBoost模型的特征重要性计算各期特征重要性均值部分结果如下表在引入均值因子的xgbfe模型中重要性最高的特征为bplfmean即bplf的均值因子重要性排名前10的特征中均值因子占据4位XGBoost模型全部均值因子重要性之和占比44接近一半水平比重较高图表25xgbfe模型各期特征重要性均值前10的特征排序因子xgbxgbfe1bplfmean-4382corrvolhigh3754123bplf5113504epttm6283455turn1m4143186std1mmean-3117expwgtreturn3m5152958expwgtreturn3mmean-2839vwap2close29028110conroegmean-274资料来源朝阳永续Wind华泰研究再次测试均值因子缩放系数的影响预处理环节我们对均值因子整体乘以001突出原始因子作用弱化均值因子影响需要说明的是从两类模型的原理看特征的相对量级对神经网络有效对XGBoost影响不大我们进一步测试均值因子缩放系数为1e-4和1时的表现以验证上述猜想结果如下表所示当缩放系数为1即不对均值因子做缩放处理时神经网络和XGBoost均表现较差随着缩放系数的降低神经网络有显著提升在系数为001时已能战胜原始模型XGBoost变化不大都不能战胜原始模型由此可见神经网络主动降低均值因子值有一定效果但对XGBoost不起作用图表26均值因子缩放系数测试模型合成因子评价指标回测期2011-01-04至2022-12-30IC均RankIC加权IC加权RankIC加权加权Top组精Bottom组Top组年化Bottom组多空对冲年基准收值均值均值均值ICIRRankICIRICIRRankICIR确率精确率收益率年化收益率化收益率益率nn851067196083099070090563598247-28126463nnfescale1e-4861077197083099070091563599256-28427063nnfescale001851077197083099070091563599255-28326963nnfescale162785171065078054071539579178-20319063xgb871136597075095057082565602233-30126763xgbfescale1e-4771035687062080045068557596205-27223963xgbfescale00168885176058072044062548578206-21921363xgbfescale1761025686063080046068555595205-26823663资料来源朝阳永续Wind华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读17金工研究图表27均值因子缩放系数测试模型回测绩效回测期2011-01-04至2022-12-30基准为中证500指数年化收年化波夏普比最大回Calmar年化超额收益年化跟踪误信息比超额收益最大超额收益Calmar相对基准月胜年化双边换益率动率率撤比率率差率回撤比率率手率nn1594256906250250321424599238133610777081618nnfescale1e-41733263606648400361578647244146610876391621nnfescale0011741262506648200361583649244152510477781618nnfescale182025350326030014653587111182703666671641xgb158226070614694034142262822697014768751626xgbfescale1e-41202261104648350251045676155141507461811619xgbfescale0011279266804849540261137680167123709268061626xgbfescale11240257204846530271072662162104210364581618资料来源朝阳永续Wind华泰研究最后从理论角度分析两类模型训练过程XGBoost对特征进行随机采样在采样的候选特征中寻找最优划分方式并非从全部特征中搜索XGBoost引入均值因子这类弱因子后原始特征被采样到的概率下降可能被排除在候选特征外导致模型预测效果下降神经网络不涉及特征采样操作因此可以通过缩小取值的方式在合理限度内使用弱因子MSE和IC损失函数的差异兼谈因子合成和组合优化的目标错配问题本文另一个反直观的结论是IC和加权IC作为损失函数单因子测试表现较好但指增组合表现较差弱于MSE和CCC损失这也是因子投资长期存在的痛点难度同样颇大我们尝试做如下分析一个不会出错的回答是单因子测试和策略回测有差异其背后是因子合成和组合优化两步的目标错配该问题早已为研究者关注常用的样本多头加权正是针对指数增强多头组合在因子合成这步进行的修正尽管未必是最佳解决方法使因子合成的目标尽可能向组合优化的现实场景靠拢然而这并不能解答本文遇到的问题即使是加权IC损失在分10层多头收益高于加权MSE和加权CCC的情况下250高于247和242指增组合超额收益仍然大幅落后83低于142和154这又如何解释容易想到的解释是分10层还不够细随着A股市场的扩容指增选股数量在股票池的占比进一步减小选股更加向头部集中目前行业里常见的做法是分20层测试结果如下图加权IC多头端收益仍然优于加权MSE和加权CCC看来问题不在于评价指标是分10层还是20层图表28部分测试模型合成因子分20层回测年化收益率nnwmsennwicnnwccc403020100-10-20-30-40-501234567891011121314151617181920资料来源朝阳永续Wind华泰研究免责声明和披露以及分析师声明是报告的一部分请务必一起阅读18金工研究可否考察加权IC超额收益低于加权MSE的交易日从个案出发寻找线索我们统计加权MSE相比加权IC近10日超额收益差距最大的交易日为2015年1月19日由于预测区间为未来10个交易日前推10日为2015年1月5日我们对比该截面日下各模型的预测值和真实值如下图所示左图加权MSE模型的IC值为051低于右图加权IC模型的IC值056但观察预测值横轴排名靠前的样本红点为前5名这些点在左图对应的纵坐标也较大表明真实收益高但在右图的纵坐标不算高这些预测值靠前的股票有大概率会被选中且分配较高权重该截面日股票池有1127只有效样本即使分20层测试由于分层组合收益通常为等权重计算这些点也会被淹没在Top组的50多只股票中但恰恰是这些样本很大程度上左右了策略的收益图表29nnwmse模型预测值和真实值对比2015-01-05截面日图表30nnwic模型预测值和真实值对比2015-01-05截面日IC051IC05620201515101005050000日收益排序标准化日收益排序标准化05051010101015152020真实值未来真实值未来04020002040610080604020002nnwmse预测值nnwic预测值资料来源朝阳永续Wind华泰研究资料来源朝阳永续Wind华泰研究至此我们得到下列关键结论1评价指标的角度传统的单因子测试评价指标可能不适用于目前多头选股场景IC值t统计量等反映预测值的全局性但对多头侧重不够即使是加权IC分20层回测多头收益也会和最终选股组合表现脱节2损失函数的角度以IC为损失函数可以让评价指标变得很好看但IC作为全局性的统计量不会侧重于个别头部样本但这些少数样本可能对组合优化影响很大而MSE的特点之一是给予极端误差较大惩罚恰好可以弥补IC的弱点CCC结合IC和MSE的特点同时学习数据中的共性和个性在本文中表现好也就不难理解3因子合成和组合优化的目标错配理想的解决方案是将两步放在相同的网络中进行优化实现真正的端到端训练但当前技术尚未成熟我们也暂没有特别好的思路相对现实的方案是设计因子合成的损失函数和评价指标尽可能向组合优化场景靠拢例如根据多头选股数量确定损失函数和评价指标的多头倾斜程度融合多种损失函数或采用多目标训练等免责声明和披露以及分析师声明是报告的一部分请务必一起阅读19金工研究总结本文梳理2022年九坤Kaggle量化大赛高分队伍解决方案提炼出特征工程损失函数交叉验证模型集成四个主要方向并应用于华泰人工智能中证500指数增强策略改进结果表明1特征工程引入均值因子对神经网络有效2CCC损失优于MSE损失和IC损失3时序交叉验证作用不明显4集成神经网络和决策树类模型提升较稳定对比整合多项改进的模型与基线模型回测期2011年至2022年内年化超额收益从142提升至170信息比率从2324提升至27随着数据科学在线社区日益成熟越来越多的爱好者投身于网络编程竞赛之中Kaggle是全球知名的数据科学在线平台之一TwoSigmaOptiver等头部量化机构曾在Kaggle发布挑战竞赛国内量化私募九坤投资于2022年1月启动Kaggle竞赛吸引两千多只队伍参赛比赛具体任务为基于给定的A股匿名特征预测股票未来短期收益最终评价指标为预测收益和真实收益的IC值属于典型的监督学习问题和实际量化选股场景较贴近我们梳理九坤Kaggle量化大赛高分队伍解决方案提炼出四个改进方向1特征工程引入截面上全部股票因子的均值均值因子可能反映原始因子整体分布的时变特性是市场环境的一种简单表达2损失函数引入一致性相关系数CCC可视作IC和MSE的融合兼顾相关性和距离3采用时序交叉验证选取最优超参数4集成不同类型机器学习模型以神经网络和XGBoost构建中证500指数增强策略作为基线测试上述技巧的改进效果四项改进技巧效果各异特征工程引入的均值因子对神经网络有提升但削弱了XGBoost损失函数中MSE表现不突出IC损失单因子测试表现好但指增组合回测表现差CCC损失在单因子测试表现一般但指增组合回测表现较好加权均优于等权交叉验证调参改进不显著考虑到时间开销大性价比不高算力有限前提下使用经验超参数即可模型集成提升较稳定神经网络类和决策树类模型有互补效果研究发现均值因子对神经网络有效但对XGBoost无效均值因子属于弱因子有用但比重不宜过大XGBoost引入弱因子后特征采样使原始因子可能被排除在外从而削弱模型神经网络可通过预处理缩小取值有限度地使用弱因子研究还发现IC损失单因子测试优于MSE损失但指增组合表现差本质是因子合成和组合优化的目标错配IC属于全局统计量不会侧重于个别头部样本但这些样本可能对组合优化影响较大MSE的特点之一是给予极端误差较大惩罚恰好弥补IC弱点CCC融合IC和MSE兼顾共性和个性是一类理想的损失函数参考文献LinIK1989Aconcordancecorrelation-coefficienttoevaluatereproducibilityBiometrics451255-268PanditVSchullerB2019Themany-to-manymappingbetweentheconcordancecorrelationcoefficientandthemeansquareerror风险提示人工智能挖掘市场规律是对历史的总结市场规律在未来可能失效人工智能技术存在过拟合风险深度学习模型受随机数影响较大本文未进行随机数敏感性测试本文测试的选股模型调仓频率较高假定以vwap价格成交忽略其他交易层面因素影响免责声明和披露以及分析师声明是报告的一部分请务必一起阅读20
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1