排序学习的定义
排序学习(Learning to Rank,LTR)又名“机器排序学习”(Machine-learnedRanking)是一种监督学习方法,此机器学习算法通过在数据集上对大量特征进行训练,从而学习生成排序模型,以用于解决实际中的排序问题。排序学习在文档检索、过滤和推荐系统等领域,已得到广泛应用。 LTR算法演变 本文逐步介绍排序学习具体的算法演变,其中包括了,基于配对文档相对排序的概率损失函数,用数据对来训练模型的pairwise排序学习方法RankNet、对RankNet的配对思想进行了扩展,将RankNet中损失函数相对得分函数的梯度定义为lambda,与整体排序的评分标准(如NDCG)进行结合的LambdaRank、以及我们模型中所用到的在LambdaRank的基础上将Mart与现有模型相结合的LambdaMart算法。 模型设计 在构建股票池的时候,选择了沪深300、中证500、中证1000的历史成份股分别作为A股市场大盘股、中盘股、小盘股的代表构建了1800只股票的备选股票池,取数时间范围为2014年11月至2023年8月底。选股策略选取了价量数据作为模型特征的主要组成部分,其中包括了每日个股上大单、中单、小单的流入流出数据,并在此基础上添加了一致预期数据。在进行数据处理之后,我们对以上数据使用了不同的算子进行特征工程。 LGBMRanker选股轮动模型回测结果 本文通过使用LGBMRanker对沪深300、中证500、中证1000的成份股进行排序学习,构建出基于价量数据的选股模型,经回测该策略从2015年11月至2023年8月底的累计绝对收益率为167.31%,相较于等权基准,累计超额收益率为160.16%,年化收益率为13.28%,超额年化为12.40%,夏普比率为0.48,最大回撤为34.58%。从回测结果来看,策略相较于等权基准的年胜率为88.89%,月胜率为65.96%,相较于沪深300的年胜率为77.78%,月胜率为58.51%,相较于中证500的年胜率为100%,月胜率为67.02%,相较于中证1000的年胜率为100%,月胜率为76.60%。策略2023年年初至8月底的绝对收益率为18.10%,相较于等权基准,超额收益率为13.14%,表现出色。 风险提示: 本报告中所有统计结果和模型方法均基于历史数据,不代表未来趋势。 研究报告全文:金融工程证券研究报告专题报告2023年09月28日专题报告基于价量数据的排序学习选股模型排序学习的定义华创证券研究所排序学习LearningtoRankLTR又名机器排序学习Machine-learnedRanking是一种监督学习方法此机器学习算法通过在数据集上对大量特征证券分析师杨宸祎进行训练从而学习生成排序模型以用于解决实际中的排序问题排序学习邮箱在文档检索过滤和推荐系统等领域已得到广泛应用yangchenyihcyjscom执业编号S0360523080003算法演变LTR本文逐步介绍排序学习具体的算法演变其中包括了基于配对文档相对排序相关研究报告的概率损失函数用数据对来训练模型的pairwise排序学习方法RankNet对量化选股系列机构情绪与个人情绪RankNet的配对思想进行了扩展将RankNet中损失函数相对得分函数的梯度2023-09-05定义为lambda与整体排序的评分标准如NDCG进行结合的LambdaRank技术指标研究之一重新认识技术指标以及我们模型中所用到的在LambdaRank的基础上将Mart与现有模型相结合2023-08-21的LambdaMart算法形态学研究之八如何利用形态信号进行行业择时模型设计2023-08-07在构建股票池的时候选择了沪深300中证500中证1000的历史成份股分K线形态研究之七停顿线2023-07-31别作为A股市场大盘股中盘股小盘股的代表构建了1800只股票的备选股K线形态研究之六乌云压顶线票池取数时间范围为2014年11月至2023年8月底选股策略选取了价量2023-07-31数据作为模型特征的主要组成部分其中包括了每日个股上大单中单小单的流入流出数据并在此基础上添加了一致预期数据在进行数据处理之后我们对以上数据使用了不同的算子进行特征工程LGBMRanker选股轮动模型回测结果本文通过使用LGBMRanker对沪深300中证500中证1000的成份股进行排序学习构建出基于价量数据的选股模型经回测该策略从2015年11月至2023年8月底的累计绝对收益率为16731相较于等权基准累计超额收益率为16016年化收益率为1328超额年化为1240夏普比率为048最大回撤为3458从回测结果来看策略相较于等权基准的年胜率为8889月胜率为6596相较于沪深300的年胜率为7778月胜率为5851相较于中证500的年胜率为100月胜率为6702相较于中证1000的年胜率为100月胜率为7660策略2023年年初至8月底的绝对收益率为1810相较于等权基准超额收益率为1314表现出色风险提示本报告中所有统计结果和模型方法均基于历史数据不代表未来趋势证监会审核华创证券投资咨询业务资格批文号证监许可20091210号专题报告投资主题报告亮点本篇报告作为排序学习系列研究的第二篇报告首先简单回顾了排序学习的理论基础与算法逻辑然后深入地介绍了排序学习几种算法的演变并做了简单的推导最后使用LGBMRanker在目标股票池内上构建出基于排序学习的选股模型表现出色投资逻辑排序学习将个股的价量特征作为参数输入将其转化为当期对个股未来走势的相对优劣排序根据历史数据回测通过持仓排名较前的个股可以取得一定的相较于等权基准的超额收益证监会审核华创证券投资咨询业务资格批文号证监许可20091210号2专题报告目录一什么是排序学习5一排序学习的背景5二排序学习的特殊之处5二排序学习算法演变5一RankNet介绍51概率损失函数6二LambdaRank介绍61对RankNet算法的加速62梯度函数的选取8三LambdaMart介绍81对Mart的介绍82LambdaMart公式推导93LambdaMart算法流程10三排序学习选股模型10一LGBMRanker简介10二选股模型设计111股票池112特征选择113标签选择134训练方法135回测结果13四总结19五风险提示20证监会审核华创证券投资咨询业务资格批文号证监许可20091210号3专题报告图表目录图表1特征表12图表2训练方法13图表3LGBMRanker选股策略净值图14图表4LGBMRanker选股策略对比指数净值图14图表5策略表现15图表6胜率表现15图表7分年度收益率统计15图表8今年以来月度收益率统计16图表9行业分布占比16图表10市值分布占比17图表11最新信号17图表12LGBMRanker选股策略9月份走势截至2023091919证监会审核华创证券投资咨询业务资格批文号证监许可20091210号4专题报告一什么是排序学习一排序学习的背景随着数字时代的来临社会信息化程度的不断加深互联网上承载的信息量呈指数级增长想要在海量的数据中检索到自己需要的信息或者想要提高用户的需求与信息之间的匹配程度就会涉及到排序问题排序问题简单来说就是如何从信息膨胀下的数据洪流中便捷地检索出用户最感兴趣的结果重要性不言而喻同时也引起了学术界和工业界的广泛关注与研究与此相关的推荐系统在过去十几年的时间里取得了长足的发展并普遍运用于搜索推荐广告等各个领域而处理排序问题的方法不同也会产生不同的推荐系统同样的关键词一个搜索引擎可以让用户在搜索结果的前几页就快速找到想要的信息而另外一个搜索引擎则无法做到或者经常浏览的两个软件一个总能推送出用户最新最感兴趣的内容而另一个只能生硬的根据用户所选的标签静态的匹配内容这些显著的差异就是因为其核心的推荐算法不同排序学习LearningtoRankLTR又名机器排序学习Machine-learnedRanking顾名思义是使用机器学习用于解决分类与回归问题的方法来解决排序问题通过机器学习算法在数据集上对大量的特征进行训练构建出排序模型让其能够依据数据的相关性重要性等衡量指标对数据进行排序从而满足用户的需求二排序学习的特殊之处相比于传统的分类和回归模型排序学习有着一些显著的不同之处首先排序学习关注的是多个对象之间的相对排序关系而不是单个对象的分类或回归问题其次由于排序学习需要处理多个对象的排序信息所以排序学习模型通常更加复杂需要考虑对象之间的交互信息和排序关系其他机器学习方法通过对一系列数据进行训练并不断优化迭代从而得到一个预测模型再把验证数据一个一个放到预测模型中生成其对应的预测值再加以利用最终目的是要降低预测值与真实值之间的差异来达到精确预测而排序学习训练集是以qD的形式输入模型其中q为query查询对于每一个查询queryq我们由n个文档Dd1d2dnn1以此作为模型的参数并让模型对其进行排序然后根据真实排序与预测排序衡量排序效果再以提升排序效果为目的不断优化迭代由此可以看出排序学习中使用的评估指标也不同于传统的分类和回归任务对于排序学习而言传统分类和回归任务中使用的评估指标如准确率均方误差等都不再适用而常用的排序学习评估指标包括NormalizedDiscountedCumulativeGainNDCG则用于度量模型在对象排序上的性能二排序学习算法演变一RankNet介绍RankNet是一种pairwise的排序学习方法基于配对文档相对排序的概率损失用成对的数据训练神经网络证监会审核华创证券投资咨询业务资格批文号证监许可20091210号5专题报告1概率损失函数假设和是查询下的两个文档和的特征向量分别是和有其中是得分函数分数越高可推断文档的排名越靠前表示第i个文档排在第j个文档的前面的预测概率为11这是一个logistic形式的概率函数取值在01之间随的取值单调递增当0时1即和排序得分相同时排在前的概率为12两个文档之间的排序没法2通过现有的信息区分开来定义的理想目标值为如果要求存在理想的输出结果使得目标概率11根据的定义当我们知道一组相邻的1的结果jik-1可计算11211因此可以考虑将文档按任意顺序排列后计算所有相邻成对文档的相对排序得分从而可以推出任意两个文档和之间的相对排序得分进而方便地求得任意两个文档的概率经证明指定任意一组相邻概率可唯一识别出有了上面的结论可以大大简化RankNet的计算量最少只计算相邻数据即可损失函数形式如下1log1log1是交叉熵损失函数衡量了目标概率与预测概率的接近程度二LambdaRank介绍LambdaRank基于RankNet的配对思想进行了扩展将RankNet中损失函数相对得分函数的梯度定义为lambda与整体排序的评分标准如NDCG进行结合实现了近似优化整体评分标准如NDCG1对RankNet算法的加速文档和在某查询下的标签分别和定义表示排在前则对应的如下10证监会审核华创证券投资咨询业务资格批文号证监许可20091210号6专题报告RankNet中的损失函数可以重新写为log11log10总的损失函数等于所有配对对应的和注意到如果排在前配对和对应的损失和是相等的此时1log1loglog1log1因此为方便起见可以将所有配对重新写为的形式使得其中包含了所有排在前的配对总的损失为在训练过程中使用损失相对权重的梯度进行更新结合链式法则得到计算损失函数相对得分函数的偏导并令其等于11111111可以发现损失函数相对和的偏导是大小相等方向相反的可以将重新写为最后一步将和第i个文档相关的文档对贡献合并在一起其中这部分的内容与物理中的力学有相似之处可看作对文档的推力每对文档对彼此的力是相互的大小相等且方向相反受到的总力由其他相关文档的贡献共同决定RankNet是在每个查询下使用随机梯度下降法每次计算一对文档的梯度并更新参数而LambdaRank通过对进行合并将总损失的梯度重新写为每个文档相加的形式可以先计算所有再计算和最后加总使得计算变得更方便加速了计算过程证监会审核华创证券投资咨询业务资格批文号证监许可20091210号7专题报告2梯度函数的选取RankNet是PairWise的方法以整体排序指标标准如NDCG衡量时效果有所欠缺因此LambdaRank在RankNet的基础上进行改进对梯度函数进行了调整将RankNet中原本梯度函数的形式与排序评价标准相结合一方面的选取要符合一定条件以保证存在合理的损失函数在训练过程中收敛并且我们希望保留相对作用的性质即配对文件相互之间的作用是大小相等方向相反的且改进后的梯度函数保证正负号不变另一方面对于整体排序结果来说某些文档的顺序相对其他文档具有更重要的作用比如在搜索推荐的问题中用户往往只在乎前面几个文档的顺序后面的文档不重要因此我们希望对于更重要的文档上升的速度更快因此考虑在RankNet形式的梯度函数中乘上一个系数是某个评价指标表示交换文档和的顺序后评价指标的变化值越大说明这对排序的结果对整体排序影响越大因此对他们施加更大的力让他们相比原方法移动更多位置以常用的NDCG为例选取为如下形式111221log1log1其中和分别为和的标签和分别为和的排序顺序是与查询相关的最大DCG保证NDCG指标最佳排序时值为1并且因为NDCG为正向指标在经过调整之后我们的损失函数就变成了效用函数而我们的优化目标也从最小化变成了最大化三LambdaMart介绍LambdaMart结合了LambdaRank中的梯度函数和MART又称GBDT算法将作为MART中的梯度对梯度用决策树进行建模1对Mart的介绍GBDT梯度增强决策树又称MART多元可加回归树是一种迭代的决策树算法多棵树的累加结果为最终结果假设有N棵树每棵树的输出为则MART总的输出为1目标值为用去拟合目标值为K棵树的输出结果为每棵树的权重如果每棵树都独立地对进行拟合最后求平均效果和直接用一棵树相比差别不大1一种想法是使第k棵树去拟合目标值和前k-1棵树输出结果的残差1得到更新1然后继续计算更新即可举一个简单的例证监会审核华创证券投资咨询业务资格批文号证监许可20091210号8专题报告子假如一位同学的年龄是15岁第一棵树去拟合年龄输出结果是10岁第二棵树去拟合15-105岁输出结果是4岁第三棵树去拟合15-1045-41岁输出是1岁那么总的估计结果为104115岁GBDT用梯度去替代残差每棵树对梯度进行建模假设损失函数是每一步迭代时我们希望损失函数在减小一般地函数向变量的负梯度方向减小每次迭代时使损失函数更新为111在之前的方法中每一步累加残差得到最终的估计函数将残差替换为负梯度相当于估计函数每一步在向负梯度方向变化最终累加负梯度得到使损失函数更小的预测函数基于前面k-1棵树的结果第k棵树对负梯度进行建模负梯度此时为1对拟合一颗回归树回归树的节点共L个样本落在第k棵树第l个叶节点的区域记为更新叶节点为1更新预测函数为12LambdaMart公式推导在LambdaMart中使用LambdaRank中的i作为拟合的目标梯度yi即每棵树拟合的是损失函数关于得分函数的正梯度将最小化损失函数转换为最大化效用函数11其中得分函数是决策树结果累加拟合的最终目标根据计算得到有1其中为概率函数中的调整参数对应的效用函数为log1证监会审核华创证券投资咨询业务资格批文号证监许可20091210号9专题报告对拟合回归树回归树的节点共L个样本落在第k棵树第l个叶节点的区域记为更新叶节点为1log1CT因为难以得到显式解用Newton-Raphson方法可求近似解122221最后再根据计算出来的叶节点来更新模型113LambdaMart算法流程训练样本共m个设定共有N棵决策树每棵决策树含L个叶节点学习率设定为1对所有训练数据包括不同查询初始化决策树0i12m2依次训练每棵决策树对第k棵决策树k12N21计算每个样本的梯度值22创建回归树去拟合梯度值训练样本落在第k棵树第l个叶节点的区域记为划分L个叶节点区域123更新叶节点区域上的输出值1224更新得分函数11三排序学习选股模型一LGBMRanker简介LGBMLightGBM是一种高效的梯度提升决策树GradientBoostingDecisionTreeGBDT的机器学习算法由Microsoft团队于2016年提出并开源LGBM以其出色的性能和高效的训练速度在数据科学和机器学习领域得到广泛应用LGBM采用了许多优化技术使其在训练过程中具有高度的并行性和低内存消耗例如基于Histogram的决策树算法基于梯度的单侧采样GOSS以及排他性特征捆绑等从而进一步提升了模型的性能降低过拟合的风险提高了模型的泛化能力证监会审核华创证券投资咨询业务资格批文号证监许可20091210号10专题报告LGBMRanker是一种基于LGBMLightGBM的排序学习模型专门用于排序学习任务从本质上来说LGBMRanker是在LGBM模型的基础上进行了扩展和定制增加了排序相关的损失函数和评估指标使其能够更加精准地处理排序学习任务的特定需求二选股模型设计1股票池在构建股票池的时候为了保证样本的稳定性和流动性同时为了控制模型训练和优化的速度我们并没有直接使用所有A股而选择了沪深300中证500中证1000的历史成份股分别作为A股市场大盘股中盘股小盘股的代表构建了1800只股票的备选股票池其中因为中证1000的发布日期为2014年10月17日所以股票池的取数时间范围为2014年11月至2023年8月底2特征选择选股策略选取了价量数据作为模型特征的主要组成部分其中包括了每日个股上大单中单小单的流入流出数据并在此基础上添加了一致预期数据在进行数据处理之后我们对以上数据使用了不同的算子进行特征工程数据方面我们使用了wind底层数据库中的每日个股的涨跌幅数据以及A股每日资金流向数据其中wind对大小单的定义如下小单4万元中单4万元到20万元之间大单20万元到100万元之间特大单100万元而一致预期数据我们选择使用朝阳永续的一致预期数据库令f代表一个数值特征numericalfeaturec代表一个分类特征categoricalfeaturen代表时间窗口参数使用的算子包括1rollingsumf滚动求和2rollingdifff滚动求差分3rollingquantilef滚动求分位数4rollingoftodayf当日占比5monthenddifff月度变化6featuredifff1f2同期特征之差7groupbyrankcf分组之后排序8rollingproductf滚动求乘积9rollingstdf滚动求波动率证监会审核华创证券投资咨询业务资格批文号证监许可20091210号11专题报告图表1特征表分类特征算子时间窗口rollingsumrollingquantile资金流向总流入流出52060featurediffrollingoftodayrollingsumrollingquantile特大单流入流出52060featurediffrollingoftodayrollingsumrollingquantile大单流入流出52060featurediffrollingoftodayrollingsumrollingquantile中单流入流出52060featurediffrollingoftodayrollingsumrollingquantile小单流入流出52060featurediffrollingoftoday一致预期滚动一致预期营业收入rollingdiff52060滚动一致预期净利润rollingdiff52060滚动一致预期每股收益rollingdiff52060滚动一致预期净资产rollingdiff52060滚动一致预期市净率rollingdiff52060滚动一致预期市销率rollingdiff52060滚动一致预期市盈率rollingdiff52060滚动一致预期PEGrollingdiff52060一致预期净资产收益率rollingdiff52060滚动一致预期营业收入rollingdiff52060同比滚动一致预期净利润同rollingdiff52060比滚动一致预期净利润两rollingdiff52060年复合增长率rollingproduct52060基础价量个股涨跌幅rollingstd资料来源华创证券另外针对groupbyrank算子我们使用了市值分组作为对应的分类特征证监会审核华创证券投资咨询业务资格批文号证监许可20091210号12专题报告3标签选择在数据特征提取完成后为了进行排序学习任务需要定义相应的相关性指标即标签为了实现数据集的构建将个股未来一个月的月度涨跌幅从高到低分为30组其中数字越大表示其月度涨跌幅越高在所有个股中的表现越好如对于标签等于30的个股就意味着该个股未来一周的涨跌幅较全股票池中排名前60这样的标签设计可以帮助模型更好地理解样本之间的相对排序关系从而更精准地进行排序预测4训练方法本文采用了滚动训练法来动态地调整模型的超参数在每个时点T0我们使用过去12个月的数据即从T-12至T-3的月度数据作为训练集而将T-3至T-1的月度数据作为验证集从而找到当前时点下的最优超参数基于找到的最优超参数我们对T0的月度数据进行预测并在T1的时候重新计算当前时点的最优超参数以此类推这种滚动训练法的优势在于它可以根据市场情况和模型性能动态地调整超参数从而保证模型在不同时期的时效性与有效性图表2训练方法资料来源华创证券5回测结果根据上述的模型设计方法将每月得到的个股信号进行筛选取前50个股票构建组合进行回测策略效果如下其中基准为股票池的等权组合证监会审核华创证券投资咨询业务资格批文号证监许可20091210号13专题报告图表3LGBMRanker选股策略净值图资料来源Wind华创证券将策略与沪深300中证500中证1000进行比较得到以下净值图图表4LGBMRanker选股策略对比指数净值图资料来源Wind华创证券证监会审核华创证券投资咨询业务资格批文号证监许可20091210号14专题报告图表5策略表现年化超额收益最大回撤持续策略名称累计收益累计超额收益率年化收益率夏普比率最大回撤率时间LGBMRanker1673116016132812400483458507天选股策略资料来源Wind华创证券在计算胜率的时候我们将策略与等权组合沪深300中证500中证1000进行比较得到以下胜率统计可以看到策略在回测区间内的胜率非常高月度胜率相较于除沪深300以外的基准都有65以上的胜率而相较于沪深300的月度胜率也能够达到5851图表6胜率表现vs行业等权年胜vs行业等权月vs沪深300年胜vs沪深300月胜vs中证500年vs中证500月vs中证1000年vs中证1000月率胜率率率胜率胜率胜率胜率888965967778585110067021007660资料来源Wind华创证券分年度具体收益率如下可以看到策略在绝大部分年份都能大幅跑赢各个基准尤其是今年在整体大盘普遍下跌的情况下策略依旧能产生18的正收益大幅跑赢等权组合以及各个宽基图表7分年度收益率统计中证超额vs等权超额超额超额时间策略等权组合沪深300中证5001000vs300vs500vs1000201512311967161734982186735712339851201612311444-1504-1128-1778-2001294825733222344520171231346-8572178-02-17351203-1832366208120181231-2235-321-2531-3332-368797429610971452201912312851245360726382567402-75621328520201231538257227212087193928082659329334412021123121352646-5215582052-512265557608320221231-1423-1579-2163-2031-2158156746087352023年初至2023年8月1811498-275-213-2821313208620242093底资料来源Wind华创证券今年以来月度收益率统计如下从2023年年初至8月底的绝对收益率为1810相较于等权基准超额收益率为1314表现出色可以看到今年策略相较于各个基准在大部分月份都能产生超额收益证监会审核华创证券投资咨询业务资格批文号证监许可20091210号15专题报告图表8今年以来月度收益率统计中证超额vs等权超额超额超额时间策略等权组合沪深300中证5001000vs300vs500vs100020231319987957377248342032612731642023228443326-211092211176543352222023331-135022-046-028-115-157-089-107-022023430-475-169-054-155-222-306-421-32-2542023531245-288-572-31-245348185554862023630178217116-081062-039063259117202373182427448149-1315533766749542023831-304-622-621-573-632318318269328累计收益1810496-274-213-2831314208420232092资料来源Wind华创证券策略过去12个月的行业分布如下可以看到最新的信号中银行建筑房地产配比最高其中银行较上个月的配比增加最高图表9行业分布占比时间202210202211202212202301202302202303202304202305202306202307202308202309交通运输00200600400200601002000040006传媒002006006002002004000000农林牧渔0000040002004002002000医药00400200010080040040180024002商贸零售00400400200200400600600014002008国防军工0002000400000000基础化工00200400600800800602021012008018004家电000004000200200020020002建材004002002002004000200200080020建筑0140140200601008002004002002004018房地产00400200400180060020000200201有色金属0000020000020020060006机械000400402400060160210280016006汽车0040020006004002008012002006002004煤炭000200200020000000电力及公000600400800400201006002004002002用事业电力设备00020004000060020040020020及新能源电子0000040020002006006001002石油石化0020040000000020020006纺织服装0060060080016012004004002008002002证监会审核华创证券投资咨询业务资格批文号证监许可20091210号16专题报告综合004000002000000002计算机00020002000002000080轻工制造00600200080020020060060060080020通信004002000600000000钢铁00200200000200002012002002银行03016034000202000010018非银行金0060060040020002004002000200融食品饮料00020000400002008000资料来源Wind华创证券市值分布如下可以看出策略整体风格偏向小盘股大部分区间内的200亿以下的个股都是持仓占比最高的分类而在最新的信号中200亿以下组和1000亿以上组是占比最高的组图表10市值分布占比时间202210202211202212202301202302202303202304202305202306202307202308202309200亿以04406404409610660941106809804下200-4000060040020040000600012002012亿400-60000400080000200000004亿600-8000040002000020000020008亿800-1000008004002000040000020004亿1000亿以034028042000260000160032上资料来源Wind华创证券策略9月最新个股信号如下图表11最新信号日期股票代码名称中信一级行业202391601288SH农业银行银行202391600028SH中国石化石油石化202391601857SH中国石油石油石化202391600490SH鹏欣资源有色金属202391601390SH中国中铁建筑202391600820SH隧道股份建筑202391002062SZ宏润建设建筑202391601988SH中国银行银行证监会审核华创证券投资咨询业务资格批文号证监许可20091210号17专题报告202391600048SH保利发展房地产202391600282SH南钢股份钢铁202391601618SH中国中冶建筑202391601155SH新城控股房地产202391601658SH邮储银行银行202391600694SH大商股份商贸零售202391001696SZ宗申动力机械202391600741SH华域汽车汽车202391601668SH中国建筑建筑202391600491SH龙元建设建筑202391600655SH豫园股份商贸零售202391600133SH东湖高新房地产202391601998SH中信银行银行202391601006SH大秦铁路交通运输202391600742SH一汽富维汽车202391000680SZ山推股份机械202391600982SH宁波能源电力及公用事业202391601611SH中国核建建筑202391600015SH华夏银行银行202391000725SZ京东方A电子202391601117SH中国化学建筑202391601166SH兴业银行银行202391601919SH中远海控交通运输202391601818SH光大银行银行202391000333SZ美的集团家电202391002574SZ明牌珠宝商贸零售202391600987SH航民股份纺织服装202391601800SH中国交建建筑202391600626SH申达股份综合202391000028SZ国药一致医药202391603906SH龙蟠科技基础化工202391600339SH中油工程石油石化202391000157SZ中联重科机械202391600362SH江西铜业有色金属202391600153SH建发股份交通运输202391600858SH银座股份商贸零售202391601169SH北京银行银行202391002540SZ亚太科技有色金属202391600736SH苏州高新房地产证监会审核华创证券投资咨询业务资格批文号证监许可20091210号18专题报告202391600665SH天地源房地产202391001218SZ丽臣实业基础化工202391601916SH浙商银行银行资料来源Wind华创证券截至9月19日信号的走势如下可以看到在9月份整体市场下行的时候策略相较于其他指数或等权组合产生了明显的超额收益结合上文的最新信号的市值与行业分布可以看出策略9月份的信号偏防御增配了银行与大盘股从而有效控制了波动图表12LGBMRanker选股策略9月份走势截至20230919资料来源Wind华创证券四总结排序学习LearningtoRankLTR又名机器排序学习Machine-learnedRanking是一种监督学习方法通过在数据集上使用机器学习算法对大量特征进行训练从而学习出排序模型用于解决实际中的排序问题在文档检索过滤和推荐系统等领域排序学习已经得到广泛应用本文逐步介绍排序学习具体的算法演变其中包括了基于配对文档相对排序的概率损失函数用数据对来训练模型的pairwise排序学习方法RankNet对RankNet的配对思想进行了扩展将RankNet中损失函数相对得分函数的梯度定义为lambda与整体排序的评分标准如NDCG进行结合的LambdaRank以及我们模型中所用到的在LambdaRank的基础上将Mart与现有模型相结合的LambdaMart算法本文通过使用LGBMRanker对沪深300中证500中证1000的成份股进行排序学习构建出基于价量数据的选股模型经回测该策略从2015年11月至2023年8月底的累计绝对收益率为16731相较于等权基准累计超额收益率为16016年化收益率为证监会审核华创证券投资咨询业务资格批文号证监许可20091210号19专题报告1328超额年化为1240夏普比率为048最大回撤为3458从回测结果来看策略相较于等权基准的年胜率为8889月胜率为6596相较于沪深300的年胜率为7778月胜率为5851相较于中证500的年胜率为100月胜率为6702相较于中证1000的年胜率为100月胜率为7660策略2023年年初至8月底的绝对收益率为1810相较于等权基准超额收益率为1314表现出色我们会在后续的报告中进一步挖掘排序学习在量化投资中的应用价值产出更多策略及模型五风险提示本报告中所有统计结果和模型方法均基于历史数据不代表未来趋势证监会审核华创证券投资咨询业务资格批文号证监许可20091210号20
|
相关研报
|
||||||||||||||||||||||
