研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 国泰君安-债市量化研究系列:如何拆分国债利率的趋势和波动-230315
上传日期:   2023/3/15 大小:   1932KB
格式:   pdf  共17页 来源:   国泰君安
评级:   -- 作者:   覃汉
下载权限:   此报告为加密报告
本报告导读:本研究尝试建立一个结合滤波-因子筛选-VAR模型预测的方法,分别预测国债利率中的趋势和波动项。
  摘要:
  影响债市利率的主逻辑往往有长短期之分,如当前市场主流预期中的短期偏积极长期偏谨慎。其主要影响因子也大有不同。本研究中我们尝试建立一个结合滤波-因子筛选-VAR模型预测的方法,拆分国债利率中的长期趋势和短期波动并分别进行预测。具体方法流程如下:
  1.使用卡尔曼滤波拆分10年期国债利率序列的长期趋势和短期波动。基于应用优先的原则,我们通过机器学习的方式找到了可以获得良好模型效果的卡尔曼滤波超参数和数值解。
  2.滤波后,将趋势项和波动项分别作为被预测变量进入模型,待选因子也被分为趋势类和波动类,趋势类包含:生产、需求、交运、CPI、PP,波动类包含:资金预期、利差图谱、市场情绪、机构行为、技术分析。
  3.采用向量自回归模型(VAR),对使用滤波器分离出的利率趋势项与利率波动项分别进行估计与预测,通过四种不同的方法来训练获得最佳的内生变量组合,分别为:相关性排序法、最远距离法、分步回归法和模块固定法。
  4.通过K-fold方法进行模型训练。将数据集10等分(K=10),按照7:1:2的比例划分样本为训练集:验证集:预测集,分别用于模型估计,超参数优化和模型评价。用平均预测利率多空方向胜手率作为交叉验证筛选的结果,以此选定最优模型。
  从模型回测结果(在预测集中进行,以实现完全样本外)看,其预测准确率大大高于等权因子得分的方法实现的预测,且可以在日频预测中获取较高的准确度。另外,综合考虑最大预测胜率,模型稳定度,以及波动项预测上表现更好等因素,日频预测中最远距离法筛选因子变量更值得推荐,而周频预测中分步回归法效果最佳。
  风险提示:数据选取偏误,指数计算过程偏差,模型选择偏差
研究报告全文:债券研究债券研究TableMainInfoTableTitleTableAuthor20230315报告作者如何拆分国债利率的趋势和波动覃汉分析师010-83939808专债市量化研究系列qinhangtjascom证书编号S0880514060011题本报告导读TableGuide本研究尝试建立一个结合滤波-因子筛选-VAR模型预测的研方法分别预测国债利率中的趋势和波动项唐元懋研究助理究0755-23976753摘要tangyuanmao026130gtjascomTableSummary影响债市利率的主逻辑往往有长短期之分如当前市场主流预期中的短证书编号S0880122030099期偏积极长期偏谨慎其主要影响因子也大有不同本研究中我们尝试建立一个结合滤波-因子筛选-VAR模型预测的方法拆分国债利率中的长TableReport相关报告期趋势和短期波动并分别进行预测具体方法流程如下资金面的两个关注点20230310聚焦两会全年维度看好数字经济转债1使用卡尔曼滤波拆分10年期国债利率序列的长期趋势和短期波动基20230308于应用优先的原则我们通过机器学习的方式找到了可以获得良好模型效票息与弹性兼备推荐34年银行二级债果的卡尔曼滤波超参数和数值解20230306进入复苏验证期等待信号明确2滤波后将趋势项和波动项分别作为被预测变量进入模型待选因子也20230303被分为趋势类和波动类趋势类包含生产需求交运CPIPP波理财规模收缩风险偏好降低20230301证动类包含资金预期利差图谱市场情绪机构行为技术分析券研3采用向量自回归模型VAR对使用滤波器分离出的利率趋势项与利率究波动项分别进行估计与预测通过四种不同的方法来训练获得最佳的内生报变量组合分别为相关性排序法最远距离法分步回归法和模块固定法告4通过K-fold方法进行模型训练将数据集10等分K10按照712的比例划分样本为训练集验证集预测集分别用于模型估计超参数优化和模型评价用平均预测利率多空方向胜手率作为交叉验证筛选的结果以此选定最优模型从模型回测结果在预测集中进行以实现完全样本外看其预测准确率大大高于等权因子得分的方法实现的预测且可以在日频预测中获取较高的准确度另外综合考虑最大预测胜率模型稳定度以及波动项预测上表现更好等因素日频预测中最远距离法筛选因子变量更值得推荐而周频预测中分步回归法效果最佳风险提示数据选取偏误指数计算过程偏差模型选择偏差请务必阅读正文之后的免责条款部分专题研究目录1用卡尔曼滤波拆分长短期波段311卡尔曼滤波的原理和基本计算步骤312卡尔曼滤波的参数选择42变量池的构建和模块分类63预测利率模型搭建预测方法变量筛选与模型训练631预测模型VAR模型6311VAR模型的基本形式和参数选择6312VAR模型的预测732模型训练K-Fold交叉验证833变量筛选9331相关性排序法10332最远距离法10333分步回归法11334模块固定法124模型回测结果1341模型回测结果和启示1342最优模型选择155风险提示16请务必阅读正文之后的免责条款部分2of17专题研究债市研究中对未来利率的定量预测是一个重要的话题简单的利率预测主要通过挖掘一些简单的相关性因子并等权打分完成但这种简单的利率定量预测有因子选择不明确准确性不高等问题另外影响债市利率的主逻辑往往有长短期之分如2023年后的短期偏积极长期偏谨慎其中短期波动长期趋势的主要影响因子可能大有不同为了解决这些问题帮助投资者拆分和预测利率债的长趋势和短波动我们尝试建立一个结合滤波-因子筛选-VAR模型预测的方法思维导图搭建如图1所示图1滤波-因子筛选-预测模型搭建思维导图滤波拆分因子筛选模型训练估计和评价卡尔曼趋势变量池估计方法滤波生产需求交运CPIPPIVAR模型趋势项波动变量池RQ参资金预期利差图谱市场情训练方法数选择绪机构行为技术分析K-fold交叉验证波动项10年期变量选择方法评价方法国债利相关性排序最远距离分步基于预测胜率打分率序列回归固定模块数据来源国泰君安证券研究1用卡尔曼滤波拆分长短期波段在金融时间序列要素拆解分析中常见的做法是对构成可观测时间序列的各个不可观测组成成分进行假设一般而言长期趋势成分如股价中的有效长期价格成分在经济学的微观基础理论上被假设为随机漫步过程而短期波动暂时性成分被假定为一个一阶自回归过程多个长期成分之间往往还受到长期协整关系的约束市场上有对股价比特币价格石油价格等市场时间序列进行微观成分拆分的研究事实上对市场多种时间序列的拆解都获得了相近的成分长期趋势和短期波动并且各项研究对时间序列的拆解后分析都得到了较好的拟合与预测表现从债券长期存在长短期逻辑不一致的现象看我们认为国债收益率同样适用于长短期双成分的拆分11卡尔曼滤波的原理和基本计算步骤我们尝试使用卡尔曼滤波对长短期进行拆分卡尔曼滤波在经济学领域的应用主要包括时间序列模型中的波动信息拆分和不可观测成分的参请务必阅读正文之后的免责条款部分3of17专题研究数拟合前者如利用卡尔曼滤波和VAR方法结合分离出限价订单中的暂时性波动和信息性波动后者如基于带有ARCH扰动的时间序列不可观测成分模型的参数拟合相似的我们认为利率序列可以进行长期趋势和短期波动的成分拆分并且卡尔曼滤波可以被用于拆分和拟合不可观测的序列成分基于应用优先的原则我们并未求解相应的组成成分动态模型的解析解而是通过机器学习的方式找到了可以获得良好模型效果的卡尔曼滤波超参数和数值解但学术界对多种时间序列探索的共同性拆分结果保证了我们模糊计算背后的可靠经济基础卡尔曼滤波的实质是根据上一刻的预测值当前的测量值和误差来计算得到当前的最优量进而再预测下一刻的量主要遵循的是预测实测修正这样一个逆推顺序第一步以K1次迭代的最优状态估计值X估计K次迭代的值Xk1kXAXBU001kkk11第二步计算新的误差协方差矩阵PkTPAPAQkk1002第三步计算预测误差增益矩阵Kk卡尔曼增益TPHKk003kTHPHRk第四步计算在K次迭代的最优状态估计值XkXXKZHX004kkkkk第五步对上述得到的误差协方差矩阵进行更新为下次迭代循环做准备PIKHPkkk005在上面的式子中各量说明如下A状态转移矩阵B控制矩阵Uk1控制向量Pk1上一次迭代的误差协方差矩阵Q预测噪声协方差矩阵H测量矩阵R测量噪声协方差矩阵Zk时刻的实际观测值12卡尔曼滤波的参数选择影响滤波结果的参数是RQ即测量噪声协方差预测噪声协方差请务必阅读正文之后的免责条款部分4of17专题研究这个值反映了我们对于预测和观测值的信任程度其值越大则越相信预测结果滤波结果平滑性越好反之则越相信观测结果滤波结果越偏向于观测值在权益波动的学术研究中一般通过分析流动性成分和信息成分在促使股指价格发生变动的程度比例构建协方差矩阵通过对角元素的取值比例获得RQ而我们通过穷举法和实际验证的方法获得该参数的取值区间通过验证10年期国债到期收益率20200113-20230306的数据当然也可以替换为10年期国开债或其他活跃利率债进行了滤波参数验证结果证明RQ数值为500以下的值会导致序列拆分后波动项中无关信息含量过高影响后续的预测分析工作而值为10000以上会导致波动项中对利率预测有用的信息含量过低即其中掺杂了许多短期波动和长期趋势对债市的影响因此我们选择了50010000的区间根据经验选取步长为100进行了离散化遍历最终结果显示参数为1000050001000和500这四个参数的滤波效果比较理想可以做到波动项中有用信息占比达到理想效果图2滤波参数验证1000050001000500数据来源国泰君安证券研究对十年国债收益率分别使用四个比率进行卡尔曼滤波每一个滤波参数都能对应获得趋势和波动两条序列两条序列是利率的完整分离121请务必阅读正文之后的免责条款部分5of17专题研究趋势Trend和波动Fluctuation这两条序列是本文的核心不同的滤波参数决定了获得的波动序列中包含的信息量滤波参数验证如图2所示在后文我们会根据训练集的验证胜率来决定最佳的滤波参数和最佳的两条分离序列2变量池的构建和模块分类滤波完成后我们将10年期国债到期收益率的趋势项和波动项分别作为被预测变量进入模型当然后续也可以将国开或者其他期限利率债作为被解释变量待选因子也被分为趋势类和波动类趋势类中我们从生产需求交运CPIPPI五个维度出发筛选了33个经济变量作为解释变量波动类中我们从资金预期利差图谱市场情绪机构行为技术分析五个维度出发筛选了21个经济变量作为解释变量变量的具体选择见表1表1变量的具体选择数据来源国泰君安证券研究3预测利率模型搭建预测方法变量筛选与模型训练我们采用向量自回归模型VectorautoregressionVAR对使用滤波器分离出的利率趋势项与利率波动项分别进行估计与预测通过四种不同的方法来训练获得最佳的因子组合分别为相关性排序法最远距离法分步回归法和模块固定法并通过K-fold方法进行模型训练31预测模型VAR模型考虑到长端利率和宏观因素市场情绪技术指标等变量的内生关系我们倾向于采用向量自回归模型VectorautoregressionVAR对使用滤波器分离出的利率趋势项与利率波动项分别进行估计与预测311VAR模型的基本形式和参数选择请务必阅读正文之后的免责条款部分6of17专题研究本文的应用中考虑到模型后期变量筛选对算力的大需求我们仅做基础的非限制性向量自回归模型模型的基本形式是弱平稳过程的自回归表达式描述的是在同一样本期间内的若干变量可以作为它们过去值的线性函数311其中Yt表示k维内生变量列向量Yt-i为滞后的内生变量p是滞后阶数T为样本数目i为待估矩阵为k维白噪声向量当使用VAR模型进行估计时我们需要做两个决定第一个是需要选择将哪些变量放入VAR模型中这将交给模型训练去解决第二个决定是需要选择滞后阶数我们用AIC准则进行滞后阶数的确定综合考虑4种滤波参数下分离出来的趋势和波动序列与252种排列组合后的变量组合在训练集中VAR模型估计的AIC检验情况我们最终采用统一的p3作为我们VAR模型的滞后阶数312VAR模型的预测观察方程311的形式我们可以知道VAR模型中的因变量是由其本身和其他内生变量的滞后历史值共同决定的使用滞后历史值意味着我们可以使用VAR模型本身对Yt进行样本外预测值的迭代推导故我们采用的是固定起点的滚动一步预测如图3所示每日预测完下一日的利率后在第二天更新样本历史值至当日再进行下一日的预测在时间序列的高频日度周度预测情况下这一步的处理很有必要而如果要进行较为长期的预测则可考虑使用周频或者月频的数据在此不展开讨论请务必阅读正文之后的免责条款部分7of17专题研究图3VAR模型的预测预测VAR估计-得到估计系数ttTt0t1tTtT1预测VAR估计-得到估计系数ttT1t0t1tT1tT2更新实际值预测VAR估计-得到估计系数ttTnt0t1tTntTn1更新实际值数据来源国泰君安证券研究32模型训练K-Fold交叉验证在机器学习建模过程中涉及到超参数的确定时通行的做法通常是将数据分为训练集和验证集本研究的超参数主要是变量池中变量的选定和组合我们构建的变量池受制于二级交易和市场情绪等数据历史数据长度只能从2020年1月1日开始考虑到样本期间较短的情况我们应用K-Fold交叉验证Cross-Validation的方法来最大限度利用有限的数据集将原始数据分成K组K-Fold将每个子集数据分别做一次验证集其余的K-1组子集数据作为训练集这样可以得到K个模型这K个模型分别在验证集中评估结果评估结果可以采用均方误差也可以根据应用情景设置一个检验准则图4K-Fold交叉验证K10K-Fold交叉验证K1012345678910验证胜率平均验证胜率traintraintraintraintraintraintrainvaildpredpredwinrate1traintraintraintraintraintrainvaildtrainpredpredwinrate2traintraintraintraintrainvaildtraintrainpredpredwinrate3traintraintraintrainvaildtraintraintrainpredpredwinratewinrate训练集4traintraintrainvaildtraintraintraintrainpredpredwinrate5traintrainvaildtraintraintraintraintrainpredpredwinrate6trainvaildtraintraintraintraintraintrainpredpredwinrate7vaildtraintraintraintraintraintraintrainpredpredwinrate8请务必阅读正文之后的免责条款部分8of17专题研究数据来源国泰君安证券研究本研究中在第1节分离获得两条序列趋势波动后在第2节中构建好的趋势与波动两个变量池我们对两条序列和两个变量池分别进行一一对应的操作将其中的数据分别进行10等分K10按照811的比例划分样本为训练集验证集预测集后续为了验证模型稳定性我们调整了预测集占比排除最后的预测集我们将剩下的8份样本依次取一份作为验证集其余7份为模型的估计训练集使用VAR模型估计得到参数并在验证集中使用参数计算预测值通过预测值与实际值的比较得到胜率即在这里我们用K组检验的平均预测利率多空方向胜手率作为交叉验证的结果当8份样本都作为验证集被训练验证过一次后我们计算当前变量组合的8次训练验证集的平均胜率以此作为本变量组合的训练集效果321其中comb为训练中的变量组合等式右手边变量的第二个下标参数为作为验证集的训练集编号分别循环完成对应滤波参数的252个趋势波动变量组合并且得到K-Fold训练对应的平均胜率后我们比较252个变量组合的平均胜率选择平均胜率最大的一个变量组合作为对应的趋势波动变量选择方案图5排列组合K-Fold验证编号趋势潜在变量编号波动潜在变量1x11z12x22z23x33z34x44z45x55z56x66z67x77z78x88z89x99z910x1010z10STEP1排列组合排列组合55C10C10组合号趋势变量组合组合号波动变量组合11234511234521234621234631234731234725056891025056891025157891025157891025267891025267891012345678验证胜率趋势第一变量波动第一变量验证胜率87654321traintraintraintraintraintraintrainvaildwinrate11组合平均验证组合平均验证winrate11vaildtraintraintraintraintraintraintraintraintraintraintraintraintrainvaildtrainwinrate12胜率胜率winrate12trainvaildtraintraintraintraintraintraintraintraintraintraintrainvaildtraintrainwinrate13winrate13traintrainvaildtraintraintraintraintrain训训traintraintraintrainvaildtraintraintrainwinratewinratewinratewinratetraintraintrainvaildtraintraintraintrain练141114练集traintraintrainvaildtraintraintraintrainwinrate15winrate15traintraintraintrainvaildtraintraintrain集traintrainvaildtraintraintraintraintrainwinrate16winrate16traintraintraintraintrainvaildtraintrainSTEP2trainvaildtraintraintraintraintraintrainwinrate17winrate17traintraintraintraintraintrainvaildtrainvaildtraintraintraintraintraintraintrainwinrate18winrate18traintraintraintraintraintraintrainvaildMAXcombwinrate250winrate250循环得到所有252个变量组合winrate251winrate251循环得到所有252个变量组合的平均验证胜率的平均验证胜率winrate252winrate252数据来源国泰君安证券研究33变量筛选利用K-fold方法训练模型时每组模型中的变量筛选方法也是非常重要的我们计划使用以下4种方法进行筛选并在样本期间利用32中的训练方法测算胜率进行比较筛选出最好的模型请务必阅读正文之后的免责条款部分9of17专题研究331相关性排序法该方法通过最基本的直觉相关性高的变量更有可能是真实的决定因素来寻找最佳的变量组合在第1节分离获得两条序列趋势波动后我们使用在第2节中构建好的趋势与波动两个变量池分别对两条序列进行相关性分析t时期的趋势波动序列与t-1期的经济变量分析相关性和排序可以分别得到与趋势和波动序列相关性相关性绝对值最大的前十经济变量我们分别对两组潜在解释变量按照其与对应分离序列的相关性大小按照排序进行标号由此我们完成了初次的变量筛选获得20个潜在经济变量如图6所示图6相关性排序发法量筛选十年国债收益率卡尔曼滤波分离利率趋势项利率波动项相关性分析Trendtxt-1相关性分析Fluctuationtzt-1趋势变量总池33个趋势潜在变量波动潜在变量波动变量总池21个x1x1z1z1x2x2z2z2x3x3z3z3相关性排序x4z4相关性排序x5z5x6z6x30x7z7z18x31x8z8z19x32x9z9z20x33x10z10z21数据来源国泰君安证券研究趋势与波动各自获得了10个潜在的变量但10个变量相对我们样本量而言还是略显臃肿为了进一步精简变量我们分两步进行1排列组合对于变量的选择我们将已经标号好的1-10个潜在变量进行10选5的排列组合获得总计252个变量组合2参数训练这里我们应用在42中介绍的K-Fold训练方法对252个变量进行训练和比较得到最好的变量组合332最远距离法相关性排序法根据相关性从高到低的原则选择变量该方法在经济意义层面上有不错的表现但在多变量回归中这种方法所筛选出来的变量组合很有可能因为解释变量之间的高相关而导致多重共线性问题为解决此问题我们尝试最远距离法该方法主要考虑解决变量间的线性关系保证了回归模型系数的稳定性详细方法如下1与相关性排序法相同我们首先根据滞后一天的相关性绝对值从高到请务必阅读正文之后的免责条款部分10of17专题研究低排序但之后我们只选取相关性最高的一个最佳变量作为趋势波动项的核心解释变量2之后我们进行第二次相关性分析这次相关分析我们会对上一步选出的最佳变量和趋势波动变量池中剔除最佳变量后的剩余变量进行同期的相关性分析并选出与这个最佳变量距离最远相关性最低的其他9个变量这9个变量与最佳变量就组成了与相关性分析法一样的10个变量为一组的初步筛选变量组合见图7本方法是相关性分析法的拓展仅仅改变了相关性分析法中第一次变量筛选的方法不改变第二部变量筛选即变量组合10选5的具体流程图7最远距离法变量筛选过程十年国债收益率卡尔曼滤波分离利率趋势项利率波动项相关性分析Trendtxt-1相关性分析Fluctuationtzt-1趋势变量总池33个趋势潜在变量波动潜在变量波动变量总池21个x1xbestzbestz1x2x1z1z2x3x2z2z3相关性排序x3z3相关性排序x4z4x5z5x30x6z6z18x31x7z7z19x32x8z8z20x33x9z9z21趋势变量剩余池32个趋势最佳变量与最佳变量最远变量与最佳变量最远变量波动最佳变量波动变剩余池20个x1xbestzbestz1x2x1z1z2x3x2z2z3x3z3x4z4相关性分析xbesttxtx5z5相关性分析xbesttxtx30x6z6z18x31x7z7z19x32x8z8z20x32x9z9z21数据来源国泰君安证券研究333分步回归法最远距离法的变量选择思路解决了相关性排序法的多重共线性问题但同时相关性排序法计量模型经济意义明确的优点也受到削弱最远距离法选出的变量没法解释剩余的四个距离最远变量与趋势波动项本身的关系因此我们更进一步采纳逐步回归的思维发展了分步回归法该方法整合了相关性排序法和最远距离法两个方法的优点通过使用最远距离法的变量选择思路修改最远距离法的回归方法即解决了回归模型多重共线性的问题又保留了模型的经济学解释力具体构建思路如下1第一步的变量筛选过程与最远距离法相同我们可以得到1个一期滞后相关性最大的最优变量和其他9个与最优变量距离最远变量请务必阅读正文之后的免责条款部分11of17专题研究组合成的10潜在变量池2第二步的10选5排列组合步骤也与前两种方法相同3在最后的训练验证过程我们采用了逐步回归的VAR模型也即分两次回归第一次回归如方程331所示用最佳变量解释趋势波动本身331第二次回归如方程332所示用剩下的4个最远距离变量来回归第一次回归的残差项332需要注意的是方程331和方程332均为VAR模型我们假设两部回归的变量均为因变量的内生变量每一个方程中的解释变量都还有对应的方程来描述所有其余变量与其本身的动态关系此处由于篇幅限制未将所有方程都写出但应注意描述方程本身的存在具体的VAR方程组构建可以查看31小节分步回归法保留了最远距离法的变量选择优势消除了模型的共线性又通过分步回归提供了模型很好的经济解释力最佳变量是对趋势波动项的解释而其他相对于最佳变量距离最远的变量可以用来解释在第一步回归中用最佳变量解释不了的残差部分由此模型得到的各个回归系数都有其对应的经济现实含义334模块固定法前面介绍的三种方法全都是完全建立在相关性高低的基础上进行变量的选择我们无法控制变量池中的哪一类的经济变量进入模型这可能会造成唯相关性的问题例如市场情绪有多个高相关的变量在池中上述模型可能会选择5个市场情绪相关的变量进入模型这种情况下模型认为市场利率是完全由市场情绪决定的而较难令人信服为此我们修改变量的选择方法让这个过程一定程度上可控让程序在在模型搭建者的经济理论框架指导下进行相关性选择防止模型出现唯相关性问题这个方法可以根据使用者的经济框架不同而相应的进行改变本文仅在这里阐述我们根据第三章节的变量模块分类进行的模型搭建流程详细步骤如下我们不再使用趋势波动变量池的二分池而是使用五模块变量池详见本文第三章节对趋势波动分别和各个模块中的变量进行滞后一期的相关性分析在每个模块中选出与趋势波动序列一期滞后相关性最高的变量由此我们通过五个模块的提前划分而得到五个模块各自最相关的变量组合请务必阅读正文之后的免责条款部分12of17专题研究图8模块固定法变量筛选过程十年国债收益率卡尔曼滤波分离利率趋势项利率波动项相关性分析Trendtxt-1相关性分析Fluctuationtzt-1趋势变量总池33个趋势变量组波动潜在变量波动变量总池21个x11相关性排序x1bestz1best相关性排序z11模块1x2bestz2best模块1x110取各模块的最佳x3bestz3best取各模块的最佳z15x21x4bestz4bestz21模块2x5bestz5best模块2x26z24x31z31模块3模块3x35z33x41z41模块4模块4x47z45x51z51模块5模块5x55z54数据来源国泰君安证券研究这种方法一定程度上控制了变量的进入我们固定了五大经济模块各个模块都必然会有一个变量进入模型这在分步回归法的基础上更进一步加强了模型的经济解释能力利率的趋势波动两部分分别是由非常完整的五个经济层面的变量来驱动变化的但是这种方法没有进行变量的排列组合筛选已经在第一步变量筛选就确定下了根据相关性排序的最佳变量组合这也意味着我们没有进行K-Fold分样本训练模型的必要这在一定程度上降低了模型的稳定性和结果的可靠性并且模型预测的表现力会很大程度上取决于模型搭建者的经济框架有效性因为模型不再是完全依靠相关性大小在这之前会先受到变量模块划分的限制所以不准确或不合适的经济理论划分模块下模型的预测表现反而会不如前三种唯相关性的方法其中存在着模型解释力和模型预测准确度的权衡取舍4模型回测结果41模型回测结果和启示模型回测结果在预测集中进行以实现完全样本外如表2所示可以看到其预测准确率大大高于等权因子得分的方法且可以在日频预测中获取较高的准确度从日频预测中我们还可以看到几个比较明显的事实1滤波参数对于模型的结果有很大的影响且主要影响分离波动序列的表现在四种方法中四种不同滤波参数训练出来的最佳变量预测效果差距很大相关性排序法和分布回归法的四种参数表现甚至能有15的胜率差距2最远距离法的下限相较于其他三种基于相关性的方法更高即便是预测表现最差的滤波分离序列也能有5152的多空预测胜率请务必阅读正文之后的免责条款部分13of17专题研究3预测利率的胜率表2最后一列很大程度上取决于波动序列的预测胜率表2从右起第二列而且不同的滤波参数主要影响波动序列的预测表现对于趋势序列的影响不显著同时在合理的滤波范围内更强的滤波分离能够呈现更好的预测准确度因为分离出的波动序列可以更好的被波动变量池中的变量拟合解释4基于相关性的方法在预测表现上更好解释力更好的模型预测表现竞争力不高其中存在准确率和解释力的权衡我们的四种方法预测胜率表现上有一定一致性但前三种基于相关性的变量选择方法都选出了胜率高达55-60的变量组合而受制于经济理论模型的模块固定法预测表现也在预期内低于其他三种方法5提升验证集和训练集长度可以提升模型极限性能但可能降低模型表现稳定性我们比较90与95训练集验证集比例设定当我们拉长训练集让模型包含更新的市场变化信息后除最远距离法外其余方法的模型最佳预测胜率提高了约1-8不等另一方面更短的预测集让模型胜率的可统计观察点减少不稳定性相较于90设定中的结果有所增加以模块固定发最为明显表2日频模型回测和结果滤波参数90训练集10预测集预测胜率95训练集5预测集预测胜率Kalman滤波器RQ比趋势序列预测胜率波动序列预测胜率合成预测利率胜率趋势序列预测胜率波动序列预测胜率合成预测利率胜率相关性排序法10009697651554551000057896053500093945152515210000552652631000092425000484810000526347375008788515248481000047374737最远距离法1000878854555758100005789552610000939457585303973757895526500863653035303100006053526350008485545551521000050005263模块固定法1000969748485000741954845161500939450005000806545164194500077274848469787103871354810000863642424091903235482903分步回归法5000924253035303741960976097100096975758530383875806548410000893953035152935558065161500954550004848967751614839数据来源WindiData国泰君安证券研究我们利用日度数据可以进行日频的预测如果将日度数据转换为周度则可进行周频预测周度模型的预测精度有所提高最优预测胜率甚至可以达到70以上其预测准确率大大高于等权因子得分的方法同时周度预测的波动序列的准确率大大提高当使用95训练集包含最新市场短期信息后波动序列的预测胜率甚至能达到8571但需要注意的是由于数据可得性一些解释变量最早只能从2020年1月开始统计我们的周度数据长度不足导致回测结果中模型稳定性表现相较于日度模型更差仅从周度模型来考虑分步回归法从胜率和稳定性角度来讲更有优势请务必阅读正文之后的免责条款部分14of17专题研究表3周频模型回测和结果滤波参数90训练集10预测集预测胜率95训练集5预测集预测胜率Kalman滤波器RQ比趋势序列预测胜率波动序列预测胜率合成预测利率胜率趋势序列预测胜率波动序列预测胜率合成预测利率胜率相关性排序法10009333400040005714428642865009333400040001000028574286500060004000333371431429142910000533340002667714314291429最远距离法500040005333533314298571714310005333533353330005714571450086674667466728575714428610000533346673333857142864286模块固定法5000533360006000428642864286100007333333333338571142914291000866726672667857114291429500866733332667857128571429分步回归法50002667666773331429857185711000060006000666771435714571450093334667400071435714428610008667266733331000042864286数据来源WindiData国泰君安证券研究42最优模型选择根据41节对四种模型回测结果的分析我们知道没有完美的模型但考虑到实际的应用需求我们希望根据各个模型的胜率表现选出当下最适合用于判断利率多空方向的高频模型模块固定法在胜率表现上不占优势我们会重点分析其余三个模型综合考虑我们更推荐在这种分解波动项和趋势项的预测中采用最远距离法筛选因子变量首先最大预测胜率的角度相关排序法和分布回归法都在这个维度上占有分别得到6053和6097的利率预测准确率这两种模型的极限性能表现非常贴近而相较于最远距离法的5758我们认为3的日频预测精度差还是会对最终的投资收益率造成较为显著的差距的其次模型稳定度的角度其中相关性排序法和分步回归法使用不同参数得到的胜率波动性较强或者说这两种方法的最差参数表现都会呈现出一种显著的预测准确度下降而这是由波动序列预测精度的不稳定导致的相反最远距离法不论是分成分预测还是合成预测预测准确度都保持了良好的一致与稳定最后我们希望模型在趋势和波动项上都表现出比较好的稳定性我们发现各种方法在长期趋势的预测中效果都比较好但短期波动上的表现却差别较大高频数据中包含的高噪音高波动性在日频情况下最远距离法模型比较好克服了日度高频预测的这一最大缺陷其对债市中对波动成分的预测较为稳定可以为短期波动带来非常多新的视角和解读但当频率下降至周频分步回归法模型能够更好的滤除无效波动信息带来最佳的预测精度和结果稳健度请务必阅读正文之后的免责条款部分15of17专题研究图9相关性排序法利率分离和预测情况滤波参数1000050001000500444435353535333325252525222215151515滤波分离1111050505050000-05-05-05-05-1-1-1trendflucratetrendflucratetrendflucratetrendflucrate005005010100050005-0050-0050波动序-01-005-01-005列预测-015-01-015-01-02-015-025-02-02-015flucpredflucflucpredflucflucpredflucflucpredfluc29292929285285285285282828282752752752752727272726526526526526262626利率预测25525525525525252525245245245245ratepreraterateprerateratepreraterateprerate数据来源Wind国泰君安证券研究5风险提示风险提示数据选取偏误指数计算过程偏差模型选择偏差请务必阅读正文之后的免责条款部分16of17专题研究本公司具有中国证监会核准的证券投资咨询业务资格分析师声明作者具有中国证券业协会授予的证券投资咨询执业资格或相当的专业胜任能力保证报告所采用的数据均来自合规渠道分析逻辑基于作者的职业理解本报告清晰准确地反映了作者的研究观点力求独立客观和公正结论不受任何第三方的授意或影响特此声明免责声明本报告仅供国泰君安证券股份有限公司以下简称本公司的客户使用本公司不会因接收人收到本报告而视其为本公司的当然客户本报告仅在相关法律许可的情况下发放并仅为提供信息而发放概不构成任何广告本报告的信息来源于已公开的资料本公司对该等信息的准确性完整性或可靠性不作任何保证本报告所载的资料意见及推测仅反映本公司于发布本报告当日的判断本报告所指的证券或投资标的的价格价值及投资收入可升可跌过往表现不应作为日后的表现依据在不同时期本公司可发出与本报告所载资料意见及推测不一致的报告本公司不保证本报告所含信息保持在最新状态同时本公司对本报告所含信息可在不发出通知的情形下做出修改投资者应当自行关注相应的更新或修改本报告中所指的投资及服务可能不适合个别客户不构成客户私人咨询建议在任何情况下本报告中的信息或所表述的意见均不构成对任何人的投资建议在任何情况下本公司本公司员工或者关联机构不承诺投资者一定获利不与投资者分享投资收益也不对任何人因使用本报告中的任何内容所引致的任何损失负任何责任投资者务必注意其据此做出的任何投资决策与本公司本公司员工或者关联机构无关本公司利用信息隔离墙控制内部一个或多个领域部门或关联机构之间的信息流动因此投资者应注意在法律许可的情况下本公司及其所属关联机构可能会持有报告中提到的公司所发行的证券或期权并进行证券或期权交易也可能为这些公司提供或者争取提供投资银行财务顾问或者金融产品等相关服务在法律许可的情况下本公司的员工可能担任本报告所提到的公司的董事市场有风险投资需谨慎投资者不应将本报告作为作出投资决策的唯一参考因素亦不应认为本报告可以取代自己的判断在决定投资前如有需要投资者务必向专业人士咨询并谨慎决策本报告版权仅为本公司所有未经书面许可任何机构和个人不得以任何形式翻版复制发表或引用如征得本公司同意进行引用刊发的需在允许的范围内使用并注明出处为国泰君安证券研究且不得对本报告进行任何有悖原意的引用删节和修改若本公司以外的其他机构以下简称该机构发送本报告则由该机构独自为此发送行为负责通过此途径获得本报告的投资者应自行联系该机构以要求获悉更详细信息或进而交易本报告中提及的证券本报告不构成本公司向该机构之客户提供的投资建议本公司本公司员工或者关联机构亦不为该机构之客户因使用本报告或报告所载内容引起的任何损失承担任何责任评级说明评级说明1投资建议的比较标准增持信用风险下降净价上涨投资评级分为信用债评级和转债评级以报告发布后的建议3个月内的信用债信用评级中性净价不变净价为比较基准报告发布后的建议投资期限内的信用债指数为比较基准减持信用风险上升净价下跌2投资建议的评级标准增持强于信用债指数报告发布日后的3个月内信用债净价的涨跌幅3个月内转债价格相对于信用转债评级中性与信用债指数持平债指数的涨跌幅减持弱于信用债指数国泰君安证券研究所上海深圳北京地址上海市静安区新闸路669号博华广深圳市福田区益田路6003号荣超商北京市西城区金融大街甲9号金融场20层务中心B栋27层街中心南楼18层邮编200041518026100032电话0213867666607552397688801083939888E-mailgtjaresearchgtjascom请务必阅读正文之后的免责条款部分17of17
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1