研究结论
分析师情感调整分数(Analyst Sentiment Adjusted Score,ASAS)。该因子通过分析师的研报标题和摘要文本序列来捕捉他们对股票的看法,并结合盈利预测调整值作为标签来训练模型。使用双层Transformer和一维卷积网络提取特征,并计算过去三个月内某只股票的情感打分均值作为量化选股因子,全样本Rank IC均值为0.04,ICIR为2.0。 自然语言处理(NLP)旨在让计算机理解和处理人类语言。自20世纪中叶起,NLP历经多次发展,涌现出ELIZA、BoW词袋模型、Word2Vec等技术。2017年,基于多头自注意力机制的Transformer模型问世,开启了预训练语言模型(T-PTLMs)时代,包括BERT、GPT-n和XLNet等,在各项自然语言处理任务中取得显著成绩。 相比于前一篇研究所使用的词袋模型,此次的研报情感打分,我们使用500词的长文本序列作为输入,使用1228万词的腾讯词库进行精准分词,并用200维的腾讯词向量作为词嵌入的预设权重,用逆概率密度函数(IPDF)对标签进行标准化,经过众多NLP模型的基线对比后,选定Transformer作为基础模型。 我们采用双层Transformer Encoder和一维卷积作为最终的训练模型结构,一维卷积在基线对比时就体现了极强的特征提取能力,配合多头注意力机制,能提炼出文本中的段落相关性,和微妙的情感表达。 ASAS因子在沪深300、中证500、中证1000样本空间中的Rank IC分别为0.047、0.041、0.037,预测能力较为稳定,各个样本空间的ICIR均大于1,因子稳定性较高。在中证500、中证800和中证1000样本空间中表现出较高的超额年化收益率,尤其在中证1000样本空间中表现最优。此外,中证1000样本空间中,年化波动率相对较低,显示出较低的风险特征。 ASAS因子在IC相关性上和标签、WFR的IC相关性较高,标签的Rank IC均值为0.035,ICIR1.4,WFR的Rank IC均值为0.029,ICIR1.3,ASAS的Rank IC均值为0.040,ICIR2.0,说明模型的升级很好地修正了分析师的盈利预测调整,使得选股能力和稳定性同步提升。 风险提示 量化模型失效风险、市场极端环境冲击 研究报告全文:金融工程专题报告报告发布日期2023年03月28日ASAS分析师情感调整分数因子选股系列之八十九刘静涵021-633258883211liujinghanorientseccomcn研究结论执业证书编号S0860520080003分析师情感调整分数AnalystSentimentAdjustedScoreASAS该因子香港证监会牌照BSX840通过分析师的研报标题和摘要文本序列来捕捉他们对股票的看法并结合盈利预测调整值作为标签来训练模型使用双层Transformer和一维卷积网络提取特征并计算过去三个月内某只股票的情感打分均值作为量化选股因子全样本RankIC均薛耕xuegengorientseccomcn值为004ICIR为20自然语言处理NLP旨在让计算机理解和处理人类语言自20世纪中叶起NLP历经多次发展涌现出ELIZABoW词袋模型Word2Vec等技术2017年基于多头自注意力机制的Transformer模型问世开启了预训练语言模型基于偏股型基金指数的增强方案因2023-03-06T-PTLMs时代包括BERTGPT-n和XLNet等在各项自然语言处理子选股系列之八十八任务中取得显著成绩分析师研报类alpha增强因子选股2023-02-17系列之八十七相比于前一篇研究所使用的词袋模型此次的研报情感打分我们使用500词的长研报文本情感倾向因子因子选股2022-12-06文本序列作为输入使用1228万词的腾讯词库进行精准分词并用200维的腾讯系列研究之八十六词向量作为词嵌入的预设权重用逆概率密度函数IPDF对标签进行标准化经过众多NLP模型的基线对比后选定Transformer作为基础模型我们采用双层TransformerEncoder和一维卷积作为最终的训练模型结构一维卷积在基线对比时就体现了极强的特征提取能力配合多头注意力机制能提炼出文本中的段落相关性和微妙的情感表达ASAS因子在沪深300中证500中证1000样本空间中的RankIC分别为004700410037预测能力较为稳定各个样本空间的ICIR均大于1因子稳定性较高在中证500中证800和中证1000样本空间中表现出较高的超额年化收益率尤其在中证1000样本空间中表现最优此外中证1000样本空间中年化波动率相对较低显示出较低的风险特征ASAS因子在IC相关性上和标签WFR的IC相关性较高标签的RankIC均值为0035ICIR14WFR的RankIC均值为0029ICIR13ASAS的RankIC均值为0040ICIR20说明模型的升级很好地修正了分析师的盈利预测调整使得选股能力和稳定性同步提升风险提示量化模型失效风险市场极端环境冲击有关分析师的申明见本报告最后部分其他重要信息披露见分析师申明之后部分或请与您的投资代表联系并请阅读本证券研究报告最后一页的免责申明金融工程专题报告分析师情感调整分数ASAS目录1NLP综述42数据说明421分词422标签盈利预测调整523词嵌入63模型对比731NLP模型介绍732基线对比733最终模型双层Transformer一维卷积84因子表现1041单因子表现1042因子相关性135风险提示146参考文献14有关分析师的申明见本报告最后部分其他重要信息披露见分析师申明之后部分或请与您的投资代表联系并请阅读本证券研究报告最后一页的免责申明2金融工程专题报告分析师情感调整分数ASAS图表目录图1个股报告示例4图2分词精准度取决于词库5图3文本分词之后的词数分布5图4原始盈利预测调整分布6图5预处理盈利预测调整分布6图6CWV腾讯的Embedding对比6图7各模型训练集损失8图8各模型测试集损失8图9模型结构9图10优化后的超参数9图11滚动训练方式10图12研报在各样本空间的覆盖率10图13ASAS各样本空间综合表现11图14ASAS超额净值全样本11图15ASAS多头净值全样本11图16ASAS超额净值沪深300样本空间11图17ASAS多头净值沪深300样本空间11图18ASAS超额净值中证500样本空间12图19ASAS多头净值中证500样本空间12图20ASAS超额净值中证1000样本空间12图21ASAS多头净值中证1000样本空间12图22ASAS分组超额净值全样本12图23ASAS分组超额净值沪深300样本空间12图24ASAS分组超额净值中证500样本空间13图25ASAS分组超额净值中证1000样本空间13图26ASAS各样本空间分组年化超额收益13图27因子值相关性右上半区IC相关性左下半区13图28剔除标签之后的因子表现14有关分析师的申明见本报告最后部分其他重要信息披露见分析师申明之后部分或请与您的投资代表联系并请阅读本证券研究报告最后一页的免责申明3金融工程专题报告分析师情感调整分数ASAS1NLP综述自然语言处理NLP的目的是让计算机能够理解和处理人类语言自20世纪中叶以来NLP历经了快速发展和挫折在20世纪60年代基于同义词抽取的对话程序ELIZA诞生同时代诞生了BoW词袋模型用词频表征文本在文本分类任务上沿用至今2013年Word2Vec诞生使得每个词能在语料的词空间中使用连续值向量表示而不是原来的One-Hot表示赋能80年代发明的神经网络模型RNN和CNN在NLP领域大放异彩改变了原有技术2017年Google在AttentionIsAllYouNeed论文中引入了Transformer模型它的诞生初衷是为了实现RNN和CNN的大一统这个模型结合了多头自注意力机制和编码-解码结构自推出以来Transformer模型在各项深度学习任务中得到了广泛应用基于Transformer的预训练语言模型T-PTLMs在NLP领域非常受欢迎其中BERTGPT-n和XLNet等模型在各种自然语言处理任务中取得了卓越成果BERT同样由Google在2018年提出是使用Transformer最早的大模型GPT-n模型由OpenAI提出其中GPT-3拥有大约1750亿参数基于GPT模型开发的网页应用ChatGPT成为全球用户过亿最快的应用程序XLNet模型由中国科学家杨植麟提出是一种类BERT的模型其自回归预训练方法被GPT所采用在各种NLP任务中超过了同期其他先进模型2数据说明在20221206研报文本情感倾向因子中我们采用的方法为词袋模型从标题和摘要中统计前1000个高频词的词频对关键词的频率用XGBoost对盈利预测调整进行训练这种方法忽略了词语之间的依赖关系无视文本的语法和顺序是NLP中比较古老的文本表征方法本报告将使用合并标题摘要的文本序列作为输入以分析师盈利预测调整作为训练标签使得模型能够从原文中提取出分析师的态度以期在前一篇报告的基础上有所提高图1个股报告示例报告ID股票代码发布机构入库时间报告期标题摘要合并盈利预测调整1524916603866中信建投2023011220221231桃李面包Q4业绩短期受疫情影响23年有望进入恢复阶段核心观点公司Q4经营受疫情因素影响营收同比微降而成本端压力仍存致盈利能力同比下滑短期冲击后展望23年后疫情时代来临在促消费的大背景下公司需求端有望回暖成本端也将出现改善有利于公司业绩重回稳健增长事件公司公布2022年业绩快报报告期内公司预计实现营业收入6686亿元同比增长554实现归母净利润648亿元同比下降1511扣非后归母净利润639亿元同比下降1075Q4单季公司预计实现营业收入1659亿元同比下降079实现归母净利润158亿元同比下降1891扣非后归母净利润152亿元同比下降1858简评Q4受疫情因素影响单季营收小幅下滑四季度分月来看10-11月伴随国庆节后的人员流动全国多地再次出现疫情反复防疫管控对公司的物流配送等环节造成了一定的影响对出行及校园等消费场景也有限制而自12月国内宣布防疫措施优化后短期内感染人数的上升对公司的生产配送等经营环节进一步造成压力消费者居家较多也不利于公司主要线下渠道的销售最终使得公司在Q4单季营收出现小幅回落全年总体来看营收基本保持稳健增长后续伴随消费场景的恢复以及公司供应端的正常化公司收入端表现有望逐步回暖短期仍面临成本压力后续有望逐步缓解就盈利而言公司Q4净利率为953同比下降213pcts环比Q3有所提升盈利能力企稳主要得益于油脂等原料价格环比回落但总体而言今年成本的上行依旧对居芰斐沙寤鳌雇3年成本压力有望逐步缓解而从费用端考虑受疫情因素的影响公司在终端配送服务方面的费用较高费率上存在不利影响其他影响利润因素中公司今年汇兑收益理财收益减少利息支出增加以及购买商品期货合约产生投资损失也对利润表现造成压力最终使得22年全年公司净利率同比下降236pcts坚持产能全国化布局静待23年经营回暖疫情以来尽管公司产能建设进度受到影响销售端的增速放缓也使得整体产能利用率出现一定下滑但从资本开支来看公司全国化产能布局的战略愿景依旧未变从经营模式来看公司中央工厂批发的商业模式使得其终端物流配送能力成为塑造自身核心竞争力的关键短期内或许带来资源投入的加大但伴随多地产能布局逐步落地将有效支撑公司市场份额的提升销售的增长也将带动生产端规模效应的-8351527881688337财通证券2023013120221231普源精电业绩超预期自研芯片产品持续扩张核心观点事件2023年1月29日公司发布2022年度业绩快报预计2022年度可实现收入625亿-639亿元同比增长29-32符合市场预期预计可实现归母净利润0895亿-0961亿元超出市场预期预计可实现扣非归母净利润045亿-051亿元预计2022年四季度可实现收入211亿-225亿元同比增长36-45预计可实现归母净利润0395亿-0461亿元同比增长58-84相比前三季度有明显向上拐点高端产品收入快速增长大客户持续开拓公司2022年高端数字示波器及任意波形发生器为代表的高端产品销售收入增长约98高端产品销售使得公司产品均价提升明显显著提升了公司的收入与毛利率水平公司大客户及终端销售直销模式的收入增长高达73核心大客户持续突破国产化替代加速行业需求稳中有增俄乌冲突与汇率波动对公司海外销售造成一定影响受益于国内政策推动及自研技术优势公司国内销售快速增长2022年公司国内销售收入增速约46随着5G的商用化新能源汽车扩张信息通信和工业生产的发展电子测量设备的需求将持续增长自研技术国内领先时域和频域有望建立优势2022年公司推出第二代自研ASIC半人马座芯片组首次实现示波器产品硬件垂直分辨率指标达到12bit标志着公司在各档次数字示波器的核心模拟信号链路均采用自研芯片技术全面助力国产替代半人马座芯片组可广泛应用于数字示波器波形发生器频谱分析仪逻辑分析仪等产品线可推动公司在时域和频域测量领域的全面快速发展投资建议公司坚持高举高打凭借自研芯片带来的技术壁垒与成本优势在中低端示波器市场形成降维打击并通过自研技术不断突破国外封锁长期展望下业务有望向硬件软件服务转型我们预测公司2022-2024年实现收入6339281247亿元实现归母净利润092203268亿元对应当前PE估值分别为131x60x45xPS估值分别为19x13x10x剔除股份支付影响对应PE为82x56x45x维持增持评级风险提示自研芯片研发及产业化进展不及预期的风险新产品推广不及预期的风险原材料价格大幅波动的风险核心组件外购受限的风险-12021534825688697广发证券2023030620221231纽威数控业绩符合预期新增产能持续落地核心观点公司发布2022年业绩快报2022年公司预计实现营收1846亿元同比增长776归母净利润259亿元同比增长5374其中Q4营收498亿元同比增长1447归母净利润069亿元同比增长29402022年公司归母净利率约1404同比提升420pctQ4单季度归母净利率1394同比提升160pct三期募投项目持续投产公司一期工程09年投产二期工程15年投产两期数控机床产能合计2400余台年折合收入15亿元年21年IPO募资投建三期中高端数控机床产业化项目规划新增产能2000台达产后总产能扩大至4400余台折合收入25-30亿元年该项目于22年7月正式投产预计22-24年产能分别释放5075100随着未来新增产能持续落地公司业绩有望实现进一步增长产品谱系全面布局高景气赛道零件加工机床公司实现了金属切削加工领域的全覆盖机床产品涵盖大型加工中心立式数控机床卧式数控机床三大类共七大系列的200多种型号当前新能源汽车扩产和海上风电发展推动新型机床需求增长公司成立了新能源汽车等机床专项小组研发突破专机目前已有近30款产品适合用于新能源汽车未来高景气度行业将成为公司业绩增量的重要方向盈利预测与投资建议我们认为纽威数控作为机床行业核心企业在宏观经济复苏期有望迎来业绩与估值同步上行的戴维斯双击阶段预计公司22-24年归母净利润分别为259365464亿元给予23年归母净利润30倍PE估值买入评级对应合理价值3354元股风险提示宏观经济波动风险外部环境的不确定性风险行业和市场竞争风险等-0381535807603515海通证券2023031020221231欧普照明公司公告点评股权激励提振信心业绩拐点正当时投资要点欧普照明发布2023年限制性股票激励计划草案公司拟通过在二级市场上回购A股普通股股票向279人激励对象授予限制性股票总计754万股占公司股本总额的100授予价格为952元股据测算本次激励费用为7178万元业绩考核条件为2023-2025年度营业收入或净利润不低于前三个会计年度的平均值复苏背景下股权激励提振信心本次股权激励涵盖对象较广主要为董事高级管理人员核心技术业务骨干等中高层人员无独立董事监事单独或合计持股5以上的股东或实际控制人或其配偶及亲属我们认为在当下宏观经济复苏背景下股权激励有利于提振公司整体经营信心地产及疫情管控放开下公司将迎业绩拐点2022年疫情反复削弱线下消费场景地产竣工低迷压制装修需求我们认为对公司家居及商照业务形成较强冲击展望2023年外部因素皆有改善叠加公司持续降本增效预计收入及利润端将重回增长按考核目标来测算公司2023年收入及利润增速为7及10左右我们预计公司22-24年EPS分别为098118126元估值方面考虑到地产竣工复苏公司平台化降本等方面有效推进预计2023年公司利润率有望提升给予公司2023年PE估值15x-17x对应合理价值区间177-201元维持优于大市评级风险提示地产竣工复苏不及预期宏观经济恢复不及预期-9541527112603348信达证券2023012620221231文灿股份海外业务计提预计负债Q4业绩承压事件公司发布2022年度业绩报告预计全年实现归母净利润22-27亿元同比增长126-178扣非归母净利润24-29亿元同比增长177-235点评新能源业务持续发力全年业绩实现高增公司预计全年归母净利润22-27亿元以中枢245亿元计同比153业绩大幅增长主要系1公司持续加强与新能源汽车客户的业务合作客户的新车型上市带来公司产品产量提升新能源汽车客户及其产品收入在公司整体营业收入的占比提高产品结构优化带动公司毛利增长2法国百炼集团整合协同顺利其产销量进一步提升推动公司业绩增长海外业务计提预计负债Q4业绩承压公司预计Q4归母净利润为-039至011亿元中枢为-014亿元扣非归母净利润为-005至045亿元以中枢为02亿元计同比-9业绩承压主要系1下属墨西哥公司铝材进口涉及增值税缴纳诉讼事项计提052亿元预计负债2广东地区疫情反复公司生产经营受影响较大行业降本压力下一体化压铸龙头有望继续享受行业红利中长期看在补贴退坡特斯拉降价背景下车企降本压力骤增一体压铸作为汽车轻量化及降本增效的有力手段有望被更多车企采用汽车车身制造革命正在开启公司作为国内一体化压铸龙头具备设备模具材料工艺等先发优势有望持续获益此外与法国百炼的协作能够补齐工艺体系实现公司全球化的布局协同作用明显我们看好公司长期发展盈利预测与投资评级公司是汽车铝合金精密铸件龙头受益于汽车轻量化进程下汽车铝材需求的增长此外公司在一体化压铸领域占据领先地位业绩有望保持较好增长我们预计公司2022-2024年归母净利润为233497759亿元对应PE分别为653120倍维持买入评级风险因素原材料价格波动产能释放不及预期客户开拓不及预期疫情缓解不及预期-3737数据来源朝阳永续东方证券研究所注在标签处理时我们只保留对最近财年的盈利预测调整值21分词自然语言处理NLP分词是将连续的文本切分成有意义的词汇或短语的过程分词是NLP任务的基础预处理步骤通过将文本拆分成更小的单元便于计算机理解和分析语义分词方法包括基于规则基于统计和深度学习等这里我们使用腾讯的词库结合jieba分词模块进行分词腾讯词库大小约为1228万能分出较为精准的词图2有关分析师的申明见本报告最后部分其他重要信息披露见分析师申明之后部分或请与您的投资代表联系并请阅读本证券研究报告最后一页的免责申明4金融工程专题报告分析师情感调整分数ASAS图2分词精准度取决于词库数据来源朝阳永续东方证券研究所分词后的序列长度分布如图3所示有大量的样本长度小于27个词这是因某些研报并未提供摘要可以看到大部分序列都小于500词所以我们在训练模型时采用500作为序列最大长度对分词序列进行Padding图3文本分词之后的词数分布数据来源朝阳永续东方证券研究所22标签盈利预测调整盈利预测调整计算方式为同一机构针对某一公司的同一财年的净利润会多次发布研报进行预测某次预测相比上一次的变化率称之为盈利预测调整但一份研报会针对多个财年进行预测在标签处理时我们只保留对最近财年的盈利预测调整值盈利预测调整反映了分析师对于公司现状的情感态度如果分析师决定上调盈利预测说明公司的基本面发生了积极的变化而这种变化会以文本的形式反映在研报的标题摘要中我们用盈利预测调整值所训练出来的模型可以理解摘要中的正负面信息从而给出更加客观的情感打分所以本因子也取名为分析师情感调整打分AnalystSentimentAdjustedScoreASAS而盈利预测调整值存在较多的零值和极值所以我们采用逆概率密度函数IPDF对其进行处理使其尽量符合正态分布在神经网络模型中更容易收敛有关分析师的申明见本报告最后部分其他重要信息披露见分析师申明之后部分或请与您的投资代表联系并请阅读本证券研究报告最后一页的免责申明5金融工程专题报告分析师情感调整分数ASAS注累积分布函数CDF来计算随机变量小于或等于给定值的概率逆概率密度函数IPDF则实现了相反的操作给定一个概率它计算出对应的随机变量的值图4原始盈利预测调整分布图5预处理盈利预测调整分布数据来源朝阳永续东方证券研究所数据来源朝阳永续东方证券研究所23词嵌入Word2Vec是一种用于生成词向量词嵌入的技术它将自然语言中的单词转换为高维空间中的数值向量使得具有相似意义的单词在空间中靠近Skip-gram是Word2Vec中的一种模型通过预测给定单词的上下文来学习这些词嵌入从而捕捉单词间的语义信息有两个著名的中文单词嵌入数据集其中一个数据集是腾讯人工智能实验室嵌入语料库另一个数据集是中文单词向量ChineseWordVector图6CWV腾讯的Embedding对比训练算法最大词库大小最大维度开发者ChineseWordVectorSGNS128万300北师大人大腾讯词向量DSG1228万200腾讯AI实验室数据来源TencentAILabGithub东方证券研究所腾讯AILab的词向量和ChineseWordVector在以下几个方面存在差异语料采集腾讯AILab词向量的训练语料来自腾讯新闻天天快报的新闻语料互联网网页和小说覆盖多种类型的词汇相比之下ChineseWordVector的训练语料来自各领域如百度百科维基百科人民日报知乎微博等词库构建腾讯AILab词向量使用了自动发现新词的算法并计算新词之间的语义相似度而ChineseWordVector则直接采用了北师大和人大研究者们开源的中文词向量语料库训练算法腾讯AILab词向量采用自研的DirectionalSkip-GramDSG算法考虑了词对的相对位置以提高词向量语义表示的准确性而ChineseWordVector使用了Skip-gramwithNegativeSamplingSGNS作为训练算法后者仅为一种提高训练速度的采样方法词库大小腾讯AILab词向量的词库大小达到了1228万而ChineseWordVector的词库大小为128万有关分析师的申明见本报告最后部分其他重要信息披露见分析师申明之后部分或请与您的投资代表联系并请阅读本证券研究报告最后一页的免责申明6金融工程专题报告分析师情感调整分数ASAS词向量维度腾讯AILab词向量的维度为200而ChineseWordVector的维度为300覆盖率腾讯AILab词向量在研报词汇覆盖率达到91而ChineseWordVector的覆盖率仅为24较低的覆盖率会导致词嵌入时出现过多的零向量综上所述腾讯AILab词向量在语料采集词库构建训练算法词库大小和覆盖率等方面与ChineseWordVector存在较大差异显示出较高的覆盖率和准确性3模型对比31NLP模型介绍循环神经网络RNN在文本处理中被广泛采用尤其是长短时记忆网络LSTM和门控循环单元GRU它们的门控机制使其具备记忆功能其中LSTM的遗忘门在长文本任务中表现出色然而GRU在多数情况下与LSTM性能相近且参数较少内存占用低且训练速度更快因此也是一个理想的选择一维卷积神经网络1D-CNN和时序卷积网络TCN在部分自然语言处理NLP任务中胜过RNN例如文本分类和语音识别融合RNN和CNN的网络如RCNN在Kaggle比赛中得到广泛应用利用Conv1D进行词向量特征提取并通过池化操作汇总可以作为特征提取器Transformer和循环神经网络RNN和都在文本处理任务中得到了广泛应用但在某些方面Transformer展现出了优势首先由于它们具有并行计算能力Transformers可以在相同时间内处理更长的序列而RNNs以逐词处理的方式进行计算使得RNNs更适合处理较短的序列其次Transformers能够更有效地捕捉长距离依赖关系这是通过自注意力Self-Attention机制实现的该机制允许每个词与序列中的其他所有词建立联系而RNNs仅能关注序列中的前一个词这限制了它们捕捉长距离依赖关系的能力BERTBidirectionalEncoderRepresentationsfromTransformers模型是一种基于Transformer架构的预训练自然语言处理模型通过整合双向上下文信息来理解句子然而BERT存在局限性首先其参数量庞大导致在微调过程中容易出现过拟合现象由于无法调整BERT内部的参数例如Dropout比率这对于连续值标签的情感分析任务可能会带来问题其次若不进行微调BERT可能缺乏对专业领域词汇的理解32基线对比我们采用50词的序列对SimpleRNNGRULSTMConv1DTransformerEncoderBERT六个模型进行对比这里的模型是Nave的也就是没有添加复杂的结构和参数进行优化以期获得各个模型在数据集上的原始性能来决定后续研究采用的模型其中Transformer未经预训练而是指单个TransformerEncoder在评价各个模型的表现时我们主要关注两个方面收敛速度和过拟合程度收敛速度从表格中可以看出Transformer在训练集上的损失收敛速度最快紧随其后的是LSTMGRU和Conv1DSimpleRNN和BERT的几乎不收敛在测试集上收敛速度的顺序与训练集基本一致Transformer和GRU依然表现出最快的收敛速度过拟合程度对于过拟合程度的评估我们主要关注训练集和测试集损失之间的差距从表格中可以观察到Transformer在训练集和测试集上的损失差距较小说明在这个任务上的有关分析师的申明见本报告最后部分其他重要信息披露见分析师申明之后部分或请与您的投资代表联系并请阅读本证券研究报告最后一页的免责申明7金融工程专题报告分析师情感调整分数ASAS过拟合程度较低而Conv1DLSTMGRU在训练集和测试集上的损失差距较大表明这些模型在这个任务上可能存在一定程度的过拟合综合考虑收敛速度和过拟合程度Transformer在这个任务上表现最好LSTMGRU的表现较为接近但存在一定程度的过拟合Conv1D的训练集收敛速度极快但过拟合程度较高后续的模型我们以Transformer作为基础搭建图7各模型训练集损失图8各模型测试集损失111051109509LSTMLSTMConv1D09Conv1DLoss08Transformer085TransformerMSEMSELoss07GRUGRU08SimpleRNNSimpleRNN06075BERTBERT0507135791113151719135791113151719EpochsEpochs数据来源朝阳永续东方证券研究所数据来源朝阳永续东方证券研究所在实验中为了使模型在结构上更贴近Transformer我们在双向门控循环单元Bi-GRU中引入了自注意力Self-Attention机制然而验证结果显示其性能依然不如原生的TransformerEncoder随着文本序列长度的增加循环神经网络RNN的训练时间显著上升在使用四块A4000显卡进行测试时文本长度为50词时RNN与Transformer的训练时间差异不大每个epoch约20秒但当文本长度扩展至500词时Transformer每个epoch的训练时间为30秒而GRU却需要6分钟LSTM更高达9分钟33最终模型双层Transformer一维卷积最终设计的模型是一个混合结构的深度学习网络结合了Transformer编码器和一维卷积神经网络1D-CNN模型结构概述输入层接收固定长度的文本序列500个词嵌入层将输入的词ID转换为固定大小的词向量这里使用预训练的词嵌入两层Transformer编码器层每个编码器包含多头自注意力机制和全连接前馈网络实现NLP中的上下文建模一维卷积层提取局部特征和n-gram模式n-gram模式可以在两个词之间形成词组全局平均池化和全局最大池化从卷积层提取的特征进行池化操作降维并捕获全局信息连接层将平均池化和最大池化的结果进行拼接Dropout层用于减少过拟合有关分析师的申明见本报告最后部分其他重要信息披露见分析师申明之后部分或请与您的投资代表联系并请阅读本证券研究报告最后一页的免责申明8金融工程专题报告分析师情感调整分数ASAS输出层全连接层使用tanh激活函数预测输入文本的情感得分图9模型结构数据来源东方证券研究所绘制这种混合结构模型在情感分析任务上具有许多优点首先通过多头自注意力机制Transformer编码器可以捕捉长距离的依赖关系提高模型对上下文信息的敏感性其次Transformer编码器支持高度并行计算有助于加快训练速度和提高模型性能此外一维卷积层可以有效地捕捉局部特征和n-gram模式增强模型的表达能力全局池化操作可以捕捉整个序列的全局信息而连接层则允许模型同时利用全局平均池化和全局最大池化的结果实现更丰富的特征表示最后这种混合结构可以轻松扩展到其他自然语言处理任务具有较强的通用性以下是进行滚动训练时使用的超参数图10优化后的超参数超参数名称英文名中文名数值SequenceLengthseqlen序列长度500NumberofHeadsnumheads头数8DepthofFeed-ForwardNetworkdff前馈网络深度96NumberofTransformerLayersnumtransformerlayersTransformer层数2NumberofFiltersfilters卷积核数量64KernelSizekernelsize卷积核大小5DropoutRatedropoutrate丢弃率05LearningRatelearningrate学习率16E-05数据来源朝阳永续东方证券研究所有关分析师的申明见本报告最后部分其他重要信息披露见分析师申明之后部分或请与您的投资代表联系并请阅读本证券研究报告最后一页的免责申明9金融工程专题报告分析师情感调整分数ASAS4因子表现我们采用滚动训练的方式图11训练集为t3t测试集为tt1整个测试集区间为2012013120230228每个月末采集过去三个月内某只股票每家券商最新报告的模型打分取均值作为分析师情感调整分数ASAS在回测中因为研报数据不会覆盖所有股票图12所以在特定样本空间用行业中值对缺失值进行填充全样本则是过去三个月内所有研报覆盖的股票不进行填充图11滚动训练方式图12研报在各样本空间的覆盖率1009590858075706560555020092010201120122013201420152016201720182019202020212022沪深300中证500中证1000数据来源朝阳永续东方证券研究所数据来源朝阳永续东方证券研究所本章的回测指标中所有和收益率相关的的指标如无特别说明均为超额收益所有超额收益的基准均为样本内的平均收益分组表现中B1为因子值最小组B10为因子值最大组41单因子表现ASAS因子在所有样本空间中的RankIC均为正值预测能力较为稳定同时各个样本空间的ICIR均大于1因子稳定性较高在中证500中证800和中证1000样本空间中该因子表现出较高的超额年化收益率尤其在中证1000样本空间中表现最优此外中证1000样本空间中年化波动率相对较低显示出较低的风险特征在中证1000样本空间中最大回撤较低表明该因子在该样本空间中的风险调整表现较为稳定ASAS因子在沪深300样本空间中的超额年化收益率和年化波动率表现较差最大回撤较高说明该因子在大盘股中的风险较高此外2022年和2023年的超额收益在全样本空间和各指数样本空间中普遍表现较差可能受到市场环境的影响有关分析师的申明见本报告最后部分其他重要信息披露见分析师申明之后部分或请与您的投资代表联系并请阅读本证券研究报告最后一页的免责申明10金融工程专题报告分析师情感调整分数ASAS图13ASAS各样本空间综合表现RankICICIRSharpeAnnRetVolMaxDD201220132014全样本0040200916712572-123166191185沪深30000471341103105101-30690221355中证5000041154515715695-17422538043中证8000044164413612388-175160220228中证10000037165820017482-119100268152201520162017201820192020202120222023全样本-57140602118721525933-08沪深300-604652-04203312137-110-17中证5001001235711172814388636中证800-601074307206153312-0612中证100012117559133156327297128-12数据来源Wind朝阳永续东方证券研究所图14ASAS超额净值全样本图15ASAS多头净值全样本450164-2143512-431025-682-8615-101405-1220-140回撤多头超额中证全指多头数据来源Wind朝阳永续东方证券研究所数据来源Wind朝阳永续东方证券研究所图16ASAS超额净值沪深300样本空间图17ASAS多头净值沪深300样本空间4010935-583-10725-15625-20154-25312-300510-350回撤多头超额沪深300多头数据来源Wind朝阳永续东方证券研究所数据来源Wind朝阳永续东方证券研究所有关分析师的申明见本报告最后部分其他重要信息披露见分析师申明之后部分或请与您的投资代表联系并请阅读本证券研究报告最后一页的免责申明11金融工程专题报告分析师情感调整分数ASAS图18ASAS超额净值中证500样本空间图19ASAS多头净值中证500样本空间580016853-2014848-4012843-6038-8010833-1008828-1206823-1404818-16013-1802808-20008回撤多头超额中证500多头数据来源Wind朝阳永续东方证券研究所数据来源Wind朝阳永续东方证券研究所图20ASAS超额净值中证1000样本空间图21ASAS多头净值中证1000样本空间700306-20255-40204-60153-80102-1001-12050-1400回撤多头超额中证1000多头数据来源Wind朝阳永续东方证券研究所数据来源Wind朝阳永续东方证券研究所图22ASAS分组超额净值全样本图23ASAS分组超额净值沪深300样本空间4544B135B135B2B233B3B32525B4B422B5B51515B6B6B711B705B805B80B90B9B10B10数据来源Wind朝阳永续东方证券研究所数据来源Wind朝阳永续东方证券研究所有关分析师的申明见本报告最后部分其他重要信息披露见分析师申明之后部分或请与您的投资代表联系并请阅读本证券研究报告最后一页的免责申明12金融工程专题报告分析师情感调整分数ASAS图24ASAS分组超额净值中证500样本空间图25ASAS分组超额净值中证1000样本空间67B1B156B2B254B3B3B44B43B53B52B6B62B7B711B8B80B90B9B10B10数据来源Wind朝阳永续东方证券研究所数据来源Wind朝阳永续东方证券研究所图26ASAS各样本空间分组年化超额收益2001501005000-50-100-150B1B2B3B4B5B6B7B8B9B10全样本沪深300中证500中证1000数据来源Wind朝阳永续东方证券研究所42因子相关性预期外净利润SUE和营业收入SUR是基于季节性随机游走模型预测的净利润和营业收入计算的用来度量业绩超预期的程度根据模型是否带漂移项我们计算了SUE0SUE1SUR0和SUR1共4个业绩超预期类指标详情参考20180518业绩超预期类因子WFR因子采用Accwt2方法对各个分析师的预测净利润相对于自己之前预测的调整比例进行加权详情参考20171203分析师研报的数据特征与alphaASAS因子在IC相关性上和标签WFR的IC相关性较高标签的RankIC均值为0035ICIR14WFR的RankIC均值为0029ICIR13ASAS的RankIC均值为0040ICIR20说明模型的升级很好地修正了分析师的盈利预测调整使得选股能力和稳定性同步提升图27因子值相关性右上半区IC相关性左下半区ASAS标签SUE0SUE1SUR0SUR1WFRASAS045029039023028041标签070037043023026078SUE0059073086047042035SUE1061071090043051039SUR0060062081080087022SUR1056055074088088024WFR068092077077067063数据来源Wind朝阳永续东方证券研究所有关分析师的申明见本报告最后部分其他重要信息披露见分析师申明之后部分或请与您的投资代表联系并请阅读本证券研究报告最后一页的免责申明13金融工程专题报告分析师情感调整分数ASASASAS是以分析师盈利预测调整作为标签训练得到的因子意在从文本中获取遗漏的信息从而对盈利调整值进行修正为了检测是否达成此目标我们用标准化后的盈利预测调整标签取三个月内的每家券商的最新研报作为样本取平均值作为标签因子回测发现其本身的选股能力也很突出在ASAS对标签因子正交后RankIC仍然能够达到25说明ASAS确实达成了提取文本中额外信息的目标与WFR正交之后能保留37的RankIC说明文本特征相比于Accwt2加权方式提供了额外的信息量图28剔除标签之后的因子表现RankICICIRSharpeAnnRetVolMaxDD201220132014ASAS全样本0040200916712572-123166191185标签因子003514311599659-22513282242与标签正交002512491045350-25010237185WFR002913201126558-2159013192与WFR正交0037190217112570-122182205187201520162017201820192020202120222023ASAS全样本-57140602118721525933-08标签因子-117213054114136142-20-09与标签正交-064112137535047-62-18WFR-09108623102137114-16-19与WFR正交-6615282-1316719328134-07数据来源Wind朝阳永续东方证券研究所5风险提示1量化模型基于历史数据分析得到未来存在失效的风险建议投资者紧密跟踪模型表现2极端市场环境可能对模型效果造成剧烈冲击导致收益亏损6参考文献WeizenbaumJ1966ELIZA-AComputerProgramFortheStudyofNaturalLanguageCommunicationBetweenManandMachineCommunicationsoftheACM9136-45SahlgrenM2006ThedistributionalhypothesisItalianJournalofLinguistics18133-53MikolovTChenKCorradoGDeanJ2013EfficientEstimationofWordRepresentationsinVectorSpaceInProceedingsofICLRLeCunYBottouLBengioYHaffnerP1998Gradient-BasedLearningAppliedtoDocumentRecognitionProceedingsoftheIEEE86112278-2324HochreiterSSchmidhuberJ1997LongShort-TermMemoryNeuralComputation981735-1780VaswaniAShazeerNParmarNUszkoreitJJonesLGomezANKaiserLPolosukhinI2017AttentionIsAllYouNeedInProceedingsofthe31stConferenceonNeuralInformationProcessingSystemsNIPS2017有关分析师的申明见本报告最后部分其他重要信息披露见分析师申明之后部分或请与您的投资代表联系并请阅读本证券研究报告最后一页的免责申明14金融工程专题报告分析师情感调整分数ASASDevlinJChangM-WLeeKToutanovaK2019BERTPre-trainingofDeepBidirectionalTransformersforLanguageUnderstandingInProceedingsofthe2019ConferenceoftheNorthAmericanChapteroftheAssociationforComputationalLinguisticsNAACLRadfordANarasimhanKSalimansTSutskeverI2018ImprovingLanguageUnderstandingbyGenerativePre-TrainingRetrievedfromhttpss3-us-west-2amazonawscomopenai-assetsresearch-coverslanguage-unsupervisedlanguageunderstandingpaperpdfYangZDaiZYangYCarbonellJGSalakhutdinovRLeQV2019XLNetGeneralizedAutoregressivePretrainingforLanguageUnderstandingInProceedingsofthe33rdConferenceonNeuralInformationProcessingSystemsNeurIPS2019YanSongShumingShiJingLiandHaisongZhangDirectionalSkip-GramExplicitlyDistinguishingLeftandRightContextforWordEmbeddingsNAACL2018ShenLiZheZhaoRenfenHuWensiLiTaoLiuXiaoyongDuAnalogicalReasoningonChineseMorphologicalandSemanticRelationsACL2018YuanyuanQiuHongzhengLiShenLiYingdiJiangRenfenHuLijiaoYangRevisitingCorrelationsbetweenIntrinsicandExtrinsicEvaluationsofWordEmbeddingsChineseComputationalLinguisticsandNaturalLanguageProcessingBasedonNaturallyAnnotatedBigDataSpringerCham2018209-221CCLNLP-NABD2018BestPaperWuXZhangYSunX2019IPDFANovelMethodforDeepLearningLabelPreprocessingInProceedingsoftheInternationalConferenceonComputerScienceandArtificialIntelligenceCSAI2019LiangPJMeursaultVRoutledgeBBetalPEADtxtPost-Earnings-AnnouncementDriftUsingTextJWorkingPapers2021依据发布证券研究报告暂行规定以下条款发布对具体股有关分析师的申明见本报告最后部分其他重要信息披露见分析师申明之后部分或请与您的投资代表联系并请阅读本证券研究报告最后一页的免责申明票作出明确估15值和投资评级金融工程专题报告分析师情感调整分数ASAS分析师TableDisclaimer申明每位负责撰写本研究报告全部或部分内容的研究分析师在此作以下声明分析师在本报告中对所提及的证券或发行人发表的任何建议和观点均准确地反映了其个人对该证券或发行人的看法和判断分析师薪酬的任何组成部分无论是在过去现在及将来均与其在本研究报告中所表述的具体建议或观点无任何直接或间接的关系投资评级和相关定义报告发布日后的12个月内的公司的涨跌幅相对同期的上证指数深证成指的涨跌幅为基准公司投资评级的量化标准买入相对强于市场基准指数收益率15以上增持相对强于市场基准指数收益率515中性相对于市场基准指数收益率在-55之间波动减持相对弱于市场基准指数收益率在-5以下未评级由于在报告发出之时该股票不在本公司研究覆盖范围内分析师基于当时对该股票的研究状况未给予投资评级相关信息暂停评级根据监管制度及本公司相关规定研究报告发布之时该投资对象可能与本公司存在潜在的利益冲突情形亦或是研究报告发布当时该股票的价值和价格分析存在重大不确定性缺乏足够的研究依据支持分析师给出明确投资评级分析师在上述情况下暂停对该股票给予投资评级等信息投资者需要注意在此报告发布之前曾给予该股票的投资评级盈利预测及目标价格等信息不再有效行业投资评级的量化标准看好相对强于市场基准指数收益率5以上中性相对于市场基准指数收益率在-55之间波动看淡相对于市场基准指数收益率在-5以下未评级由于在报告发出之时该行业不在本公司研究覆盖范围内分析师基于当时对该行业的研究状况未给予投资评级等相关信息暂停评级由于研究报告发布当时该行业的投资价值分析存在重大不确定性缺乏足够的研究依据支持分析师给出明确行业投资评级分析师在上述情况下暂停对该行业给予投资评级信息投资者需要注意在此报告发布之前曾给予该行业的投资评级信息不再有效有关分析师的申明见本报告最后部分其他重要信息披露见分析师申明之后部分或请与您的投资代表联系并请阅读本证券研究报告最后一页的免责申明16免责声明HeadertTableDisclaimerTableDisclaimer本证券研究报告以下简称本报告由东方证券股份有限公司以下简称本公司制作及发布本报告仅供本公司的客户使用本公司不会因接收人收到本报告而视其为本公司的当然客户本报告的全体接收人应当采取必要措施防止本报告被转发给他人本报告是基于本公司认为可靠的且目前已公开的信息撰写本公司力求但不保证该信息的准确性和完整性客户也不应该认为该信息是准确和完整的同时本公司不保证文中观点或陈述不会发生任何变更在不同时期本公司可发出与本报告所载资料意见及推测不一致的证券研究报告本公司会适时更新我们的研究但可能会因某些规定而无法做到除了一些定期出版的证券研究报告之外绝大多数证券研究报告是在分析师认为适当的时候不定期地发布在任何情况下本报告中的信息或所表述的意见并不构成对任何人的投资建议也没有考虑到个别客户特殊的投资目标财务状况或需求客户应考虑本报告中的任何意见或建议是否符合其特定状况若有必要应寻求专家意见本报告所载的资料工具意见及推测只提供给客户作参考之用并非作为或被视为出售或购买证券或其他投资标的的邀请或向人作出邀请本报告中提及的投资价格和价值以及这些投资带来的收入可能会波动过去的表现并不代表未来的表现未来的回报也无法保证投资者可能会损失本金外汇汇率波动有可能对某些投资的价值或价格或来自这一投资的收入产生不良影响那些涉及期货期权及其它衍生工具的交易因其包括重大的市场风险因此并不适合所有投资者在任何情况下本公司不对任何人因使用本报告中的任何内容所引致的任何损失负任何责任投资者自主作出投资决策并自行承担投资风险任何形式的分享证券投资收益或者分担证券投资损失的书面或口头承诺均为无效本报告主要以电子版形式分发间或也会辅以印刷品形式分发所有报告版权均归本公司所有未经本公司事先书面协议授权任何机构或个人不得以任何形式复制转发或公开传播本报告的全部或部分内容不得将报告内容作为诉讼仲裁传媒所引用之证明或依据不得用于营利或用于未经允许的其它用途经本公司事先书面协议授权刊载或转发的被授权机构承担相关刊载或者转发责任不得对本报告进行任何有悖原意的引用删节和修改提示客户及公众投资者慎重使用未经授权刊载或者转发的本公司证券研究报告慎重使用公众媒体刊载的证券研究报告HeadertTableAddress东方证券研究所地址上海市中山南路318号东方国际金融广场26楼电话021-63325888传真021-63326786网址wwwdfzqcomcn东方证券股份有限公司经相关主管机关核准具备证券投资咨询业务资格据此开展发布证券研究报告业务东方证券股份有限公司及其关联机构在法律许可的范围内正在或将要与本研究报告所分析的企业发展业务关系因此投资者应当考虑到本公司可能存在对报告的客观性产生影响的利益冲突不应视本证券研究报告为作出投资决策的唯一因素
|
相关研报
|
||||||||||||||||||||||
