>> 国金证券-Alpha掘金系列之十六:基于概念文本相似度聚类的组合优化方案-250405
| 上传日期: |
2025/4/6 |
大小: |
2177KB |
| 格式: |
pdf 共19页 |
来源: |
国金证券 |
| 评级: |
-- |
作者: |
高智威 |
| 下载权限: |
无限制-登录即可下载 |
|
|
掌握股票的“相似性”可以帮助投资者解决许多问题。因此,有效地衡量股票相似性对于投研来说及其重要。相似性研究的核心在于找到个股之间的“共性”因素,并通过定量化方法进行刻画。本文将“投资概念”作为共性的代理变量,借助大模型实现了基于投资概念的股票相似性衡量,并在组合优化的应用中证明其优势。 基于投资概念的股票拆解思路 我们提出一种从投资概念出发的股票相似性衡量思路,设计了自动化的股票概念提取工作流,使用思维链技术让大模型分析研报与公告文本,提取出投资概念与对应解释文本,并构建完善的股票概念关系数据库。 在概念提取的思维链中,我们要求大模型从主营业务、产品产出、技术工艺、政策事件这些角度出发,将所有可能相关的概念名称进行列示。在提取概念名称时,我们要求大模型同步生成概念对应的名词解释与提取原因,以进一步降低大模型的幻觉现象,并获取更加丰富的信息量。 如何根据概念衡量个股相似性 我们通过Embedding模型对概念文本进行向量化,并聚合到股票层面,最终在同一个向量空间中表示股票与概念两类对象,进而实现对股票相似性的衡量。 具体来说,我们将前述步骤中生成的概念名称、概念含义与提取原因合并为概念文本,并对这一长文本进行向量化。概念向量中嵌入了概念的语义信息,这使得我们能够通过向量余弦相似度来衡量两个概念之间的相似性。在股票层面加总向量并单位化之后,我们便能够得到股票向量,并进行后续的个股相似性排序或聚类分析。 相似性的应用:组合优化 最终我们将股票向量应用于组合优化任务中,对股票向量进行降维聚类并将聚类结果替换掉传统的行业分类。我们以沪深300、中证500与中证A500指数的增强策略为案例,通过对比不同的聚类方案与参数调优,找到相较于传统GICS或中信一级行业分类更加有效的股票聚类结果,并为组合超额净值带来提升。以沪深300增强策略为例,控制股票概念聚类的暴露能够使信息比率达到1.838,而控制中信一级行业分类的策略其信息比率仅1.474。 整体来说,tSNE降维搭配Agglomerative层次凝聚聚类算法效果普遍最好。且股票聚类算法在沪深300上的优势相对中证500或中证A500都更好,这一方面有股票概念覆盖度的原因,另一方面也说明概念相似性更适用于业务范围较广、涉及概念较多的大市值股票。上市公司的业务越难以通过单一的行业完整描述,则使用概念聚类的效果约好。 总结 股票概念关系数据库的构建与相关性衡量是本文的核心贡献,其能够为我们带来丰富的想象空间,譬如可以通过概念相似性捕捉动量溢出效应,快速布局存在补涨可能性的股票,并构建相应选股策略。如何进一步挖掘股票概念数据库的潜力也是我们接下来的研究方向之一。 同时,股票概念关系数据库的构建则是大语言模型在投研领域的又一重要应用案例。大模型能够帮助我们将非结构化的文本信息融入现有策略框架中,并完成此前难以实现的各类任务,也将为传统投研带来全新的方法与思路。 风险提示 以上结果通过历史数据统计、建模和测算完成,在政策、市场环境发生变化时模型存在时效的风险。策略通过一定的假设通过历史数据回测得到,当交易成本提高或其他条件改变时,可能导致策略收益下降甚至出现亏损。大语言模型输出结果具有一定随机性的风险,模型迭代升级、新功能开发可能会导致结论不同。人工智能模型得出的结论仅供参考,可能出现错误答案的风险。
|
|