>> 东方证券-量化研究参考系列之八:DiffsFormer,用扩散模型扩充股票特征样本-260615
| 上传日期: |
2026/6/15 |
大小: |
807KB |
| 格式: |
pdf 共18页 |
来源: |
东方证券 |
| 评级: |
-- |
作者: |
刘静涵 |
| 下载权限: |
此报告为加密报告 |
|
|
研究结论 文献信息:本次分享的论文由中国科学技术大学与阿里巴巴达摩院(DAMOAcademy )团队联合撰写,2024年2月作为arXiv预印本发布(编号2402.06656),标题为《DiffsFormer: ADiffusion Transformer on Stock FactorAugmentation》。 推荐理由:股票预测长期受困于数据稀缺,论文将其归为信噪比低(特征与收益率相关性绝对值通常不足0.03)与数据同质化(同行业个股走势趋同)两点,二者使模型易在高维特征空间过拟合、样本外泛化下降。为此论文引入以Transformer为骨干的条件扩散模型DiffsFormer,先在更大源域训练,再对目标域真实样本做“编辑”以扩充训练集。它是上游的即插即用数据增强模块,只增强历史特征、不生成收益率标签(标签沿用真实样本原值),不直接做预测或交易,仅为下游模型扩充训练样本。实证显示,合成数据增强使下游模型在A股的样本外年化收益率明显提升。 核心框架:1)扩散增强原理:对真实特征逐步加噪、再学习逐步去噪,从而拟合特征分布。2)编辑式增强与迁移学习:在更大源域(全A股)训练,对目标域(CSI300/CSI800)样本只加噪T′步再去噪,由T′控制生成样本偏离目标域的程度。3)条件扩散:以收益率标签与行业为条件、并令生成特征沿用原标签,将扩散模型从生成适配到监督回归,采用predictor-free guidance免去额外预测器、简化训练流程。4)即插即用:作为上游模块挂接MLP、LSTM、Transformer等八类下游模型,无需改动骨干。 亮点分析:相较普通生成式增强,有四点突破:1)以“编辑现有样本”替代“纯噪声生成”,可视化显示增强样本贴近原始分布,保真度更高;2)在更大源域训练再编辑目标域,蒸馏新信息、缓解行业同质化;3)以标签条件化解决标签难匹配问题,效果明显优于直接生成标签;4)即插即用,可适配多类下游预测模型。 实证结果:实证在A股进行,股票池为CSI300与CSI800,特征取自Qlib的Alpha158(回看8日),数据期2008–2022年;CSI300测试八类模型,CSI800因缺概念数据未纳入HIST。年化收益率的相对提升上,CSI300与CSI800分别达7.2%与27.8%(均为相对提升,并非绝对年化收益率)。机制上,编辑步存在保真度与多样性的权衡(CSI300上T′=300最优),标签加行业的联合条件最优;源域选择需结合实证,单纯扩大源域并不必然有效,全A股作为源域时迁移效果最好。对照实验显示,编辑式增强优于直接生成、随机加噪与Shake-shake;仅用增强数据反优于“真实加增强”并集,作者推测与缓解data collision有关。 改进方向:结合A股投研流程,四个落地方向:1)适配本土因子池,对接自有因子体系;2)扩展条件维度,在论文已初步尝试市值条件的基础上,系统纳入市值、风格与宏观状态;3)将增强模块嵌入因子挖掘、训练、压力测试与组合风控流程;4)加强实盘约束,重点评估数据泄漏、交易成本与容量,原文未充分扣费,落地需检验净收益。 风险提示 1.生成样本依赖历史分布,对全新市场环境外推有限,建议持续跟踪模型表现。 2.编辑步T′需调参,过大偏离目标域、过小增强有限。 3.条件信息设置不当可能导致生成特征与标签不匹配,削弱监督信号质量。 4.合成数据训练存在数据泄漏风险,若与真实测试集隐含关联,可能高估样本外表现。 5.论文以年化收益率为主、采用top30drop30规则且未充分扣费,A股实盘需检验扣费后净收益
|
|