>> 浙商证券-学界纵横系列之三:引入门控机制的Transformer模型探究-240123
| 上传日期: |
2024/1/23 |
大小: |
1124KB |
| 格式: |
pdf 共13页 |
来源: |
浙商证券 |
| 评级: |
-- |
作者: |
陈奥林 |
| 下载权限: |
此报告为加密报告 |
|
|
在时序依赖的任务中(如RL),基于RNN的模型性能和稳定性优于Transformer架构。然而,Transformer中的自注意力机制能够长时间跨度上有效整合信息并扩展到大量数据。为了提升时序依赖任务场景中的模型表现,在Transformer-XL基础上提出的Gated Transformer-XL(GTrXL),该模型架构在稳定和性能上持平甚至赶超LSTM模型。 RNN模型在时序依赖任务方面有优势 RNN(循环神经网络)模型在处理时序数据时,相对其它模型架构具有优势。 RNN通过循环连接,可以在隐藏状态中保持并传递先前的信息,因此可以捕捉到时间上的依赖关系。这使得RNN模型在处理序列数据时能够有效地捕捉到时间序列中的长期依赖关系。相比之下,Transformer架构中的自注意力机制虽然可以捕捉全局的依赖关系,但对于时序依赖关系的建模相对较弱。 引入门控制机制的GTrXL架构 本报告推荐的文章是Emilio Parisotto,H. Francis Song,Jack W. Rae等人于2019年发布的Stabilizing Transformers for Reinforcement Learning。文献认为,传统的Transformer在RL环境中很难优化,通常导致性能不稳定,甚至无法优于随机策略。 通过引入门控机制(gating mechanisms)替代传统的残差连接,以及重新排列层标准化(layer normalization)的顺序,作者提出了一种新的架构,称为GatedTransformer-XL(GTrXL)。这一架构在训练中更为稳定,学习速度更快,最终性能也更好。 GTrXL有稳定和高性能表现 作者通过广泛的实验证明了Gated Transformer-XL(GTrXL)在多环境和任务中相较于传统Transformer具有更快的学习速度、更可靠的性能以及更优异的最终表现。在多任务DMLab-30套件上,GTrXL达到了最先进水平,并在基于记忆的任务中明显优于LSTM。GTrXL不仅在记忆驱动的任务上表现卓越,而且在反应性任务和连续控制环境中也显著胜过LSTM。相对于传统Transformer和LSTM,GTrXL提供更好的学习速度和性能,因此成为强化学习代理中LSTM的一个有潜力的替代方案。 作者还进行了详尽的消融实验,评估了各种门控层变体在稳健性、优化难度和最终性能方面的影响,以及重新排序层标准化的效果。结果显示,类似于GatedRecurrent Unit(GRU)的门控机制在所有方面表现最佳,具有与LSTM相当的稳健性,同时仍然保持性能提升。 风险提示 文章内容参考了文献Parisotto E , Song HF , Rae JW ,et al.Stabilizing Transformersfor Reinforcement Learning[J].。文章内容部分仅代表该文献的观点,不代表浙商金工研究观点。 文章由英文文献翻译而来,受术语差异、语境丢失和情感解读等影响,可能存在翻译偏差,仅供参考。文献具体内容请参照原文
|
|