研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 浙商证券-AI前沿跟踪系列(二),TimeGPT1:时间序列预测大模型-231010
上传日期:   2023/10/11 大小:   752KB
格式:   pdf  共10页 来源:   浙商证券
评级:   -- 作者:   陈冀
下载权限:   此报告为加密报告
Azul Garza等人近期提出时间序列预测模型的新范式。集中海量各类时间序列训练通用基础序列大模型。实验结果表明,TimeGPT预测结果在rMAE上还优于一些常见的树模型或深度学习模型。
  海量序列训练通用模型
  TimeGPT是在尽可能大的公开可用时间序列集合上进行训练的,总共包含超过1000亿个数据点。训练集涵盖了金融、经济、人口统计、医疗保健、天气、物联网传感器数据、能源、网络流量、销售、交通和银行等广泛领域的时间序列。
  精度和效率确有提升
  从rMAE和rRMSE的角度评估,TimeGPT确实比简单时间序列方法、树模型、传统DeepLearning方法略有提升。应用效率上,由于传统方法通常需要针对具体的场景重构训练模型,而TimeGPT预测即直接inference。因此TimeGPT看上去预测效率的提升,其实在训练时间序列大模型的时候已经开销掉了。
  缺少有信息的预测基础
  TimeGPT依然是一个纯数据驱动的大模型,未将关于底层过程的知识(如物理定律、经济原则或医学事实)纳入预测中。而这种底层知识往往可能存在输入非时间序列甚至非结构化数据表达。这就需要TimeGPT未来在多模态以及多模块嵌入上进行进一步探索。
  风险提示
  本报告依据最新前沿论文进行解读评述,若有理解不当请以原始论文表述为准。且本报告为AI应用方法和框架介绍,并不作为有效投资方法建议,仅供参考。
  
研究报告全文:证券研究报告智能配置点评智能配置点评报告日期2023年10月10日时间序列预测大模型TimeGPT1AI前沿跟踪系列二核心观点分析师陈冀执业证书号S1230522110001AzulGarza等人近期提出时间序列预测模型的新范式集中海量各类时间序列训练通chenjistockecomcn用基础序列大模型实验结果表明TimeGPT预测结果在rMAE上还优于一些常见相关报告的树模型或深度学习模型1基于人机互动和大语言模型海量序列训练通用模型的因子挖掘平台20230918TimeGPT是在尽可能大的公开可用时间序列集合上进行训练的总共包含超过1000亿个数据点训练集涵盖了金融经济人口统计医疗保健天气物联网传感器数据能源网络流量销售交通和银行等广泛领域的时间序列精度和效率确有提升从rMAE和rRMSE的角度评估TimeGPT确实比简单时间序列方法树模型传统DeepLearning方法略有提升应用效率上由于传统方法通常需要针对具体的场景重构训练模型而TimeGPT预测即直接inference因此TimeGPT看上去预测效率的提升其实在训练时间序列大模型的时候已经开销掉了缺少有信息的预测基础TimeGPT依然是一个纯数据驱动的大模型未将关于底层过程的知识如物理定律经济原则或医学事实纳入预测中而这种底层知识往往可能存在输入非时间序列甚至非结构化数据表达这就需要TimeGPT未来在多模态以及多模块嵌入上进行进一步探索风险提示本报告依据最新前沿论文进行解读评述若有理解不当请以原始论文表述为准且本报告为AI应用方法和框架介绍并不作为有效投资方法建议仅供参考httpwwwstockecomcn110请务必阅读正文之后的免责条款部分智能配置点评正文目录1TimeGPT源起42深度学习预测简述43时间序列TimeGPT-1631TimeGPT-1架构632训练数据集633TimeGPT训练74实验结果741Zero-shot推理742Fine-tune微调843预测时间效率对比95结论96参考文献9httpwwwstockecomcn210请务必阅读正文之后的免责条款部分智能配置点评图表目录图1时间序列预测范式4图2TimeGPT设计架构示意图6图3TimeGPT微调效果rMAE跟踪结果8表1多种方法多时间维度时间序列预测rMAE结果对比8httpwwwstockecomcn310请务必阅读正文之后的免责条款部分智能配置点评1TimeGPT源起不确定性是生活中固有的一部分是人类不断努力寻求应对和理解不确定中是否存在相对恒定的因素从古代文明建立的传统方法到当代世界中的复杂统计技术聪明的头脑们一直在不断努力预测未来事件可能的分布制定系统性数量化的方法进行决策时间序列按时间顺序排列的数据构成了数据系统的基本结构它的影响范围从测量海洋潮汐到跟踪道琼斯指数的每日收盘价数据表示对金融医疗保健气象社会科学等行业至关重要在这些行业中识别时间模式趋势和周期性变化对于预测未来价值和决策过程都有着不小的数量化指导作用然而对时间序列的当前理论和实践理解还没有达到与语言和感知等人类基本领域中生成模型普遍赞誉相一致的程度在预测任务中众多领域在评估深度学习的效果方面仍存在分歧目前也还没有实现真正通用的预训练时间序列模型Garza等人最新的论文介绍了TimeGPT这是针对时间序列预测的预训练基础模型可以在各种不同的领域和应用中产生精度提升的预测结果而无需额外的训练通用的预训练模型构成了一项创新突破为预测实践开辟了一种新的范式更易于访问和准确时间消耗更少大大降低了计算复杂性图1时间序列预测范式资料来源arXiv231003589v1csLG1浙商证券研究所整理2深度学习预测简述关于深度学习方法的优势时间序列预测领域目前存在分歧尚未建立统一的方法最近这些不同的范式越来越多地互相挑战质疑新的发展的有用性准确性和复杂性尽管深度学习架构在其他领域取得了成功但一些时间序列实践者已经证明了该领域中提出的一些创新并不符合其所声称的要求或期望在历史上统计方法如ARIMAETSMSTLTheta和CES在各个领域都得到可靠的应用在过去的十年中机器学习模型如1AzulGarzaMaxMergenthaler-CansecoTimeGPT-12023Octhttpwwwstockecomcn410请务必阅读正文之后的免责条款部分智能配置点评XGBoost和LightGBM在公开竞赛和实际应用中取得了良好的结果因此受到了广泛关注然而随着深度学习的出现时间序列分析发生了范式转变深度学习方法在学术界和大规模工业预测应用中变得流行起来由于其全局方法深度学习方法在可伸缩性灵活性和潜在准确性方面相对统计局部方法具有显著优势此外它们学习复杂的数据依赖关系的能力有效地绕过了其他全局方法如LightGBM或XGBoost所需的复杂特征工程最初深度学习时间序列预测的成功源于对已有架构的改进其中包括为自然语言处理NLP而设计的循环神经网络RNN和为计算机视觉CV而设计的卷积神经网络CNNRNN成为了流行模型如DeepAR和ESRNN的基础DeepAR用于概率预测ESRNN是M4比赛的获胜者CNN在顺序数据的多个任务上表现出优于RNN的性能它们现在成为了流行的构建模块如DPMN和TimesNet前馈网络由于其低计算成本和高效性而经常被使用其中包括N-BEATS和NHITS等著名模型基于Transformer的模型在近年来变得越来越受欢迎因为它们在大规模环境和复杂任务如长序列预测中展现出了出色的性能早期的例子包括TFT和MQ-Transformer它们都具有多分位能力Informer通过Prob-sparse自注意机制将Transformer引入了长序列预测随后在AutoformerFEDformer和PatchTST等模型中这个概念通过各种形式的归纳偏置和注意机制得到进一步改进基础模型的潜力即在大型数据集上进行预训练并后续进行专门任务微调的大规模模型对于时间序列预测任务来说仍然未被充分探索然而有早期迹象显示了预测基础模型的可能性例如Oreshkin等人2021表明预训练模型可以在任务之间进行转移而不会降低性能此外Kunz等人2023提供了关于Transformer架构在时间序列预测任务上的数据和模型规模存在缩放定律的证据因此基于深度学习的时间序列模型旨在简化预测流程并提高可伸缩性它们处理大量数据和捕捉长期依赖性的能力使它们在数据不断增长的复杂预测任务中具有优势然而学术研究人员和实践者在这些承诺方面持不同意见各种研究人员和实践者对提高准确性的基本假设提出了质疑提出了证据表明简单模型在成本和复杂性更低的情况下表现出色相反一些行业领导者报告称深度学习方法改善了他们的结果并简化了他们的分析流程在当前的历史背景下深度学习模型在自然语言处理NLP和计算机视觉CV方面的优越能力是不可否认的但时间序列分析领域对神经预测方法的性能持怀疑态度作者认为这种怀疑态度是由以下原因引起评估设置不匹配或定义不清晰与其他领域引入理想测试数据集如ImageNet用于计算机视觉不同公开可用的时间序列数据集没有足够的规模和容量让深度学习方法表现出色次优模型由于数据集有限且特定即使构思良好的深度学习架构在泛化方面可能遇到困难或者需要大量努力来找到最佳设置和参数此外缺乏满足深度学习方法需求的大规模标准化数据集也可能阻碍该领域的进展虽然其他领域已经受益于基准数据集和明确的评估指标但时间序列社区仍需开发此类资源以促进创新和验证新技术在这篇论文中作者证明了更大更多样化的数据集可以使更复杂的模型在各种任务上表现更好TimeGPT是第一个在最小复杂性下始终优于其他选择的基础模型进一步研究httpwwwstockecomcn510请务必阅读正文之后的免责条款部分智能配置点评基础模型在时间序列中的改进可能会开启该领域的新篇章促进对时间数据的更深入理解并提高预测的准确性和效率3时间序列TimeGPT-131TimeGPT-1架构TimeGPT是基于Transformer的时间序列模型具有基于自注意力机制的能力该机制基于Vaswanietal2017TimeGPT使用历史值的窗口来生成预测并添加本地位置编码来丰富输入该架构包括一个编码器-解码器结构每个结构都有残差连接和层归一化最后线性层将解码器的输出映射到预测窗口的维度总体的想法是基于注意力的机制能够捕捉过去事件的多样性并正确地推断未来的潜在分布开发一个用于时间序列的通用全局模型面临许多挑战主要是由于处理来自广泛的基础过程信号的复杂任务频率稀疏性趋势季节性平稳性和异方差性等特征给本地和全局模型带来了不同的复杂性因此任何基础的预测模型必须具备处理这种异质性的能力TimeGPT被设计成能够处理不同频率和特征的时间序列同时适应不同的输入大小和预测时间跨度这种适应性在很大程度上归功于TimeGPT所构建的基于Transformer的底层架构需要注意的是TimeGPT不是基于现有的大型语言模型LLM虽然TimeGPT遵循在庞大的数据集上训练大型Transformer模型的原则但其架构专门用于处理时间序列数据并经过训练以最小化预测误差图2TimeGPT设计架构示意图资料来源arXiv231003589v1csLG2浙商证券研究所整理32训练数据集TimeGPT是在尽可能大的公开可用时间序列集合上进行训练的总共包含超过1000亿个数据点该训练集涵盖了金融经济人口统计医疗保健天气物联网传感器数据能源网络流量销售交通和银行等广泛领域的时间序列由于这个多样化的领域集合训练数据集包含具有各种特征的时间序列2AzulGarzaMaxMergenthaler-CansecoTimeGPT-12023Octhttpwwwstockecomcn610请务必阅读正文之后的免责条款部分智能配置点评在时间模式方面训练数据集包含具有多个季节性的序列不同长度的周期以及各种类型的趋势除了时间模式之外数据集在噪声和异常值方面也有所变化提供了一个稳健的训练环境一些序列包含干净的规律的模式而其他序列具有较大的噪声或意外事件为模型提供了广泛的场景进行学习大多数时间序列都以原始形式包含在内处理仅限于格式标准化和填充缺失值以确保数据完整性选择这样一个多样化的训练集对于开发一个强大的基础模型至关重要这种多样性涵盖了非平稳现实世界数据的复杂性其中趋势和模式可以随着时间的推移而变化这是由于多种因素的影响通过在这个丰富的数据集上训练TimeGPT使其能够处理各种场景提高其稳健性和泛化能力这有效地使TimeGPT能够准确地预测未见的时间序列同时消除了对个别模型的训练和优化的需求33TimeGPT训练TimeGPT在一组NVIDIAA100GPU上进行了多天的训练在这个过程中开发人员进行了广泛的超参数探索以优化学习率批量大小和其他相关参数与Brownetal2020的研究结果一致的模式即较大的批量大小和较小的学习率是有益的TimeGPT使用PyTorch实现并使用Adam进行训练学习率衰减策略将其降低到初始值的124实验结果预测性能评估是基于将数据集中的每个时间序列分割成训练集和测试集根据定义的截断点进行的即使是交叉验证版本的原则也不足以评估基础模型因为其主要特点是能够准确预测全新的时间序列作者通过在大量不同的时间序列上对TimeGPT进行测试来探索它作为预测基础模型的能力这些时间序列在模型训练期间从未见过测试集包括来自多个领域的30多万个时间序列包括金融网络流量物联网天气需求和电力评估是在每个时间序列的最后一个预测窗口中进行的预测窗口的长度根据采样频率而变化TimeGPT使用先前的历史值作为输入而不重新训练其权重zero-shot根据频率指定不同的预测时段以代表常见的实际应用每月12个每周1个每日7个每小时24个评估指标包括相对平均绝对误差rMAE和相对均方根误差rRMSE两者都相对于季节性朴素模型的性能进行了归一化相对误差指标的好处是它们与尺度无关可以在每个频率的结果之间进行比较为了确保数值稳定性和评估一致性作者在每个综合数据集的全局范围内应用这种归一化41Zero-shot推理首先对TimeGPT在zero-shot推理上的能力进行测试这意味着在测试集上不进行额外的微调TimeGPT在各个频率上超过了经过全面测试的统计模型和SoTA深度学习方法位列前三名必须注意的是预测模型的有效性只能相对于其在与之竞争的替代方案中的表现来评估尽管准确性通常被视为唯一相关的指标但计算成本和实施复杂性对于实际应用来说httpwwwstockecomcn710请务必阅读正文之后的免责条款部分智能配置点评是关键因素在这方面TimeGPT的结果是对预训练模型的预测方法进行简单且非常快速的调用相比之下其他模型需要完整的训练和预测流程表1多种方法多时间维度时间序列预测rMAE结果对比MonthlyWeeklyDailyHourlyrMAErMAErMAErMAEZeroModel20456075298910255LGBM1050099325060733DeepAR0988098708531028NHITS0738088307880829TimeGPT0727087808040852资料来源arXiv231003589v1csLG3浙商证券研究所整理42Fine-tune微调微调是有效利用基础模型和基于transformer的架构的关键步骤基础模型在大量数据上进行了预训练捕捉了广泛而通用的特征然而这些模型通常需要专门针对特定上下文或特定领域进行调整通过微调可以根据特定任务的数据集调整模型参数使模型可以根据新任务的要求调整其广泛的预存在知识这个过程确保模型保留其广泛的理解并在特定任务中表现出色由于其固有的灵活性和学习复杂模式的能力基于transformer的架构在微调方面特别受益提高了其在特定领域应用中的性能因此微调是一个关键的桥梁将基础模型的广泛能力与目标任务的特定需求联系起来TimeGPT在微调步骤数量增加时对一部分测试集时间序列准确性的改善结果图3TimeGPT微调效果rMAE跟踪结果资料来源arXiv231003589v1csLG4浙商证券研究所整理3AzulGarzaMaxMergenthaler-CansecoTimeGPT-12023Oct4AzulGarzaMaxMergenthaler-CansecoTimeGPT-12023Octhttpwwwstockecomcn810请务必阅读正文之后的免责条款部分智能配置点评43预测时间效率对比TimeGPT的平均GPU推断速度为每个序列06毫秒几乎与简单的季节性朴素模型相同作为对比全局模型如LGBMLSTM和NHITS每个序列的训练和推断平均为57毫秒由于其zero-shot能力TimeGPT在总体速度上比传统的统计方法和全局模型具有数量级的优势5结论传统的预测实践通常涉及复杂的流程包括从数据处理到模型训练和选择的多个步骤TimeGPT通过将流程简化为推理步骤大大减少了复杂性和时间投入同时仍能实现最先进的性能此外TimeGPT使得大型Transformer模型的优势普惠于数据量庞大计算资源丰富技术专长的组织之外的机构基础预训练模型可能重新定义未来的多场景预测实践TimeGPT值得金融领域借鉴的经验和存在的缺陷集成数据预测系统搭建金融领域中的数据复杂且多元宏观中观微观高频中频低频涉及各个局部子模块投研机构可借鉴TimeGPT的设计思路构建独立的全数据序列基础大模型再针对各个投研板块进行微调形成BaseModelSectionalModel的模式时间序列大模型存在相似性污染传统上从同一类别如零售或金融的序列之间的相似性可能比跨领域序列之间的相似性更大因此一个可靠的衡量序列相似性的度量标准可能会极大地有益于该领域然而明显不同分类但时间序列又存在某种模式上的相似则可能对集中训练生成的基础大模型产生污染TimeGPT模式缺少可解释的预测纯数据驱动未将关于底层过程的知识如物理定律经济原则或医学事实纳入预测中而这种底层知识往往可能存在输入非时间序列甚至非结构化数据表达的情况这就需要TimeGPT未来在多模态以及多模块嵌入上进行进一步探索6参考文献1BorisNOreshkinDmitriCarpovNicolasChapadosandYoshuaBengioMeta-learningframeworkwithapplicationstozero-shottime-seriesforecastingInProceedingsoftheAAAIConferenceonArtificialIntelligencevolume35pages9242-925020212ManuelKunzStefanBirrMonesRaslanLeiMaZhenLiAdeleGouttesMateuszKorenTofighNaghibiJohannesStephanMariiaBulychevaetalDeeplearningbasedforecastingacasestudyfromtheonlinefashionindustryarXivpreprintarXiv23051440620233AshishVaswanietalAttentionisallyouneedAdvancesinneuralinformationprocessingsystems3020174TomBrownBenjaminMannetalLanguagemodelsarefew-shotlearnersAdvancesinneuralinformationprocessingsystems331877-19012020httpwwwstockecomcn910请务必阅读正文之后的免责条款部分智能配置点评股票投资评级说明以报告日后的6个月内证券相对于沪深300指数的涨跌幅为标准定义如下1买入相对于沪深300指数表现20以上2增持相对于沪深300指数表现10203中性相对于沪深300指数表现1010之间波动4减持相对于沪深300指数表现10以下行业的投资评级以报告日后的6个月内行业指数相对于沪深300指数的涨跌幅为标准定义如下1看好行业指数相对于沪深300指数表现10以上2中性行业指数相对于沪深300指数表现1010以上3看淡行业指数相对于沪深300指数表现10以下我们在此提醒您不同证券研究机构采用不同的评级术语及评级标准我们采用的是相对评级体系表示投资的相对比重建议投资者买入或者卖出证券的决定取决于个人的实际情况比如当前的持仓结构以及其他需要考虑的因素投资者不应仅仅依靠投资评级来推断结论法律声明及风险提示本报告由浙商证券股份有限公司已具备中国证监会批复的证券投资咨询业务资格经营许可证编号为Z39833000制作本报告中的信息均来源于我们认为可靠的已公开资料但浙商证券股份有限公司及其关联机构以下统称本公司对这些信息的真实性准确性及完整性不作任何保证也不保证所包含的信息和建议不发生任何变更本公司没有将变更的信息和建议向报告所有接收者进行更新的义务本报告仅供本公司的客户作参考之用本公司不会因接收人收到本报告而视其为本公司的当然客户本报告仅反映报告作者的出具日的观点和判断在任何情况下本报告中的信息或所表述的意见均不构成对任何人的投资建议投资者应当对本报告中的信息和意见进行独立评估并应同时考量各自的投资目的财务状况和特定需求对依据或者使用本报告所造成的一切后果本公司及或其关联人员均不承担任何法律责任本公司的交易人员以及其他专业人士可能会依据不同假设和标准采用不同的分析方法而口头或书面发表与本报告意见及建议不一致的市场评论和或交易观点本公司没有将此意见及建议向报告所有接收者进行更新的义务本公司的资产管理公司自营部门以及其他投资业务部门可能独立做出与本报告中的意见或建议不一致的投资决策本报告版权均归本公司所有未经本公司事先书面授权任何机构或个人不得以任何形式复制发布传播本报告的全部或部分内容经授权刊载转发本报告或者摘要的应当注明本报告发布人和发布日期并提示使用本报告的风险未经授权或未按要求刊载转发本报告的应当承担相应的法律责任本公司将保留向其追究法律责任的权利浙商证券研究所上海总部地址杨高南路729号陆家嘴世纪金融广场1号楼25层北京地址北京市东城区朝阳门北大街8号富华大厦E座4层深圳地址广东省深圳市福田区广电金融中心33层上海总部邮政编码200127上海总部电话862180108518上海总部传真862180106010浙商证券研究所httpswwwstockecomcnhttpwwwstockecomcn1010请务必阅读正文之后的免责条款部分
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1