研报下载就选股票报告网
您好,欢迎来到股票分析报告网!登录   忘记密码   注册
>> 中信建投-计算机行业AI前沿系列(一):混合专家模型技术(MoE)-230818
上传日期:   2023/8/18 大小:   3355KB
格式:   pdf  共24页 来源:   中信建投
评级:   -- 作者:   阎贵成,金戈,于芳博
行业名称:   计算机
下载权限:   此报告为加密报告
核心观点:混合专家模型技术(MoE)是由专家模型和门控模型组成稀疏门控制的深度学习技术。MoE通过门控网络实现任务/训练数据在不同专家模型间的分配,让每个模型专注处理其最擅长的任务,进而实现模型的稀疏性。随着大模型参数量的持续提升,MoE在提升计算效率方面展现出强大的能力。同时,近年来MoE逐渐与不同领域的模型相结合,包括自然语言、图像、推荐系统、多模态等,并展现出优秀的性能。后续MoE技术将在提升训练及推理效率、优化模型性能和边缘&端侧AI应用等方面发挥重要作用,建议关注相关研究进展。
  混合专家模型技术(MoE)让模型具有稀疏性,进而提高模型计算效率。在传统的密集模型中,输入的内容要在整个模型中进行计算,而MoE通过门控模型将输入内容分配至一个或多个专家模型,保证在单次处理中只有少数专家模型被激活或使用,而大部分专家模型处于未被激活状态,从而实现模型的稀疏性。这一性质大幅提高了模型的计算效率,例如Switch Transformer的训练速度最高可以达到T5模型(参数量相近情况下)的7倍,而V-MoE相较于ViT模型,达到相同性能的情况下节省了2.5倍的算力消耗。
  混合专家模型(MoE)技术目前在多个AI细分领域中有所应用,性能提升显著。近年来随着MoE技术的不断突破,其在自然语言处理、计算机视觉、多模态、推荐系统等丰富场景中有所应用。相较于密集模型而言,稀疏的MoE模型在性能和计算效率上都有显著提升,例如NLP领域的GLaM模型在零样本、单样本和少样本学习任务上相较于GPT-3分别实现了平均10.2%、6.3%和4.4%的性能提升,多模态领域的LIMoE在零样本、少样本的图像分类任务中的绝对平均性能相较于CLIP分别实现了10.1和12.2%的提升。
  展望未来,混合专家模型(MoE)技术将成为AI技术革新和AI应用落地的强大推动力。AI技术革新方面,MoE技术将从计算效率、模型性能和模型可解释性方面提供发展助力,相关论文发表数量呈现明显上升趋势;AI应用落地方面,MoE将推动训练门槛降低、更新迭代速度加快、推理速度加快、推理算力需求降低、应用领域拓展等方面的进度,相关科技巨头都已对这一技术展开布局,相关应用领域如机器人、计算机视觉等将加速发展。
  风险提示
  人工智能模型技术发展不及预期:人工智能模型属于先进AI算法,若后续算法更新迭代效果不及预期,则会影响人工智能模型演进及拓展,进而会影响其商业化落地等。
  算法隐私问题:人工智能在进行预训练过程中,使用了大量数据,其中会涉及相关隐私问题。
  应用不及预期:人工智能算法与相关应用落地之间还存在一定距离,需要注意应用落地不及预期风险。
  算力基础设施支持不及预期:美国制裁中国高科技企业,对中国形成芯片、算力的封锁,人工智能模型训练过程中需要大量算力资源,需要关注中美关系带来的中国算力的压力。
  数据数量与数据质量不及预期:人工智能模型需要大量的高质量数据进行训练,若数据数量和质量存在短板,则会影响模型效果。
  伦理冲突风险:人工智能模型将进一步推动人工智能迈向通用型人工智能,人工智能进一步智能化将产生人工智能欺骗、人工智能上瘾、人与人工智能之间的关系等一系列伦理问题。
研究报告全文:证券研究报告行业动态报告AI前沿系列一混合专家模型技术MoE分析师阎贵成分析师金戈分析师于芳博yanguichengcsccomcnjingecsccomcnyufangbocsccomcnSAC编号S1440522030001SAC编号S1440518040002SAC编号S1440517110001SFC编号BNS315SFC中央编号BPD352发布日期2023年8月18日本报告由中信建投证券股份有限公司在中华人民共和国仅为本报告目的不包括香港澳门台湾提供在遵守适用的法律法规情况下本报告亦可能由中信建投国际证券有限公司在香港提供同时请参阅最后一页的重要声明核心观点核心观点混合专家模型技术MoE是由专家模型和门控模型组成稀疏门控制的深度学习技术MoE通过门控网络实现任务训练数据在不同专家模型间的分配让每个模型专注处理其最擅长的任务进而实现模型的稀疏性随着大模型参数量的持续提升MoE在提升计算效率方面展现出强大的能力同时近年来MoE逐渐与不同领域的模型相结合包括自然语言图像推荐系统多模态等并展现出优秀的性能后续MoE技术将在提升训练及推理效率优化模型性能和边缘端侧AI应用等方面发挥重要作用建议关注相关研究进展混合专家模型技术MoE让模型具有稀疏性进而提高模型计算效率在传统的密集模型中输入的内容要在整个模型中进行计算而MoE通过门控模型将输入内容分配至一个或多个专家模型保证在单次处理中只有少数专家模型被激活或使用而大部分专家模型处于未被激活状态从而实现模型的稀疏性这一性质大幅提高了模型的计算效率例如SwitchTransformer的训练速度最高可以达到T5模型参数量相近情况下的7倍而V-MoE相较于ViT模型达到相同性能的情况下节省了25倍的算力消耗混合专家模型MoE技术目前在多个AI细分领域中有所应用性能提升显著近年来随着MoE技术的不断突破其在自然语言处理计算机视觉多模态推荐系统等丰富场景中有所应用相较于密集模型而言稀疏的MoE模型在性能和计算效率上都有显著提升例如NLP领域的GLaM模型在零样本单样本和少样本学习任务上相较于GPT-3分别实现了平均10263和44的性能提升多模态领域的LIMoE在零样本少样本的图像分类任务中的绝对平均性能相较于CLIP分别实现了101和122的提升展望未来混合专家模型MoE技术将成为AI技术革新和AI应用落地的强大推动力AI技术革新方面MoE技术将从计算效率模型性能和模型可解释性方面提供发展助力相关论文发表数量呈现明显上升趋势AI应用落地方面MoE将推动训练门槛降低更新迭代速度加快推理速度加快推理算力需求降低应用领域拓展等方面的进度相关科技巨头都已对这一技术展开布局相关应用领域如机器人计算机视觉等将加速发展目录一混合专家模型MoE介绍二MoE技术在不同领域中的应用三MoE最新研究进程及未来展望11混合专家模型MoE发展历程TransformerGPT-3ViTChatGPTGPT-420215-7自然语言处理2020620221202322017SpeechMoE20226-7计算机视觉GshardMoEDeepSpeed-MoELIMoESparseMoE其他应用领域SparseV-MoEMoE技术GLaMUFOHashLayer20211-320218-920223-4202210-1120237-8199120132018FastMoEZ-codeMoEFasterMoEEC-CFFLAN-MoEMoE架构首次被提出DMoEMMoEDenseSwitchTransformerTHORST-MoEMegaBlocksSoftMoE199020102020202120222023早期MoE主要用MoE逐渐应用于深度学习随着模型规模的不断扩大MoE成为高效的训练和推理计算的重要发展方向门控网络通信算法等核心技于机器学习领域但后续研究有所停滞术的持续革新推动着MoE在NLPCV多模态推荐系统等领域中广泛应用并取得优异性能MoE2017在两个LSTM层之间插入一个MoE层在机器翻译中实现SOTASwitchTransformer2021模型整体参数量扩大至16万亿通过MoEGshard2020实现了更为高效率的模型训练相同计算V-MoE2021将MoE应用于Transformer架构中并提供资源的情况下训练速度是T5的7倍V-MoE可以在保持性能的同时减少计算资源的使用了高效的分布式并行计算架构SoftMoE2023从而实现更高效的模型训练和推理提出了SoftMoE的token处理方式实现了训练稳定性资料来源WebofscienceGooglescholar中信建投和可拓展性的提升12混合专家模型思想基础集成学习MoE前身--集成学习EnsembleLearning集成学习是通过训练多个模型基学习器来解决同一问题并且将它们的预测结果简单组合例如投票或平均集成学习的主要目标是通过减少过拟合提高泛化能力以提高预测性能常见的集成学习方法包括BaggingBoosting和Stacking集成学习流程介绍在训练过程中利用训练数据集训练基学习器基学习器的算法可以是决策树SVM线性回归KNN等在推理过程中对于输入的X在每个基学习器得到相应的答案后将所有结果有机统一起来例如通过求均值的方法解决数值类问题通过投票方式解决分类问题图集成学习技术方法介绍图集成学习技术示意图集成学习基学习器介绍方法种类数据集不同的学习策略Bagging同质相互独立地并行学习这些弱学习器并按照某种确定性的过程将它们组合起来训练集KNNLinRegSVM决策树X训练训练训练训练它以一种高度自适应的方法线性学习这X模型1X模型2X模型3X模型4些弱学习器每个基础模型都依赖于前Boosting同质不同的基学习器面的模型并按照某种确定性的策略将它们组合起来测试集投票方式并行地学习它们并通过训练一个元求均值方式YStacking异质模型将它们组合起来根据不同弱模型的预测结果输出一个最终的预测结果资料来源机器之心Leovan中信建投13混合专家模型的主要组成部分基本概念混合专家模型MoE是一种稀疏门控制的深度学习模型主要由一组专家模型和一个门控模型组成MoE的基本理念是将输入分割成多个区域并对每个区域分配一个或多个专家模型每个专家模型可以专注于处理输入的一部分从而提高模型的整体性能门控模型稀疏门网络是混合专家模型的一部分它接收单个数据元素作为输入然后输出一个权重这些权重表示每个专家模型对处理输入数据的贡献例如如果模型有两个专家输出的概率可能为07和03这意味着第一个专家对处理此数据的贡献为70第二个专家为30专家模型在训练的过程中输入的数据被门控模型分配到不同的专家中进行处理如右图所示不同的专家被分配到处理不同种类的输入数据在推理的过程中被门控选择的专家会针对输入的数据产生相应的输出这些输出可以是标签或者数值最后会和每个专家模型处理该特征的能力分配的权重进行加权组合形成最终的预测结果混合专家模型在训练过程中通过门控模型实现因材施教进而在推理过程中实现专家模型之间的博采众长图MoE结构示意图图不同的专家处理不同的输入LIMoE资料来源MultimodalContrastiveLearningwithLIMoEtheLanguage-ImageMixtureofExpertsOutrageouslyLargeNeuralNetworksTheSparsely-GatedMixture-of-ExpertsLayer中信建投14混合专家模型的稀疏性混合专家模型MoE的稀疏性在传统的密集模型中对于每一个输入都需要在完整的模型中进行计算在稀疏混合专家模型中处理输入数据时只有少数专家模型被激活或者使用而大部分专家模型处于未被激活状态这种状态便是稀疏稀疏性是混合专家模型的重要优点也是提升模型训练和推理过程的效率的关键对于稀疏性的控制主要通过调整门控网络的设计和参数来实现在参数选择上如果门控网络单次选择的专家模型数量较多则模型的稀疏性就会降低单次选择专家的数量越多模型的表现能力可能有所提升因为更多的专家模型处理输入数据所以导致稀疏性有所下降增加计算的复杂性和耗时因此MoE模型的稀疏性在效率和表现能力之间存在权衡根据不同的应用需求和资源限制需要适当调整门控网络的设计和参数来找到最佳的效率和表现能力之间的平衡图密集模型和稀疏混合专家模型的对比资料来源AReviewofSparseExpertModelsinDeepLearning中信建投151混合专家模型选择专家的不同策略门控模型是混合专家模型的重要组成部分是模型稀疏性和性能提升的技术基础这里简单介绍两种激活不同专家数的门控策略Top-k策略通过根据门控网络的输出将token输入到最适合的K个专家模型中根据门控的稀疏性可以节约MoE的计算成本在谷歌的SwitchTransformer中提出了只选择最好的专家模型使用即K1在谷歌的GLaM模型中则选择了最好的两个专家模型进行使用即K2按需门控策略对于多层的混合专家模型每一层的专家选择根据数据的特性进行动态选择并通过联合优化的方式实现不同层级间的最佳专家配置如下图所示对于从左往右的三层混合专家模型而言其中分别激活了213个专家来进行计算图按需门控策略示意图资料来源GLaMEfficientScalingofLanguageModelswithMixture-of-ExpertsSwitchTransformersScalingtoTrillionParameterModelswithSimpleandEfficientSparsityDeepMixtureofExpertsviaShallowEmbedding中信建投152混合专家模型选择专家的不同策略不同的任务或训练数据究竟被分配到哪个专家模型这里介绍三种不同的策略依据TokensTasks及专家选择路径策略Tokens和tasks策略基于tokens的MoE将不同的token分配到不同的专家子模型中相似的token会被分配到同一个专家模型中如左图b所示你和you被分配到同一个专家而基于任务的MoE则基于任务对token进行分配相同任务的token会被分配到同一个模型中如左图a所示中文任务被分配到第一个expert英文任务被分配到第二个expert专家选择路径策略与传统的MoE网络中基于tokens的路径选择方法不同专家选择方法是让每个专家选择最相关的tokens在这一算法下每个专家都可以得到较为充分的训练更平衡的训练负载也会带来训练速度的提升但也存在着部分训练语料未能被充分的学习的风险图Tokens和tasks策略图专家选择路径策略基于task的MoE基于任务的信息将不同任基于token的MoE将相关的token分配到同专家选择路径的MoE让每个专家选择相关的务的token分配到同一个专家中例如最上一个expert中例如将最下面的格子中将token进而让每个专家都得到较为充分的训练面的格子中分别是中文任务和英文任务你和you分配到同一个专家但可能存在训练数据遗漏的问题资料来源BeyondDistillationTask-levelMixture-of-ExpertsforEfficientInferenceMixture-of-ExpertswithExpertChoiceRouting中信建投目录一混合专家模型MoE介绍二MoE技术在不同领域中的应用三MoE最新研究进程及未来展望21自然语言处理在自然语言处理领域中2017年谷歌首次将MoE引入自然语言处理领域通过在LSTM层之间增加MoE实现了机器翻译方面的性能提升2020年Gshard首次将MoE技术引入Transformer架构中并提供了高效的分布式并行计算架构而后的SwtichTransformer和GLaM则进一步挖掘MoE技术在自然语言处理领域中的应用潜力实现了优秀的性能表现SwitchTransformer通过MoE技术对模型进行拓展最大版本的SwitchTransformer的参数量高达16万亿因其优秀的稀疏性在计算资源相同的情况下74亿版本的SwitchTransformer训练速度可以达到T5模型的725倍对应T5模型的不同版本Large为77亿Base为22亿同时在多任务的表现上也取得了相比密集模型更为优秀的结果GLaM最大的GLaM拥有12万亿个参数大约是GPT-3的7倍然而它只消耗了训练GPT-3所需能量的13并在推理时只需要一半的计算浮点运算量计算效率更高在零样本单样本和少样本学习任务上也实现了更好的性能在七个具体任务中分别实现了平均10263和44的性能提升图SwitchTransformer优秀的稀疏性带来训练效率提升图GLaM模型与GPT-3模型对比资料来源GShardScalingGiantModelswithConditionalComputationandAutomaticShardingSwitchTransformersScalingtoTrillionParameterModelswithSimpleandEfficientSparsity中信建投22计算机视觉在计算机视觉领域中2013年的DMoE便是在MNIST数据集上使用了密集的MoE层2021年的V-MoE将MoE架构应用在计算机视觉领域的Transformer架构模型中同时通过路由算法的改进在相关任务中实现了更高的训练效率和更优秀的性能表现V-MoE原理V-MoE通过将ViT中的一部分密集前馈层替换为稀疏的MoE层来实现每个图像块被路由到一组专家MLPs中进行处理同时通过对图像中重要信息的优先分析优先级路由使得模型可以不需要分析所有信息便可以得到较为准确的结果如下左图所示对于鸭子的图片通过将其中重要的16个token分配到4个专家处便可以得到较为正确的分析提升了模型运算效率V-MoE性能通过使用稀疏的MoE层V-MoE可以在保持性能的同时减少计算资源的使用从而实现更高效的模型训练和推理如右图所示在两个任务中V-MoE相较于ViT模型达到相同性能的情况下节省了25倍的算力消耗而在相同的算力消耗下V-MoE也实现了更优的性能同时V-MoE还可以用于其他计算机视觉任务如目标检测和图像生成图V-MoE架构与处理优先级路由BPR图V-MoE与ViT图像处理性能对比资料来源ScalingVisionwithSparseMixtureofExperts中信建投23多模态在多模态领域中2022年的LIMoE是首个应用了稀疏混合专家模型技术的多模态模型模型性能相较于CLIP也有所提升LIMoE原理将输入的图像文本通过门控网络分配到不同的专家模型中如下图所示鸭子drake的图片和对应的文字描述的token被分配到不同的专家中进行处理每个专家处理完后通过输出层为图像或文本生成一个统一的向量表示LIMoE性能在零样本和10样本的ImageNet分类任务中LIMoE的绝对平均性能相较于CLIP实现了101和122的提升在CocoT2I文本到图像检索任务上LIMoE也实现了较为明显的性能提升其中在小规模模型上这一提升更为显著图不同的图像token被分配到了不同的Expert中进行处理图LiMoE与CLIP模型性能对比资料来源MultimodalContrastiveLearningwithLIMoEtheLanguage-ImageMixtureofExperts中信建投24推荐系统在推荐系统领域中自2018年谷歌提出MMoEMulti-gateMixture-of-Experts模型以优化其广告推荐系统的多目标学习任务后该架构已被广泛应用于工业界的推荐系统重要的互联网公司如阿里巴巴腾讯和字节跳动也纷纷采用MMoE架构以更精准地模拟用户行为和优化多目标推荐场景模型架构MMoE可以针对不同的例如点击率预测CTR转化率预测CVR等之间有一定关联程度等目标同时根据通过不同的门控网络得到一个独立的输出权重最后加权合并这些不同输出得到模型的总损失然后模型再根据这个总损失进行训练MMoE应用性能知乎在2019年将其推荐系统中的硬参数共享策略Hard-parameterSharing替换为MMoE模型引入MMOE后交互层面预估子任务的AUC值至少提升了千分之二而主任务预测阅读的AUC值没有下降上线后的效果也非常正向除了阅读行为略有下降约2但用户的其他行为如点赞收藏评论分享等却显著提升范围在50至100之间知乎的整体用户留存率在多目标学习上线后大约提升了5图使用了多个门控网络的MMoE资料来源ModelingTaskRelationshipsinMulti-taskLearningwithMulti-gateMixture-of-ExpertsAI前线中信建投单个门控的多个门控的MoE模型MoE模型目录一混合专家模型MoE介绍二MoE技术在不同领域中的应用三MoE最新研究进程及未来展望311盘古-具有稀疏异构计算的万亿参数语言模型2023年3月华为诺亚方舟实验室等机构的研究人员于发布文章PANGU-TOWARDSTRILLIONPARAMETERLANGUAGEMODELWITHSPARSEHETEROGENEOUSCOMPUTING推出了盘古-模型模型架构盘古-模型由底层密集的Transformer层共32层和上层稀疏的Transformer层共8层组成其中底层密集的Transformer层共同分析来自不同领域的数据而上层的Transformer层的前馈网络部分根据输入token来自的领域不同而基于RRE方法激活对应的Expert即不同的Expert处理来自不同领域的文本数据核心优势1PanGu-允许添加修改或删除特定领域的Expert而不会对其他Expert产生任何影响具有很高的灵活性2PanGu-允许根据实际需要提取特定领域的子模型并且只部署子模型增强了在具体场景中应用的便捷性3通过特殊的两级路由方式节省了大量的通信量和减少端到端训练延迟4平衡了Expert之间的计算负载图盘古-模型架构基于盘古-改进而来图基于盘古-的子模型资料来源PANGU-TOWARDSTRILLIONPARAMETERLANGUAGEMODELWITHSPARSEHETEROGENEOUSCOMPUTING中信建投312盘古-具有稀疏异构计算的万亿参数语言模型盘古-的ECSS方法将专家视为存储特定知识的知识库不同的任务或领域实现了模型训练过程中数据吞吐量的提升在每次迭代中专家被具有特定特征的不同token稀疏地激活在MindSpore中对于部分激活的专家稀疏地更新它们的参数当使用较低的专家稀疏率例如01计算成本仅接近完整模型的10除了ECSS方法外还采用了其他并行训练和MindSpore和CANN9提供的加速技术最终使得模型训练时的数据吞吐量达到原先的634倍图盘古-在训练过程中采取ECSS方式图模型吞吐量提升至原先的63倍资料来源PANGU-TOWARDSTRILLIONPARAMETERLANGUAGEMODELWITHSPARSEHETEROGENEOUSCOMPUTING中信建投32MoE与指令调优的结合可大幅提升模型性能2023年7月5日Google发布论文Mixture-of-ExpertsMeetsInstructionTuningAWinningCombinationforLargeLanguageModelsFLAN-MoEFLAN-MOE采用稀疏的专家混合技术结合了指令微调和MoE的优点指令微调提高了特定任务的性能而MoE提供了计算效率和减少的内存需求MoE模型与指令调优相互作用相得益彰实验结果显示如果不使用指令调优MoE模型的性能通常不如与之计算能力相当的密集模型但当结合指令调优时情况发生了变化指令调优后的MoE模型Flan-MoE在多个任务上的表现超越了更大的密集模型即使MoE模型的计算成本只是密集模型的三分之一与密集模型相比MoE模型从指令调优中获得的性能提升更为显著因此当考虑计算效率与性能时MoE将成为大型语言模型训练的有力工具图指令调优对MoE模型与密集模型的影响图FLAN-MoE模型和FLAN-T5密集模型在两组不同任务上性能的对比资料来源Mixture-of-ExpertsMeetsInstructionTuningAWinningCombinationforLargeLanguageModels中信建投331路由算法革新SoftMoE2023年8月2日GoogleDeepmind发布论文FromSparsetoSoftMixturesofExperts提出了全新的SoftMoE路由方法稀疏混合专家模型的问题最常见的离散优化问题是如何将每一个token更好的分配到哪个专家目前有不同的解决策略15年提出的强化学习17年提出的Top-K为每个token选择专家的方式21年提出的线性规划22年提出的Top-K为每个专家分配token和最优传输等方法都会面临着token丢失或专家不平衡的问题SoftMoE原理SoftMoE为每一对输入token和slot计算得分这些得分是基于每个slot的可学习参数得来的然后这些得分会按slot列进行标准化每个slot根据这些加权得分对所有输入token进行线性组合左图中绿色的部分为这一构成的逻辑结构右图为不同的图片token结合成slot的示意图接着每个专家处理它分配的slots例如左图中显示每个专家处理2个slot右图绿框则为本次合成后的slot最后用原始得分按token即行进行标准化并用于组合所有slot的输出图SoftMoErouting算法图传统MoE与SoftMoE选择方法对比资料来源FromSparsetoSoftMixturesofExperts中信建投332路由算法革新SoftMoE核心优势1具备连续性与微分特性在SparseMoE的核心是一个将tokens分配给专家的问题多数方法都是离散的并且不可微分与之不同SoftMoE的所有操作都是连续的并完全可微分2稳定的分配策略传统的路由机制常常面临token丢失或专家不平衡的问题这两者都会严重影响模型性能相对于此SoftMoE对此问题表现出高度的抗性其每个slot都是所有tokens的加权平均确保了平衡和完整性3高效运行速度SoftMoE的运行速度主要由其slots的数量决定它成功地避免了排序和top-k操作这些操作在硬件加速器上往往较慢因此SoftMoE在速度上显著优于大多数SparseMoE4序列级的决定性在容量限制的前提下SparseMoE无法同时处理所有的token因此往往是将tokens分为几组并在组内实现平衡但这导致模型丢失一定的序列信息而SoftMoE将每个输入序列中的所有tokens组合起来确保了模型的序列级决定性图SoftMoE与稀疏MoE的性能和训练时间对比图SoftMoE在两个测试数据集上都优于密集模型和其他稀疏MoE资料来源FromSparsetoSoftMixturesofExperts中信建投
 
Copyright © 2005 - 2021 Nxny.com All Rights Reserved 备案号:蜀ICP备15031742号-1