>> 国泰海通证券-【AI产业深度】MoE大模型进化树-250728
| 上传日期: |
2025/7/28 |
大小: |
692KB |
| 格式: |
pdf 共5页 |
来源: |
国泰海通证券 |
| 评级: |
-- |
作者: |
鲍雁辛,李嘉琪 |
| 下载权限: |
此报告为加密报告 |
|
|
本图旨在系统性地梳理现代混合专家(Mixture of Experts, MoE)架构从理论提出至2025年的技术演进脉络。核心分类依据是门控函数(Gating Function)。 稠密路由(Dense):激活全量专家进行计算,常见于早期研究或特定微调场景。 软性路由(Soft):采用完全可微分的合并策略,通过加权融合令牌或专家,来规避离散路由选择的难题。1)专家合并路径(Expert Merging):将所有专家的参数加权融合成一个临时的单一专家来处理令牌。2)令牌合并路径(Token Merging):将输入的多个令牌加权融合成聚合体,再送入不同专家处理。 稀疏路由(Sparse):仅激活部分专家,是当前最高效、最主流的技术范式。1)令牌选择路径(Token-Choice):通过一个可训练的门控网络,为每个令牌动态选择一部分(top-k)专家。这是最主流的稀疏路由方式。2)非可训练令牌选择路径(Non-trainable Token Choice):采用固定的、无需训练的规则(如哈希函数)来分配令牌,不含可学习的路由参数。3)专家选择路径(Expert-Choice):反向路由模式,由每个专家从一批输入中主动选择自己要处理的令牌,天然地解决了负载均衡问题。 风险提示:1)大语言模型的技术进展不及预期。2)人工智能行业竞争格局变化带来的不确定性。3)算法或功能优化不及预期。
|
|