>> 长江证券-软件与服务行业全球AI瞭望台系列一:Mistral AI,引领端侧开源大模型革命-240101
| 上传日期: |
2024/1/2 |
大小: |
1506KB |
| 格式: |
pdf 共13页 |
来源: |
长江证券 |
| 评级: |
看好 |
作者: |
宗建树 |
| 下载权限: |
此报告为加密报告 |
|
|
Mistral AI:引领开源模型新革命 Mistral AI是一家法国人工智能初创公司,成立于2023年5月。公司由前DeepMind、前Meta科学家创办而成,具备深厚的技术背景。三位创始人皆具有大模型开发经验,参与过LLaMA系列大模型的开发。公司在2023年6月获得了种子轮投资1.05亿欧元,又在12月获得了3.85亿欧元的二轮融资。两轮融资之后,公司估值已达20亿美元。 公司于2023年9月发布了Mistral 7B开源大模型,模型具备73亿参数,在所有测试集中的表现都优于LLaMA 2的70亿模型以及130亿参数模型,并且在逻辑推理、数学和编程能力的基准测试中优于LLaMA 340亿参数的模型。Mistral 7B模型滑动窗口注意力机制(SWA)来提升长文本处理速度,使用分组查询注意力(GQA)以实现更快的推理。 公司在12月11日发布了Mixtral 8x7B开源模型。Mixtral 8x7B是一款高质量的稀疏专家混合模型(SMoE),模型由8个专家小模型组成,总参数量达到了467亿,可用上下文窗口达到了32k tokens。模型以宽松的Apache-2.0开源协议发布,开源了其全部参数并可以免费商用。与此同时,Mixtral模型在性能与成本两方面取得了较好的平衡,在大多数基准测试中表现优于GPT-3.5模型以及LLaMA270B模型,并且推理速度比LLaMA2模型快6倍。 端侧有望成为AI落地新场景 随着AIGC的迅猛发展,AI正在重构各类终端,新一轮创新周期开启。与此同时,专家模型(MoE)可以有效降低算力消耗,或成为未来端侧主流技术方向。Mixtral专家模型由8个小模型组成,每个模型擅长不同的任务。在训练和推理阶段,专家模型仅激活部分参数。这使得模型节约了大量算力成本。虽然Mixtral有467亿参数,但每次推理时只同时计算129亿参数;因此相较于467亿参数的传统模型,Mixtral专家模型算力花费节省了72%,适合用于端侧、边缘测等低算力场景。与此同时,参数量较小的Mistral7B也有望拉平我国端侧智能硬件厂商与海外厂商在软件层面的差距。 开源模型或在端侧占据核心地位 端侧模型最重要的是营造生态,开源模型天然在生态上占据优势,未来有望在端侧占据重要地位。端侧的软硬件应用数量众多,场景复杂,具备较强的长尾属性,因此需要众多开发者共同参与构建。这种商业模式决定了开源模型或在端侧场景占据重要地位。以LLaMA模型为例,在LLaMA模型推出后,各厂商以行业数据集对其进行深度调参,得到了金融、医疗、法律等场景的行业垂类应用。当前Mistral和Mixtral模型已有众多衍生模型。Mistral AI公司有望在Meta之后,成为第二个开源模型的重要厂商,为AI端侧、边缘测营造丰富的开源大模型生态。 投资建议:建议关注算力与AI智能硬件 大模型在智能终端的落地会在边缘算力等方面将提出更高要求,需要其迭代更新来适应更大参数的模型,因此建议关注边缘算力相关厂商;AI的终端硬件创新诞生出新的终端形态如Ai Pin等也会给相应的供应商带来新机会,因此建议关注AI智能硬件相关标的。 风险提示 1、开源模型商业模式发展不及预期; 2、AI终端使用体验不及预期
|
|