>> 长江证券-软件与服务行业AI产业速递:阿里发布并开源Qwen3系列,智能体应用有望加速落地-250501
| 上传日期: |
2025/5/2 |
大小: |
576KB |
| 格式: |
pdf 共5页 |
来源: |
长江证券 |
| 评级: |
看好 |
作者: |
宗建树 |
| 下载权限: |
此报告为加密报告 |
|
|
事件描述 4月29日凌晨,阿里发布并开源新一代通义千问混合推理模型Qwen3,包含MoE和Dense两种架构,共8款不同尺寸,本次发布的旗舰模型是Qwen3-235B-A22B。Qwen3依旧采用Apache2.0协议开源,可免费下载模型并商用,也可通过阿里云百炼调用Qwen3的API服务。 事件评论 开源模型智能水平新高,模型能力持续增强。作为Qwen系列全新一代的混合推理模型,Qwen3在推理、指令遵循、工具调用、多语言能力等方面均大幅增强,235B模型在ArenaHard测试得分95.6,超过OpenAI-o1(92.1)、DeepSeek R1(93.2),在奥数水平的AIME25测试得分81.5分,刷新开源纪录。此外,Qwen3能够在思考模式(用于复杂的逻辑推理、数学和编码)和非思考模式(用于高效的通用聊天)之间无缝切换,从而确保在各种场景中实现最佳性能。我们认为,通过这种方式,用户能够根据具体需求,来控制模型的“思考”的程度,做到效果、成本、时间上的平衡。 部署成本大幅下降,有望加速应用放量。成本降低主要来源于参数量低,以及MoE架构下激活参数量降低,Qwen3最大参数量达到235B,仅为DeepSeek-R1最大参数量671B的1/3,部署满血版Qwen3仅需4张H20,显存占用仅为性能相近模型的1/3。从部署成本角度看,Qwen3旗舰模型是满血版R1的25%~35%,部署成本大降75%~65%,显存占用仅为性能相近模型的三分之一。 包含两类架构八款尺寸,同时加强对MCP的支持,加速智能体多场景灵活落地。Qwen3系列模型包含两款混合专家模型(MoE)和六款稠密模型(Dense),MoE模型包括Qwen3-235B-A22B和Qwen3-30B-A3B;其中235B和30B分别是总参数量,22B和3B分别是激活参数量。密集模型参数分别为32B、14B、8B、4B、1.7B和0.6B。本次Qwen3的更新同时也加强了对MCP的支持,并具备强大的工具调用能力。我们认为Qwen3家族灵活满足了AI应用和不同场景对性能和成本的多样需求,场景落地的边界进一步延伸。 小模型匹敌大模型,Agent能力积累。1)预训练数据集显著扩展。Qwen3使用数据量约36T个token(Qwen2.5为18T),涵盖119种语言和方言,包括三个步骤:S1在30万亿token上预训练,上下文4K;S2增加知识密集型数据的比例来改进数据集,在额外5万亿数据再预训练;S3使用高质量长上下文数据扩展至32K上下文。(2)后训练步骤递进实现混合推理:Qwen3实施四阶段训练流程,包括长思维链冷启动、长思维链强化学习、思维模式融合、通用强化学习。四个步骤不断递进,大幅提升模型在特定领域的性能。从专注于训练模型的时代过渡到以训练Agent为中心的时代,AI仍将是今年技术变革最强主线。建议关注:1)AIAgent相关厂商;2)中国推理算力产业链,重点推荐国内AI芯片领军寒武纪;3)云服务厂商,重点关注与DeepSeek合作的相关云厂商;4)IDC,重点关注与腾讯、阿里、字节等大厂合作的IDC。 风险提示 1、AI技术发展不及预期; 2、下游应用需求不及预期。
|
|