>> 国盛证券-传媒行业AI产业研究系列|模型跟踪-智谱GLM-5.3:后训练Scaling驱动能力跃升-260819
| 上传日期: |
2026/8/19 |
大小: |
392KB |
| 格式: |
pdf 共3页 |
来源: |
国盛证券 |
| 评级: |
增持 |
作者: |
刘文轩,赵海楠 |
| 行业名称: |
传媒 |
| 下载权限: |
无限制-登录即可下载 |
|
|
事件:8月14日,智谱发布GLM-5.3并上线官方编程工具ZCode,模型权重将于两周内开源。 点评: 基座不变、后训练驱动能力跃升。GLM-5.3延续GLM-5.2的架构与参数规模,全部提升来自后训练,包括数十倍扩充的长程任务环境、更丰富的环境类型与更长的后训练时间,并基于IndexShare、SAO与新一代Slime框架在同一基座上推进强化学习。据智谱披露,GLM-5.3在Terminal-Bench3.0上得分由4.6升至28.3,DeepSWE v1.1与Agents‘ Last Exam得分分别升至66.9和28.5,多项公开基准位列开源第一,且当前基座的智能上界远未开发殆尽。我们认为,同一基座下仍能持续释放增量,体现智谱后训练体系的效率,后续切换更大预训练底座后的能力弹性值得期待。 编程能力对齐最强闭源模型,token层面成本压力小于闭源旗舰。1)能力方面:据智谱披露,GLM-5.3在终端操作、长程Agent任务上领先KimiK3,其中Terminal-Bench 3.0得分28.3对17.4,传统软件工程任务上双方互有胜负。GLM-5.3编程与智能体能力接近Claude Fable 5,在自研Z.aiCode Bench中High档准确率31.4%、每任务输出约5万tokens,优于Claude Opus 4.8最高档的29.5%和约12万tokens,Max档34.5%仍低于Fable 5的39.5%。2)价格成本方面:GLM-5.3定价与GLM-5.2持平,腾讯云平台报价每百万tokens输入8元、输出28元、缓存命中2元,叠加积分制峰谷五折与98%以上的缓存命中率,token层面的成本压力小于闭源旗舰。 多层次产品入口逐步形成,GLM-5.3商业化空间有望持续释放。截至8月17日,GLM-5.3已通过GLMCoding Plan、ZCode及部分第三方开发与办公工具向用户提供服务。模型支持1M上下文和128K最大输出,能够承载大型代码库处理、长流程任务执行等高价值需求。随着通用ModelAPI、开放权重及配套开发工具陆续推出,其服务范围有望进一步从订阅用户扩展至企业客户和广大开发者。 后训练规模化的难点正从模型侧转向环境侧,ZCode承接能力落地。据Z.ai官方博客,后训练规模化的难点正从模型侧转向环境侧,训练数据正从文本、代码扩展为包含任务、工具、轨迹与奖励信号的完整环境,官方为此构建了端到端的环境合成管线,由研究型Agent采集真实任务模式、裁判型Agent验证任务可解性;GLM-5.3的部分训练任务相当于工程师数天的工作量。截至8月14日,GLM-5.3已上线智谱的AI编程工具Zcode、效率工具AutoClaw,支持通过GLMCoding Plan使用。我们认为,高质量环境将成为后训练阶段重要的数据资产,官方工具既是能力展示与订阅入口,也承担真实任务轨迹的回收职能,Zcode重要性或将提升。 GLM-5.3网络安全能力加速涌现,安全场景有望成为较早兑现生产力价值的场景。1)能力方面:智谱在后训练中引入漏洞发现数据与环境后,安全能力随训练规模扩大加速涌现。GLM-5.3在白盒漏洞发现基准CyberGym上得分84.5%,高于Mythos 5的83.8%;在更接近完整利用的ExploitBench上得分54.4%,仍低于Mythos 5的78.0%。2)实际应用方面:GLM-5.2发布以来,公司联合清华、南开及奇安信、绿盟、腾讯玄武等团队累计发现漏洞2,436个,其中中高危1,097个、覆盖269个项目,已提交CNNVD/CNVD国家漏洞库,按全球漏洞交易与赏金市场公开报价测算价值约3,000万元,并获微软官方致谢;此前Hugging Face安全事件中GLM已被用于防御。我们认为,安全场景是企业需求明确、专业价值较高的应用方向,且已有真实交付案例,有望成为继Coding之后较早兑现生产力价值的场景 风险提示:技术迭代不及预期;行业竞争加剧风险;算力不足风险等。
|
|