>> 国金证券-大模型赋能投研系列之三十:GLM-5.3与GLM-5.3-Flash金融投研能力评测-260828
| 上传日期: |
2026/8/28 |
大小: |
4905KB |
| 格式: |
pdf 共34页 |
来源: |
国金证券 |
| 评级: |
-- |
作者: |
高智威 |
| 下载权限: |
无限制-登录即可下载 |
|
|
GLM-5.3 / 5.3-Flash正式发布 2026年8月14日,智谱发布GLM-5.3,API名称为glm-5.3;8月26日再发GLM-5.3-Flash。5.3沿用5.2底座(官方口径744B /约40B激活),提升全部来自后训练,主打长程Agent、复杂编程和工具执行;Flash是全新320B / 18B多模态底座,支持文本、图像和视频,权重当天MIT开源。两边都是1M上下文、最大输出128K,思考不可关闭,分low / high / max。相对5.2,5.3在DeepSWE上+44.8%、AutomationBench v1.0.6上+84.0%;Flash同样明显高于5.2,Toolathlon、Automation甚至局部超过自家旗舰。与V4 Pro-0813比,5.3多数Agent项略高;与V4 Flash-0731比,5.3-Flash在DeepSWE、Toolathlon上差距更明显。评测在统一Claude CodeHarness、max思考强度下完成。 价格方面,5.3与5.2同价:未命中输入8元、输出28元/百万Token,无峰谷。Flash标价0.8 / 2.8元,约为5.3的1/10,限时5折后约1/20。同一套「1M未命中输入+ 20万输出」场景下,Flash标价约1.36元、折扣后约0.68元,低于V4 Flash谷时的2.4元和V4 Pro谷时的7.2元;5.3约13.6元。Coding Plan里Flash额度约为5.3的3倍,非高峰积分对折。本地部署上,Flash官方FP8权重大约306 GiB,重于V4 Flash的约167GB。 GLM-5.3 / 5.3-Flash三类金融投研任务实测 这次评测做了估值、回测和行业研究三项任务。五个模型都能交文件,差别主要在底稿能不能重算、回测有没有把成本和成交时点做对、材料能不能追溯。 估值上,GLM-5.3最好:分产品量价能贯通三表和DCF,改假设可以跟着算。Flash也能联动,但产品拆得粗,所谓三表其实是损益表加现金桥。V4 Pro报告更谨慎,公式却对不上;Kimi不少数是写死的。 回测上,V4 Pro和V4 Flash把成本和成交时点处理得更完整。GLM-5.3和Flash样本、底稿都齐,也能纠错重跑,但没扣成本、执行偏研究口径,还不能当实盘结果用。 行业研究上,V4 Pro的Wiki和来源治理最完整。GLM-5.3公司覆盖最广、数据更新;Flash页面不少,原始资料和反链偏弱。两边都适于出底稿和初稿,正式结论仍要人工核财务口径、交易约束和来源。 风险提示 结果通过历史数据统计、建模和测算完成,历史规律不代表未来;在市场环境发生变化时,模型存在失效的风险;策略依据一定的假设通过历史数据回测得到,当交易成本或其它条件改变时,可能导致策略收益下降甚至出现亏损;大模型输出的内容存在一定的随机性和准确性风险;本文所提炼的观点,基于一定的提示词产生,大语言模型输出的结果可能随着提示词的变化而发生变化。部分应用本身可能存在一定的安全风险,在使用此类应用时,用户需自行承担由此可能引发的任何风险和后果。在使用AI生成内容时,需要注意相关版权问题。用户应确保所使用的工具及其生成的内容符合相关法律法规的要求,避免侵犯他人知识产权。
|
|