>> 国金证券-大模型赋能投研系列之二十三:Kimi K3超越GPT 5.6了吗?-投研Agent模型能力对比评测-260719
| 上传日期: |
2026/7/19 |
大小: |
3734KB |
| 格式: |
pdf 共26页 |
来源: |
国金证券 |
| 评级: |
-- |
作者: |
高智威,许坤圣 |
| 下载权限: |
无限制-登录即可下载 |
|
|
2026年7月,OpenAI与Moonshot AI先后推出面向长程Agent任务的新一代模型GPT 5.6和Kimi K3。为评估新一代模型在真实金融研究场景中的综合能力,本次测评将上述两款模型与GLM-5.2进行横向比较,围绕估值建模、多因子回测和行业研究三类典型金融投研任务展开实测。相较于单轮问答测试,本次任务更强调复杂工作流下的连续执行与成果交付,不仅要求模型理解较为开放的研究需求,还需要自主拆解任务、规划执行路径,并在多个工具和数据源之间完成协同操作。 三类金融投研任务表现 综合三类投研任务的表现,三款模型均已具备完成复杂投研任务的基础能力,其中GPT 5.6 Sol综合表现最佳,在任务完成度、研究细节保留和长程执行稳定性方面均较为突出;Kimi K3的报告结构和分析逻辑整体较好,但底稿联动和任务执行稳定性仍需提升;GLM-5.2擅长任务拆解与报告展示,但底稿报错、结论不闭环及Wiki断链影响了交付物的可用性。需要说明的是,本次Kimi K3测试于模型发布当天进行,测试过程中出现推理速度较慢和请求无法响应的情况,可能受到发布首日访问量和服务负载影响。因此,本文主要评价其已经完成的交付结果,暂不对响应速度和服务稳定性作出确定判断。与此同时,本次结论仅基于有限次数的任务测试,也可能受到任务样本、提示词设计和推理模式等因素影响,后续仍需通过多轮测试验证结果的稳定性和可复现性。 估值建模方面,GPT 5.6 Sol的预测逻辑较为清楚,Excel模型能够联动更新,可复算性和可检查性最好。Kimi K3采用“销量×单价”预测收入,报告逻辑基本自洽,但底稿缺少联动,部分公式错误影响数据复核。GLM-5.2的底稿存在多处公式异常,目标价与投资评级也出现逻辑冲突,表现相对较差。 多因子回测方面,GPT 5.6 Sol明确采用“月末形成信号、下一交易日执行”的方式,交易时点处理最为严谨。KimiK3保留了Python代码、每期选股、组合收益和净值等结果,计算过程的可检查性较好,但没有明确区分信号日与执行日,也未完整处理交易成本和不可交易状态。GLM-5.2覆盖区间较长,但同样存在交易时点和交易约束问题,中间计算过程的披露也相对不足。 行业研究方面,GPT 5.6 Sol的研究逻辑和来源管理最为规范,但公司实体页较少。Kimi K3的报告和投资框架较为完整,但Wiki内容沉淀不足。GLM-5.2覆盖公司最多、展示效果较好,但投资框架分析逻辑不够清楚,来源管理和内部链接也不完整。 风险提示 结果通过历史数据统计、建模和测算完成,历史规律不代表未来;在市场环境发生变化时,模型存在失效的风险;策略依据一定的假设通过历史数据回测得到,当交易成本或其它条件改变时,可能导致策略收益下降甚至出现亏损;大模型输出的内容存在一定的随机性和准确性风险;本文所提炼的观点,基于一定的提示词产生,大语言模型输出的结果可能随着提示词的变化而发生变化。部分应用本身可能存在一定的安全风险,在使用此类应用时,用户需自行承担由此可能引发的任何风险和后果。在使用AI生成内容时,需要注意相关版权问题。用户应确保所使用的工具及其生成的内容符合相关法律法规的要求,避免侵犯他人知识产权。
|
|