>> 长江证券-软件与服务行业AI产业跟踪:月之暗面发布并开源Kimi K2 Thinking,关注国内大模型推理能力迭代进展-251111
| 上传日期: |
2025/11/12 |
大小: |
622KB |
| 格式: |
pdf 共5页 |
来源: |
长江证券 |
| 评级: |
看好 |
作者: |
宗建树 |
| 下载权限: |
此报告为加密报告 |
|
|
事件描述 11月6日,月之暗面正式发布并开源Kimi K2 Thinking模型,MoE架构,总参1T,激活参数32B,上下文长度256K,更好支持国产GPU。 事件评论 能力全面提升,开闭源模型差距进一步收敛。定位基于“模型即Agent”理念训练的新一代Thinking Agent,原生掌握“边思考,边使用工具”的能力。(1)推理性能全面提升:HLE测试中以44.9%准确率超过GPT-5(41.7%)取得SOTA;(2)自主搜索与浏览能力:BrowseComp测试得分60.2% (人类平均得分29.2%),超越GPT-5(54.9%)拿下SOTA,此外在BrowseComp-ZH、SEAL-0、FinSearchComp-T3等基准测试中均拿下SOTA成绩。(3)Agentic编程能力增强,在Tau2 Bench Telecom基准测试中,K2Thinking以93%分位列第一,在SWE-Multilingual、SWE-bench Verified、LiveCodeBenchV6测试得分为61%、71%、83%,该模型在HTML、React等方面的任务上有了很明显的进步,并与Claude Sonnet 4.5和GPT-5不相上下。 受益于长程规划和自主搜索能力的提升,推理表现更稳定。K2可借助多达上百轮的“思考→搜索→浏览网页→思考→编程”动态循环,持续地提出并完善假设、验证证据、进行推理,并构建出逻辑一致的答案,任务拆分更加清晰、可执行。从实测来看,面对复杂问题时,K2 Thinking会自己拆解步骤、搜索信息、调用外部工具、再整合结果,团队把这种机制称为“交替思考”,让推理更连贯。 通用基础能力升级,是少数具有多工具调用能力的开源模型。在无人干预情况下,K2Thinking可连续调用200-300次工具,通过同时扩展思考Token和工具调用轮次,模型实现了更强的Agent和推理性能。我们认为,从交互到反思,K2 Thinking实现多轮地使用工具,具备了Agent重要的特征。 工程落地层面,原生INT4量化提升推理效率与硬件兼容性。在后训练阶段采用了量化感知训练(QAT),并对MoE组件应用了INT4纯权重(weight-only)量化,使得Kimi K2Thinking能够在复杂推理和Agentic任务中支持原生的INT4推理,并将生成速度提升了约2倍。低比特量化是降低大规模推理服务器的延迟和GPU显存占用的有效方法,INT4对推理硬件的兼容性更强,对国产加速计算芯片更友好,有望开辟国产模型降本新路线。 定价层面,价格与KimiK2-0905相同,输入4元/M tokens,输出16元/M tokens,命中缓存的输入为1元。速度高达100 Token/s的Turbo API也同步上架,输入8元/M tokens,输出58元/M tokens,命中缓存的输入为1元。模型定价略高于同期上新的Minimax-M2。 关注模型后续发布。当前时点大模型技术仍在不断迭代,近期国内模型仍在技术侧不断演化,考虑到当前成本仍为制约token消耗量的核心因素,商业化落地需要进一步关注模型在降本层面的效果。继续看好国产AI产业链,持续重点推荐铲子股和卡位优势显著的巨头本身。 风险提示 1、AI技术发展不及预期; 2、下游应用需求不及预期。
|
|