>> 兴业证券-资讯科技行业:DeepSeek V4开启国模国芯全栈适配新纪元-260506
| 上传日期: |
2026/5/6 |
大小: |
583KB |
| 格式: |
pdf 共4页 |
来源: |
兴业证券 |
| 评级: |
-- |
作者: |
洪嘉骏,周路昀 |
| 下载权限: |
此报告为加密报告 |
|
|
投资要点: DeepSeek-V4双版本齐发,延续极致性价比:DeepSeek-V4在多项核心评测中达到全球领先水平。LiveCodeBench得分93.5,排名全球第一;SWE-bench Verified得分80.6%,持平Gemini-3.1-Pro;MMLU-Pro得分87.5%,持平GPT-5.4 xHigh;GPQADiamond得分90.1%。整体能力上,编码智能体任务超越Claude Sonnet 4.5,非思考模式接近Opus 4.6。其中本次发布两个版本: V4-Pro:总参数1.6万亿,激活490亿,上下文1MToken,输入(缓存命中)优惠价为0.025元/百万Token、输入(缓存未命中)限时优惠价为3.0元/百万Token、输出限时优惠价6.0元/百万Token。 V4-Flash:总参数2840亿,激活130亿,上下文1MToken,输入(缓存命中)优惠价为0.02元/百万Token、输入(缓存未命中)限时优惠价1元/百万Token、输出限时优惠价2元/百万Token。 CSA与HCA混合压缩,KV缓存与算力齐优化:DeepSeek-V4采用CSA与HCA交替部署的混合架构。在1M上下文下,V4-Pro单Token推理FLOPs降至V3.2的27%,KV缓存压缩至10%;V4-Flash更极致,两项指标分别压低至10%与7%。具体机制: CSA(压缩稀疏注意力):先压缩后稀疏筛选。将每4个相邻Token的KV缓存压缩为1个压缩条目(压缩率4:1),相邻块间保留重叠以避免边界信息丢失。随后在压缩后的Cache上通过LI叠加KVCache稀疏技术,其中V4-Flash版本选取Top-512个对KV参与Attention计算,进一步提升长序列下的性能表现; HCA(重度压缩注意力):激进压缩,全量稠密覆盖。将每128个Token压缩为1个KV条目(压缩率128:1),直接在压缩后的全序列上执行稠密Attention,不依赖稀疏筛选,以更粗的粒度换取对超长上下文的低成本全局感知。同样保留128 Token滑动窗口补充近程信息。 国产芯片深度适配,性能与开源同步落地:昇腾方面,在昇腾950节点上,V4-Pro单卡Decode吞吐达4700 TPS,V4-Flash为1600 TPS;A364卡集群下V4-Flash达2000+ TPS。架构并行策略上,Prefill阶段引入CP,将长序列切分至多卡并行处理,显著降低首Token延迟;Decode阶段采用TP,拆分注意力与FFN参数矩阵,提升生成吞吐;算子创新方面,依托CANNN异构计算架构,针对DeepSeek-V4的Compressor、mHC等模块,手工融合了CP跨卡通信与TP矩阵分片,减少冗余数据输送。寒武纪也已完成对V4-Flash与V4-Pro的全量适配与推理部署,相关适配代码已同步开源。 投资关注:DeepSeek-V4的极致性价比与Day 0全栈适配,标志着国产AI模型与国产芯片的生态闭环初步形成。模型推理成本的大幅下降将驱动B端应用规模化落地,拉动国产算力基础设施的强劲需求。关注国产芯片厂商如华为昇腾(未上市)、寒武纪(688256.SH)、天数智芯(09903.HK)、昆仑芯(港交所递表),与上游供应链如盛合晶微(688820.SH)、芯原股份(688521.SH)、华虹半导体(01347.HK)等。 风险提示:AI模型迭代不及预期;市场竞争超预期加剧;算力基础设施建设瓶颈。
|
|