>> 中信证券(香港)-韩国科技行业:Deepseek新模型效率提升-260914
| 上传日期: |
2026/9/14 |
大小: |
484KB |
| 格式: |
pdf 共2页 |
来源: |
中信证券(香港) |
| 评级: |
-- |
作者: |
吴俊豪 |
| 下载权限: |
无限制-登录即可下载 |
|
|
摘要 中信证券财富管理与中信里昂研究观点一致。根据中信里昂研究在2026年9月13日发布的题为《Deepseek newmodel efficiency gains》的报告,DeepSeek于9月10日发布的最新模型DeepSeek-V4.1-Flash,将基于HBM的KV缓存需求降低了75%(至890 bytes/token),并将eSSD缓存需求降低了87.5%,这似乎对内存股构成了压力。需要注意的是,这一改进仅适用于KV缓存效率,并不代表GPU总内存或存储需求的削减。历史表明,对内存效率提升会降低内存需求的担忧是没有根据的。AI模型一直在持续提高效率,DeepSeek从V1到V4将每token内存效率提升了约110x。然而,随着更低成本推动更广泛使用,内存需求仍在持续增长。随着token量激增(8月token需求翻倍),模型效率的提升以及内存/计算性能的进步预计将继续推动整体内存需求。中信里昂维持对内存股的正面看法。 75%的降幅具体适用于推理期间的KV缓存,而不适用于模型权重、训练内存或更广泛的HBM占用。如果推理变得更便宜,开发者就会运行更多智能体、更长上下文以及更多推理工作负载。处理的token数量上升的速度可能远快于每token所需内存下降的速度。即使缓存压缩降低了容量需求,AI模型仍然需要巨大的带宽来在GPU与内存之间传输数据。因此,较低的容量强度并不一定会按比例转化为更低的HBM需求。 然而,这再次证明算法效率可以缓解限制超长上下文和智能体工作负载的内存容量瓶颈。压缩KV缓存占用意味着数据中心能够承载大得多的批处理规模、支持更长的上下文窗口,并服务显著更多的并发用户。 就像Google的Turbo quant(2026年3月)和Deepseek的早期版本(2025年1月)一样,这降低了每次查询或每位用户的内存负担,但它往往会触发杰文斯悖论(Jevons Paradox):随着推理变得更便宜且更高效,整体使用量、采用率和API调用量激增,这可以在很大程度上抵消单位硬件节省。 分析预计,软件创新将继续推动内存效率提升,投资者应预期会周期性看到宣称内存使用下降的新闻标题。然而,算力需求正呈指数级增长,上下文长度持续扩展,而智能体AI正大幅增加推理量。最终结果是,即使每token内存消耗下降,总内存需求也可能强劲上升。
|
|