>> 长江证券-软件与服务行业AI产业速递:DeepSeek开源FlashMLA解码内核,持续提升LLM推理效率-250226
| 上传日期: |
2025/2/27 |
大小: |
549KB |
| 格式: |
pdf 共5页 |
来源: |
长江证券 |
| 评级: |
看好 |
作者: |
宗建树 |
| 下载权限: |
此报告为加密报告 |
|
|
事件描述 2025年2月24日,DeepSeek开源了FlashMLA解码内核。FlashMLA解码内核是专为英伟达Hopper架构GPU打造的高效推理引擎,已实际应用在DeepSeek中。FlashMLA通过压缩KV缓存和优化GPU计算能力,显著提升了LLM的推理效率。 事件评论 FlashMLA内核使用分页的KV缓存,Batch大小为64。在LLM中,随着序列长度的增加,KV缓存的内存占用和计算成本会显著上升,成为性能瓶颈。Multi-head LatentAttention (MLA)将键和值投影到低维潜空间中,使用潜向量表示缓存,并通过上投影矩阵增强表达能力。这种方法显著减少了KV缓存的大小,同时保持模型性能,从而加速推理过程。 使用分页的KV缓存进一步提升了DeepSeek推理效率。分页方法允许FlashMLA将数据分成可管理的batch,提高了内存效率并减少了解码期间的延迟,便于在边缘设备上部署。在H800 SXM5算力芯片上运行CUDA 12.6,FlashMLA在受内存带宽限制的配置下可达3000 GB/s,在受计算能力限制的配置下可达580 TFLOPS。 FlashMLA支持BF16(Brain Float 16)精度。与FP32(32位浮点)等更高精度的格式相比,BF16精度可减少内存使用量并加快计算速度,同时保持大多数AI任务所需的足够精度,有助于在硬件资源受限情况下上部署大模型。 支持BF16精度拓宽了DeepSeek落地场景。支持BF16精度提升了DeepSeek长序列的语言推理性能,使得DeepSeek更加适用于文档分析或长对话。 新一轮技术供给革命,国内AI产业迎来价值重估。DeepSeek带来AI平权,有望大幅度提升应用端落地速度,并扩容AI算力需求。建议关注:1)中国推理算力产业链,重点推荐国内AI芯片领军寒武纪;2)云服务厂商,重点关注与DeepSeek合作的相关云厂商;3)IDC,重点关注与腾讯、阿里、字节等大厂合作的IDC;4)AI应用相关标的,重点关注AI+政务、AI+金融、AI+医疗、AI+教育等方向。 风险提示 1、AI技术发展不及预期; 2、下游应用需求不及预期。
|
|