>> 西部证券-计算机行业周观点第35期:DeepSeek公布成本利润率,利好AI云-250301
| 上传日期: |
2025/3/2 |
大小: |
690KB |
| 格式: |
pdf 共8页 |
来源: |
西部证券 |
| 评级: |
-- |
作者: |
郑宏达 |
| 行业名称: |
计算机 |
| 下载权限: |
此报告为加密报告 |
|
|
DeepSeek于2025年2月24日正式启动“开源周”,并于3月1日开源DeepSeek-V3/R1推理系统。 理论成本利润率达545%,DeepSeek开启AI星辰大海。3月1日,DeepSeek发布文章《DeepSeek-V3 / R1推理系统概览》,并公布成本和理论收入。根据DeepSeek测算,如果所有token都按照DeepSeek-R1的定价计费,每日总收入将达到56万美元,成本利润率为545%。但因为V3的定价更低,同时收费服务只占了一部分,另外夜间还会有折扣,所以实际收入低于理论值。 DeepSeek开源周Day1:FlashMLA。FlashMLA是DeepSeek专为英伟达Hopper GPU打造的高效MLA解码内核,特别针对变长序列进行了优化。亮点:加速推理,通过优化MLA解码和分页KV缓存,能够提高LLM推理效率,尤其是在H100 / H800这样的高端GPU上发挥出极致性能。 DeepSeek开源周Day2:DeepEP。DeepEP是为混合专家(MoE)和专家并行(EP)量身定制的通信库,提供高吞吐量且低延迟的all-to-all GPU内核,这些内核也被称为MoE调度与合并。亮点:显著提升MoE模型的性能和效率,适用于大规模AI训练和推理。 DeepSeek开源周Day3:DeepGEMM。DeepGEMM是专为FP8通用矩阵乘法(GEMM)优化的库,具备精细的缩放机制。亮点:加速矩阵运算,具有更高的效率和更灵活的部署。DeepGEMM设计轻量,大约300行代码,却在大多数矩阵尺寸上超越了专家级别调优的内核。 DeepSeek开源周Day4:DualPipe & EPLB & profile-data。DualPipe是一种创新的双向流水线并行算法,亮点:实现了前向和后向计算通信阶段的完全重叠,优化并行计算效率。EPLB为负载均衡算法,亮点:解决MoE模型在分布式训练和推理中的负载不平衡问题。通过动态调整专家(MoE模型中的子网络)的分配来平衡GPU之间的工作负载,同时减少跨节点通信开销,最大化硬件利用率以及提高训练效率。 DeepSeek开源周Day5:3FS & Smallpond。3FS(Fire-Flyer File System)是一种高性能分布式文件系统,旨在应对AI训练和推理工作负载的挑战。亮点:用于AI训练时计算节点中的模型批量读取样本数据场景,通过高速的计算存储交互加快模型训练,把固态硬盘的带宽性能利用到极致。 相关标的:1)国产AI芯片:寒武纪、海光信息;2)AI服务器:浪潮信息、华勤技术;3)AIDC:云赛智联、金山云、并行科技、首都在线、青云科技、优刻得;4)AI应用:虹软科技、博思软件、新致软件、赛意信息、深桑达、云赛智联、金山办公、金蝶国际、用友网络、迈富时。 风险提示:产业政策转变、技术进展不及预期、应用落地不及预期、行业竞争加剧、国际环境发生变化
|
|