>> 长江证券-软件与服务行业AI产业速递:DeepSeek-V3发布,创新实现高效推理及低成本训练-241230
| 上传日期: |
2024/12/30 |
大小: |
571KB |
| 格式: |
pdf 共5页 |
来源: |
长江证券 |
| 评级: |
看好 |
作者: |
宗建树 |
| 下载权限: |
此报告为加密报告 |
|
|
事件描述 近日,国产大模型厂商DeepSeek宣布DeepSeek-V3首个版本上线并同步开源。DeepSeekV3多项评测成绩超越Qwen2.5-72B和Llama-3.1-405B等开源模型,性能比肩GPT-4o和Claude-3.5-Sonnet等世界顶尖闭源模型。 事件评论 DeepSeek-V3性能赶超其他开源模型,比肩世界顶尖闭源模型。DeepSeek-V3是一个6710亿参数的专家混合模型,激活参数370亿,在14.8万亿token上进行了预训练。经测试,在英语、代码、数学、汉语以及多语言任务上,其基础模型DeepSeek-V3 Base表现优异,全面超越DeepSeek-V2-Base和Qwen2.572BBase,并在大多数基准测试中超越LLaMA-3.1405BBase。同时在AGIEval、CMath、MMMLU-non-English等任务上,DeepSeek-V3表现出了远超其他开源大模型的性能,即便与GPT-4o和Claude 3.5Sonnet等世界顶尖闭源模型相比也不遑多让。 DeepSeek-V3实现低成本训练,API价格大幅下降。根据公布的DeepSeek-V3技术报告,DeepSeek-V3整个训练使用了277.8万个GPU小时(GPU为H800),训练成本为557.6万美元(约合4070万人民币)。相较之下,Llama 3405B的训练时长是3080万GPU小时(GPU为H100),参数量为7B的Llama 2的训练成本为76万美元(约合555万人民币)。另一方面,其API也大幅下降,DeepSeek-V3每百万输入tokens 0.5元(缓存命中)/ 2元(缓存未命中),每百万输出tokens 8元。同时,DeepSeek此次提供了45天优惠价格体验期,在2025年2月8日之前,所有用户使用DeepSeek-V3API的价格分别下降了80%(输入命中)、50%(输入未命中),75%(输出)。DeepSeek-V3说明在有限算力预算下进行模型预训练仍可以达到优秀的性能,目前在数据和算法方面仍有大量优化空间,低成本的训练和高效推理应用或将是下一阶段大模型发展的方向之一。 DeepSeek-V3优异表现源于其技术革新。基于其前身DeepSeek-V2的高效性,DeepSeek-V3采用了用于高效推理的多头潜在注意力(Multi-head Latent Attention,MLA)和用于经济训练的DeepSeekMoE。同时,DeepSeek-V3为DeepSeekMoE额外引入了辅助无损耗负载平衡策略,以减轻因确保负载平衡而导致的性能下降,并采用了多Token预测目标(Multi-Token Prediction,MTP)用于推理加速的推测解码,从而提高模型性能。在模型架构方面的创新有力的提升了DeepSeek-V3的性能表现。 低成本训练高性能输出,DeepSeek-V3或将降低大模型准入门槛。此次DeepSeek-V3仅用277.8万个H800 GPU小时便完成了训练,并在性能上达到了世界领先的水平,说明了目前在数据和算法方面仍有大量优化空间,后续有望在有限的预算下开发强劲性能的大模型,从而降低大模型的准入门槛,推动AI应用的落地进程。建议关注1)中国领先的AI大模型厂商,重点推荐国产大模型领军企业科大讯飞;2)中国推理算力产业链,重点推荐国内AI芯片领军企业寒武纪。 风险提示 1、AI技术发展不及预期; 2、下游应用需求不及预期。
|
|