>> 华泰证券-科技行业动态点评-Token推动计算Compute需求:非线形增长-250717
| 上传日期: |
2025/7/17 |
大小: |
2124KB |
| 格式: |
pdf 共23页 |
来源: |
华泰证券 |
| 评级: |
增持 |
作者: |
谢春生 |
| 下载权限: |
此报告为加密报告 |
|
|
Token调用量与算力需求非线性增长 推理和Token调用量之间不是线性关系:从Agentic AI底层来看,推理过程的倍数项包含Agent数和迭代次数,多Agent协作和多工具调用带来Token消耗量倍数增长。Token的增长与算力硬件需求之间也不是线性关系:据黄仁勋在3月份的GTC大会中所述,“Token量增长10倍,所需的算力量的增长可能增长100倍”。这是因为推理过程变得更加复杂,在同样的算力条件下,计算的时间也将增长,如果要求模型具备交互性与实时性,则需要将计算速度提升10倍。我们认为,Agentic AI将带来Token调用量10倍以上增长,从而带来算力需求100倍以上提升。目前市场对于算力需求有较大的预期差,未来算力需求空间广阔。 三条Scaling曲线为算力需求打开空间 目前市场熟知的Scaling law是预训练Scaling law,即数据和参数量的增长可以提升模型性能。对预训练Scaling law见顶的担忧导致市场对算力的需求的低估。但我们认为,考虑到后训练Scaling和推理Scaling,AI对算力的需求仍有大量空间。推理Scaling的必要性在于提高模型性能,特别是模型在困难问题方面的表现,是通往Agentic AI的重要路径。回顾Grok 4的发展历程,对应了三条Scaling曲线。2025年2月,Grok 3发布,相比于Grok 2,将预训练阶段的算力扩大10倍,实现性能的突破,对应预训练阶段的Scaling law。2025年7月,Grok 4发布,将后训练与推理过程的算力扩大10倍,在推理/测试阶段花费更多时间思考,调用更多算力,例如通过多Agent共同思考,商议问题结果,进一步在HLE测评集上实现突破,对应后训练与推理过程的Scaling law。 Token调用量随推理扩展呈倍数增长 GTC 2025大会中,黄仁勋多次提到了“Agentic AI”,理解Agentic AI才能理解大会中Token量大幅增长的结论。我们认为Deep Research是“Agentic化”的AISearch,是研究Agentic AI合适的抓手。我们从Deep Research的底层系统设计入手,分析得出Token量增长源于多Agent和多工具调用,并基于系统运行流程对Token增量进行量化。根据我们的测算,Deep Research的Token消耗可能接近单次聊天的50倍。对于比Deep Research更复杂的一般Agentic AI,Token增长量会更高。 AI算力需求随Token增长呈倍数增长 推理过程中存在延迟与吞吐量两个重要指标,两个指标相互制约,分别决定了用户对于模型/AI应用的使用体验(若延迟过高,则会失去用户)与模型/AI应用厂商的总任务处理量,对应AI服务的量价关系,从而决定了AI服务的商业化。考虑模型/AI应用厂商Token经济学的“帕累托最优”问题,则需要追求用户使用量与AI服务质量之间的平衡,而想要扩大最优边界,则需要增加算力硬件。随着推理过程变得更加复杂,在同样的算力条件下计算的时间也将增长。用户太久的等待将失去耐心,如果要求模型具备交互性与实时性,则需要用额外的算力来减少因为单任务Token量扩大带来的时延,即用算力换时间,所以算力需求的增长与Token的增长呈倍数关系。 风险提示:宏观经济波动,模型迭代不及预期,AI商业化进展不及预期。
|
|