>> 西部证券-计算机行业人工智能系列报告(九)/算力系列报告(二):TileLang,中国的CUDA和Triton-251015
| 上传日期: |
2025/10/15 |
大小: |
1152KB |
| 格式: |
pdf 共9页 |
来源: |
西部证券 |
| 评级: |
超配 |
作者: |
郑宏达,李想 |
| 行业名称: |
计算机 |
| 下载权限: |
此报告为加密报告 |
|
|
CUDA是英伟达于2007年发布的高性能计算平台,经过近二十年的发展,CUDA在成熟度和面向AI场景的支持能力方面,相比其他AI芯片厂商存在一定的优势。英伟达先后在CUDA平台引入了NVLink、混合精度训练(FP16)等能力,并在CUDA层面实现了对Tensor Core的支持,使矩阵计算的速度得到数量级提升。因此,CUDA也成为了英伟达在高性能计算和AI计算领域的主要壁垒。 虽然CUDA已具备较高的成熟度以及较为完善的算子支持,但在工程中仍需要开发者进行工作量较大的手动优化。同时,在进行跨平台代码迁移时,基于CUDA接口的代码也需要开发者重新进行编写。因此,Philippe Tillet由于2019年提出Triton项目,Triton能够自动化处理线程、内存的操作等底层细节,进一步降低了GPU内核程序的开发门槛,加快了开发者在AI场景下的开发效率。随着Philippe Tillet在2020年加入OpenAI,Triton在OpenAI内部得到了推广和使用,OpenAI于2021年正式将Triton开源。 目前,国产AI芯片厂商的高性能计算平台在框架兼容性和工具链完善度上,与英伟达CUDA平台仍有一定的差距。此外,国产AI芯片厂商的硬件架构无法做到互相兼容,各厂商的高性能计算平台也无法实现通用,这导致开发者需要针对不同的国产AI芯片平台进行优化和适配,增加了开发成本,不利于国产AI芯片的大规模推广和使用。 TileLang由北京大学计算机学院团队开发,并于2025年1月正式开源。TileLang与Triton类似,都是专为AI算子开发设计的程序语言。TileLang将高性能计算中的“分块技术”(Tile)作为提升AI算子性能的关键,通过分块实现了内存优化和自动调度。TileLang将原本需要手动优化的操作,与内核的数据流(Dataflow)解耦,将大多数优化工作交给TileLang编译器完成,编译器能够自动推导出适合目标硬件的优化策略。 我们认为:TileLang或将解决头部AI芯片公司与国产AI芯片的高性能计算平台之间接口互不兼容的问题,同时,对国产AI芯片的高性能计算平台进行有效的优化。TileLang有望降低互联网大厂在生成式AI模型推理和训练代码迁移时的成本,加速国产AI芯片的技术落地和商业化。 建议关注: 1)AI推理芯片:寒武纪、海光信息。 2)算力服务器:浪潮信息、中科曙光、华勤技术、神州数码。 风险提示:人工智能技术落地和商业化不及预期;产业政策转变;宏观经济不及预期。
|
|