剑指英伟达CUDA!DeepSeek开源华为昇腾全套组件
2026年09月30日 20:40
作者: 科创板日报记者 黄心怡
来源: 财联社
小 中 大
东方财富APP

方便,快捷

手机查看财经快讯

专业,丰富

一手掌握市场脉搏

手机上阅读文章

提示:

微信扫一扫

分享到您的

朋友圈

  DeepSeek今日宣布正式开源面向华为昇腾平台的全套基础设施组件,涵盖编程语言TileLang、计算库与分布式通信库,且与此前面向英伟达平台的开源组件一一对应。

  此次开源的核心是TileLang昇腾版本,它对昇腾底层指令进行了封装,让开发者能用更简单的高级语言编程,同时不损失硬件性能,目标是成为对标英伟达CUDA语言的“工具箱”。

  DeepSeek方面表示,要建立新一代自主可控的GPU软件生态,首要的事情是先建立一个通用的、编程简单的,同时能达到硬件性能上限的高级语言。TileLang在这样的历史背景下诞生。

  一方面,相对于英伟达的CUDA语言,TileLang的编程更简单,能显著提高开发效率、简化代码逻辑。

  另一方面,相对于其它同类高级语言,TileLang的编程模型可以充分发挥芯片的特性,达到硬件的性能上限。

  TileLang路线首先在英伟达成熟平台上得到了验证,如今已承载了DeepSeek V4系列模型训练中大部分算子的实现,是其探索AGI新范式、开发高性能算子的核心工具。

  双方共同推进基于昇腾950的128卡超节点方案

  从披露的细节看,这并非简单的单向适配。华为团队提供了较大的支持,双方共同推进了基于昇腾950的128卡超节点方案,并对计算与通信进行了深度优化。

  这种“芯模协同”的深度,是组件能达到接近硬件上限性能的关键。相关技术成果也已在华为的CANN社区同步开源,形成了双向的生态共建。

  《科创板日报》记者获悉,华为向DeepSeek团队提供了联合定义的昇腾超节点SuperPoD Flex和UBL128组网方案,可实现128卡3.2Tbps单层交换Scale-up网络和256K卡两层交换Scale-out网络,可以支持超低时延推理和前沿基座模型的大规模训练的需求。

  基于全互联的UBL128超节点,昇腾提供了ASC-COMM高性能自定义通信编程库,支撑用户通信算子与通算融合算子高性能编程。Deepseek团队开发了高性能DeepEP通信库,涵盖EP/CP/PP/FSDP等模式下的通信算子,为更大模型向更大集群扩展提供支持,互联带宽实测达到Dispatch 375GB/s、Combine 347 GB/s的通信性能,接近硬件上限。

  为支持开发者基于昇腾950及超节点集群部署DeepSeek模型,华为将此次联合创新的成果在CANN社区开源,包括大EP低延时推理部署、单卡/单机部署、大规模训练、超长文本KVcache池化与Agentic RL。其中面向大规模推理场景,基于EP32部署策略,offline推理模式下DeepSeek-V4.1-Flash不带框架纯模型性能可实现TPOT=5ms,每卡输出吞吐2469tokens/s;TPOT=10ms,每卡输出吞吐5102 tokens/s。

  此外,DeepSeek还开源了五个关键的计算与通信组件,覆盖了模型训练的核心环节:DeepGEMM加速通用矩阵运算;DeepEP提供高效的大规模跨设备通信;TileKernels提供数据处理所需的常规向量计算和访存算子;FlashMLA提供稀疏注意力算子,提升长上下文处理效率;DeepSelect则实现了高效的数据筛选。

  在多项关键测试用例中,上述组件的计算与通信性能已接近硬件上限。多项关键测试显示,这些组件的计算与通信性能均已接近硬件上限。

  降低大模型训练与推理代码的迁移成本

  这次开源的战略意义,远大于其技术细节。

  业内人士王敏坚告诉《科创板日报》记者,过去三年,中国AI芯片的真正瓶颈从来不在晶体管,而在软件。英伟达的护城河不是芯片算力,而是CUDA十八年积累的软件生态,数百万开发者、无数调优过的算子、以及“写一次到处能跑”的开发体验。国产芯片算力规格一次次逼近,客户却总在最后一步犹豫:迁移成本太高。

  DeepSeek在此次公告中提到,DeepSeek训练中用到的每一个TileLang算子,在昇腾上都有对应的高性能实现。这句表述,翻译成产业语言就是:训练DeepSeek级别的前沿模型,从此在软件栈层面不再唯一依赖英伟达。

  王敏坚表示,对国产芯片而言,TileLang的战略价值在于换轨,与其在CUDA的主场上追模拟生态,不如在更高一层,对硬件中立的算子语言建立新标准。算子写在TileLang里,后端可以指向英伟达、昇腾,也可以指向任何愿意实现编译后端的AI芯片。

  有券商研报早在去年就指出:TileLang或将解决国产AI芯片高性能计算平台之间接口互不兼容的问题,降低大模型训练与推理代码的迁移成本。

  国产AI芯片有望共享算子生态

  根据公开资料,TileLang是一款由北京大学计算机学院团队主导开发的开源高性能AI算子编程语言,属于领域特定语言(DSL),于2025年1月开源。其核心设计基于“Tile”(张量分块)抽象,采用类Python的声明式语法,开发者可用接近数学公式的形式描述计算意图,由编译器自动完成循环优化、内存调度等底层硬件适配,旨在降低AI算子开发门槛并实现“一次编写,多架构运行”。

  TileLang于2025年9月应用于DeepSeek-V3.2-Exp等大模型研发,并与华为昇腾、摩尔线程、算能、沐曦等硬件厂商达成适配合作。

  在华为全联接大会2025的开发者日上,TileLang团队成员董宇骐介绍了TileLang实现FlashAttention算子开发,代码量从500+行减少至80行,并保持了与官方版本持平的性能。

  这次DeepSeek公告中另一句值得细读的话:TileLang昇腾版本作为一个开源工作,希望能对更多AI芯片建立高可用软件生态起到示范作用。

  王敏坚认为,这个示范作用指向的是寒武纪、海光、摩尔线程、沐曦等一众国产芯片公司:与其各自为战地造轮子,不如共同对接TileLang这样的中立语言层。芯片厂只需提供编译后端和底层指令接口(昇腾为此开放了Ascend C与PTO ISA底层指令体系),上层算子生态即可复用。若这一路径成立,国产AI芯片有望第一次拥有跨芯片共享的算子生态,碎片化困局出现真正的解法。

  不过,在肯定此次开源战略价值的同时,也需看到现实的挑战。英伟达CUDA生态积累了十余年,拥有数百万开发者和海量工具。TileLang昇腾版是一个重要的起点,但要从“可用”到“好用”再到“开发者主动选择”,仍需持续的社区运营和迭代。

  此外,虽然软件优化能逼近硬件上限,但硬件本身的算力天花板仍是基础。昇腾芯片的持续迭代能力,将决定这套软件生态最终能支撑多大的模型和场景。而DeepSeek的示范能否带动更多模型厂商跟进,则是生态能否真正繁荣的关键。

(文章来源:财联社)

文章来源:财联社 责任编辑:3
原标题:剑指英伟达CUDA!DeepSeek开源华为昇腾全套组件
郑重声明:东方财富发布此内容旨在传播更多信息,与本站立场无关,不构成投资建议。据此操作,风险自担。
举报
分享到微信朋友圈

打开微信,

点击底部的“发现”

使用“扫一扫”

即可将网页分享至朋友圈

扫描二维码关注

东方财富官网微信


扫一扫下载APP

扫一扫下载APP
信息网络传播视听节目许可证:0908328号 经营证券期货业务许可证编号:913101046312860336 违法和不良信息举报:021-61278686 举报邮箱:jubao@eastmoney.com
沪ICP证:沪B2-20070217 网站备案号:沪ICP备05006054号-11 沪公网安备 31010402000120号 版权所有:东方财富网 意见与建议:4000300059/952500