DeepSeek联合华为开源全套CUDA替代方案,昇腾950已完整适配V4系列模型
9月30日,深度求索(DeepSeek)正式宣布开源面向华为昇腾算力平台的全套编程基础设施,涵盖TileLang高级语言编译工具、核心计算库、分布式通信库等组件,所有组件均与此前面向英伟达平台的开源版本一一对应。这标志着曾经牢不可破的CUDA生态壁垒,迎来了首个完整的国产替代方案。

DeepSeek在官方公告中强调,华为团队在这套工具链的研发过程中提供了"毫无保留的大力支持"。双方深度协同,共同推进了基于128卡昇腾950芯片的超级节点解决方案,对单芯片内部高效计算与芯片间数据高速传输两大核心痛点完成了底层优化。
此次开源的核心是TileLang——一款面向AI芯片的高层级开源编程语言。DeepSeek表示,TileLang的编程模型比CUDA更简洁,可显著提升开发效率、简化代码逻辑,同时能充分释放硬件的性能上限。该语言此前已在NVIDIA平台完成验证,支撑了DeepSeek V4系列模型中大部分算子的实现,是其探索AGI新范式、开发高性能算子的核心工具。本次更新新增昇腾950原生支持,覆盖代码生成、自动调度、同步机制等完整能力。

除TileLang外,开源组件还包括DeepGEMM-Ascend矩阵运算库,承担大模型核心的矩阵乘法与通用计算,支持BF16、FP8、FP4全精度运算;DeepEP-Ascend分布式通信库,负责训练与推理场景下的大规模跨设备通信,支持混合专家(MoE)模型中不同专家模块的数据路由调度与输出合并。此外还包含TileKernels基础向量与访存算子库、FlashMLA稀疏注意力算子、DeepSelect高效数据筛选组件。
在多项关键测试中,上述组件的计算与通信性能均已接近昇腾硬件的理论上限。例如FlashMLA在昇腾950上处理输入上下文的预填充阶段,稀疏注意力算子最高达到硬件理论峰值的95%;解码阶段最高达到83%。
本次开源适配的是昇腾950平台,属于当前已量产商用的主力算力平台。而两周前华为在全联接大会上发布的昇腾960系列才是下一代旗舰产品,采用业界首个NPO近封装光学技术,单超节点最高可扩展至4096张计算卡,FP8精度下总算力达8EFLOPS,预计将于2027年大规模应用于大模型训练场景。
读者评论 (3)
想参与讨论?请 登录 后发表评论。
希望不是又个“纸老虎”,真用起来别卡得让人想砸键盘。
TileLang比CUDA还简洁?要是真落地,写代码的噩梦就该少一半了
终于有人把CUDA那套墙拆开了,国产芯片这步棋走得挺硬。