← 返回资讯热点
AI热点雷峰网发布时间:2026-09-30 10:58热度 188.0000

DeepSeek 开源算子工具大礼包,联手华为昇腾,手撕 CUDA 绑定!

一套代码能跑遍所有芯片。 作者丨 高允毅 编辑丨岑 峰 刚刚,DeepSeek做了一个开源壮举: 把给英伟达 GPU 写代码的全套工具链,原样铺到了华为昇腾 950 NPU 上。 最核心的算子开发产品 TileLang 官宣原生支持昇腾。不仅如此,连同 DeepGEMM、DeepEP、FlashMLA、TileKernels、DeepSelect 五大核心计算与通信库也同步推出昇腾版本,直接对标英伟达平台的全套工具链。 这意味着国产算力第一次在核心算子工具层面,做到了与英伟达生态的能力对标 。 在此之前,全球 AI 行业苦 CUDA 垄断久矣;而现在,DeepSeek 用一行行开源代码,为国产算力自主生态蹚出了一条康庄大道。 01 写算子的 “手工作坊” 时代,该结束了 做过 AI 底层开发的都知道, “写算子” 一直是门槛最高、耗时最久的工作之一。 一张芯片的理论算力上限很高,但如果底层算子写得不达标,芯片内部的计算单元就会有大量时间等数据流转,导致几万块钱的芯片可能只能发挥出 20% 的性能。写算子的目的,就是为了把这 20% 的硬件利用率提高到 95% 以上。 拿最常见的 矩阵乘法(GEMM) 来说,要想榨干一张 AI 芯片的算力,开发者要手动管理三级缓存、调度线程块、搞定数据预取流水线,甚至要深入到寄存器分块和指令重排层面。 为了优化上千行底层代码,资深工程师打磨好几周都是常态。这就导致了一个行业的核心冲突:模型算法迭代太快,芯片厂商官方算子库永远跟不上。 过去行业里有三条路可选,但各有各的局限: 第一条路是自己手写 CUDA : 性能天花板最高,但开发效率极低,深度绑定英伟达生态,无法跨平台移植; 第二条路是使用厂商的预制算子库 : 比如英伟达 cuBLAS,标准算子开箱即用、性能拉满,但灵活性极差,开发者无法修改内部逻辑、也无法做算子融合,新算法很容易卡在算力层; 第三条路是使用高层 DSL 编译器: 比如 OpenAI 的 Triton,大幅降低了开发门槛,但性能上限受限于编译器本身的优化策略,对昇腾、AMD 等非英伟达硬件原生支持度低,异构适配成本很高。 而 TileLang 开辟了第四条路,终结算子开发的 “手工作坊” 模式,同时兼顾开发灵活性、运行性能与跨平台能力。 它的核心是 多级分块(Tiling), 将庞大计算任务切分成标准化的数据块。开发者只需声明 “每块数据在哪里计算”,编译器自动完成数据搬运、线程同步等底层工作,性能直逼手写 CUDA 的硬件上限。 这本质上是把资深工程师手工调优的成熟思路抽象为标准化编程原语。 TileLang 主攻大模型核心算子:通用矩阵乘法、反量化 GEMM、FlashAttention、线性注意力、稀疏 MLA。这些算子承载大模型训练和推理 90% 以上计算量,直接决定 AI 芯片算力利用率。 算子速度

来源:雷峰网
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。