万维读者网>世界军事论坛>帖子
DeepSeek 又双叒搞大事!开源一整套华为芯片训练框架,对标 CUDA!
送交者: 员外 2026-10-01 09:17:06 于 [世界军事论坛]

AI 圈又有大动作了!这回 DeepSeek 没有选择在周末搞突然袭击,而是在深夜给国产算力生态直接扔下一枚重磅炸弹:正式开源一整套面向华为昇腾(Ascend)芯片的基础设施组件。

简单来说,就是把此前在英伟达 GPU 平台上跑得飞起的那套最核心、最底层的基础设施,开始系统性、毫无保留地搬到了华为昇腾上。

从写高级算子的 TileLang,到搞矩阵计算的 DeepGEMM,再到搞 MoE 大规模跨卡通信的 DeepEP、稀疏注意力的 FlashMLA,以及 TileKernels 和 DeepSelect,几乎一字排开,全面对齐。

这套动作到底有多狠?如果说以前国内开发者用国产芯片练大模型就像是硬拧生锈的螺丝,那 DeepSeek 这次相当于直接把特高压电动螺丝刀和全套标准配件打包送到了每个人手里。

1. 软件栈之痛:老黄的真实护城河与国产算力的物理墙

关注芯片圈的朋友都知道,英伟达能够在全球 AI 浪潮里乱杀,依靠的绝对不仅仅是 A100、H100 或 B200 这些黑科技硬件本身。老黄真正的绝密护城河,是研发打磨了接近二十年的 CUDA 软件生态。

在 GPU 的世界里,硬件只是冰冷的钢铁,软件才是决定能发挥多少动力的发动机。

过去国产芯片行业经常陷入一个尴尬的境地:硬件性能参数看起来很亮眼,单看算力 TFLOPS 似乎能追上英伟达,可一旦买回来落地,工程团队就开始集体抱头痛哭。

因为底层生态太匮乏了!

开发者想要榨干芯片性能,往往不得不直接去编写像 Ascend C 甚至 CUDA 汇编这种极其底层的代码。

这就像是你买了一辆理论极速

400

公里/小时的超级跑车,结果厂家没配自动挡,连手动档杠杆都是裸露的齿轮。驾驶员一边踩油门,一边还要拿皮带手动调整发动机喷油嘴。更绝望的是,如果你下次换了另一个型号的芯片,不好意思,所有底层的代码和齿轮参数全部作废,必须推翻重来。

因此,大量 AI 团队宁愿花大价钱租英伟达卡,也不愿轻易尝试国产算力。不是大家不想支持,而是软件适配的人力成本和时间成本,实在高到令人发指。

2. 核心大招 TileLang:用 Python 的姿势,榨干硬件的干电池

在这次 DeepSeek 开源的整套工具链里,最受业内瞩目的莫过于 TileLang。

这到底是个什么神器?

简单比喻,TileLang 就是 AI 算子开发领域的同声传译员和通用适配器。

以往,想要针对特定的芯片写出极速的 GEMM(矩阵乘法)或者 Attention(注意力机制)算子,开发者必须精通特定芯片的底层硬件架构,熟记每一个寄存器和指令集。而 TileLang 做的事情,是在硬件和开发者之间往上抽取了一层。

你只需要用非常简单、接近 Python 语法的表达方式去描述算子逻辑,剩下的脏活累活——比如怎么把计算任务拆分成 Tile(图块)、怎么调度流水线、怎么压榨内存带宽,全由 TileLang 自动编译并翻译给底层的硬件。

你可能会问:这不就是微软的 Triton 吗?

有点像,但 TileLang 从出生第一天起,目标就是多硬件后端平台。它不仅能编译给英伟达 GPU,还能直接跨越编译给 AMD 和华为昇腾。

更关键的是,TileLang 绝不是只为了好写而牺牲性能的玩具。DeepSeek 最新一代 V4 系列模型训练里的庞大算子库,很多本身就是用 TileLang 一笔一画写出来的。

而这次发布的昇腾适配版本,直接把底层复杂的 Ascend C 指令封得严严实实。DeepSeek 训练过程里用到的每一个 TileLang 算子,现在在华为昇腾上都有了现成的、一键对齐的实现。

昇腾社区官方展示的 TileLang-Ascend 矩阵乘法代码

3. 极致暴力美学:贴脸输出的 99.8% 硬件利用率

如果你以为 DeepSeek 只是把代码移植过来能跑通,那就太小看这家硬核技术公司了。他们奉行的向来是极致的工业级榨干原则。

根据 DeepGEMM Ascend 项目的官方测试数据,在部分 Dense GEMM(密集矩阵乘法)测试中,昇腾 NPU 上的算力利用率最高竟然达到了硬件理论上限的 99.8%!

99.8% 是什么概念?

这相当于你买了一台额定功率 1000 瓦的电机,DeepSeek 通过算法调优和指令编排,硬生生踩出了 998 瓦的净输出!这已经不是简单的软件优化了,这是拿着皮鞭在分子层面逼着芯片把最后一丝电荷都给吐出来。

除了 DeepGEMM,这次配套开源的其他几个仓库也极其精准地砸中了 LLM(大语言模型)训练和推理的致命痛点:

  • DeepEP:专门解决 MoE(混合专家模型)在成千上万张卡之间疯狂路由 token 时的通信瓶颈。没有高效的 EP 通信,MoE 模型多卡并行就会沦为集群卡顿灾难;

  • FlashMLA:专为稀疏注意力机制设计的加速库;

  • TileKernels:集成了大模型训练和推理中最频繁调用的通用高频算子;

  • DeepSelect:负责高效数据筛选。

这一套全家桶组合拳打下来,基本上把大模型底层所需的计算、通信、存储调度链条全部给补齐了。

DeepGEMM

4. 华为 Ascend 950 与 128 卡超节点:集群并行的硬核突破

更值得细细品味的是,在官方披露的细节中,明确提到了 DeepSeek 已经与华为团队深度合作,针对基于 Ascend 950 芯片的 128 卡超节点方案进行了计算与通信的全面联合优化。

很多人可能对集群卡数没有直观的概念。在分布式训练中,单卡性能强不强只决定下限,上百张甚至上万张卡合在一起时通信损耗大不大,才决定上限。

如果把单张芯片比作一个天才,128 张芯片放在一起,极易出现因为组网延迟、数据传输阻塞而导致的集群等数据开会现象。最后 128 张卡的整体效率可能还不如 30 张卡。

而

DeepSeek 与华为在 Ascend 950 上的 128 卡超节点优化,直接打通了超大节点内部的互联脉络,让 128

张芯片如同同一个超级大脑般高效运转。这也印证了一个趋势:国产芯片不再是单打独斗的试水,而是具备了支撑顶级大模型大集群实战的硬核底气。

5. 免费的基建工程队:打破生态垄断的终极答案

科技史上很多伟大的变革,往往不是由垄断者的宣示发起的,而是由打破规则的叛逆者推动的。

过去国产算力生态面临的最大死循环就是:因为没有好用的软件栈,所以大家不用国产卡;因为没人用国产卡,所以软件栈始终没人去打磨。

现在,DeepSeek 扮演了那个最不讲道理的基建狂魔。

他们拿着自己在全球顶级竞争中实战验证过的全套底层武器,不仅自己踩完了所有的坑,还在极短时间内把坑填平、铺上了双向十六车道的柏油路,最后顺便把收费站给拆了,向全行业免费开源。

对于广大的国内开发者和企业来说,这意味着大家终于有机会摆脱对单一硬件生态的深度捆绑;对于国产芯片厂商来说,更是得到了一份千金难买的顶级软件实战补丁。

当真正打过超级硬仗的 AI 团队开始把兵工厂里的瑞士军刀和重型火炮直接摆在公桌上,那个依靠软件垄断高墙躺着收税的时代,可能真的要变天了。

100%(1) 0.00%(0) 0.00%(0)
当前新闻共有1条评论
  和华为搞在一起有前途  /无内容 - eachus 10/01/26 (2)
笔  名 (必选项):
密  码 (必选项):
注册新用户
标  题 (必选项):
内  容 (选填项):