DeepSeek 把内核栈开源到昇腾:DeepGEMM-Ascend 首发,FlashMLA 新增 Ascend 950 支持

2026 年 9 月 30 日,DeepSeek 在 GitHub 上公开 deepseek-ai/DeepGEMM-Ascend 仓库,README 的 News 段标注 2026.09.30 首发、支持 Ascend 950 设备;同日 FlashMLA 合并了标题为 Ascend 950 开源版本的 PR,新增昇腾 NPU 的稀疏注意力 prefill 与解码内核,支持范围收窄到 DeepSeek-V4.1。

这次发布的是什么

2026 年 9 月 30 日,DeepSeek 在 GitHub 上公开了两个面向华为昇腾平台的底层内核动作。

其一是新仓库 deepseek-ai/DeepGEMM-Ascend,即矩阵乘法库 DeepGEMM 的昇腾版本。仓库 README 的 News 段写明「2026.09.30: Initial release of DeepGEMM Ascend, with support for Ascend 950 devices」,许可为 MIT。官方描述它是 DeepGEMM 在昇腾平台上的移植,与 DeepGEMM 完全 API 兼容,支持 BF16、FP8、FP4 GEMM、MQA logits 与 MegaMoE 算子,且沿用同一个包名,用户安装后可以直接复用其他平台上 DeepGEMM 的调用方式。

其二是 FlashMLA 仓库合并了标题为「Open-source release for Ascend 950 (2026.09.30)」的 PR,合并时间 2026-09-30。PR 说明里写明新增华为昇腾 NPU 的稀疏注意力 prefill 与解码内核,并同时收窄了支持范围。

影响谁:在昇腾硬件上做大模型训练与推理的底层工程团队。这不是面向普通用户的功能更新,而是把原本绑定在英伟达生态上的算子层搬到了另一套加速器上。

可用性与限制

  • 硬件前提:DeepGEMM-Ascend 要求华为昇腾 NPU,官方 README 写明在 Ascend 950 系列上开发与验证;其他昇腾型号的可用性请以仓库说明为准。
  • 软件前提:官方 README 列出的依赖包括 CANN 9.20 toolkit(提供 bisheng 与 ld.lld)、torch_npu、Python 3.10 及以上、支持 C++20 format 的编译器与标准库,以及被声明为包依赖的 tilelang。
  • FlashMLA 的支持范围:PR 说明写为 sm_100a / sm_103a 与 Ascend 950(dav-3510),仅支持 DeepSeek-V4.1,并使用 fp8 与 fp4 两种 KV-cache 布局。
  • 需要留意的破坏性变更:同一份 PR 说明写明移除了对英伟达 Hopper 架构 GPU 的支持,也移除了对 DeepSeek V3 / V3.2 / V4.0 模型的支持。正在用旧版本的人升级前要看清这一点。
  • 数据格式差异:官方 README 注明昇腾上的 scaling factor 格式与英伟达不同——K 维上每对 UE8M0 缩放因子被打包成一个 int16,并以 MN-major 顺序存储。
  • 性能数字:官方 README 给出了在 Ascend 950DT(CANN 9.20)上的实测表格,本文不转述具体数值,请以仓库 README 与 tests 目录的复现方式为准。

主要功能

  • 在昇腾 NPU 上跑 BF16、FP8、FP4 三种精度的 GEMM
  • 提供 MQA logits 与 MegaMoE 相关算子
  • 复用 DeepGEMM 的 API 与包名,降低迁移成本
  • 为昇腾平台新增稀疏注意力的 prefill 与解码内核
  • 通过 set_num_sms 之类的工具函数控制可用的 AI 核数量
  • 用 DG_JIT 系列环境变量控制编译缓存与调试输出

技术原理

据官方 README 的说明,DeepGEMM-Ascend 对昇腾平台的矩阵乘加原语(MAD)做了一层轻量抽象,把分形矩阵布局、对齐约束、地址计算和参数转换这些细节隐藏起来,使 GEMM kernel 的实现能保持简洁。它使用了昇腾平台特有的优化手段,包括稀疏数据加载和基于协程的流水线,目标是逼近硬件的性能上限。

FlashMLA 这一侧,PR 说明提到 KV cache 改为 token-interleaved 布局,即每个 token 的量化原始数据后面紧跟它的 scale,而不再是「先存全部原始数据、再存全部 scale」的排布。这是一次内存布局的改动,配合新增的昇腾稀疏注意力内核使用。

值得强调的是这是内核与算子层的移植,不是模型权重的发布:它解决的是「能不能在这套硬件上高效算」,而不是「能不能拿到一个能直接对话的模型」。

实际体验

想确认这套代码是否能在自己的环境里跑起来,可以按官方 README 给出的路径做一次最小验证,步骤是可复现的:

第一步,确认环境满足官方列出的前提:Ascend 950 系列硬件、CANN 9.20 toolkit、torch_npu、Python 3.10 及以上,以及支持 C++20 format 的编译器。任何一项不满足都会卡在编译阶段。

第二步,按 README 的方式克隆仓库(需要带子模块),执行仓库里的构建脚本,再用 pip install 安装,注意官方给出的安装方式是不带构建隔离的。

第三步,用仓库 tests 目录里的用例做正确性校验,而不是只看性能表。官方 README 提供了 aclnn 系列的参考 GEMM 用来交叉核对结果,这是判断自编译内核是否算对的现成工具。

没有昇腾硬件的话,这一层无法验证,只能读代码与文档。

项目地址与获取方式

两个仓库都在 GitHub 的 deepseek-ai 组织下:DeepGEMM-Ascend 用于昇腾平台的 GEMM 算子,FlashMLA 用于注意力内核(本次昇腾支持在标题含 Ascend 950 的合并请求中)。安装方式以各自 README 为准,克隆 DeepGEMM-Ascend 时需要带子模块。请通过官方仓库获取,避免安装被篡改的版本。

适合谁用

  • 在昇腾硬件上做大模型训练或推理、需要自己调算子性能的工程团队
  • 研究 GEMM 与注意力内核实现、需要一份昇腾平台优化参考的开发者
  • 评估异构算力迁移成本、想先看公开代码再决策的架构负责人

不必用的情况:只调用模型 API 做应用开发、不接触算子层的开发者,这次发布对日常工作没有直接影响;手上是英伟达 Hopper 架构 GPU 且用 DeepSeek V3 / V3.2 / V4.0 的用户,反而会因为本次支持范围收窄而需要先确认版本。

常见问题

这次开源的是模型还是算子?

是底层算子与内核库,不是模型权重。DeepGEMM-Ascend 提供矩阵乘法相关的算子,FlashMLA 提供注意力相关的内核。想直接拿到可用模型的人,这里的产物对不上需求。

DeepGEMM-Ascend 和原来的 DeepGEMM 是什么关系?

官方 README 写明它是 DeepGEMM 在昇腾平台上的移植,与 DeepGEMM 完全 API 兼容,并沿用同一个包名。按官方说法,用户在昇腾平台上安装这个包后,可以沿用其他平台上 DeepGEMM 的 API 与开发流程。

这次更新会让我原来的环境跑不起来吗?

FlashMLA 的这份合并请求说明里明确写了两项移除:不再支持英伟达 Hopper 架构 GPU,不再支持 DeepSeek V3 / V3.2 / V4.0 模型。如果你的环境落在这两项范围内,升级前需要先确认版本,不要直接拉取新版。

性能数字能直接对照英伟达平台看吗?

不能简单对照。官方 README 的性能表是在 Ascend 950DT 配合 CANN 9.20 上用仓库自带工具测的,测试形状与用例沿用 DeepGEMM 的测试集。跨硬件的横向比较需要自己搭统一的测试方法,本文不转述具体数值。

有没有许可上的限制?

DeepGEMM-Ascend 仓库标注的许可为 MIT,属于宽松许可。但依赖链上的 CANN toolkit、torch_npu 等组件各有自己的条款,商用前请以各自官方说明为准。

相关工具与内容

  • /category/code — AI 编程工具分类,算子与内核开发属于这一类的工作流
  • /category/other — 其他 AI 工具分类,底层基础设施类内容归在此处
  • /tool/deepseek — DeepSeek 官方产品入口,可对照看模型侧的能力
  • /tool/lingma — 阿里云的通义灵码,面向代码场景的辅助工具
  • /tool/comate — 百度文心快码,代码辅助工具
  • /article/deepseek-review-2026 — 若你想先看模型侧的评测,可参考这篇
Related
快讯 2 小时前

Cohere 发布 Embed 5:Pro 与 Fast 共享同一个向量空间,索引和查询可以分开选

Cohere 于 2026 年 9 月 30 日发布 Embed 5 嵌入模型家族,含 Pro 与 Fast 两档,模型名为 embed-v5.0-pro 与 embed-v5.0-fast。两档共享同一个嵌入空间,可用 Pro 建索引、用 Fast 承接在线查询而无需重建向量库。支持文本与图像输入、100 多种语言、128K token 上下文与多档输出维度。

前沿快讯 0 阅读
链接已复制