2026 年 9 月 30 日,DeepSeek 在 GitHub 上公开 deepseek-ai/DeepGEMM-Ascend 仓库,README 的 News 段标注 2026.09.30 首发、支持 Ascend 950 设备;同日 FlashMLA 合并了标题为 Ascend 950 开源版本的 PR,新增昇腾 NPU 的稀疏注意力 prefill 与解码内核,支持范围收窄到 DeepSeek-V4.1。
DeepSeek 把内核栈开源到昇腾:DeepGEMM-Ascend 首发,FlashMLA 新增 Ascend 950 支持
这次发布的是什么
2026 年 9 月 30 日,DeepSeek 在 GitHub 上公开了两个面向华为昇腾平台的底层内核动作。
其一是新仓库 deepseek-ai/DeepGEMM-Ascend,即矩阵乘法库 DeepGEMM 的昇腾版本。仓库 README 的 News 段写明「2026.09.30: Initial release of DeepGEMM Ascend, with support for Ascend 950 devices」,许可为 MIT。官方描述它是 DeepGEMM 在昇腾平台上的移植,与 DeepGEMM 完全 API 兼容,支持 BF16、FP8、FP4 GEMM、MQA logits 与 MegaMoE 算子,且沿用同一个包名,用户安装后可以直接复用其他平台上 DeepGEMM 的调用方式。
其二是 FlashMLA 仓库合并了标题为「Open-source release for Ascend 950 (2026.09.30)」的 PR,合并时间 2026-09-30。PR 说明里写明新增华为昇腾 NPU 的稀疏注意力 prefill 与解码内核,并同时收窄了支持范围。
影响谁:在昇腾硬件上做大模型训练与推理的底层工程团队。这不是面向普通用户的功能更新,而是把原本绑定在英伟达生态上的算子层搬到了另一套加速器上。
可用性与限制
- 硬件前提:DeepGEMM-Ascend 要求华为昇腾 NPU,官方 README 写明在 Ascend 950 系列上开发与验证;其他昇腾型号的可用性请以仓库说明为准。
- 软件前提:官方 README 列出的依赖包括 CANN 9.20 toolkit(提供 bisheng 与 ld.lld)、torch_npu、Python 3.10 及以上、支持 C++20 format 的编译器与标准库,以及被声明为包依赖的 tilelang。
- FlashMLA 的支持范围:PR 说明写为 sm_100a / sm_103a 与 Ascend 950(dav-3510),仅支持 DeepSeek-V4.1,并使用 fp8 与 fp4 两种 KV-cache 布局。
- 需要留意的破坏性变更:同一份 PR 说明写明移除了对英伟达 Hopper 架构 GPU 的支持,也移除了对 DeepSeek V3 / V3.2 / V4.0 模型的支持。正在用旧版本的人升级前要看清这一点。
- 数据格式差异:官方 README 注明昇腾上的 scaling factor 格式与英伟达不同——K 维上每对 UE8M0 缩放因子被打包成一个 int16,并以 MN-major 顺序存储。
- 性能数字:官方 README 给出了在 Ascend 950DT(CANN 9.20)上的实测表格,本文不转述具体数值,请以仓库 README 与 tests 目录的复现方式为准。
主要功能
- 在昇腾 NPU 上跑 BF16、FP8、FP4 三种精度的 GEMM
- 提供 MQA logits 与 MegaMoE 相关算子
- 复用 DeepGEMM 的 API 与包名,降低迁移成本
- 为昇腾平台新增稀疏注意力的 prefill 与解码内核
- 通过 set_num_sms 之类的工具函数控制可用的 AI 核数量
- 用 DG_JIT 系列环境变量控制编译缓存与调试输出
技术原理
据官方 README 的说明,DeepGEMM-Ascend 对昇腾平台的矩阵乘加原语(MAD)做了一层轻量抽象,把分形矩阵布局、对齐约束、地址计算和参数转换这些细节隐藏起来,使 GEMM kernel 的实现能保持简洁。它使用了昇腾平台特有的优化手段,包括稀疏数据加载和基于协程的流水线,目标是逼近硬件的性能上限。
FlashMLA 这一侧,PR 说明提到 KV cache 改为 token-interleaved 布局,即每个 token 的量化原始数据后面紧跟它的 scale,而不再是「先存全部原始数据、再存全部 scale」的排布。这是一次内存布局的改动,配合新增的昇腾稀疏注意力内核使用。
值得强调的是这是内核与算子层的移植,不是模型权重的发布:它解决的是「能不能在这套硬件上高效算」,而不是「能不能拿到一个能直接对话的模型」。
实际体验
想确认这套代码是否能在自己的环境里跑起来,可以按官方 README 给出的路径做一次最小验证,步骤是可复现的:
第一步,确认环境满足官方列出的前提:Ascend 950 系列硬件、CANN 9.20 toolkit、torch_npu、Python 3.10 及以上,以及支持 C++20 format 的编译器。任何一项不满足都会卡在编译阶段。
第二步,按 README 的方式克隆仓库(需要带子模块),执行仓库里的构建脚本,再用 pip install 安装,注意官方给出的安装方式是不带构建隔离的。
第三步,用仓库 tests 目录里的用例做正确性校验,而不是只看性能表。官方 README 提供了 aclnn 系列的参考 GEMM 用来交叉核对结果,这是判断自编译内核是否算对的现成工具。
没有昇腾硬件的话,这一层无法验证,只能读代码与文档。
项目地址与获取方式
两个仓库都在 GitHub 的 deepseek-ai 组织下:DeepGEMM-Ascend 用于昇腾平台的 GEMM 算子,FlashMLA 用于注意力内核(本次昇腾支持在标题含 Ascend 950 的合并请求中)。安装方式以各自 README 为准,克隆 DeepGEMM-Ascend 时需要带子模块。请通过官方仓库获取,避免安装被篡改的版本。
适合谁用
- 在昇腾硬件上做大模型训练或推理、需要自己调算子性能的工程团队
- 研究 GEMM 与注意力内核实现、需要一份昇腾平台优化参考的开发者
- 评估异构算力迁移成本、想先看公开代码再决策的架构负责人
不必用的情况:只调用模型 API 做应用开发、不接触算子层的开发者,这次发布对日常工作没有直接影响;手上是英伟达 Hopper 架构 GPU 且用 DeepSeek V3 / V3.2 / V4.0 的用户,反而会因为本次支持范围收窄而需要先确认版本。
常见问题
这次开源的是模型还是算子?
是底层算子与内核库,不是模型权重。DeepGEMM-Ascend 提供矩阵乘法相关的算子,FlashMLA 提供注意力相关的内核。想直接拿到可用模型的人,这里的产物对不上需求。
DeepGEMM-Ascend 和原来的 DeepGEMM 是什么关系?
官方 README 写明它是 DeepGEMM 在昇腾平台上的移植,与 DeepGEMM 完全 API 兼容,并沿用同一个包名。按官方说法,用户在昇腾平台上安装这个包后,可以沿用其他平台上 DeepGEMM 的 API 与开发流程。
这次更新会让我原来的环境跑不起来吗?
FlashMLA 的这份合并请求说明里明确写了两项移除:不再支持英伟达 Hopper 架构 GPU,不再支持 DeepSeek V3 / V3.2 / V4.0 模型。如果你的环境落在这两项范围内,升级前需要先确认版本,不要直接拉取新版。
性能数字能直接对照英伟达平台看吗?
不能简单对照。官方 README 的性能表是在 Ascend 950DT 配合 CANN 9.20 上用仓库自带工具测的,测试形状与用例沿用 DeepGEMM 的测试集。跨硬件的横向比较需要自己搭统一的测试方法,本文不转述具体数值。
有没有许可上的限制?
DeepGEMM-Ascend 仓库标注的许可为 MIT,属于宽松许可。但依赖链上的 CANN toolkit、torch_npu 等组件各有自己的条款,商用前请以各自官方说明为准。
相关工具与内容
- /category/code — AI 编程工具分类,算子与内核开发属于这一类的工作流
- /category/other — 其他 AI 工具分类,底层基础设施类内容归在此处
- /tool/deepseek — DeepSeek 官方产品入口,可对照看模型侧的能力
- /tool/lingma — 阿里云的通义灵码,面向代码场景的辅助工具
- /tool/comate — 百度文心快码,代码辅助工具
- /article/deepseek-review-2026 — 若你想先看模型侧的评测,可参考这篇
相关内容
Cohere 发布 Embed 5:Pro 与 Fast 共享同一个向量空间,索引和查询可以分开选
Cohere 于 2026 年 9 月 30 日发布 Embed 5 嵌入模型家族,含 Pro 与 Fast 两档,模型名为 embed-v5.0-pro 与 embed-v5.0-fast。两档共享同一个嵌入空间,可用 Pro 建索引、用 Fast 承接在线查询而无需重建向量库。支持文本与图像输入、100 多种语言、128K token 上下文与多档输出维度。
Manus Flex 上线:自带推理服务商的 API 密钥,模型你自己选,智能体它来跑
Manus 于 2026 年 9 月 29 日发布官方博客,推出 Manus Flex 模块:用户可在 Manus 工作区接入受支持推理服务商的自有 API 密钥,模型推理由该服务商直接计费,Manus 继续负责规划、工具与执行环境。首批推理合作伙伴为 OpenRouter、Fireworks 与 Modal。
Transformers v5.18.0 发布:新增说话人日志与多模态推理模型,附数项破坏性变更
Hugging Face 于 2026 年 9 月 30 日发布 Transformers v5.18.0(非预发布)。本版新增四个模型支持:NVIDIA 的 Nemotron 3 Diarization 说话人日志模型与 NemotronH Omni 多模态推理模型、NAVER 的 HyperCLOVAX Vision V2 视觉语言模型,以及 GTE 文本表示模型;同时包含数项破坏性变更。