如果你关注中国 AI 芯片赛道,昨天是标志性的一天。
2026 年 9 月 30 日,DeepSeek 联合华为宣布开源一套完整的 Ascend 加速器编程工具链。这不是又一个「基于 CUDA 的适配层」——这是一套从语言到运行时全部从头为华为昇腾芯片编写的软件栈,直接对标 NVIDIA 统治了 AI 行业近二十年的 CUDA 生态。
消息由 Bloomberg 率先报道,随后多家媒体确认。核心产品是 TileLang——DeepSeek 自称的「更高级编程语言」,被定位为 CUDA 的直接替代品。但 TileLang 只是拼图的一块,整个 release 包含了六个模块:DeepGEMM(矩阵运算)、DeepEP(芯片间通信)、TileKernels(标准向量计算)、FlashMLA(长上下文注意力优化)、以及 DeepSelect(数据过滤)。它们完整镜像了 DeepSeek 已经在 NVIDIA GPU 上跑通的全套工具链,只是这次——全部为华为硅片重写。
换句话说,DeepSeek 把自己训练旗舰模型的全部软件能力,移植到了中国能自主生产的芯片上,然后直接开源了。
为什么不是「又一套适配层」
CUDA 真正的护城河不是技术复杂度,而是迁移成本。切换到非 NVIDIA 芯片意味着数月重写代码、重新调试性能、重新验证精度——这不是一个小团队能承担的风险。过去几年里,「兼容 CUDA」的尝试(AMD ROCm、Intel oneAPI)都因为「兼容」而非「原生」的设计哲学,在性能和开发体验上始终差一步。
DeepSeek 的做法完全不同:不为兼容而适配,为新一代芯片原生编写。
TileLang 的定位是「高级语言」,意思是开发者用比 CUDA 更简洁的语法写 kernel,编译器负责优化到 Ascend 硬件上。DeepSeek 声称 TileLang 已经在 V4 系列模型的训练中验证了几乎所有算子——这意味着一家顶级 AI 实验室用自己的旗舰模型证明了这套工具的可行性。
同时,DeepSeek 的 PyTorch 库增加了从 CUDA 代码到 CUNN(华为的底层接口)的自动转换能力。这虽然不一定能达到原生性能,但它把「迁移」从半年的工程任务变成了「先跑起来再优化」的渐进过程。
性能到底差多少
根据 DeepSeek 在 Tom’s Hardware 上披露的数据,华为 Ascend 910C 目前的推理性能约为 NVIDIA H100 的 60%。这个数字经过手动优化的 CUNN kernel 后还可以提升。
但别忘了关键背景:H100 已经是两年前的架构了。NVIDIA 当前主力是 Blackwell 和 Vera Rubin,而华为 Ascend 910C 在完全没有 NVIDIA 等效软件生态支持的情况下,逼近了 H100——这条曲线的斜率本身就在说明问题。
更重要的是,DeepSeek 和华为正在联合开发一个 128 颗 Ascend 950 互联的 Supernode 架构。当 128 颗芯片组成一个计算单元时,芯片间通信效率往往比单芯片性能更关键——这正是 DeepEP 模块解决的核心问题。
| 维度 | NVIDIA H100 | Huawei Ascend 910C |
|---|---|---|
| 推理性能(相对值) | 100% | ~60% |
| 软件生态 | CUDA(20年积累) | TileLang + CUNN(开源刚起步) |
| 出口管制风险 | H20 受限,H100 不可对中国销售 | 国产可控 |
| 互联方案 | NVLink(成熟) | DeepEP + 128-chip Supernode(开发中) |
| 可用性 | 需美国政府批准 | 国内直接采购 |
商业信号:三巨头集体下单
DeepSeek V4(1.6 万亿参数)在 2026 年 4 月发布时做了一件微妙的事:它把早期访问权优先给了中国芯片厂商,而非 NVIDIA 或 AMD。据 DeepLearning.AI 和 Capacity 的报道,ByteDance、腾讯、阿里巴巴在确认 DeepSeek 旗舰模型能在国产芯片上跑通后,迅速向华为锁定了 Ascend 950 的大规模订单。
这组信号的意义在于:芯片采购不再是「信仰判断」,而是「验证后的事实」。 一个能做 1.6T 参数模型训练推理的软件栈,改变了中国 AI 公司从「想不想买国产芯片」到「能不能不买」的决策逻辑。
Bloomberg Intelligence 的数据印证了趋势:NVIDIA 在中国市场的份额已被华为 Ascend 挤压到个位数区间。H20 芯片(专为符合美国出口规则而阉割的版本)又遭遇了额外的许可问题——每进一步收紧,就给中国 AI 生态多一个理由构建不依赖美国许可的完整堆栈。
更大的棋:出口管制加速独立
这是整件事最讽刺也最值得关注的地方。
美国出口管制的初衷很清楚:限制中国获取先进芯片,遏制其 AI 发展。2022 年的 A100 禁令、2023 年的 H100 禁令、2024 年的 H20 许可限制——层层加码。但 DeepSeek 的开源行动给出了一个清晰的反问:如果制裁只是加速了中国自建替代方案的速度,代价是什么?
NVIDIA 中国业务本就因 H20 限制变得微薄。但芯片出口禁令针对的是硬件——你可以限制一颗芯片进入哪个市场。而开源代码一旦被释放,你无法把它收回。DeepSeek 在 9 月 30 日把整套工具链放到了 GitHub 上,任何人、任何公司、任何国家都可以免费下载、修改、优化。
制裁可以限制芯片,但限制不了开源代码。
DeepSeek 的 CTO 梁文锋在内部曾说过一段话(经 DeepLearning.AI 引用):「我们不是在做中国版的 CUDA。CUDA 的问题在于它让你只能在 NVIDIA 上跑。我们想解决的问题是:你的模型应该能在任何硬件上跑——这不是一个商业问题,这是一个技术信仰问题。」
写在最后
DeepSeek + Huawei 的开源工具链不是第一个、也不会是最后一个挑战 CUDA 垄断的尝试。但它的独特之处在于:它不是从外部攻进来的,而是从内部长出来的——它已经被世界顶级模型 V4 验证过,它的创造者有足够的工程底气说「我们不需要兼容」。
接下来真正值得关注的是:TileLang 能在多大程度上被中国 AI 生态以外的开发者采用。 ByteDance、阿里、腾讯的订单是一个信号,但中小型 AI 实验室、以及非中国的开发团队,才是决定「反 CUDA」运动能否全球蔓延的关键指标。
你可以限制一颗芯片的出口。但你限制不了一行能被任何人下载的代码。
在 AI 基础设施的博弈里,开源是最不讲政治的——也是最不讲情面的。
延伸阅读:《豪掷 $530 亿!阿里发布最强 AI 芯片 Zhenwu V900》 — 国产 AI 芯片的另一条战线