图片

2026 年 4 月 24 日,DeepSeek V4 系列模型正式发布并同步开源。作为新一代面向 Agent 与 Coding 场景 深度优化的大模型,DeepSeek V4-Pro 与 DeepSeek V4-Flash 在能力与工程可用性上实现了跨越式升级,模型上下文处理长度由原有的 128K 显著扩展至 1M,首次增加了 KV Cache 滑窗和压缩算法,大幅减少 Attention 计算和访存开销。

与此同时,昇腾超节点完成全栈适配,AtomGit 平台首发代码仓库与实践方案,第一时间向开发者开放。

DeepSeek V4:从能力提升,到工程可用

过去一年,大模型的竞争焦点一直集中在“更强能力”。而 DeepSeek V4 的关键变化在于不仅更强,而且更可落地。根据官方的介绍,此次 DeepSeek-V4 在 Agent 能力、世界知识和推理性能上均实现国内与开源领域的领先。

图片

图片

昇腾超节点:把“能跑”变成“跑得极致”

昇腾一直同步支持 DeepSeek 系列模型,本次通过双方芯模技术紧密协同,实现昇腾超节点全系列产品支持 DeepSeek V4 系列模型。昇腾 950 通过融合 kernel 和多流并行技术降低 Attention 计算和访存开销,大幅提升推理性能,结合多种量化算法,实现了高吞吐、低时延的 DeepSeek V4 模型推理部署。昇腾 A3 超节点系列产品也全面适配,同时为便于用户快速微调,提供了基于昇腾 A3 集群的训练参考实现。

昇腾 950:重新定义长文本推理性能

实现 DeepSeek V4-Pro 20ms 和 DeepSeek V4-Flash 10ms 低时延推理

基于 DeepSeek V4-Pro 模型,在 8K 输入场景,昇腾 950 超节点可实现 TPOT 约 20ms 时单卡 Decode  吞吐 4700TPS。DeepSeek V4-Flash 模型,8K 长序列输入场景下可实现 TPOT 约 10ms 时单卡 Decode 吞吐 1600TPS(注:上述 Benchmark 数据均基于 Offine 推理模式采集,不包含 Serving 调度和框架负载均衡影响)。极低时延的实现源于昇腾 950 代际底层架构的三大升级:

  • 原生精度加速: 全面支持 FP8 、MXFP8、MXFP4 等数据格式,在保证模型精度的同时,可实现内存占用降低 50%+,计算能力翻倍。

  • 稀疏访存优化: 针对 MoE 模型的离散访存特征,通过大幅提升硬件级稀疏访存能力,有效解决了专家路由过程中的带宽瓶颈。

  • Vector 与 Cube 共享 Memory: 创新的存储架构设计,实现了向量单元(Vector)与矩阵单元(Cube)的 Memory 共享,消除了大量片上数据搬运开销,极大地降低了端到端推理时延。

除了底层架构的升级,昇腾 950 超节点从基础器件、协议算法到光电互联,实现了系统级的创新突破,支持用户以 64 卡为步长按需扩展,可实现 8192 卡无收敛全互联,提供业界最大 Scale Up 能力。

同时基于昇腾超节点架构,进一步大幅提升延迟和吞吐,同时实现低成本,且兼顾万卡级别的 Scale out 集群规模。解决了长序列 4K 到 1M 序列长度范围内都有低延迟和高吞吐。此架构支持基于 NAND SSU 的超低成本、超大容量、高性能 KV cache 有效支撑支持长序列应用。

昇腾 A3 超节点:规模化推理的现实解

A3 超节点系列产品,实现 DeepSeek V4-Flash 模型单卡 Decode 吞吐 2000+ TPS

Atlas 900 A3 SuperPoD 液冷超节点及 Atlas 800 A3 风冷超节点采用平等架构、全局内存统一编址、点对点互联带宽达 784GB/s。提供 32 到 384 多种规格满足不同业务需求,昇腾超节点是国内唯一成熟规模商用的超节点产品,满足互联网、运营商、金融等行业对大模型推理超高吞吐、超大并发的极致性能需求。

基于昇腾 A3 64 卡超节点结合大 EP 模式部署,DeepSeek v4-Flash 模型,8K/1K 输入输出场景,基于 vLLM 推理引擎可实现 2000+ TPS 的单卡 Decode 吞吐,单卡吞吐持续提升。针对 DeepSeek V4-Pro 模型,昇腾 A3 同步支持推理部署,性能持续优化中。

训练侧同步突破:不是 Demo,是可复现工程

昇腾同步支持并开源 DeepSeek V4 复杂 Sparse Attention + mHC 架构续训练参考实现,TorchTitan-NPU 携手 Autofuse,助力训练轻松入图、开箱即优

昇腾 CANN 基于 A3 64 卡超节点正式完成 DeepSeek V4-Flash 模型续训练(CPT)的 0-day 适配支持。通过 TorchTitan-NPU 插件与 Autofuse 自动融合技术的深度协同,实测模型吞吐量最高达到 1100 tokens/p/s,实现模型训练性能开箱即优。而这一亮眼的开箱表现,主要源自以下三大维度的硬核系统级优化:

  • 极简分布式并行架构: 突破传统复杂的混合并行设计,采用超节点亲和的大 EP + 纯 FSDP 的极简并行切分策略,以极低适配成本和通信开销达成内存占用最优,实现易用性与性能的较好均衡

  • 原生“入图”与自动融合:TorchTitan-NPU 深度适配 torch.compile 机制,使能训练入图技术,依托 Inductor + AutoFuse(基于 Ascend C 的 Codegen 后端)实现端到端的 Vector 算子自动融合,为整网带来高达 31.8% 的开箱即用性能收益

  • 稀疏 Attention 高效融合算子: 针对稀疏注意力等复杂结构,开发 SparseAttnSharedkv、LightningIndexer 等多个高效的 NPU 融合算子,从负载均衡分核计算、内存与计算均衡等维度协同优化,充分释放芯片稀疏算力

开发范式升级:PyPTO + TileLang 开源

为了解决自定义算子开发门槛高、周期长的痛点,昇腾CANN 推出了 PyPTO 编程范式。PyPTO 提供完善的 Python API,使开发者能够以符合 Python 习惯的语法进行算子开发。

  • 高效的算子开发:PyPTO 依托内置高级编译优化,可自动完成流水编排与内存管理,使开发者无需关注硬件细节而专注于计算流表达,实现 DeepSeek V4 新一代模型算子开发周期可缩短至天级。

  • 高性能Kernel自动生成:针对 Attention、Compressor、mHC 等复杂逻辑算子,PyPTO 可自动生成高度优化的 Kernel,避免开发者手动处理繁琐的同步与数据搬运,显著缩短从算法验证到部署落地的开发周期。

  • PTO ISA 虚拟指令集跨代兼容:PyPTO 基于 PTO 虚拟指令集(PTO ISA),实现了对硬件新特性的“零感适配”,针对不同代际芯片统一指令接口,实现了同一套算子代码,在不同代际芯片上的兼容实现。借助毕昇编译器的 VF(Vector Fusion) 自动融合能力,可在 micro kernel 级别实现更优融合。

  • TileLang 社区生态:TileLang-Ascend 是 TileLang 针对华为昇腾平台深度优化的实现,分别对应 Tilelang-Ascend 的 Expert 和 Developer 开发模式,提供 AscendC 基础指令和 PTO AS 两种对接层次,为各种编程前端语言和编译器提供多层开放接口。DeepSeek V4 模型相关实现已在 TileAI 开源社区正式发布,后续将持续推进性能优化与功能迭代。

昇腾A2、A3及950全系列产品适配DeepSeek v4-Flash、DeepSeek v4-Pro。

AtomGit 首发:让开发者真正用起来

作为本次 DeepSeek V4 昇腾适配的首发平台,AtomGit 已同步上线完整实践体系:

  • 模型推理优化方案

  • Ascend C 融合算子实现

  • TorchTitan-NPU 训练实践

围绕 DeepSeek V4 × 昇腾 × AtomGit,我们在今日 16:00 带来主题直播,看大模型,如何真正进入生产环境?

💬 AtomGit互动讨论区

https://atomgit.com/org/cann/discussions/85

相关资源

  • DeepSeek V4 模型推理优化实践:https://atomgit.com/cann/cann-recipes-infer/tree/master/docs/models/deepseek-v4/deepseek_v4_inference_guide.md

  • DeepSeek-V4 Ascend C 融合算子优化:https://atomgit.com/cann/cann-recipes-infer/tree/master/docs/models/deepseek-v4/deepseek_v4_ascendc_operator_guide.md

  • 基于CANN平台的TorchTitan-NPU + AutoFuse 极简训练优化实践:https://atomgit.com/cann/cann-recipes-train/blob/master/docs/llm_pretrain/deepseek-v4_torchtitan_npu_autofuse.md

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐