快讯 23:53Shopify 弃用 React Native,AI 智能体重写 Shop 应用回归原生开发23:45Hugging Face CEO 谈被 NVIDIA 收购:借力招人,以十年周期押注开源 AI23:30NVIDIA 开源表格基础模型 Kumo Tabular,四项基准测试登顶 全部快讯 →
实操专栏 新大陆研究院 约 3 分钟读完 素材来源 量子位

DeepSeek开源昇腾平台基础设施组件,覆盖算子库与通信库

9月30日,DeepSeek正式开源面向昇腾算力平台的基础设施组件,涵盖TileLang编译工具、高性能算子库及分布式通信库。DeepEP通信库实测Dispatch带宽达375 GB/s,昇腾超节点方案支持128卡3.2Tbps互联,为国产AI芯片软件生态提供新选择。

9月30日,DeepSeek宣布正式开源面向华为昇腾算力平台的基础设施组件。此次开源涵盖TileLang高级语言编译工具、高性能计算库与分布式通信库,与此前DeepSeek面向GPU平台开源的组件形成一一对应关系。这一动作被业内视为国产AI芯片软件生态建设的重要节点,为算力平台提供了GPU之外的新选项。

从具体发布内容看,DeepSeek此次开源了DeepGEMM、FlashMLA、TileKernel、DeepSelect等高性能昇腾算子库组件,以及DeepEP分布式通信库。在算子开发层面,昇腾提供Ascend C API接口,允许开发者对访存路径及计算流水线进行深度调优;同时依托PTO ISA底层指令体系,支撑了TileLang编程的开源工作。该生态兼顾手工调优与高级语言编译两种开发范式,适配不同技术背景的开发者。

在通信与组网方面,华为向DeepSeek团队提供了联合定义的昇腾超节点SuperPoD Flex和UBL128组网方案,可实现128卡3.2Tbps单层交换Scale-up网络和256K卡两层交换Scale-out网络,覆盖超低时延推理与前沿基座模型大规模训练两类需求。基于UBL128超节点,昇腾提供ASC-COMM高性能自定义通信编程库,DeepSeek团队据此开发了DeepEP通信库,涵盖EP、CP、PP、FSDP等模式下的通信算子。实测数据显示,其互联带宽达到Dispatch 375 GB/s、Combine 347 GB/s,接近硬件上限。

为推动开发者基于昇腾950及超节点集群部署DeepSeek模型,华为将联合创新成果在CANN社区开源,内容包括大EP低延时推理部署、单卡/单机部署、大规模训练、超长文本KVcache池化与Agentic RL。其中面向大规模推理场景,基于EP32部署策略,offline推理模式下DeepSeek-V4.1-Flash不带框架纯模型性能可实现TPOT=5ms时每卡输出吞吐2469 tokens/s,TPOT=10ms时每卡输出吞吐5102 tokens/s。上述Benchmark数据均基于Offline推理模式采集,不包含Serving调度和框架负载均衡影响,ContextLength为128K,Dspark投机接受率为0.85。

华为昇腾平台表示,后续将与DeepSeek等前沿模型团队持续深耕芯模协同,以AI算力底座承载模型能力,打通推理到训练的全链路,共同推进开放、高效、易用的AI软件生态建设。相关开源实践与技术报告已在CANN社区发布。

DeepSeek华为昇腾开源AI芯片
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
54
企业落地案例
8
完整版提示词