DeepSeek开源DeepGEMM:统一GPU张量核心内核库,支持FP8/FP4/BF16
摘要
DeepSeek在GitHub发布DeepGEMM,一个统一的高性能张量核心内核库,整合LLM关键计算原语,包括FP8/FP4/BF16 GEMM、融合MoE通信重叠、MQA评分等,所有内核通过DeepJIT运行时编译,安装无需CUDA编译。
DeepSeek近日在GitHub上开源了名为DeepGEMM的项目,定位为一个统一且高性能的GPU张量核心内核库。该库将现代大语言模型中的关键计算原语整合到单一CUDA代码库中,涵盖FP8、FP4、BF16精度的GEMM运算、融合MoE与通信重叠的Mega MoE、用于闪电索引器的MQA评分,以及HyperConnection(HC)等模块。
在实现层面,DeepGEMM的所有内核均通过DeepJIT在运行时编译,这意味着用户在安装阶段无需进行CUDA编译,降低了部署门槛。该项目借鉴了CUTLASS和CuTe的部分设计理念,但刻意避免了对它们的重度依赖,以保持代码库的轻量与可控。
从技术布局看,DeepGEMM试图解决LLM训练与推理中多种计算模式分散、内核库碎片化的问题。通过统一接口和运行时编译机制,它为开发者提供了一个可快速集成FP8/FP4低精度计算与MoE通信优化的基础设施,有望简化大模型底层算子的适配流程。
目前该项目已在GitHub Trending中受到关注,具体性能数据与基准测试结果尚未在原文中披露。
本文由新大陆基于公开信息编辑整理
信息来源:GitHubTrending GitHubTrending ↗