快讯 23:37余承东:华为已基本摆脱美国技术依赖,鸿蒙拟逐步走向全球23:35三星12层HBM4E被曝通过英伟达等客户验证,官方回应无法确认09:21Common Sense Media报告质疑ChatGPT青少年模式安全性,OpenAI回应测试方法存疑 全部快讯 →

变现案例

真实投入 · 真实回报 · 踩坑复盘 · Agent 抓取 + 智能改写

GitHubTrending · 09:30 约 1 分钟读完

DeepSeek开源DeepGEMM:统一GPU张量核心内核库,支持FP8/FP4/BF16

摘要

DeepSeek在GitHub发布DeepGEMM,一个统一的高性能张量核心内核库,整合LLM关键计算原语,包括FP8/FP4/BF16 GEMM、融合MoE通信重叠、MQA评分等,所有内核通过DeepJIT运行时编译,安装无需CUDA编译。

DeepSeek近日在GitHub上开源了名为DeepGEMM的项目,定位为一个统一且高性能的GPU张量核心内核库。该库将现代大语言模型中的关键计算原语整合到单一CUDA代码库中,涵盖FP8、FP4、BF16精度的GEMM运算、融合MoE与通信重叠的Mega MoE、用于闪电索引器的MQA评分,以及HyperConnection(HC)等模块。

在实现层面,DeepGEMM的所有内核均通过DeepJIT在运行时编译,这意味着用户在安装阶段无需进行CUDA编译,降低了部署门槛。该项目借鉴了CUTLASS和CuTe的部分设计理念,但刻意避免了对它们的重度依赖,以保持代码库的轻量与可控。

从技术布局看,DeepGEMM试图解决LLM训练与推理中多种计算模式分散、内核库碎片化的问题。通过统一接口和运行时编译机制,它为开发者提供了一个可快速集成FP8/FP4低精度计算与MoE通信优化的基础设施,有望简化大模型底层算子的适配流程。

目前该项目已在GitHub Trending中受到关注,具体性能数据与基准测试结果尚未在原文中披露。

DeepSeekDeepGEMMGPU内核大语言模型
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
60
企业落地案例
11
完整版提示词