快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期六 · 09-12 10:28 约 1 分钟读完

DLSS 5 混合精度 Mod 实测:RTX 50 神经渲染耗时仅降 1% 至 2%

摘要

开发者将 FP8 与 NVFP4 混合精度用于 DLSS 5 神经渲染模型,在 RTX 50 系列上测试,4K 分辨率下神经渲染阶段耗时仅降低约 1% 至 2%,开发者称 Blackwell 架构改进非常有限。

英伟达 DLSS 5 神经渲染 DLL 文件流出后,围绕其推理效率的民间调试迅速展开。部分 Mod 开发者试图通过降低模型推理成本来换取游戏性能,其中一种思路是将低精度数据格式引入 DLSS 5 的计算流程。

据 X 用户 SwurvGaming 分享的信息,有开发者把 FP8 与 NVFP4 混合精度方案应用于 DLSS 5 神经渲染模型,并在 RTX 50 系列显卡上运行。测试结果显示,在 4K 分辨率下,该方案仅将神经渲染阶段的耗时压低约 1% 至 2%,开发者直言其在 Blackwell 架构上的改进“非常有限”。

这一尝试的技术背景在于,英伟达 Blackwell 架构的第五代 Tensor Core 原生支持 NVFP4。开发者据此将部分 DLSS 5 计算从 FP8 切换至 NVFP4,希望借助低精度格式降低推理开销。NVFP4 是英伟达面向神经网络推理推出的数据格式,相比 FP8 可减少内存需求,并利用 Blackwell Tensor Core 的原生加速能力。

需要明确的是,1% 至 2% 的降幅仅对应 DLSS 5 神经渲染阶段的耗时变化,并不等同于整款游戏的帧率提升。该实验由 OptiScaler-DLSSNR-PreSR-Multipass 项目引入,相关更新出现在 0.7.1 版本。项目发布说明同时指出,不支持的模型形状仍会回退至 FP8,因此混合精度方案无法覆盖全部计算过程。

英伟达DLSS 5RTX 50混合精度
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词