DLSS 5 混合精度 Mod 实测:RTX 50 神经渲染耗时仅降 1% 至 2%
开发者将 FP8 与 NVFP4 混合精度用于 DLSS 5 神经渲染模型,在 RTX 50 系列上测试,4K 分辨率下神经渲染阶段耗时仅降低约 1% 至 2%,开发者称 Blackwell 架构改进非常有限。
英伟达 DLSS 5 神经渲染 DLL 文件流出后,围绕其推理效率的民间调试迅速展开。部分 Mod 开发者试图通过降低模型推理成本来换取游戏性能,其中一种思路是将低精度数据格式引入 DLSS 5 的计算流程。
据 X 用户 SwurvGaming 分享的信息,有开发者把 FP8 与 NVFP4 混合精度方案应用于 DLSS 5 神经渲染模型,并在 RTX 50 系列显卡上运行。测试结果显示,在 4K 分辨率下,该方案仅将神经渲染阶段的耗时压低约 1% 至 2%,开发者直言其在 Blackwell 架构上的改进“非常有限”。
这一尝试的技术背景在于,英伟达 Blackwell 架构的第五代 Tensor Core 原生支持 NVFP4。开发者据此将部分 DLSS 5 计算从 FP8 切换至 NVFP4,希望借助低精度格式降低推理开销。NVFP4 是英伟达面向神经网络推理推出的数据格式,相比 FP8 可减少内存需求,并利用 Blackwell Tensor Core 的原生加速能力。
需要明确的是,1% 至 2% 的降幅仅对应 DLSS 5 神经渲染阶段的耗时变化,并不等同于整款游戏的帧率提升。该实验由 OptiScaler-DLSSNR-PreSR-Multipass 项目引入,相关更新出现在 0.7.1 版本。项目发布说明同时指出,不支持的模型形状仍会回退至 FP8,因此混合精度方案无法覆盖全部计算过程。