vLLM 集成 Gumbel-max 无失真水印,兼容投机解码保多样性
摘要
vLLM 宣布在 Model Runner v2 采样管线中支持基于 Gumbel-max 算法的无失真文本水印,通过 PR #54053、#56122、#56233 落地融合 GPU kernel、双键方案与上下文去重,可在兼容投机解码的同时保持输出多样性。
推理框架 vLLM 近日新增一项文本水印能力。该功能基于 Gumbel-max 算法实现,被定位为「无失真」,意味着在嵌入水印的同时不改变模型原本的输出分布。
从集成路径看,这一能力被直接接入 Model Runner v2 的采样管线,而非以外挂模块形式存在。相关改动通过三个 PR 逐步落地:PR #54053、#56122 与 #56233。
三个 PR 各自承担不同职责。据 vLLM 方面披露,其分别实现了融合 GPU kernel、双键方案以及上下文去重。这三项改动共同支撑起水印功能在工程层面的可用性。
兼容性是此次实现的另一重点。该水印方案可与投机解码共存,并保持输出的多样性,这使其在需要兼顾生成效率与内容溯源的场景中具备落地空间。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗