Google AI 团队发布 LLM-as-a-Judge 评分标准编写指南
Google AI 团队发布教程,系统讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准。教程指出模糊提示会导致评估不一致与 token 浪费,并给出四条核心经验:原子化问题、限定客观事实评估、聚焦明确要求、使用专家标注的 golden set 校准评判模型。
在大型语言模型评测领域,LLM-as-a-Judge 正逐渐成为自动评估生成质量的主流方案。然而,评判模型的表现高度依赖于评分标准的编写质量。针对这一痛点,Google AI 团队于近日发布了一份实操教程,系统梳理了如何构建可靠的布尔式评分标准,以提升评测的一致性与效率。
教程开篇即点明一个常见误区:模糊或含混的提示词往往导致评判模型在不同调用间产生相互冲突的判定结果,同时增加 token 开销。为避免此类问题,Google 团队提出了四条核心编写经验,旨在将评分标准从主观印象转化为可复现的客观准则。
第一,问题设计需保持原子化,即每个评分项应聚焦单一维度,且各问题之间互不重叠,从而降低评判模型的认知负担。第二,评判模型应仅被要求评估可验证的客观事实,而非主观感受或隐含语义;教程建议使用 RFC 2119 中的规范性术语(如 MUST)来表述硬性要求,以消除歧义。
第三,评分标准应严格限定于 prompt 中明确提出的指令内容,避免评判模型自行推断或扩展评估范畴,否则可能引入与任务无关的偏差。第四,也是团队强调的收尾步骤:需使用由领域专家预先标注的 golden set 对评判模型进行校准与迭代,直至其输出与人类评分达成高度一致,方可投入正式评测流程。
这份指南的发布正值业界对自动评估可靠性提出更高要求的阶段。通过将评分标准工程化、规则化,Google AI 团队为开发者提供了一条可操作的路径,以减少人工评估成本并提升评测结果的可信度,对依赖 LLM 进行大规模质量把控的团队具有直接的参考价值。