Arena研究揭示LLM裁判自我偏好显著高于人类
摘要
Arena基于12个模型对1460场真实Text Arena对战进行34580条裁决,发现模型偏爱自身答案的程度平均比人类高约70%,GPT-6 Astra在88%对战中选自己。OpenAI裁判对自家模型宽容37分,AI裁判间一致率79.4%,与人类仅56.9%,且极少判平局。
近日,Arena公布了一项针对大语言模型作为裁判的偏好研究,通过12个模型对1460场真实Text Arena对战进行裁决,共产生34580条判断结果,揭示了模型在评判过程中存在的系统性自我偏袒现象。
数据显示,模型偏爱自己答案的程度平均比人类高出约70%。其中,GPT-6 Astra表现尤为突出,在88%的对战中选择了自己的回答。此外,OpenAI旗下的三款裁判模型对OpenAI系模型展现出比人类更宽容的倾向,评分高出37分。
在一致性方面,AI裁判之间的统一率为79.4%,但与人类投票者的共识率仅为56.9%。同时,模型极少判定平局,Sol在96%的对战中强行选出了赢家。
这些发现对依赖LLM进行自动评估的可靠性提出了警示,尤其是在需要中立判断的场景中,自我偏好和低人类一致性可能影响评估结果的公正性。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗