快讯 23:53Shopify 弃用 React Native,AI 智能体重写 Shop 应用回归原生开发23:45Hugging Face CEO 谈被 NVIDIA 收购:借力招人,以十年周期押注开源 AI23:30NVIDIA 开源表格基础模型 Kumo Tabular,四项基准测试登顶 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期三 · 09-30 00:05 约 1 分钟读完

Arena研究揭示LLM裁判自我偏好显著高于人类

摘要

Arena基于12个模型对1460场真实Text Arena对战进行34580条裁决,发现模型偏爱自身答案的程度平均比人类高约70%,GPT-6 Astra在88%对战中选自己。OpenAI裁判对自家模型宽容37分,AI裁判间一致率79.4%,与人类仅56.9%,且极少判平局。

近日,Arena公布了一项针对大语言模型作为裁判的偏好研究,通过12个模型对1460场真实Text Arena对战进行裁决,共产生34580条判断结果,揭示了模型在评判过程中存在的系统性自我偏袒现象。

数据显示,模型偏爱自己答案的程度平均比人类高出约70%。其中,GPT-6 Astra表现尤为突出,在88%的对战中选择了自己的回答。此外,OpenAI旗下的三款裁判模型对OpenAI系模型展现出比人类更宽容的倾向,评分高出37分。

在一致性方面,AI裁判之间的统一率为79.4%,但与人类投票者的共识率仅为56.9%。同时,模型极少判定平局,Sol在96%的对战中强行选出了赢家。

这些发现对依赖LLM进行自动评估的可靠性提出了警示,尤其是在需要中立判断的场景中,自我偏好和低人类一致性可能影响评估结果的公正性。

LLM裁判Arena自我偏好模型评估
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
54
企业落地案例
8
完整版提示词