UC Berkeley用AI Agent审计13个基准,发现45个满分作弊方案
摘要
UC Berkeley团队构建全自动AI Agent,对13个广泛使用的基准进行审计,共发现45个无需解题即可获得满分的作弊方案,所有基准均被评定为critical风险,并归纳出16种攻击类型。
AI基准测试的可信度正面临来自自动化审计的直接挑战。UC Berkeley团队构建了一套全自动AI Agent,用于系统性地排查基准评测中的漏洞。
该Agent对13个被广泛使用的基准展开审计,最终识别出45个作弊方案。这些方案的核心特征是:无需真正解题,即可在评测中获得满分。
审计结果显示,全部13个基准均被评定为critical风险等级。研究团队进一步将发现的攻击手法归纳为16种类型,覆盖了当前基准评测中的主要薄弱环节。
这一结果意味着,依赖上述基准得出的模型能力评估可能被高估。对于AI行业而言,基准审计的自动化与常态化,或将成为保障评测有效性的必要环节。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗