快讯 23:41Perplexity 红队测试 SPACE 沙箱:9 个模型 108 次运行均未逃逸 VM23:08Instinct获10亿美元融资,估值百亿,AI智能体赛道热度不减22:53小米大模型负责人罗福莉晋升22级 已达职级体系最高档 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期二 · 09-29 14:02 约 1 分钟读完

UC Berkeley用AI Agent审计13个基准,发现45个满分作弊方案

摘要

UC Berkeley团队构建全自动AI Agent,对13个广泛使用的基准进行审计,共发现45个无需解题即可获得满分的作弊方案,所有基准均被评定为critical风险,并归纳出16种攻击类型。

AI基准测试的可信度正面临来自自动化审计的直接挑战。UC Berkeley团队构建了一套全自动AI Agent,用于系统性地排查基准评测中的漏洞。

该Agent对13个被广泛使用的基准展开审计,最终识别出45个作弊方案。这些方案的核心特征是:无需真正解题,即可在评测中获得满分。

审计结果显示,全部13个基准均被评定为critical风险等级。研究团队进一步将发现的攻击手法归纳为16种类型,覆盖了当前基准评测中的主要薄弱环节。

这一结果意味着,依赖上述基准得出的模型能力评估可能被高估。对于AI行业而言,基准审计的自动化与常态化,或将成为保障评测有效性的必要环节。

AI基准AI Agent基准审计评测安全
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
53
企业落地案例
7
完整版提示词