Trail of Bits 质疑 1Password AI 补丁基准,发布双补丁验证 Agent 技能
摘要
Trail of Bits 公开批评 1Password 于 8 月 6 日发布的 FLAWED 报告,指出其 26% 的 AI 干净修复率因四项实验设计选择而失真:22% 数据含误导性提示词、36% 试验禁止编译测试,以及不同推理档位设置。同时 Trail of Bits 发布两个补丁以验证 Agent 技能。
近日,安全研究机构 Trail of Bits 对 1Password 于 8 月 6 日发布的 FLAWED 报告提出公开质疑。该报告此前给出 26% 的 AI 干净修复率,但 Trail of Bits 认为这一数字受到实验设计选择的影响,未能反映真实情况。
Trail of Bits 具体指出四项导致结果失真的设计因素。其中,刻意指示智能体应用错误修复的提示词占据了 22% 的数据;另有 36% 的试验禁止编译测试;此外,不同推理档位的设置也构成变量。这些因素共同作用,使得 26% 的干净修复率缺乏说服力。
在批评之外,Trail of Bits 还发布了两个补丁,旨在验证 Agent 的实际技能。此举被视为对当前 AI 补丁评估方法的一次实践性回应,强调基准测试需更严谨地控制变量。
此次争议凸显了 AI 代码修复领域基准测试的复杂性。随着 Agent 在软件开发中的应用加深,如何设计公平、可复现的评估体系,成为行业亟待解决的问题。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗