快讯 23:46Anthropic 拟登陆纳斯达克,连续两季盈利目标估值 2 万亿美元23:06英伟达联手 Perplexity:本地智能体 Portable Computer 登陆 Windows RTX PC23:05X与SpaceXAI撤回对苹果反垄断诉讼,继续追责OpenAI 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期二 · 09-15 19:00 约 1 分钟读完

Trail of Bits 质疑 1Password AI 补丁基准,发布双补丁验证 Agent 技能

摘要

Trail of Bits 公开批评 1Password 于 8 月 6 日发布的 FLAWED 报告,指出其 26% 的 AI 干净修复率因四项实验设计选择而失真:22% 数据含误导性提示词、36% 试验禁止编译测试,以及不同推理档位设置。同时 Trail of Bits 发布两个补丁以验证 Agent 技能。

近日,安全研究机构 Trail of Bits 对 1Password 于 8 月 6 日发布的 FLAWED 报告提出公开质疑。该报告此前给出 26% 的 AI 干净修复率,但 Trail of Bits 认为这一数字受到实验设计选择的影响,未能反映真实情况。

Trail of Bits 具体指出四项导致结果失真的设计因素。其中,刻意指示智能体应用错误修复的提示词占据了 22% 的数据;另有 36% 的试验禁止编译测试;此外,不同推理档位的设置也构成变量。这些因素共同作用,使得 26% 的干净修复率缺乏说服力。

在批评之外,Trail of Bits 还发布了两个补丁,旨在验证 Agent 的实际技能。此举被视为对当前 AI 补丁评估方法的一次实践性回应,强调基准测试需更严谨地控制变量。

此次争议凸显了 AI 代码修复领域基准测试的复杂性。随着 Agent 在软件开发中的应用加深,如何设计公平、可复现的评估体系,成为行业亟待解决的问题。

Trail of Bits1PasswordAI 补丁基准Agent 技能
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
41
企业落地案例
4
完整版提示词