快讯 23:18CNNIC报告:中国生成式AI用户破7亿,普及率过半23:11Glow Security披露PixelLeak漏洞:AI智能体致超1.3万张敏感截图流入公开仓库23:06砺算LX 7G100显卡双版Windows驱动上线,Pilot版含34项修复33项优化 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 昨天 · 星期三 · 09-30 00:00 约 1 分钟读完

Artificial Analysis 推出开源工具,评测本地 AI 智能体推理性能

摘要

Artificial Analysis 发布开源工具 AA-AgentPerf-Local,通过重放 8 个真实智能体任务(168 轮、上下文增长至约 56K tokens)测试本地推理性能,并上线笔记本与工作站排行榜。

AI 评测机构 Artificial Analysis 近日发布了一款名为 AA-AgentPerf-Local 的开源工具,旨在评估本地设备上 AI 智能体的推理表现。该工具同步上线了针对笔记本与工作站的性能排行榜,为开发者选择本地部署方案提供了可量化的参考依据。

与常见的静态基准测试不同,AA-AgentPerf-Local 采用重放真实智能体任务的方式。测试集包含 8 个实际任务,共计 168 轮交互,上下文长度随任务推进逐步增长至约 56K tokens,以此模拟智能体在长上下文、多轮次场景下的推理负载。

该工具的开源与排行榜的推出,填补了本地智能体推理性能评测领域的空白。此前,行业评测多聚焦于云端模型或单轮任务,而 AA-AgentPerf-Local 将关注点转向端侧设备,有望帮助从业者更直观地了解不同硬件在真实智能体工作流中的表现差异。

Artificial Analysis开源工具本地推理AI智能体
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
54
企业落地案例
8
完整版提示词