Artificial Analysis 推出开源工具,评测本地 AI 智能体推理性能
摘要
Artificial Analysis 发布开源工具 AA-AgentPerf-Local,通过重放 8 个真实智能体任务(168 轮、上下文增长至约 56K tokens)测试本地推理性能,并上线笔记本与工作站排行榜。
AI 评测机构 Artificial Analysis 近日发布了一款名为 AA-AgentPerf-Local 的开源工具,旨在评估本地设备上 AI 智能体的推理表现。该工具同步上线了针对笔记本与工作站的性能排行榜,为开发者选择本地部署方案提供了可量化的参考依据。
与常见的静态基准测试不同,AA-AgentPerf-Local 采用重放真实智能体任务的方式。测试集包含 8 个实际任务,共计 168 轮交互,上下文长度随任务推进逐步增长至约 56K tokens,以此模拟智能体在长上下文、多轮次场景下的推理负载。
该工具的开源与排行榜的推出,填补了本地智能体推理性能评测领域的空白。此前,行业评测多聚焦于云端模型或单轮任务,而 AA-AgentPerf-Local 将关注点转向端侧设备,有望帮助从业者更直观地了解不同硬件在真实智能体工作流中的表现差异。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗