OpenRouter 实测:Jev 1.13 分类准确率略逊 Opus 5,延迟与成本优势显著
摘要
OpenRouter 基于 Banking77 测试集 3,080 条客服语料,对比 Jev 1.13 与 Claude Opus 5 的意图分类表现。Jev 准确率 81.0%,低于 Opus 的 84.4% 约 3.3 个百分点,但中位延迟仅 175 ms,约为 Opus(2,266 ms)的十三分之一,每千次请求成本 $0.11,远低于 Opus 的 $2.42。
意图分类是客服自动化场景中的核心任务,模型在准确率之外的表现同样影响落地选择。OpenRouter 近日以 Banking77 测试集为基准,对 Jev 1.13 与 Claude Opus 5 两款模型展开横向评测,评测样本为 3,080 条客服语料。
结果显示,Claude Opus 5 在分类准确率上保持领先,达到 84.4%;Jev 1.13 的准确率为 81.0%,两者相差 3.3 个百分点。这意味着在意图识别的正确性维度,Opus 5 仍占据一定优势。
但在响应速度与成本两个维度,Jev 1.13 呈现出明显反差。其中位延迟为 175 ms,而 Claude Opus 5 为 2,266 ms,前者约为后者的十三分之一。成本方面,在启用提示词缓存的条件下,Jev 1.13 每千次请求花费 $0.11,Claude Opus 5 则为 $2.42。
对于需要处理高频客服请求的业务而言,这一组数据提供了准确率之外的另一重权衡依据:Jev 1.13 以约 3.3 个百分点的准确率差距,换取了数量级更低的延迟与成本。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗