Anthropic 推出 Claude Sonnet 5.5,Terminal-Bench 4.0 得分跃升至 70.6%
摘要
Anthropic 正式发布 Claude Sonnet 5.5,在 Terminal-Bench 4.0 基准测试中得分 70.6%,较 Sonnet 5 的 10.3% 大幅提升。新模型定价保持不变,仍为每百万输入 token 2 美元、输出 token 10 美元。
Anthropic 近日更新其中端模型产品线,推出 Claude Sonnet 5.5。此次迭代的核心变化体现在终端任务处理能力上,官方公布的 Terminal-Bench 4.0 测试结果显示,新模型得分达到 70.6%。
对比上一代 Claude Sonnet 5,该基准成绩仅为 10.3%。两代模型在同一测试中的差距接近七倍,表明 Sonnet 5.5 在终端环境下的指令执行与任务完成能力出现了明显跃升。
定价方面,Anthropic 维持了 Sonnet 系列的原有价格体系:每百万输入 token 收费 2 美元,每百万输出 token 收费 10 美元。这意味着开发者在获得显著性能提升的同时,无需承担更高的调用成本。
Terminal-Bench 4.0 主要评估模型在真实终端场景中的操作能力,涵盖命令执行、环境交互与多步骤任务处理等维度。Sonnet 5.5 在该测试中的表现,使其在同类中端模型中具备了更强的竞争力。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗