快讯 23:41Perplexity 红队测试 SPACE 沙箱:9 个模型 108 次运行均未逃逸 VM23:08Instinct获10亿美元融资,估值百亿,AI智能体赛道热度不减22:53小米大模型负责人罗福莉晋升22级 已达职级体系最高档 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期二 · 09-29 03:08 约 1 分钟读完

Anthropic 推出 Claude Sonnet 5.5,Terminal-Bench 4.0 得分跃升至 70.6%

摘要

Anthropic 正式发布 Claude Sonnet 5.5,在 Terminal-Bench 4.0 基准测试中得分 70.6%,较 Sonnet 5 的 10.3% 大幅提升。新模型定价保持不变,仍为每百万输入 token 2 美元、输出 token 10 美元。

Anthropic 近日更新其中端模型产品线,推出 Claude Sonnet 5.5。此次迭代的核心变化体现在终端任务处理能力上,官方公布的 Terminal-Bench 4.0 测试结果显示,新模型得分达到 70.6%。

对比上一代 Claude Sonnet 5,该基准成绩仅为 10.3%。两代模型在同一测试中的差距接近七倍,表明 Sonnet 5.5 在终端环境下的指令执行与任务完成能力出现了明显跃升。

定价方面,Anthropic 维持了 Sonnet 系列的原有价格体系:每百万输入 token 收费 2 美元,每百万输出 token 收费 10 美元。这意味着开发者在获得显著性能提升的同时,无需承担更高的调用成本。

Terminal-Bench 4.0 主要评估模型在真实终端场景中的操作能力,涵盖命令执行、环境交互与多步骤任务处理等维度。Sonnet 5.5 在该测试中的表现,使其在同类中端模型中具备了更强的竞争力。

AnthropicClaude Sonnet 5.5Terminal-Bench 4.0模型发布
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
53
企业落地案例
7
完整版提示词