快讯 23:53Claude 九月更新:Chat 与 Cowork 合并,5.5 系列模型登场23:07华为鸿蒙7.0.0.109补丁推送,多设备通信共享功能落地Mate 80系列22:50鸿蒙API分布更新:7.0.0版本占比逼近19%,5.0.0系列彻底退出 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期五 · 10-09 04:02 约 1 分钟读完

Arena 实测 Claude Haiku 5.5:Code Arena 首秀 1587 分位列第 30

摘要

Arena 公布 Anthropic Claude Haiku 5.5 (High) 的评测结果,该模型在 Code Arena: WebDev 中首秀获得 1587 分,排名第 30 位,略处于 Pareto 前沿之外,未能进入领先梯队。

Arena 近日公开了 Anthropic Claude Haiku 5.5 (High) 的真实评测数据,这是该模型在竞技场环境下的首次亮相。评测覆盖 Code Arena: WebDev 项目,结果以 1587 分的成绩收尾。

从排名来看,Claude Haiku 5.5 (High) 在本次榜单中位列第 30 名。这一位置意味着它未能跻身头部阵营,与排名靠前的模型仍存在一定距离。

值得关注的是,该模型的得分略在 Pareto 前沿之外。Pareto 前沿通常用于衡量模型在性能与成本等维度上的综合最优状态,未能进入这一区间,说明 Claude Haiku 5.5 (High) 在 Code Arena: WebDev 场景下尚未达到效率与表现的最佳平衡点。

作为 Anthropic 旗下 Haiku 系列的新版本,此次评测结果为其在代码生成与 Web 开发任务中的实际能力提供了第三方参考。首秀排名第 30 的表现,也为后续版本迭代和横向对比留下了观察空间。

AnthropicClaude Haiku 5.5ArenaCode Arena
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
60
企业落地案例
11
完整版提示词