快讯 23:46Anthropic 拟登陆纳斯达克,连续两季盈利目标估值 2 万亿美元23:06英伟达联手 Perplexity:本地智能体 Portable Computer 登陆 Windows RTX PC23:05X与SpaceXAI撤回对苹果反垄断诉讼,继续追责OpenAI 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期二 · 09-15 01:21 约 1 分钟读完

DeepSeek-V4.1-Flash(Max)登Agent Arena开源榜第三,成本优势重塑帕累托前沿

摘要

DeepSeek-V4.1-Flash(Max)在Agent Arena开源模型排名中升至第三,净提升4.87%,每任务中位成本仅0.07美元。其成本较第二名Hy4 preview低68%,成绩仅差0.09个百分点,总榜列第12,Confirmed Success信号排名第四。

Agent Arena最新榜单显示,DeepSeek-V4.1-Flash(Max)在开源模型序列中占据第三位。该版本此次录得4.87%的净提升,在竞争激烈的评测环境中实现了名次上的实质推进。

成本数据成为本次排名中最突出的变量。DeepSeek-V4.1-Flash(Max)的每任务中位成本为0.07美元,与位列第二的Hy4 preview相比,成本降幅达到68%。两者在成绩上的差距仅为0.09个百分点,意味着该模型以显著更低的单任务开销逼近了前一名的表现,对Agent Arena的帕累托前沿构成了重新定义。

在涵盖范围更广的总榜中,DeepSeek-V4.1-Flash(Max)排名第12。细分指标方面,其Confirmed Success信号排名位列第4,该指标较此前提升了13.75%,显示出模型在任务确认成功维度上的进展。

对于关注Agent部署成本与产出效率的开发者而言,这一排名变化提供了新的权衡参照:在成绩与头部开源模型接近的情况下,单任务成本的量级差异可能直接影响规模化调用的可行性。

DeepSeekAgent Arena开源模型成本效率
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
41
企业落地案例
4
完整版提示词