快讯 23:53Claude 九月更新:Chat 与 Cowork 合并,5.5 系列模型登场23:07华为鸿蒙7.0.0.109补丁推送,多设备通信共享功能落地Mate 80系列22:50鸿蒙API分布更新:7.0.0版本占比逼近19%,5.0.0系列彻底退出 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期五 · 10-09 11:53 约 1 分钟读完

Mistral Large 4 预览版登陆 Agent Arena,净改进分 -6.6% 位列第 43

摘要

Arena 数据显示,Mistral Large 4 预览版基于超 5000 个真实智能体会话,净改进分为 -6.6%,总排名第 43,跻身前十五实验室。相比前代 Mistral Medium 3.5 的 -12.60%,排名高出 11 位。

AI 模型评测平台 Arena 近日更新了 Agent Arena 榜单,Mistral 旗下新一代模型 Mistral Large 4 的预览版首次入榜,并帮助 Mistral 进入该榜单的前十五实验室行列。

根据 Arena 公布的数据,此次评估基于超过 5000 个真实智能体会话。Mistral Large 4 预览版的净改进分为 -6.6%,在总排名中位列第 43。

作为对比,Mistral 前代模型 Mistral Medium 3.5 的净改进分为 -12.60%。Mistral Large 4 预览版在排名上较前者高出 11 位,显示出代际间的性能变化。

Agent Arena 的评估聚焦于真实智能体交互场景,其排名和净改进分反映了模型在具体任务中的表现。Mistral Large 4 预览版此次入榜,为观察该系列模型在智能体方向上的进展提供了新的参考数据。

MistralAgent Arena模型评测
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
60
企业落地案例
11
完整版提示词