Mistral Large 4 预览版登陆 Agent Arena,净改进分 -6.6% 位列第 43
摘要
Arena 数据显示,Mistral Large 4 预览版基于超 5000 个真实智能体会话,净改进分为 -6.6%,总排名第 43,跻身前十五实验室。相比前代 Mistral Medium 3.5 的 -12.60%,排名高出 11 位。
AI 模型评测平台 Arena 近日更新了 Agent Arena 榜单,Mistral 旗下新一代模型 Mistral Large 4 的预览版首次入榜,并帮助 Mistral 进入该榜单的前十五实验室行列。
根据 Arena 公布的数据,此次评估基于超过 5000 个真实智能体会话。Mistral Large 4 预览版的净改进分为 -6.6%,在总排名中位列第 43。
作为对比,Mistral 前代模型 Mistral Medium 3.5 的净改进分为 -12.60%。Mistral Large 4 预览版在排名上较前者高出 11 位,显示出代际间的性能变化。
Agent Arena 的评估聚焦于真实智能体交互场景,其排名和净改进分反映了模型在具体任务中的表现。Mistral Large 4 预览版此次入榜,为观察该系列模型在智能体方向上的进展提供了新的参考数据。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗