快讯 23:31迪士尼设立CTO职位,Character.AI前CEO阿南德10月2日上任23:10英特尔发布 Arc 显卡 9030 测试版驱动,新增三款游戏支持并修复多项崩溃问题13:51理想AI眼镜Livis推送9月OTA:同声传译扩语种,音量可自适应调节 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期日 · 09-20 13:46 约 1 分钟读完

B站推出AI无限竞技场测评榜,GPT-6 Astra首轮登顶,国产模型占据前五三席

摘要

B站上线“AI无限竞技场”大模型测评榜,首轮GPT-6 Astra在10位UP主测评中登顶,GLM-5.3获榜首次数冠军,前五中国产模型占三席。榜单由UP主以真实工作流自主命题,覆盖上百模型,排名实时更新。

9月20日,B站宣布上线名为“AI无限竞技场”的大模型测评榜单,并同步公开了首轮排名结果。该榜单定位为汇集站内UP主大模型实测内容的竞技广场,试图以社区化的方式呈现不同模型在真实任务中的表现差异。

根据首轮榜单,GPT-6 Astra在10位UP主的测评中拿下榜首,成为登顶次数最多的模型,GLM-5.3紧随其后获得榜首次数冠军。前五名中,国产大模型占据三席。榜单覆盖DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax等主流模型,排名实时更新,并持续面向全站UP主开放报名。

与传统跑分评测不同,B站“AI无限竞技场”不设主题或测评维度限制。来自各个分区的UP主以真实工作流、专业应用或趣味脑洞自主命题,在同题PK中直观呈现各模型的实际表现差异,测评主题涵盖代码、推理、协作、知识等多种类型。

B站方面披露的数据显示,过去一年平台AI知识内容消费时长同比增长72%,月均观看AI内容的用户超过1.9亿。平台已涌现出大量覆盖发布、讨论、测评、使用、求助、共建等环节的AI相关内容,此次榜单的推出可视为对这一内容生态的进一步整合。

B站大模型测评AI无限竞技场
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
45
企业落地案例
5
完整版提示词