快讯 23:22加州叫停REK人机笼斗赛,未获许可组织格斗活动涉轻罪08:50DeepSeek V4.1 Flash推动中美顶尖模型LiveBench差距收窄至3%08:24PromptArmor 披露 Databricks Genie 恶意 Skill 可绕过四类控制实施钓鱼与数据外泄 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期一 · 10-05 08:50 约 1 分钟读完

DeepSeek V4.1 Flash推动中美顶尖模型LiveBench差距收窄至3%

摘要

彭博行业研究报告指出,DeepSeek发布V4.1 Flash后,中国顶尖模型在LiveBench基准测试中仅落后美国对手3%,较5月的9%和年初的15%显著收窄。该模型全球排名第六,成为R1以来排名最高的中国模型,引发对美国技术出口限制有效性的质疑。

北京时间10月5日,彭博行业研究发布报告称,中美顶尖AI模型之间的性能差距已收窄至历史最低点。该机构高级分析师罗伯特·利亚在周一的一份报告中指出,DeepSeek于9月发布V4.1 Flash之后,中国最强模型在基准测试得分上仅落后美国竞争对手3个百分点。这一数字较5月份的约9%和今年早些时候的15%出现了明显下降。

具体来看,DeepSeek V4.1 Flash在LiveBench全球排名中位列第六,成为这家创业公司自2025年凭借推理模型R1取得突破以来排名最高的中国模型。LiveBench通过评估AI模型对问题、谜题或任务的回答与分析能力进行打分,其机制类似于衡量人类智商。DeepSeek最近一次在该榜单上的得分为81.1分。

彭博行业研究认为,中国模型性能的持续提升,意味着中国竞争者将进一步扩大市场份额。报告将这一进展归因于中国AI专业能力的不断深化,以及研究人员针对国产硬件优化模型的能力。

利亚在报告中写道,中国取得的进展“进一步让人质疑美国在AI领域的科技主导地位能否长期维持”。彭博指出,这些进展也让人们开始质疑美国限制技术出口的做法是否有效。

DeepSeekLiveBench中美AI竞争彭博行业研究
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
60
企业落地案例
10
完整版提示词