DeepSeek V4.1 Flash推动中美顶尖模型LiveBench差距收窄至3%
摘要
彭博行业研究报告指出,DeepSeek发布V4.1 Flash后,中国顶尖模型在LiveBench基准测试中仅落后美国对手3%,较5月的9%和年初的15%显著收窄。该模型全球排名第六,成为R1以来排名最高的中国模型,引发对美国技术出口限制有效性的质疑。
北京时间10月5日,彭博行业研究发布报告称,中美顶尖AI模型之间的性能差距已收窄至历史最低点。该机构高级分析师罗伯特·利亚在周一的一份报告中指出,DeepSeek于9月发布V4.1 Flash之后,中国最强模型在基准测试得分上仅落后美国竞争对手3个百分点。这一数字较5月份的约9%和今年早些时候的15%出现了明显下降。
具体来看,DeepSeek V4.1 Flash在LiveBench全球排名中位列第六,成为这家创业公司自2025年凭借推理模型R1取得突破以来排名最高的中国模型。LiveBench通过评估AI模型对问题、谜题或任务的回答与分析能力进行打分,其机制类似于衡量人类智商。DeepSeek最近一次在该榜单上的得分为81.1分。
彭博行业研究认为,中国模型性能的持续提升,意味着中国竞争者将进一步扩大市场份额。报告将这一进展归因于中国AI专业能力的不断深化,以及研究人员针对国产硬件优化模型的能力。
利亚在报告中写道,中国取得的进展“进一步让人质疑美国在AI领域的科技主导地位能否长期维持”。彭博指出,这些进展也让人们开始质疑美国限制技术出口的做法是否有效。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗