GPT-6 Astra登顶Web开发基准测试 领先Claude系列35分
摘要
OpenAI最新旗舰模型GPT-6 Astra在Web开发基准测试Code Arena WebDev中以1797分位居榜首,超出第二名Claude Fable 5.1达35分,进一步巩固其在AI编程领域的领先地位。
在AI编程能力竞争日趋白热化的背景下,OpenAI于近日发布了其新一代旗舰模型GPT-6 Astra的基准测试成绩。据Code Arena平台公布的Web开发专项排名显示,GPT-6 Astra(Max)以1797分的综合得分位居第一,这一成绩不仅刷新了该榜单的历史记录,也拉开了与竞争对手的明显差距。
具体来看,紧随其后的Anthropic旗下模型Claude Fable 5.1(Max)取得了1762分,与榜首相差35分。而排名第三的Claude Opus 5(Max)得分则为1688分,与前两名存在约70分的差距。这一梯度分布表明,在Web开发这一细分赛道上,顶尖模型之间的性能鸿沟正在被进一步拉大。
Code Arena WebDev是业界公认的严格评测环境,主要考察模型在真实网页开发任务中的代码生成质量、框架适配能力及问题解决效率。GPT-6 Astra在此次评测中的表现,得益于其全新的架构优化与训练策略,尤其在处理复杂前端交互逻辑和响应式布局方面展现了较强的稳定性。
值得注意的是,OpenAI并未在本次公告中透露GPT-6 Astra的具体技术参数或发布时间表,但这一测试结果已引发行业对下一代模型能力边界的重新审视。对于依赖AI辅助开发的企业而言,模型在标准化测试中的领先能否转化为实际工程效率的提升,仍需结合具体业务场景进行验证。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗