快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期日 · 09-06 05:31 约 1 分钟读完

GPT-6 Astra登顶Web开发基准测试 领先Claude系列35分

摘要

OpenAI最新旗舰模型GPT-6 Astra在Web开发基准测试Code Arena WebDev中以1797分位居榜首,超出第二名Claude Fable 5.1达35分,进一步巩固其在AI编程领域的领先地位。

在AI编程能力竞争日趋白热化的背景下,OpenAI于近日发布了其新一代旗舰模型GPT-6 Astra的基准测试成绩。据Code Arena平台公布的Web开发专项排名显示,GPT-6 Astra(Max)以1797分的综合得分位居第一,这一成绩不仅刷新了该榜单的历史记录,也拉开了与竞争对手的明显差距。

具体来看,紧随其后的Anthropic旗下模型Claude Fable 5.1(Max)取得了1762分,与榜首相差35分。而排名第三的Claude Opus 5(Max)得分则为1688分,与前两名存在约70分的差距。这一梯度分布表明,在Web开发这一细分赛道上,顶尖模型之间的性能鸿沟正在被进一步拉大。

Code Arena WebDev是业界公认的严格评测环境,主要考察模型在真实网页开发任务中的代码生成质量、框架适配能力及问题解决效率。GPT-6 Astra在此次评测中的表现,得益于其全新的架构优化与训练策略,尤其在处理复杂前端交互逻辑和响应式布局方面展现了较强的稳定性。

值得注意的是,OpenAI并未在本次公告中透露GPT-6 Astra的具体技术参数或发布时间表,但这一测试结果已引发行业对下一代模型能力边界的重新审视。对于依赖AI辅助开发的企业而言,模型在标准化测试中的领先能否转化为实际工程效率的提升,仍需结合具体业务场景进行验证。

OpenAIGPT-6AI编程基准测试
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词