OpenAI推GPT-6 Astra 多项基准超越竞品
OpenAI发布GPT-6 Astra,官方数据显示其在ARC-AGI-3基准上达到99.9%饱和,ExploitBench得分100%,全面超越此前保持SOTA两天的Claude Fable 5.1,且定价更具竞争力。
人工智能领域的模型竞赛再度升温。OpenAI于今日正式发布新一代旗舰模型GPT-6 Astra,官方宣称该模型在多项核心基准测试中取得突破性成绩,并对现有顶尖模型形成全面压制。这一发布距离Anthropic旗下Claude Fable 5.1登顶SOTA榜单仅隔两天。
根据OpenAI公布的官方基准数据,GPT-6 Astra在ARC-AGI-3测试中达到99.9%的饱和水平,该测试主要评估模型在抽象推理与泛化能力上的表现。与此同时,模型在ExploitBench——一个衡量安全漏洞利用能力的专项基准上,取得了100%的满分成绩。
更值得关注的是,除性能数据外,OpenAI在定价策略上采取了更具进攻性的姿态。官方对比显示,GPT-6 Astra的API调用价格显著低于Claude Fable 5.1,这意味着企业在同等预算下可获得更强的模型能力,或将加速市场对新一代模型的选择与迁移。
值得注意的是,此次基准对比完全基于OpenAI自报数据,独立第三方验证尚未公开。在过往的模型竞赛中,不同测试环境与提示词设置常导致成绩差异,因此行业观察者建议在完整技术报告及独立评测出炉后再做最终结论。
GPT-6 Astra的发布无疑将加剧头部AI实验室的竞争烈度,尤其在推理能力、安全性与成本效率三个维度上,市场已进入短周期迭代阶段。对于开发者与企业用户而言,模型的快速更迭既带来了能力红利,也提出了更高的选型与适配要求。