快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期五 · 09-04 03:49 约 2 分钟读完

OpenAI推出GPT-6 Astra 多项基准测试成绩亮眼

摘要

OpenAI正式发布GPT-6 Astra,CEO Sam Altman称其为计算机操作、专业工作、科学、编码及网络安全领域全球最佳模型。官方在FrontierMath Tier 4、ARC-AGI 3及ExploitBench测试中分别取得98%、99.9%和100%的得分,并强调为满足安全与对齐标准而推迟了发布。

OpenAI日前正式揭晓其新一代旗舰模型GPT-6 Astra,首席执行官Sam Altman在发布声明中将其定位为当前全球范围内在计算机使用、专业任务处理、科学研究、代码编写以及网络安全等多个维度性能最优越的AI系统。这一表态标志着该公司在通用人工智能能力竞赛中的又一次关键推进。

与以往产品迭代节奏不同,OpenAI此次在发布时机上显得更为审慎。官方解释称,为了达到该能力层级所必需的安全保障与对齐标准,团队投入了额外的时间进行打磨与验证。这一延迟策略反映出前沿模型在部署前所需面对的复杂风险评估流程。

在技术表现层面,OpenAI同步公开了三项独立基准测试的得分:在涉及高阶数学推理的FrontierMath Tier 4评估中,GPT-6 Astra取得了98%的正确率;在衡量通用智能与适应性的ARC-AGI 3测试中,其得分高达99.9%;而在针对真实世界漏洞利用场景的ExploitBench测试中,模型则获得了满分100%。这些数据为模型的宣称提供了量化支撑。

业内人士指出,ExploitBench的满分成绩尤其值得关注,因为它直接关联到模型在识别与应对网络安全威胁方面的实际能力。不过,也有专家提醒,基准测试的高分并不完全等同于现实世界中的部署表现,模型在开放环境下的鲁棒性仍需后续独立验证。

随着GPT-6 Astra的正式落地,OpenAI在高端AI服务市场的竞争格局将面临新一轮调整。对于依赖前沿模型支撑其业务的企业用户而言,该模型在专业领域展现出的潜力,可能会加速其从现有系统向新一代架构迁移的决策进程。

OpenAIGPT-6AI模型基准测试
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词