快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期五 · 09-04 08:07 约 2 分钟读完

OpenAI 推出 GPT-6 Astra:基准测试创纪录,安全能力达关键门槛

摘要

OpenAI 发布新一代模型 GPT-6 Astra,在数学推理、通用智能及漏洞利用检测等多项基准测试中刷新纪录,其中 ExploitBench 满分。公司称其网络安全能力已触及内部安全框架的最高分级,引发行业对前沿模型安全边界的关注。

OpenAI 于今日正式发布其最新一代旗舰模型 GPT-6 Astra,这是继 GPT-5 系列之后,公司在通用人工智能路径上的又一次重大迭代。该模型被定位为兼具前沿推理深度与主动安全防御能力的综合系统,其发布即引发行业对下一代模型能力边界的重新评估。

在官方公布的基准测试结果中,GPT-6 Astra 在多项被视为“硬指标”的评测集上表现亮眼:在面向高阶数学推理的 FrontierMath Tier 4 测试中达到 98% 的准确率,在旨在衡量通用抽象推理的 ARC-AGI-3 上获得 99.9% 的成绩,而在针对真实世界漏洞利用场景的 ExploitBench 评测中,该模型更是取得了 100% 的满分表现。

值得注意的是,OpenAI 特别强调了 GPT-6 Astra 在网络安全维度的能力跃升。公司表示,该模型在内部推行的 Preparedness Framework(准备框架)评估体系中,其网络安全相关能力已被正式认定为达到“Critical”(严重)级别门槛。这一分级通常意味着模型具备自主发现并利用高危漏洞的潜在能力,也标志着 AI 系统在攻防两端的影响力进入新阶段。

从技术架构角度看,GPT-6 Astra 并未沿用此前传闻中的 MoE(混合专家)稀疏化路线,而是采用了全新的稠密注意力机制与动态计算分配方案。据接近研发团队的消息人士透露,该模型在训练阶段引入了大规模对抗性红队模拟,这可能是其在 ExploitBench 上取得满分成绩的关键原因。不过,OpenAI 官方并未公布模型参数量及具体训练成本。

行业分析人士指出,GPT-6 Astra 在数学与推理基准上的数据虽令人印象深刻,但更值得关注的是其安全分级认定。随着模型能力逼近甚至超过人类专家在特定攻防领域的水平,如何界定“负责任的能力释放”将成为监管机构与科技企业共同面临的紧迫课题。OpenAI 表示,GPT-6 Astra 的 API 将分阶段向安全合作伙伴开放,初期不会全面公开权重。

截至目前,OpenAI 尚未披露 GPT-6 Astra 的具体商用时间表,也未说明该模型是否将直接集成至 ChatGPT 消费端产品。外界普遍预期,在后续的开发者大会或技术白皮书中,官方将提供更多关于模型对齐技术细节及安全限制措施的说明。

OpenAIGPT-6 AstraAI安全基准测试
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词