OpenAI推GPT-6 Astra:桌面任务效率提升与安全对齐双突破
OpenAI发布新一代模型GPT-6 Astra,首席研究官Mark Chen介绍其具备构建测试软件、跨应用操作及探索开放科学问题的能力。官方数据显示,OSWorld真实桌面任务耗时从75分钟降至40分钟,职场自动化率由18%升至41%,未防护越权率从48%降至0%,但带工具综合测试仍逊于Claude。
OpenAI于今日正式推出其最新一代旗舰模型GPT-6 Astra,定位为面向复杂计算环境与自主操作场景的进阶系统。据首席研究官Mark Chen在发布说明中透露,该模型的核心能力覆盖软件测试构建、跨应用桌面操作乃至开放科学问题的初步探索,标志着模型从被动应答向主动执行的角色迁移。
在性能层面,OpenAI披露了多项关键基准数据。在OSWorld真实桌面任务评估中,完成时间由上一代的75分钟显著压缩至40分钟,降幅接近47%;职场自动化任务的成功率则从18%提升至41%,近乎翻倍。更引人关注的是安全对齐方面的进展:在未加防护的对抗性越权测试中,GPT-6 Astra的越权成功率从上代的48%骤降至0%,显示出对指令边界更强的内化控制能力。
此外,Mark Chen特别提及一项计算密集型验证:团队投入约2000美元算力,成功解出了10道此前十年未获突破的数学与理论计算难题。该结果虽未提供完整解题日志,但被视作模型在长链条推理与符号操作上具备潜力的佐证。
不过,OpenAI亦未回避局限。在配备外部工具的综合能力评测中,GPT-6 Astra的表现仍落后于Anthropic的Claude系列,暗示其在工具调用生态的协同效率上尚有优化空间。这一披露使得本次发布更趋于务实,而非单方面宣称全面领先。
整体而言,GPT-6 Astra的发布焦点明显偏向于‘可操作的智能’与‘可控的自主性’两大维度。效率数据的跃升与越权率的归零,为企业在高敏场景中部署自动化代理提供了初步的安全依据;而工具评测的短板则提示,模型能力与工程化工具链的整合仍需行业持续投入。对于AI从业者而言,这既是一个可量化的进步节点,也是一份待完善的技术路线图。