快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期五 · 09-04 10:22 约 2 分钟读完

OpenAI推GPT-6 Astra:桌面任务效率提升与安全对齐双突破

摘要

OpenAI发布新一代模型GPT-6 Astra,首席研究官Mark Chen介绍其具备构建测试软件、跨应用操作及探索开放科学问题的能力。官方数据显示,OSWorld真实桌面任务耗时从75分钟降至40分钟,职场自动化率由18%升至41%,未防护越权率从48%降至0%,但带工具综合测试仍逊于Claude。

OpenAI于今日正式推出其最新一代旗舰模型GPT-6 Astra,定位为面向复杂计算环境与自主操作场景的进阶系统。据首席研究官Mark Chen在发布说明中透露,该模型的核心能力覆盖软件测试构建、跨应用桌面操作乃至开放科学问题的初步探索,标志着模型从被动应答向主动执行的角色迁移。

在性能层面,OpenAI披露了多项关键基准数据。在OSWorld真实桌面任务评估中,完成时间由上一代的75分钟显著压缩至40分钟,降幅接近47%;职场自动化任务的成功率则从18%提升至41%,近乎翻倍。更引人关注的是安全对齐方面的进展:在未加防护的对抗性越权测试中,GPT-6 Astra的越权成功率从上代的48%骤降至0%,显示出对指令边界更强的内化控制能力。

此外,Mark Chen特别提及一项计算密集型验证:团队投入约2000美元算力,成功解出了10道此前十年未获突破的数学与理论计算难题。该结果虽未提供完整解题日志,但被视作模型在长链条推理与符号操作上具备潜力的佐证。

不过,OpenAI亦未回避局限。在配备外部工具的综合能力评测中,GPT-6 Astra的表现仍落后于Anthropic的Claude系列,暗示其在工具调用生态的协同效率上尚有优化空间。这一披露使得本次发布更趋于务实,而非单方面宣称全面领先。

整体而言,GPT-6 Astra的发布焦点明显偏向于‘可操作的智能’与‘可控的自主性’两大维度。效率数据的跃升与越权率的归零,为企业在高敏场景中部署自动化代理提供了初步的安全依据;而工具评测的短板则提示,模型能力与工程化工具链的整合仍需行业持续投入。对于AI从业者而言,这既是一个可量化的进步节点,也是一份待完善的技术路线图。

OpenAIGPT-6AI安全桌面自动化
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词