快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期五 · 09-04 03:31 约 2 分钟读完

Artificial Analysis 评测:GPT-6 Astra 编码智能体追平 Fable 5,成本优势明显

摘要

Artificial Analysis 最新评测显示,GPT-6 Astra 在 Coding Agent Index 中得分 67,与 Claude Opus 5 和 Fable 5 持平,但成本仅为后者一半以下,token 效率较 GPT-5.6 Sol 提升约 70%。

独立评测机构 Artificial Analysis 近日发布了针对 GPT-6 Astra 的深度测试报告,重点考察其在编码智能体任务中的综合表现。结果显示,该模型在 Coding Agent Index 上获得 67 分,与 Anthropic 的 Claude Opus 5 以及另一款主流模型 Fable 5 处于同一水平线,标志着 OpenAI 在复杂编码场景中已具备对标头部竞品的能力。

值得注意的是,性能持平并未以高昂成本为代价。据评测数据,GPT-6 Astra 的单位任务处理成本不到 Fable 5 的一半,这一性价比优势在需要大规模调用编码智能体的企业级工作流中尤为关键。相比之下,此前发布的 GPT-5.6 Sol(max 配置)虽在部分基准上表现亮眼,但 Astra 在 token 效率上实现了约 70% 的显著提升,意味着完成同等任务所需消耗的计算资源大幅缩减。

从技术架构层面看,GPT-6 Astra 的进步并非单纯依赖参数规模扩张,而更多体现在推理路径规划与工具调用策略的优化上。评测方指出,该模型在多轮代码修改、测试生成及错误修复等长链路任务中展现出更稳定的状态保持能力,减少了因上下文漂移导致的重复劳动。

对于 AI 工程团队而言,这一结果释放出明确信号:顶尖编码智能体的性能差距正在收窄,而成本与效率正成为下一阶段竞争的核心变量。随着 GPT-6 Astra 以更低门槛进入市场,企业或许能在不牺牲代码质量的前提下,将智能体驱动开发流程扩展至更多非核心项目。

不过,评测同样提示,当前分数仅反映特定基准下的表现,真实生产环境中的并发响应速度、安全对齐以及复杂私有代码库适配能力,仍需更长时间的实践验证。OpenAI 尚未公布该模型的正式商用时间表,但业界普遍预期其将首先面向开发者平台开放测试。

GPT-6 Astra编码智能体AI评测成本效率
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词