快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期日 · 09-06 14:46 约 1 分钟读完

OpenAI多次调整GPT-6 Astra基准数据,幻觉率记录前后不一

摘要

据《财富》杂志报道,OpenAI在9月3日发布GPT-6 Astra后,多次修改其评测基准数据,其中幻觉率曾从4.2%下调至2%,后又改回。此举引发外界对AI模型性能报告透明度的关注。

《财富》杂志最新调查显示,OpenAI在发布GPT-6 Astra模型后,对官方公布的评测基准数据进行了多次修订,引发业界对AI性能声明可信度的讨论。报道指出,自9月3日公告发布以来,OpenAI至少两次调整了关键指标,其中幻觉率这一核心安全参数经历了先降后升的波动。

具体而言,GPT-6 Astra的幻觉率最初被记录为4.2%,随后在某个版本中悄然降至2%,但最终又被改回至接近原始数值。尽管OpenAI未公开解释修改原因,但此类数据变动在AI行业并不寻常,尤其是在模型发布初期,基准结果往往成为外界评估技术实力的重要依据。

此次事件折射出大模型竞赛中,厂商在性能宣传与真实表现之间的张力。对于依赖第三方评测或官方数据的企业用户而言,基准测试的可复现性和稳定性至关重要。目前,OpenAI尚未就数据修改的具体时间点及内部审核流程作出回应。

分析人士认为,随着AI模型复杂度提升,基准测试标准亟待统一,以避免类似数据修订引发市场误解。GPT-6 Astra作为OpenAI的最新旗舰模型,其性能数据的变化不仅影响投资者信心,也可能波及下游开发者的选型决策。

OpenAIGPT-6基准测试AI安全
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词