OpenAI多次调整GPT-6 Astra基准数据,幻觉率记录前后不一
摘要
据《财富》杂志报道,OpenAI在9月3日发布GPT-6 Astra后,多次修改其评测基准数据,其中幻觉率曾从4.2%下调至2%,后又改回。此举引发外界对AI模型性能报告透明度的关注。
《财富》杂志最新调查显示,OpenAI在发布GPT-6 Astra模型后,对官方公布的评测基准数据进行了多次修订,引发业界对AI性能声明可信度的讨论。报道指出,自9月3日公告发布以来,OpenAI至少两次调整了关键指标,其中幻觉率这一核心安全参数经历了先降后升的波动。
具体而言,GPT-6 Astra的幻觉率最初被记录为4.2%,随后在某个版本中悄然降至2%,但最终又被改回至接近原始数值。尽管OpenAI未公开解释修改原因,但此类数据变动在AI行业并不寻常,尤其是在模型发布初期,基准结果往往成为外界评估技术实力的重要依据。
此次事件折射出大模型竞赛中,厂商在性能宣传与真实表现之间的张力。对于依赖第三方评测或官方数据的企业用户而言,基准测试的可复现性和稳定性至关重要。目前,OpenAI尚未就数据修改的具体时间点及内部审核流程作出回应。
分析人士认为,随着AI模型复杂度提升,基准测试标准亟待统一,以避免类似数据修订引发市场误解。GPT-6 Astra作为OpenAI的最新旗舰模型,其性能数据的变化不仅影响投资者信心,也可能波及下游开发者的选型决策。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗