OpenAI发布GPT-6 Astra后多次调整基准数据,部分成绩变动明显
摘要
OpenAI于9月3日发布GPT-6 Astra,但公告过程波折,博客上线后基准数据多次修改,部分成绩提升,Anthropic模型成绩下调。公司未说明具体原因,但否认与基准测试相关。
据外媒报道,OpenAI在9月3日发布GPT-6 Astra模型后,对其基准测试数据进行了多次修订。部分更新显示Astra性能有所提升,而竞争对手Anthropic的模型成绩则出现下调。这一系列变动发生在一次异常曲折的公告发布过程中。
OpenAI原定于美东时间下午2点发布博客,但实际推迟近两小时。下午3点32分,官方X账号发布链接,但页面无法访问;3点50分,CEO萨姆·奥尔特曼转发链接,称遇到小问题。约一小时后,页面才恢复正常。
OpenAI承认博客在下午2点后短暂上线后撤下,但拒绝透露具体原因,强调与基准测试无关。最初解释为内容管理系统故障,后称是互联网中断。博客重新上线后,多项基准数据已发生变化,且部分数据持续调整。
此次事件引发外界对OpenAI发布流程和基准测试透明度的关注。尽管公司否认数据修改与基准测试本身有关,但多次调整仍可能影响行业对其模型性能评估的信任度。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗