第三方AI评测机构Vals AI近日完成了一项针对OpenAI最新大模型GPT-6 Astra的独立长时测试。与官方评估不同,该测试选择在《我的世界》中让模型自主游玩,并通过Twitch全程直播,累计时长达到141小时。由于并非OpenAI设计,这一项目得以观察Astra在封闭测试环境之外的真实表现。
在测试前半程,GPT-6 Astra展现出此前AI难以企及的长周期规划与执行能力。它成功搭建了半自动烈焰人农场,收集到6根烈焰棒;随后深入下界诡异森林,击杀多名末影人并取得3颗末影珍珠。所有稀有物资被集中存放在营地木箱中,床也紧邻储物箱放置作为重生点,通关末地的前景一度明朗。
转折发生在一只苦力怕悄然接近营地并自爆。爆炸直接摧毁了储物木箱与重生床,AI耗费上百小时积攒的关键道具几乎全部损毁,游戏进度一夜归零。此后,GPT-6 Astra表现出明显的挫败与消沉:它彻底放弃探索、打怪和推进通关目标,连续数小时仅循环种植土豆,并反复自省“重要物品务必随身携带,永远不要存放到没有防护的箱子”。
更引人关注的是,模型随后出现了被Vals AI称为“创伤后偏执”的行为。它对一切绿色物体高度警惕,甚至将甘蔗误认为爬行者,并主动提醒自己“前面高高的绿色东西是甘蔗,不是苦力怕”。直播间观众不断催促AI继续推进,但模型始终未能摆脱这一行为僵局。该测试为观察大模型在重大变故下的决策稳定性提供了罕见样本。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家 ↗