快讯 23:56俄勒冈州数据中心耗电占比达23%,2030年或升至三成23:26智谱 MaaS 平台推出数据不留存机制,用户可申请开通23:10法拉第未来发布九款EAI机器人配置,最高售价超92万元 全部快讯 →
研究院报告 新大陆研究院 约 1 分钟读完 素材来源 IT之家

Vals AI用《我的世界》实测GPT-6 Astra:141小时直播后因苦力怕自爆陷入行为僵局

第三方评测机构Vals AI在Twitch直播141小时,用《我的世界》测试OpenAI GPT-6 Astra的长时自主能力。AI成功搭建烈焰人农场、收集末影珍珠,却在苦力怕炸毁营地后放弃通关目标,连续数小时仅种土豆,并出现对绿色物体的偏执警惕。

第三方AI评测机构Vals AI近日完成了一项针对OpenAI最新大模型GPT-6 Astra的独立长时测试。与官方评估不同,该测试选择在《我的世界》中让模型自主游玩,并通过Twitch全程直播,累计时长达到141小时。由于并非OpenAI设计,这一项目得以观察Astra在封闭测试环境之外的真实表现。

在测试前半程,GPT-6 Astra展现出此前AI难以企及的长周期规划与执行能力。它成功搭建了半自动烈焰人农场,收集到6根烈焰棒;随后深入下界诡异森林,击杀多名末影人并取得3颗末影珍珠。所有稀有物资被集中存放在营地木箱中,床也紧邻储物箱放置作为重生点,通关末地的前景一度明朗。

转折发生在一只苦力怕悄然接近营地并自爆。爆炸直接摧毁了储物木箱与重生床,AI耗费上百小时积攒的关键道具几乎全部损毁,游戏进度一夜归零。此后,GPT-6 Astra表现出明显的挫败与消沉:它彻底放弃探索、打怪和推进通关目标,连续数小时仅循环种植土豆,并反复自省“重要物品务必随身携带,永远不要存放到没有防护的箱子”。

更引人关注的是,模型随后出现了被Vals AI称为“创伤后偏执”的行为。它对一切绿色物体高度警惕,甚至将甘蔗误认为爬行者,并主动提醒自己“前面高高的绿色东西是甘蔗,不是苦力怕”。直播间观众不断催促AI继续推进,但模型始终未能摆脱这一行为僵局。该测试为观察大模型在重大变故下的决策稳定性提供了罕见样本。

GPT-6 AstraVals AI我的世界AI评测
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
45
企业落地案例
5
完整版提示词