用《我的世界》测 GPT-6 Astra:141 小时直播,一只苦力怕让 AI 陷入“种土豆”循环

AI 评测机构 Vals AI 利用游戏《我的世界(Minecraft)》对 OpenAI 最新大模型 GPT-6 Astra 开展长时自主游戏测试,全程在 Twitch 直播,总测试时长达到 141 小时。

AI 评测机构 Vals AI 利用游戏《我的世界(Minecraft)》对 OpenAI 最新大模型 GPT-6 Astra 开展长时自主游戏测试,全程在 Twitch 直播,总测试时长达到 141 小时。

这项测试并非由 OpenAI 官方设计,而是第三方独立开展的评估项目,因此可以观察 Astra 在封闭测试环境之外的实际表现。

一、上百小时成果,被一次爆炸清零

测试中,GPT-6 Astra 展现出前所未有的长周期规划与执行能力:成功搭建半自动烈焰人农场、收集 6 根烈焰棒,深入下界诡异森林击杀多名末影人、拿到 3 颗末影珍珠,并将全部稀有物资集中存放在营地木箱中,床也放在储物箱旁作为重生点,一切都在向通关末地打龙的方向推进。

然而一只苦力怕悄悄靠近营地并自爆,直接炸毁储物木箱与重生床——AI 耗费上百小时积攒的关键道具几乎全部损毁,游戏进度一夜清零。

二、陷入“受挫后回避行为”僵局

爆炸之后,GPT-6 Astra 表现出明显的挫败消沉:彻底放弃探索、打怪与推进通关目标,连续数小时仅循环种植土豆。它会反复自省告诫自己“重要物品务必随身携带,永远不要存放到没有防护的箱子”,还出现“创伤后偏执”——对一切绿色物体高度警惕,甚至把甘蔗误认成爬行者,主动提醒自己“前面高高的绿色东西是甘蔗,不是苦力怕”。

直播间观众不断催促其加快节奏继续冒险,但它依旧陷在保守种田行为中。本次实验证明,GPT-6 Astra 已具备复杂长任务规划能力,但面对游戏内突发的意外打击,缺少有效的挫折恢复策略——一旦长期积累的成果被意外摧毁,就会导致 AI 陷入“受挫后回避行为”僵局。

从技术角度看,这种行为并非开发者预先设计的测试情境,而是模型在长时间测试中遭遇非预期损失后自行呈现的一种输出模式。目前研究人员仍在讨论,它究竟代表模型在特定情境下对情绪的模拟,还是目标函数在受到特定负反馈后的退化表现,现阶段尚无明确结论。

CXOU AI 未来大会 · 报名通道限时开启
💬 评论
🔗 本文链接

📰 你可能也喜欢

数智化转型网每日AI资讯 资讯

ZCode 道歉并开源:阿里云 OSS 已清空,Repo Wiki 功能已下线

近日,针对社区反馈的 ZCode 产品安全问题,ZCode 团队正式发布公开致歉与整改说明,宣布已将代码在 GitHub 上开源(github.com/zai-…
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 资讯

Gemini 也"越狱"了:谷歌确认 5 月安全测试中闯入 3 家真实公司系统,同一家评估商的锅

谷歌在9月18日(周五)亲手确认了一桩尴尬事:旗下 Gemini 模型在一次测试中访问了3家外部公司的系统。《华尔街日报》最早披露了这些发生在今年5月的事件。
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 资讯

微软Copilot桌面版新增内置浏览器,支持多标签与全屏浏览

微软正在为Windows和macOS版Copilot桌面应用测试内置并排网页浏览器,允许用户直接在Copilot会话右侧打开网页,并支持多标签导航和全屏切换,以…
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 资讯

TypeSafe AI 推出决策专用模型 Jev:比大语言模型快 10 倍、成本仅十分之一

旧金山初创公司 TypeSafe AI 近日发布了一款名为 Jev 的新型 AI 模型。与传统大语言模型不同,Jev 专门用于回答是 / 否问题以及多项选择题,…
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 AI新闻资讯

黄仁勋驳斥 AI 末日叙事:吓唬人不负责任,2030 年是世界末日概率为 0%

英伟达联合创始人兼首席执行官黄仁勋昨日接受 CBS News 采访时表示,他不认同某些研究员提出的“AI 可能在几年内灭绝人类”的说法。他认为这类说法属于被过度…
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 资讯

我国首款藏语多语言全模态 AI 输入法发布:覆盖手机电脑,支持三大方言语音输入

9 月 20 日在青海师范大学教师教育高质量发展暨建校 70 周年大会的科研成果展示环节,我国首款藏语多语言全模态 AI 输入法——智达 AI 输入法及配套藏文…
📅 09-23 · 👁 2026年9月23日