GPT-6 Astra 18小时通关《宝可梦火红》,Minecraft中因一次苦力怕爆炸改种数小时土豆
据The Decoder报道,GPT-6 Astra在《宝可梦火红》中用18小时12分钟拿到冠军,而GPT-5.6 Sol用了96小时35分钟;在ARC-AGI-3上Astra标准接口得分62.7%,GPT-5.6 Sol为7.78%。同一模型在Minecraft被苦力怕炸毁箱子后,给自己立下规则并连续数小时只种土豆。
AI解读:这条新闻最值得看的不是“AI又通关了一个游戏”,而是同一个模型在两件事上表现出的极端反差:在结构化目标明确的游戏里,Astra的进度比上一代快出好几倍;但在开放、随机事件多的环境里,一次失败经验会被它固化成永久规则,反而拖住自己。
对做智能体产品的人来说,Astra的做法提供了一个可复用思路:把不熟悉的机制翻译成自己发明的符号描述,记录对象、坐标、规则和计划,再用“先确认输入是否生效,再决定要不要重复”的方式行动。这个习惯让它不会卡在无效动作上,也是它在ARC-AGI-3上从7.78%跳到62.7%的原因之一。
但同一个习惯在Minecraft里变成了问题。被苦力怕炸掉箱子和床之后,Astra写下的规则是“重要物品永远随身携带,不要再放进无人看管的箱子”,随后数小时只守着土豆田。把经验变成规则本身不是新想法,2023年的Voyager就做过技能库,区别在于Astra直接通过屏幕、鼠标和键盘玩游戏,没有专用游戏接口。
实际影响是双向的:这种“检查再重复”的能力可以帮自动化智能体减少无效循环,适合需要自己探索规则的任务;但在开放世界或真实业务里,随机坏事件可能让智能体过度纠正,把一次损失变成长期绕路。现在还没有公开数据说明这种倾向在任务完成率之外会造成多大成本。
报道依据来自The Decoder摘要和其中引用的Vals AI、ARC Prize等第三方运行记录,不是OpenAI官方发布。多数数字是社区运行结果,适用条件包括特定游戏版本、是否允许存档和快速旅行等,不能直接外推到其他任务。
据The Decoder报道,GPT-6 Astra在《宝可梦火红》中拿到冠军用了18小时12分钟;作为对比,GPT-5.6 Sol用了96小时35分钟,GPT-5.5在超过218小时后仍未通关。该对比来自“GPT Plays Pokemon”项目运营者Clad3815。
Astra在ARC-AGI-3基准上标准接口得分62.7%,使用OpenAI自己的测试装置约为99.9%;GPT-5.6 Sol得分为7.78%,Claude Opus 5略高于30%。ARC Prize解释这一跃升的原因是,Astra会把不熟悉的游戏机制翻译成紧凑的符号描述,并用自己开发的简写跟踪对象、坐标、规则和计划动作。
在Vals AI的Minecraft运行中,Astra运行141小时后被叫停。此前它用不到三小时建好下界传送门、与僵尸战斗、困住骷髅并找回基地;但在一次苦力怕爆炸炸毁箱子和床之后,它写下“重要物品永远随身携带,不要再放进无人看管的箱子”,随后数小时几乎只种土豆。
Astra在Factorio: Space Age的社区运行中,通过带MCP接口的自定义Lua mod控制,约两小时后产出蓝色科技包,约十小时后发射第一枚火箭;同一设置下GPT-5.6 Luna和Fable 5.1从未越过供电和石油勘探阶段。
其他通关记录包括:《传送门》全流程到制作人员名单、《辐射2》22小时、RimWorld中带领殖民地经历多次袭击并最终离开星球,以及《辐射3》主线约59小时。用户imjustnewatai在YouTube发布了《辐射3》完整运行:他本人玩完101避难所开场,把存档交给OpenAI的Codex智能体工具,Astra设为最大推理,之后由它自己选择路线和动作,允许存档、同伴和快速旅行,约59小时后通关。
一次爆炸之后,Astra把“安全”写成了永久规则
Vals AI的Minecraft运行使用通用计算机操作,也就是屏幕、鼠标和键盘,没有专用游戏接口。相比之下,2023年由Nvidia和Caltech参与的研究项目Voyager用GPT-4在Minecraft中提出任务、编写JavaScript代码,并根据报错修改代码,有效程序进入技能库,但Voyager从未真正“看到”游戏,它接收结构化数据并通过Mineflayer接口控制游戏。
在苦力怕爆炸后,Astra笔记里出现了用大写强调的规则:永远随身携带关键物品,使用keepInventory,不要再存放在无人看管的箱子里。此后数小时,它不信任任何高大的绿色物体,曾记录“前方绿色高物是甘蔗,不是苦力怕”,并自责可能犯错丢东西。它也不愿再花一整晚追“深粉色像素”,也就是Minecraft中容易获得的食物来源猪;据Vals AI,唯一让它觉得安全的是土豆田。
ARC Prize说的“先检查再重复”在《辐射3》里也出现
ARC Prize解释Astra的跃升时提到,模型把观察变成规则,再把规则变成计划。这种模式在《辐射3》最难的一段里表现明显:在87号避难所,角色死亡多次、弹药耗尽,Astra不得不回头治疗。状态消息显示,一个动作没有效果时,它不重复动作,而是找原因并记录结果。
一张本该治疗角色的床起初没反应。Astra让游戏运行片刻,再试一次,然后记录:“让游戏短暂运行后床可以用了。生命值已完全恢复到260/260。”射击敌人连续未命中时,它判断火力线上有障碍物,靠近后记录:“靠近后清除了妨碍之前射击的障碍物。”在键盘输入处,它会等到游戏确认按键后再继续。
Astra把这些片段归纳为一条原则:重复输入之前,先确认这次输入是否生效。这听起来很简单,但正是它避免智能体一遍遍循环同一个无效动作的能力。报道指出,在《辐射3》中这种谨慎拖慢了运行,但没有让运行停摆;在Minecraft中则直接导致它停在了土豆田。
这个能力在抽象游戏和开放世界里的不同结果
ARC-AGI-3把模型放进不熟悉的抽象游戏环境,要求它们通过自己的动作推断规则。Astra在这一基准上的分数远高于GPT-5.6 Sol和Claude Opus 5。报道称,在开放世界中随机事件出现时,把一次坏体验变成永久规则,会让模型过度纠正并偏离原本目标。
The Decoder的报道还提到,2022年OpenAI的VPT只在2.5%的运行中拿到钻石镐,远未接近传送门;在一次Vals AI的对比中,VPT需要10分钟才到达某个节点。这些数字用于说明与早期Minecraft智能体的差距。