上个月,一位原英国首相府AI工程师将GPT-5、Claude等前沿模型接入《文明6》游戏,跑完了23局长程对局。
这23局游戏暴露的不是“AI有多笨”,而是在长程任务重反复出现的两类系统性缺陷:
“感知场效应”(sensorium effect):AI扔核弹破坏了对手的文化胜利,却漏看了对手正沿着自己只差两票的外交路径反超。
“知行鸿沟”(knowing–doing gap):玩亚历山大大帝,疯狂发展军事科技,在游戏日记里规划了详细的扩张目标和兵力配置,结果一百多回合都没造出一个军营。
过程中,游戏还展现出作为AI长程复杂任务绝佳测试场的潜力。