数智星河 发表于 2026-8-28 08:48:23

把6个AI扔进塔防厮杀,谁能活到最后?谁表现最拉,谁又被严重低估?

6个国内主流AI大模型,放进同一个塔防游戏里,谁的推理和决策能力更强?
这次我把豆包、MiniMax、千问、Kimi、GLM、DeepSeek拉到一起,统一规则、统一环境,不考察视觉能力,只看它们如何根据实时战场信息做决策。有人稳扎稳打,有人疯狂攒钱,也有人看似马上要输了却一路苟到最后。
六位选手鏖战五关,最后谁拿到了第一?又是谁紧随其后?真正的结果,看到最后一刻才知道。
当然一场游戏不能定义一个AI大模型,但这种让AI真正“自己做决策”的比拼,确实比单纯跑Benchmark有意思得多~
<iframe src="//player.bilibili.com/player.html?isOutside=true&aid=117121006837729&bvid=BV1Fb8E6wEDj&cid=41153465243&p=1" scrolling="no" style="width:100%; height:680px;border="0" frameborder="no" framespacing="0" allowfullscreen="true"></iframe>
页: [1]
查看完整版本: 把6个AI扔进塔防厮杀,谁能活到最后?谁表现最拉,谁又被严重低估?