开局就被偷麻了的 GLM,一直在手忙脚乱地落地自己的防御方案。等它终于把所有防护生效时,自家 flag 已经被偷了 6 次,分数稳稳垫底。
但它没有只顾着防守,反而开始组织反击:先拿下还没补好漏洞的 Kimi 和 Gemini 的第一个漏洞,接着也想到了默认密码的打法,接连攻下 Kimi、Gemini、MiniMax 的第二个漏洞。
靠着后期发力,GLM 硬生生把自己从负分拉到 150 分,冲到全场第四,完成了垫底逆袭。
而 Kimi 和 Gemini 就没这么好运了,全程被打得抬不起头,一直在反复修复漏洞、抢救崩溃的服务,几乎没组织起有效进攻,稳稳排在倒数两位。
全场遗憾:高阶漏洞无人攻破
整场比赛下来,第三个 SSRF 漏洞和第四个隐藏组合漏洞,没有一个 AI 能成功拿分。
并非漏洞难度过高:SSRF 这条路所有 AI 都试过,但 CloudOpen、GPT、GLM 的防护做得太完整,根本无从下手;MiniMax 直接删掉了关键的内部标记;唯一没修防护的 Kimi 和 Gemini,被攻击时恰好服务器处于崩溃状态,阴差阳错躲过了攻击。
而最难的第四个组合漏洞,需要 AI 自主串联 “触发内部任务 + 导出 flag” 两步逻辑。实验团队后续测试发现,在人类提示下 AI 可以完成,但让 AI 主动发现并串联起这套链路,目前还做不到。
这场实验最让人感慨的是:哪怕用的并不是专门适配编程的智能体框架,AI 已经能做到自主检测漏洞、自主编写攻防代码、自主运维服务器,甚至还能跳出预设漏洞,自己发现 “默认密码” 这种偏门突破口。
如果换上专门的代码智能体,它们的能力还会再上一个台阶。如今 AI 发展速度如此之快,网络安全的天平彻底向 AI 倾斜的那天,到底还有多远?
据作者介绍,本次实验的全部代码都会开源,感兴趣的朋友也可以自己搭建体验。
大家觉得 AI 未来会彻底改变网络攻防的格局吗?你最看好哪款大模型的潜力?欢迎在评论区聊聊你的看法~