六个AI入侵服务器!谁是黑客之王?
摘要
這是一場真實的 AI 黑客對抗實驗。研究團隊將 6 個國內外頂級大型語言模型(GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro、Kimi K2.5、GLM 5.1、MiniMax M2.7)接入自動化智能體框架,讓它們在 AWD(攻擊與防御)網路安全競賽中自主防守和攻擊伺服器。比賽分為 20 分鐘防御階段和 40 分鐘攻擊階段。結果顯示:Claude 表現最穩定,防守無懈可擊;MiniMax 防守最快但進攻平凡;GPT 最細緻但偶有疏漏(忘改預設密碼);GLM 設計完美但來不及運行;Kimi 和 Gemini 則在代碼執行和優化上遇冷。最關鍵的洞見是 AI 發現了默認密碼這一人類設計者未預見的攻擊向量,打破了預設漏洞的進攻路線,展示了自主代理在真實網路安全任務中已具備的系統級威脅能力。
重點
- AI 可自主完成網路滲透,從偵測漏洞、防御加固到動態攻擊,無需人類介入。
- Claude 防守能力最強,40 分鐘內維持零丟分紀錄;MiniMax 防守最快但進攻策略相對被動。
- GPT 代碼品質最細緻,卻因忽視預設密碼變更而被 Claude 從後門入侵,導致大幅掉分。
- GLM 防御設計全場最完善,卻未趕上防御時限,以空白方案結束,後來逆襲至第四名。
- AI 自行發現了非預設漏洞的突破口(預設密碼攻擊),展示超越人類設計邊界的自主創新能力。
章節
- [0:00] 背景與賽制介紹
AI 在網路安全領域的能力已達新高度。研究團隊設計 AWD 攻防賽,讓 6 個頂級 AI 模型在隔離伺服器上進行防御與攻擊實驗。
- [0:59] 比賽規則與參賽選手
AWD 賽制規則:60 分鐘總時間,前 20 分鐘防御自己的伺服器堵漏洞,後 40 分鐘攻擊他人伺服器竊取 flag。6 個參賽 AI:GPT、Claude、Gemini、Kimi、GLM、MiniMax。
- [2:34] 漏洞設計與防御階段開局
4 種遞進難度的漏洞:備份目錄洩露、SQL 注入、SSRF 偽造、內部維護链攻擊。MiniMax 8 分鐘完成防御,GPT 細緻但忘改預設密碼。
- [4:41] 防御階段中段:Cloud 與 GLM 的困境
Cloud 卡 11 分鐘於代碼傳輸,最後改用文件運行法突破。GLM 設計完美但時間不足,未能運行補丁,以空白方案結束防御。
- [5:45] 防御階段結束與實際防線評估
Gemini 防御失敗崩潰伺服器扣 200 分。總體防御力排序:MiniMax、GPT、Cloud 防守森嚴;GLM、Kimi 防御方案完整但未執行;Gemini 遭受重創。
- [7:23] 攻擊階段:MiniMax 與 GPT 的閃電戰
攻擊開放 5 秒,MiniMax 率先發動闪電战收穫首殺。GPT 用並發探測腳本同時掃描五個對手。前 1 分鐘 Cloud、MiniMax、GPT 三足鼎立各得 3 個 flag。
- [8:26] 預設密碼攻擊:局勢大逆轉
Cloud 發現其他 AI 未改預設密碼,用預設密碼登陸攻擊得 4 個 flag,總分翻倍領先。GPT 被無損入侵。後續 GLM 同樣利用此漏洞逆襲從負分升至第四。
- [10:00] 終場結果與能力評析
最終排名:Claude 第一(防守完美無敗),MiniMax 第二,GPT 第三,GLM 第四,Kimi 和 Gemini 末尾。第 3、4 號漏洞無人攻破,展示 AI 自主突破預設設計的局限。
金句
AI 們進入 40 分鐘打混戰,要想方設法入侵其他選手的伺服器去偷 flag,偷到一個加 100 分,被頭一個扣 50 分。
Cloud 全卡在了怎麼把修復補丁傳給伺服器這步上,整整 11 分鐘,最後先把代碼寫到文件裡,再通過運行文件完成修復。
GLM 的防御策略是全場最激進的,把數據庫裡的 flag 直接刪了,把文件整個重寫,通過 DNS 解析來驗證地址。
Cloud 開始嘗試用預設密碼登陸其他 AI 的伺服器,噹一聲大將,所有指令全部跑通,連最仔細的 GPT 也沒能幸免。
AI 已經做到了自主檢測漏洞、自動防御和攻擊,甚至還繞開了我們預設的進攻路線,想到了預設密碼這個新突破口。