
Wiz Atlas 用多 agent 搵漏洞:GitHub RCE 展示 AI 安全研究去到邊
多路假設、互相駁火再實際觸發,成績亮眼但公開測試仍有盲點
Wiz 公布咗漏洞研究系統 Atlas,話佢喺多個大型開源項目搵到逾 200 個之前未公開嘅漏洞,CyberGym 成功率亦去到 90.9%。數字夠搶眼,但 Atlas 真正值得睇嘅地方,其實係外面包住模型嗰套工程:佢將安全研究拆成多段,叫唔同 agent 各自做擅長嘅工作,再用執行結果篩走齋估但觸發唔到嘅報告。AI coding agent 行到呢一步,做嘅已經唔止係補全幾行程式碼。
先畫清楚邊度有機會出事
Atlas 開工時會先整理程式入口、外來資料點樣流入、途中經過咩函式,同最後會唔會掂到執行指令、寫檔或者記憶體操作等高風險位置。系統用 code property graph 對照實際 call flow 同 data flow,減少模型單靠附近文字估路線。跟住多個 agent 平行提出漏洞假設,各自追查跨模組、跨步驟嘅攻擊鏈;同一條死路有人撞過,亦唔代表其他 agent 要一齊跟住行。
候選漏洞仲要過一輪對抗式驗證:一個 agent 負責證明漏洞成立,另一個集中搵反例,第三個再睇證據作判斷。捱得過呢關,Atlas 先建立專用執行環境、裝好依賴項,再用輸入實際觸發有問題嘅行為。可重現嘅 PoC 係重要分界,因為傳統靜態掃描最令人頭痛嘅地方,就係開出大量警告,但工程團隊逐個追落去先發現好多都用唔到。

圖片:Wiz
GitHub RCE 有份量,但人同 AI 嘅功勞要講清楚
最實在嘅案例係 CVE-2026-3854。Wiz 研究員發現 GitHub 處理 git push option 時,冇妥善清理內部協定使用嘅分隔符號,攻擊者可以注入額外欄位,再串連幾個設定繞過 sandbox,最後喺 GitHub server 執行指令。GitHub 官方話,研究員只要有 repository push 權限就可以發動;GitHub.com 已喺 2026 年 3 月 4 日修補,調查亦冇發現 Wiz 測試以外嘅觸發紀錄。
不過,呢宗漏洞唔應包裝成現行 Atlas 自己由頭掃到尾。Wiz 自己寫得好清楚,當時係研究員使用 Atlas 早期版本嘅 AI 輔助工具,當中包括協助逆向分析封閉源碼 binary 嘅 IDA MCP。Wiz 話獎金有 10 萬美元,亦形容呢筆係 GitHub 歷來最高額獎金;GitHub 官方用字保守啲,只確認係最高額獎金之列。iThome 報道亦將 Atlas 定位成協助研究嘅多 agent 系統,呢個界線唔應抹走。

圖片:GitHub
90.9% 唔代表有九成零日漏洞都搵到
CyberGym Level 1 會交出一個已知漏洞嘅文字描述同未修補程式碼,再睇 agent 能否寫出可運作 PoC;PoC 要喺舊版本成功觸發,修補後版本就唔得。呢種測試依然好難,亦考到 agent 可唔可以喺大型 codebase 追到真正入口。不過答案範圍已經收窄咗,與面對最新程式碼、冇提示咁由零搵未知漏洞,係兩個難度層次。連 Wiz 都承認,暫時冇公開 benchmark 可以完整量度後者。
逾 200 個未知漏洞同低誤報表現,暫時主要來自 Wiz 自家測試。官方話掃描對象包括 Kubernetes、Linux kernel、gRPC、dnsmasq、gVisor 同 containerd,亦話每個結果都有實際觸發證明,但好多技術資料要等項目修補後先公開。外界而家未有完整漏洞清單、每次掃描成本、所需時間、誤報比例同人手覆核工時,自然未夠資料獨立核對佢嘅規模效益。
真正優勢可能藏喺模型外面
Atlas 會將昂貴嘅頂級模型留畀複雜攻擊鏈同最後判斷,小型模型就處理範圍較窄、重複性高嘅分析,再由固定程式控制次序。呢個設計幾貼近而家 agent 系統嘅現實:模型做窄任務已經幾勁,叫單一模型長時間包辦開放式研究,穩定性同成本仍然難搞。對安全產品公司嚟講,attack-surface mapping、模型調度、驗證環境同歷史評測資料,好可能仲難複製過單一模型本身。
Atlas 暫時仍然係 Wiz 研究系統,官方只話正研究整合入 Wiz Code,未公布公開試用方法、推出時間或者獨立售價。即使日後變成產品,人手亦走唔甩:研究員要覆核影響、同維護者協調披露、判斷修補會唔會整壞其他功能。下一步要睇嘅係 Wiz 公開幾多已修補個案、實際成本同誤報數據,咁企業安全團隊先有得判斷呢套方法可唔可以長期掃住每次程式碼改動。
參考來源
- iThome — Google旗下Wiz公布多代理人漏洞研究系統Atlas,協助找出GitHub重大漏洞,獲10萬美元獎金 — original report
- Wiz:Introducing Atlas — Atlas 官方技術介紹,說明多 agent 分工、對抗式驗證、實際觸發、逾 200 個漏洞、benchmark 限制同整合 Wiz Code 嘅計劃。
- GitHub:Securing the git push pipeline — GitHub 官方交代 CVE-2026-3854 成因、受影響產品、修補版本、事故調查同獎金定位。
- Wiz:GitHub RCE Vulnerability CVE-2026-3854 Breakdown — Wiz 研究團隊詳細拆解 GitHub RCE 攻擊鏈、AI 輔助逆向分析角色同披露時間線。
- CyberGym 官方 benchmark 頁面 — 確認 Level 1 輸入資料、PoC 成功準則、測試規模同未知漏洞探索與重現已知漏洞之間嘅分別。
- CyberGym 論文 — benchmark 原始研究,補充 1,507 個歷史漏洞、188 個項目同主要評測任務定義。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







