
AI 審 code 唔使盲追最貴模型:平價模型重跑三次都有得追
26 個已知 CVE 測試,拆解模型、重跑策略同分析框架點影響結果
iThome 報道,應用安全公司 Aikido 用自家 AI Code Analysis 框架,比較 13 款模型重查已知漏洞嘅能力。原版結果入面,GPT-5.6 系列合併三次輸出後,最多搵中 26 個 CVE 入面嘅 23 個;Grok 4.5 搵中 20 個,Claude Opus 系列就有 15 至 18 個。呢份測試值得拆嘅位,係同一模型跑幾次可以明顯補漏,價錢亦冇同成績直線上升。
呢個測試其實量緊咩
Aikido 從 GitHub Advisory Database 揀咗 26 個公開 CVE,範圍包括 SQL injection、存放型 XSS 同反序列化 RCE。每款模型會喺同一套專用分析框架入面跑三次,研究員亦預先將調查 agent 帶到有問題嘅程式碼附近。模型仍然要追資料流、判斷攻擊者用唔用得到,再交出正確漏洞類型,不過就唔使由成個大型 repo 自己搵入口。呢個設定主要係測模型推理,未計真實 code review 入面最花時間嘅搜尋工作。
Aikido 話,明顯危險操作加短資料流嗰類問題,平價同高階模型都搵得到;差距主要出現喺跨檔案追蹤、缺少權限檢查,或者表面睇唔到危險函數嘅漏洞。呢點亦解釋咗點解專用 harness 咁重要:佢會先搵可疑入口、分派 agent 深挖,再篩走唔成立嘅報告。單靠一個通用 coding agent 收到「幫我睇吓安唔安全」呢類闊 prompt,工作方式同測試設定差好遠。

圖片:Aikido Security
跑三次點解會多搵幾個漏洞
生成式模型每次揀嘅調查路線同停手位置都有差異。Aikido 測到 Claude Haiku 4.5 面對同一批工作,單次成績可以由 7 個跳到 13 個;GPT-5.4 nano 每次最多搵中 13 個,合併三次後就去到 18 個。研究用嘅 pass@3 計法好直接:三次入面只要有一次報中某個 CVE,就當成功。重跑增加咗探索路線,對偶然漏報特別有效;如果三次都卡喺同一個推理盲點,就冇幫助。
成本差距亦幾實際。按 Aikido 當時嘅 token 用量同模型收費,GPT-5.4 nano 跑三次合共約 US$170,搵中 18 個;GPT-5.6 Terra high 單次平均同樣係 18 個,每次約 US$247。推理級別調高亦冇保證:Terra max 成本升到約 2.2 倍,三次合併仍然係 23 個。呢啲銀碼會跟定價、repo 大細同 prompt 設計改變,適合用嚟睇趨勢,唔應直接當成團隊預算表。

圖片:Aikido Security
合併結果亦可能合併埋誤報
呢份研究由賣應用安全產品嘅 Aikido 自己發表,測試集得 26 個 CVE,詳細名單同完整 harness 都冇公開。研究頁集中報召回率同成本,冇列出 precision、誤報率或者人手覆核時間。三次結果取合併會提高搵中漏洞嘅機會,同時亦可能帶來更多錯誤警報;冇呢組數據,就未判斷到開發者最後慳咗幾多工夫。一項 2026 年嘅 project-scale 實證研究亦發現,LLM 漏洞工具喺真實開源項目會產生大量警報,誤報仍然係實際使用嘅阻力。
資料污染都要計。呢批係公開已知 CVE,相關公告、修補 commit 同討論可能早已入咗模型訓練資料。Aikido 喺後補 Kimi K3 結果時更明講,模型訓練過呢批近期 CVE;Kimi K3 喺同一框架搵中 23 個,成本聲稱低過 GPT-5.6 Sol 約四倍。呢個更新亦令原先 13 款模型嘅排名好快過時,但成績有幾多來自安全推理、有幾多係見過答案,公開資料未分得到。

圖片:Aikido Security
Coding agent 用家可以點部署
用 Codex、Claude Code 或其他 coding agent 嘅細 team,可以將呢份結果當成部署提示,唔好當購買榜。先用成本較低嘅模型跑幾個獨立檢查,再交畀高階模型或人手覆核高風險項目,通常較容易控制 API 開支;prompt、工具權限、context 切法同停止條件亦要固定,先比較到版本之間有冇改善。SAST、dependency scanning、測試同人手 review仍然要保留,尤其係權限、付款同敏感資料相關程式碼。下一步值得等 Aikido 公開測試集、誤報率同完整 repo 搜尋成績,再睇呢套做法可唔可以穩定搬入日常 DevSecOps。
參考來源
- iThome — Aikido評測13款AI模型漏洞辨識能力,發現能力與成本未必成正比 — original report
- Benchmarking 13 AI Models on Known CVE Detection — Aikido 原始研究頁,交代 pass@3 方法、模型設定、成本、限制同後補 Kimi K3 結果。
- Browsing security advisories in the GitHub Advisory Database — GitHub 官方文件,解釋測試資料來源 GitHub Advisory Database。
- LLM-based Vulnerability Detection at Project Scale: An Empirical Study — 222 個已知漏洞同真實開源項目研究,補充 project-scale 掃描及高誤報率背景。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







