Google 用 Gemini 3.5 Flash Cyber 密集掃 code,資安 AI 開始鬥規模
Tech News

Google 用 Gemini 3.5 Flash Cyber 密集掃 code,資安 AI 開始鬥規模

圖片:via iThome — https://www.ithome.com.tw/news/177583
TechLab 編輯部(譯)·

專用模型暫時只限政府同可信合作夥伴經 CodeMender 試用

呢個唔係 Gemini app 新功能

iThome 7 月 23 日報道咗 Google 呢項公布;按 Google 公開資料,Gemini 3.5 Flash Cyber 係由 3.5 Flash 調校而成,集中處理漏洞發現、驗證同修補。一般用家唔會喺 Gemini app 見到新按鈕,開發者暫時亦冇公開 API 可以直接調用。Google 話呢款模型稍後會經 CodeMender 展開有限試用,首批只畀政府同可信合作夥伴,之後先逐步擴大範圍。

Gemini 3.5 Flash Cyber 官方主視覺,以藍色盾牌代表資安模型

圖片:Google DeepMind

Flash 嘅優勢係可以掃得密

大型 codebase 有大量分支同執行路徑,搵漏洞好多時唔係靠一次超長推理就搞掂。CodeMender 要反覆叫模型查看唔同位置、驗證可疑結果,再將資料合成報告;每次調用又貴又慢,agent 自然冇辦法掃咁多條路徑。Google 今次揀 Flash 級模型,重點落喺速度同成本,等 agent 可以用同一筆運算資源多試幾條路徑,亦較容易放入 commit 檢查、版本推出前掃描同定期資安工作。

CodeMender 先負責將模型變成完整工具

Flash Cyber 本身只係推理核心,CodeMender 先會安排工具、拆分工作同檢查 patch。Google 早前介紹呢個 agent 時提到,系統會用靜態分析、動態分析、差異測試、fuzzing 同 SMT solver 追查根源;產生修改後,另一批 critique agent 會檢查功能、回歸風險同 coding style,最後仍然交畀人確認。對開發團隊嚟講,呢個分工幾重要:模型識寫 patch,只係流程入面一環,測試環境同審批機制同樣決定佢可唔可以安全接入 CI。

55 個問題有參考價值,但未係獨立實證

Google 話,喺固定調用次數嘅 V8 JavaScript 引擎測試入面,Flash Cyber 搵到 55 個已確認兼不重複嘅問題,主線 3.5 Flash 有 47 個,Claude Opus 4.6 有 36 個;當中 10 個只由 Flash Cyber 發現。CyberGym 測試就容許 CodeMender 為一份最終報告調用模型最多五次,官方形容成績可同體積大好多嘅模型競爭。不過 Google 同時註明部分對手數字來自供應商自行申報,調用預算同 agent 配置亦會影響結果,唔適合只睇一條分數就判勝負。

CyberGym 本身包含 1,507 個來自 188 個開源項目嘅歷史漏洞,主要工作係畀 agent 參考漏洞描述同未修補原始碼,再產生可以重現問題嘅 PoC。呢種評測量度到 agent 睇 code 同驗證漏洞嘅能力,但唔等於佢識得盲掃全新漏洞,亦證明唔到 patch 長期放喺 production 會唔會引起回歸。Google 自家 Big Sleep、Chrome commit pipeline 同 V8 測試較貼近主動發現,但完整測試集同原始結果未有公開,外界暫時難以重跑核對。

Google 內部案例亦解釋咗點解要限用

Google 自述 Flash Cyber 配合 CodeMender 已經用喺 Chrome、Android、Cloud、Ads 同 YouTube 嘅內部 codebase。Google Cloud 漏洞研究團隊話,模型兩小時內喺 public API 搵到遙距執行程式碼漏洞,又喺敏感 production 服務發現記憶體損毀問題,之後更產生一套官方形容為百分百可靠嘅攻擊驗證。呢批資料未經外部重現,不過能力明顯有雙重用途:守方可以快啲確認同修補問題,一旦控制不當,攻擊者亦可以更快將漏洞變成實際攻擊。

一般開發團隊而家可以點理解

Google 另有將 CodeMender 嘅基礎能力放入 Gemini Enterprise Agent Platform,配合已全面供應嘅 Gemini 模型,但呢件事唔代表 Flash Cyber 已經開放。企業 IT 或軟件團隊短期內較值得參考嘅係架構:用較快模型擴闊掃描,再靠專用工具、隔離環境、自動測試同人手覆核逐層收窄結果。真係接入公司 repo 前,仲要問清楚 code 會送去邊、agent 有咩權限、錯誤 patch 點回滾,同埋邊個為漏報負責。下一步要睇 Google 會唔會公開更完整評測方法,同有限試用可唔可以交出外部可核對嘅成效。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook