
Google 推 Gemini 3.5 Flash Cyber:細模型多跑幾轉,先限政府同受信任夥伴
配合 CodeMender 重複掃更多 code path,成本同速度仍等公開數據
先講清楚:普通開發者而家用唔到
Google 公布 Gemini 3.5 Flash Cyber,定位係專攻軟件漏洞搜尋同修補嘅 AI 模型,底層建基於 Gemini 3.5 Flash。佢會先經 Google 嘅 CodeMender coding agent,畀政府同受信任夥伴使用。普通 Gemini 3.5 Flash 已經公開放入 Gemini API、AI Studio 同多款開發工具,唔代表 Flash Cyber 都有同樣使用渠道。 暫時冇公開 API、價格、申請方法或者全面推出時間,香港軟件團隊亦未有渠道直接採用。

圖片:Google DeepMind
Flash Cyber 點樣配合 CodeMender
Flash Cyber 負責理解 code 同搵可疑路徑,CodeMender 就包辦外圍工作,包括靜態分析、動態分析、fuzzing、differential testing 同 SMT solver,再交畀專門 critique agent 檢查修補有冇引入 regression。Google 喺 2025 年公布 CodeMender 時話,半年內已經向開源項目提交 72 個 security fix,當中最大嘅項目約有 450 萬行 code。;不過所有 patch 當時仍由研究員逐個覆核,呢點亦反映自動改 code 距離無人看管仲有一段路。
細模型多跑幾次,換取更闊搜尋範圍
今次最值得睇嘅設計係調度方式。大型模型單次推理能力通常較強,但每次 call 用多啲運算資源,掃成個大型 codebase 時未必適合不斷重試。Google 嘅做法係畀 CodeMender 高速重複呼叫 Flash Cyber,改用唔同方向探索 code path。如果每次 call 真係夠平,團隊就可以用同一筆預算跑多幾轉,增加撞中隱蔽漏洞嘅機會。 呢種橫向擴展取向對每日改動頻密、repository 又大嘅項目特別有吸引力。
55 個問題有參考價值,但未夠證明平快兼準
Google 話 Flash Cyber 最多呼叫五次後,喺 CyberGym benchmark 有足以同大型模型競爭嘅表現。掃描 V8 JavaScript engine 時,佢搵到 55 個確認、冇重複嘅問題;普通 Gemini 3.5 Flash 搵到 47 個,Claude Opus 4.6 就有 36 個,當中 10 個只由 Flash Cyber 發現。數字幾搶眼,不過官方未交代每個模型用咗幾多 token、時間同成本,亦冇公開完整 task 設定、誤報率、嚴重程度或者有幾多最終變成獲接納嘅 patch。「搵到問題」同「交到安全又可維護嘅修補」中間,仍然差一輪工程驗證。
同 Mythos 嘅分別,暫時主要係產品取向
Anthropic 嘅 Mythos 5 走高運算量、高能力路線,亦因為網絡安全能力具有雙重用途而設有存取限制。The Verge 指 Mythos 5 使用成本係 Claude Opus 4.8 嘅兩倍;Google 就將 Flash Cyber 形容成成本較低嘅替代方案。不過兩邊公開嘅測試條件、agent harness 同存取模式都有差異,現階段未適合直接用漏洞數量判勝負。Google 冇公布 Flash Cyber 定價,所謂「較平」暫時仍係官方定位,未有獨立測試證明實際掃描一個 repository 可以慳幾多。
掃得多,人手覆核工作亦會增加
高頻掃描可以帶出更多候選漏洞,同時亦會製造更多報告、PoC、patch 同 regression 測試結果。開發團隊原本怕漏報,之後可能要處理大量優先級判斷同 maintainer review;CodeMender 嘅自動驗證夠唔夠準,實際上會直接決定 Flash Cyber 有幾啱用。對企業 IT 同開源開發者嚟講,呢條低成本密掃路線值得留意,但要等 Google 公開價格、完整 benchmark、誤報數據同更多上游接納紀錄,先可以判斷佢係咪真係減到日常修補工作量。
參考來源
- The Verge — Google launches a cheaper alternative to large AI security models like Mythos — original report
- Introducing Gemini 3.5 Flash Cyber — Google DeepMind 官方公告連結,係產品定位、CodeMender 整合方式同官方測試數字嘅第一手來源。
- Introducing CodeMender: an AI agent for code security — Google DeepMind 詳解 CodeMender 用到嘅分析、驗證工具、72 個修補紀錄同人手覆核安排。
- Gemini 3.5: frontier intelligence with action — 確認普通 Gemini 3.5 Flash 嘅定位同公開渠道,協助分清楚佢同受限 Flash Cyber 嘅可用範圍。
- CyberGym: Evaluating AI Agents’ Real-World Cybersecurity Capabilities at Scale — CyberGym 官方項目頁,交代 benchmark 點樣用真實開源漏洞評估 agent,同埋呢類測試本身涵蓋咩工作。
- Assessing Claude Mythos Preview’s cybersecurity capabilities — Anthropic 第一手講解 Mythos 嘅網絡安全能力、雙重用途風險同受限制部署背景。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







