Gemini 3.6 Flash 平咗亦快咗,Google 用 Flash Cyber 推漏洞修補 agent
Tech News

Gemini 3.6 Flash 平咗亦快咗,Google 用 Flash Cyber 推漏洞修補 agent

圖片:via iThome — https://www.ithome.com.tw/news/177518
TechLab 編輯部(譯)·

兩款通用模型拆工合作,資安版暫時只限指定夥伴

iThome 報道,Google 喺 7 月 21 日公布 Gemini 3.6 Flash、3.5 Flash-Lite 同專做程式碼安全嘅 3.5 Flash Cyber。表面睇係三款新模型,實際部署思路幾清楚:複雜 coding 同多步 agent 交畀 3.6 Flash,大量搜尋、文件抽取同子任務用 Flash-Lite;高風險漏洞研究就鎖喺 CodeMender 入面,暫時唔開放畀一般開發者。

3.6 Flash 升級重點係縮短每項工作所需時間

Gemini 3.6 Flash 嘅 API 輸入價維持每 100 萬 token 1.5 美元,輸出就由 3.5 Flash 嘅 9 美元減到 7.5 美元。Google引用 Artificial Analysis 數據,話新模型平均少用 17% 輸出 token,做 DeepSWE 任務時部分情況更少用達 65%。agent 每多兜一個圈,就會多一輪推理、工具呼叫同上下文,所以少用 token 除咗慳錢,亦直接縮短完成時間。

Artificial Analysis 嘅預先測試量到 3.6 Flash 每秒輸出約 304 token,平均每項工作由 3.5 Flash 嘅 2.7 分鐘縮到 1.3 分鐘,成本就由 0.59 美元降至 0.50 美元。不過佢喺 Intelligence Index 同 3.5 Flash同樣攞 50 分,反映今次進步主要來自快、少兜圈同平啲,整體能力未見全面升級。呢批數字屬第三方 benchmark,唔係 TechLab 實測。

Gemini 3.6 Flash、3.5 Flash-Lite 同 3.5 Flash Cyber 官方主視覺

圖片:Google

Flash-Lite 平得多,適合做大量子任務

模型 API 輸入/輸出價 官方定位 Artificial Analysis 速度
Gemini 3.6 Flash US$1.50/US$7.50 coding、多步 agent、多模態分析 約 304 token/s
Gemini 3.5 Flash-Lite US$0.30/US$2.50 搜尋、文件抽取、高吞吐子任務 約 350 token/s

Flash-Lite 嘅輸入價得 3.6 Flash 五分一,輸出亦只係三分一左右,預設推理強度仲較低。Google 官方 benchmark 顯示,佢喺 Terminal-Bench 2.1 由上代 Flash-Lite 嘅 31%升到 54%,SWE-Bench Pro 同 OSWorld-Verified 亦跑贏 Gemini 3 Flash。呢啲仍然係 Google 揀選同公布嘅測試,部署前最好用公司自己嘅文件、程式庫同工具鏈再跑一次。

比較實際嘅做法係用 3.6 Flash 做主 agent,負責拆題、判斷風險同整合答案,格式轉換、資料抽取同多個獨立搜尋,就分派畀 Flash-Lite 處理。兩款模型都支援 100 萬 token context 同內置 Computer Use 工具,但低價模型一樣可能答錯;涉及改 production code、批核付款或操作管理介面,權限、測試同人工確認仍然要分開處理。

Gemini 3.5 Flash Cyber 配上藍色盾牌嘅官方圖片

圖片:Google DeepMind

CodeMender 會先搵根源,再驗證個 patch

Flash Cyber 係由 3.5 Flash 微調出嚟嘅資安模型,會喺 CodeMender 入面由多個 agent 重複掃描唔同 code path,再合併成一份報告。CodeMender 會用 debugger、程式碼搜尋、靜態及動態分析、差異測試、fuzzing 同 SMT solver 找出漏洞根源,跟住產生 patch,再用測試同另一個批判 agent 檢查功能有冇變、會唔會引入 regression,同埋改動係咪符合專案風格。

呢套設計最重要嘅一環係驗證。安全 patch 改得少,唔代表風險低;表面見到 buffer overflow,真正出錯位置可能喺另一段狀態管理邏輯。Google DeepMind 表示,CodeMender 只會把通過多重檢查嘅 patch 交畀研究員,而現階段所有準備提交到開源專案嘅改動仍有人手覆核。Google 公布嘅內部漏洞發現成果同 CyberGym 成績亦屬廠商測試,暫時未有足夠獨立結果證明佢喺其他大型 codebase 同樣穩定。

CodeMender 把中斷程式路徑修補連接嘅官方概念圖

圖片:Google DeepMind

Flash Cyber 暫時冇得自行開 API

Google 明講 Flash Cyber 有雙重用途風險,初期只會經限量試行計劃,向政府同「可信合作夥伴」提供 CodeMender 存取權。一般公司而家可以接觸嘅係 Gemini Enterprise Agent Platform 入面部分 CodeMender 基礎能力,唔等於可以揀 Flash Cyber 模型,亦唔代表可以自行產生或驗證 exploit。開發團隊短期內較實際嘅方向,係把通用 Gemini 模型接入現有掃描、測試同人工 code review,而唔好當佢係全自動安全閘門。

香港 app 可用,開發者 API 仍有地區限制

截至 2026 年 7 月 22 日,Google 支援頁面已把香港列入 Gemini 網頁版同手機 app 地區。不過 Google AI Studio/Gemini API 嘅官方地區名單截至 4 月 28 日仍然冇香港,香港帳戶或設於香港嘅 server 未必可以直接用開發者入口。公司若果經 Google Cloud、Gemini Enterprise 或其他 region 部署,仍要逐一確認有冇相關模型、資料會喺邊度處理,同埋合約包唔包括有關服務;3.6 Flash 同 Flash-Lite 喺相關 Google Cloud region 嘅實際可用性暫時係 [待確認]

Google 同時透露 3.5 Pro 仲由合作夥伴測試,Gemini 4 就已開始預訓練,兩者都冇正式推出日期。對而家要控制 agent 成本嘅團隊,值得先測 3.6 Flash 同 Flash-Lite 點樣分工,再睇真實任務嘅成功率、token 數同人工覆核時間,唔使等下一個型號名。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook