Gemini 3.6 Flash 快咗又平咗,開發者應點揀 3.5 Flash-Lite?
3C 產品

Gemini 3.6 Flash 快咗又平咗,開發者應點揀 3.5 Flash-Lite?

圖片:TechLab 自製資訊圖
TechLab 編輯部(譯)·

兩款模型定位分得幾清楚,遷移舊 API 就要執埋參數

Google 今次一口氣公布三款 Gemini,但開發者真正要揀嘅主要得兩款:3.6 Flash 負責較複雜嘅 coding、文件分析同多步 agent;3.5 Flash-Lite 就主攻大量、重複、講求吞吐量嘅工作。 兩款都已經 GA,可經 Gemini API 使用,亦同樣有 100 萬 token context、最高 64K token 輸出、thinking 同內置工具支援。

3.6 Flash 升級重點喺效率

3.6 Flash 收費係每百萬 input token 1.50 美元、output token 7.50 美元。對比 3.5 Flash,input 價冇變,output 就由 9 美元減到 7.50 美元。Google 引用 Artificial Analysis 數據,話新模型平均少用 17% output token;DeepSWE 個別測試甚至少用 65%,不過後者只代表特定 coding agent 工作,唔應該直接套落所有 app。

Artificial Analysis 用發布前 API 測到,3.6 Flash 喺佢哋嘅 Intelligence Index 同 3.5 Flash 同樣得 50 分,但平均每項工作由 2.7 分鐘縮到 1.3 分鐘,成本亦由 0.59 美元降至 0.50 美元。今次更新主要係加快推理同降低成本,整體能力就未見大幅提升。 Agent 每次任務會反覆推理、call tool 同改 code,少幾輪已經可以明顯減低延遲同帳單。

Google 公布嘅細項分數亦反映到呢點:DeepSWE 由 37% 升至 49%,MLE-Bench 由 49.7% 升至 63.9%,OSWorld-Verified 就由 78.4% 升至 83.0%。官方文件亦承認,3.6 Flash 處理簡單 frontend 工作時可能花多咗步驟檢查,而且人工評審偏好舊模型嘅視覺排版。寫 coding agent、分析圖表或者跑長流程可以先試 3.6;純粹追求靚 UI,prompt 最好寫清楚設計規格。

Gemini 3.6 Flash、3.5 Flash-Lite 同 3.5 Flash Cyber 官方發布主圖

圖片:Google

Flash-Lite 平,但唔代表每項工作都慳錢

3.5 Flash-Lite 每百萬 input、output token 分別收 0.30 同 2.50 美元,預設只用 minimal thinking。Artificial Analysis 測得輸出速度約每秒 350 token,平均任務時間 0.6 分鐘,適合單據擷取、文件分類、結構化 JSON、搜尋 subagent 同其他高流量自動化。不過佢每項工作平均成本由上代 3.1 Flash-Lite 嘅 0.04 美元升到 0.09 美元,原因係新價高咗;吞吐量提升唔等於每張單都平咗。

所以揀模型可以睇個 workflow 點行:大量短任務、格式固定、錯一次可以重試,Flash-Lite 通常較抵;會改 repository、連續 call tool、讀長文件再落判斷,就應該先用 3.6 Flash。Flash-Lite 遇到複雜 subagent 工作亦可以調高 thinking level,但 token 同延遲都會跟住升,最好用自己嘅真實 prompt 計每項完成任務成本,淨睇每百萬 token 個價會睇漏重試率。

換 model ID 前要執 API

今次遷移唔止改一行 model ID。Google 文件列明,temperaturetop_ptop_k 已經標為棄用,新模型而家會忽略,往後版本更可能直接回傳 400;thinking_budget 要改成 thinking_level,預填 model turn 亦唔再支援。舊程式如果靠預填內容迫模型只出 JSON,要轉用 system instruction 或 structured output。上線前亦應重跑輸出格式、function calling、延遲同成本測試,避免模型成功回應,但成個 pipeline 行為已經變咗。

Flash Cyber 暫時同一般開發者無關

3.5 Flash Cyber 係基於 3.5 Flash 微調嘅網絡保安模型,會配合 CodeMender,由多個 agent 掃描、驗證同修補漏洞。DeepMind 話佢喺 V8 測試搵到 55 個確認問題,多過普通 3.5 Flash 嘅 47 個同 Claude Opus 4.6 嘅 36 個;呢啲都係 Google 自家測試結果,競爭對手數字亦有部分來自供應商申報。更重要係,Flash Cyber 只會喺限量試行計劃畀政府同可信合作夥伴使用,暫時冇公開通用 API。一般團隊現階段應集中評估 3.6 Flash 同 Flash-Lite,唔好將 Cyber 寫入產品路線圖。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook