Gemini 3.5 Pro 再延期:coding 能力點解成為焦點
Tech News

Gemini 3.5 Pro 再延期:coding 能力點解成為焦點

圖片:via iThome — https://www.ithome.com.tw/news/177449
TechLab 編輯部(譯)·

官方只確認仍在測試,推出日子同規格暫時未有下文

六月過咗,官方時間表亦跟住消失

Google 五月發布 Gemini 3.5 Flash 時,明確話 3.5 Pro 已經內部使用,預計下一個月推出。不過六月過咗,Gemini API、Google AI Studio 同 Vertex AI 都冇見到 3.5 Pro。Google 而家只確認正同合作夥伴測試呢款模型、升級版 Flash 同其他模型,冇再畀推出日期、價錢、模型規格或者公開 benchmark。所以坊間講嘅七月底、八月甚至直接跳過呢代,暫時都只可以當傳聞,唔適合攞嚟排正式開發時間表。

Google Gemini 3.5 官方發布頁主視覺,展示 Gemini 3.5 字樣同漸變色背景

圖片:Google

「由頭打造」仍然只係消息人士講法

iThome 報道轉述 Bloomberg 消息,話 Gemini 3.5 Pro 已經落後原定時間幾個月,DeepMind 主要想改善 coding 能力;報道亦引述匿名消息人士,指團隊更新訓練資料後,成果仍未達內部目標。至於模型因幻覺、輸出唔一致而要由頭打造,Google 冇公開確認過。官方回應只講測試繼續,同埋公司仍快速推出唔同價位嘅模型,冇直接解釋技術問題去到幾嚴重。兩邊資料要分開睇,唔可以將內部消息寫成 Google 公告。

Coding 出事,對 agent 嘅殺傷力特別大

Google 咁緊張 coding,原因幾實際。一般聊天答錯一句,用家仲有機會即場察覺;coding agent 就會讀成個 repository、改幾個檔案、跑指令,再按錯誤結果繼續下一步。模型一旦前後判斷唔一致,細錯可以沿住十幾輪工具操作一路放大,最後留下表面行到、實際難維護嘅程式碼。Pro 型號要處理長時間、多步驟工作,穩定性往往重過一次 benchmark 攞高分,Google 寧願押後,至少反映內部門檻唔只睇生成一段 code 有幾靚。

Flash 已經好快,但未填到 Pro 個位

Google 將 Gemini 3.5 Flash 定位成 coding 同 agent 工作嘅主力,官方模型卡亦顯示佢喺部分測試贏過 3.1 Pro;不過同一張表入面,其他對手喺若干 coding、長內容同推理項目仍然領先。呢個結果解釋咗點解 Google 唔容易用 Flash 當完整替代品:處理大量自動化任務時,速度同成本比較重要;但去到大型程式庫重構、複雜除錯同企業流程,團隊仍然會追求更高能力。Pro 延期期間,Google 平台有可用模型,卻少咗一款可以正面承接高難度工作的旗艦選擇。

API 用家唔使即刻改 code,但規劃會變得尷尬

3.5 Pro 未公開,即係暫時冇新 endpoint、價錢、配額、地區供應同淘汰時間表,現有 API 亦唔會因今次延期突然失效。麻煩位反而係原本等住新模型做評估嘅團隊:prompt、工具調用、延遲預算同成本模型全部未有實物可以驗證。如果開發團隊預計今季用 Gemini 升級 coding agent,最好先用現有穩定模型做基準測試,並抽離模型層,避免成套流程綁死喺一個仲未存在嘅 model ID。

企業揀模型,唔應該再押注發表日期

公司採購亦唔適合停低等 3.5 Pro。較穩陣嘅做法係按真實工作建立測試集,分開量度程式碼正確率、工具調用失敗、延遲、成本同人工覆核時間,再用兩至三款模型比較。等 3.5 Pro 真正進入 Gemini API 或 Vertex AI,先加落同一套測試。Google 下一步要交代嘅係正式 endpoint、價錢、模型卡同穩定版本安排;喺呢啲資料出現之前,「仍在測試」只代表開發未停,唔代表已經接近推出


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook