
Android Bench更新:Claude Fable 5跑贏,Gemini排後,成本同私隱要計
Google新榜單加入Harbor框架同8個模型,開發者揀agent要睇埋repo同token
Google自己個榜,Gemini今次冇霸頭位
Google 7月8日更新 Android Bench,重點係換咗 Harbor framework 做基礎、全數模型重跑,又加咗8個新模型入榜:Claude Fable 5、Claude Sonnet 5、Claude Opus 4.8、GLM 5.2、Kimi K2.7 Code、MiniMax M3、Qwen 3.7 Plus 同 Qwen 3.7 Max。Android Bench本身專攻Android開發任務,唔係一般LeetCode題;官方方法頁寫明,佢用100個Android開發任務,題目由38,989個開源pull request池入面揀出嚟,再用測試去驗證patch有冇真係解決問題。
榜面幾直接:官方7月8日最新結果,Claude Fable 5 84.5分排第一,GPT 5.5 80.2分第二,Claude Sonnet 5 76.2分第三;Gemini 3.1 Pro Preview有73.7分,排到第五,Gemini 3.5 Flash就係71.1分。Google 自己個榜冇將 Gemini 硬推上第一,可信度反而高啲。開發者要留意嘅係,Android task 同一般 coding benchmark 可以係兩回事。

圖片:Android Developers Blog
頭幾名好強,但唔平
Fable 5排第一唔意外,Anthropic而家主打長時間agentic coding,Android Bench亦跑到8.0小時平均latency,同時每次完整100 task benchmark run平均成本係133.2美元。GPT 5.5得分低一截但都要138.3美元,Sonnet 5係99.9美元。呢啲數唔等於你改一個bug就要133美元,不過佢提醒咗一件事:agent mode一跑多檔案、多輪debug、再加CI回合,月費plan之外嘅token數好快變成項目成本。
open-weight模型要睇平定穩
開放權重組別入面,Google官方話GLM 5.2以72.2分排頭,Kimi K2.7 Code有70.4分;兩者已經貼近Gemini 3.1 Pro Preview,但速度同部署形態差好遠。GLM 5.2喺榜上平均latency係38.9小時,成本117.0美元;Kimi K2.7 Code latency 31.8小時,不過成本48.1美元。即係話,平過Fable唔代表即刻啱全team日用,慢、配套、host喺邊、可唔可以插入你現有CI,全部都要擺返入實際 workflow 試過先知。
Qwen同MiniMax畀個現實感
今次新加入嗰堆唔係個個都貼前列。MiniMax M3有63.6分,Qwen 3.7 Plus有57.7分,Qwen 3.7 Max得54.2分,名叫Max都唔保證Android task一定醒。呢度要小心嘅係 marketing 講法:大 context、agent 能力、前端 demo 跑得快,唔代表放入 Android repo 都一樣掂。Gradle、Compose migration、Wear OS networking、平台 API 變動同測試環境,全部都會考模型識唔識改 code,同埋會唔會整亂舊架構。
公司揀agent,要先問repo可唔可以俾人睇
呢份榜最好用嘅方法,係當採購清單第一關:先揀幾個喺Android task上分數過得去嘅模型,再喺自己repo入面跑一批真ticket。尤其本地做app嘅freelance、agency同startup team,客戶code可唔可以交畀雲端模型、API key點管、prompt同log會唔會入訓練集,全部都係合約同風險問題。Google自己Gemini in Android Studio文件寫明,code context要你同意先會交出去;免費版你打入chat嘅code有機會用嚟訓練,商業版、Google One或個人API key就有另一套保護,Google話唔用你輸入嘅code嚟訓練。
點睇呢份榜
Android Bench而家最有用嘅地方,係逼大家由分數睇到成本同失敗模式。Google方法頁亦講得幾白:成本同latency係跑完整100 task suite嘅平均值,失敗率高嘅模型可能早早停手,所以望落會平啲、快啲;latency仲受網上路徑同provider server位置影響。要揀Android AI agent,我會先睇三樣:喺你自己repo成功率、每個真ticket燒幾多token、公司可唔可以接受code context出街。榜單有用,但唔好當成IDE入面一撳即啱用嘅保證。
參考來源
- Ars Technica — Google updates Android Bench with new LLMs, but Gemini still lags behind — original report
- Android Developers Blog: Evolving how LLMs are measured for Android — 官方7月8日公告,核對Harbor框架、8個新模型同頭三名分數。
- Android Bench leaderboard — 官方即時排行榜,核對7月8日各模型分數、latency同成本。
- Android Bench methodology — 官方方法頁,核對100個任務、38,989個pull request池、成本同latency計法限制。
- android-bench/android-bench GitHub repository — GitHub repo,核對工具、dataset同提交任務方式。
- Gemini in Android Studio: Data and privacy — Google私隱文件,核對Gemini in Android Studio點處理code context同訓練用途。
- Anthropic: Claude Fable 5 and Claude Mythos 5 — Anthropic官方頁,核對Claude Fable 5定位同API定價。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







