
Android Bench 換評測方法:AI 寫 Android app 排名要重新睇
Google 開放任務提交,開發者可以用自己 codebase 試模型
Google 改咗玩法
Google 喺 7 月 8 日更新 Android Bench,根據官方 blog 同 Android Bench 頁面,今次唔止係榜上加咗 Claude Fable 5。Google 仲改用 Harbor framework 重新跑一次全套模型,舊分數放入 archive。Android Bench 3 月先推出,本來係畀開發者睇邊個 LLM 寫 Android code 靠得住;幾個月後就換評測框架,代表 AI coding benchmark 嘅保鮮期其實短到好誇張。

圖片:Android Developers Blog
Fable 5 贏,但唔好只睇名次
截至 2026 年 7 月 8 日官方 leaderboard,Claude Fable 5 以 84.5 分排第一,GPT 5.5 80.2 分第二,Claude Sonnet 5 76.2 分第三;Open-weight 入面 GLM 5.2 係 72.2,Kimi K2.7 Code 係 70.4。官方同一頁顯示,Fable 5 每次完整 benchmark run 平均 latency 8.0 小時、成本 $133.2,GPT 5.5 係 11.4 小時、$138.3。個分數係 100 個任務跑 10 次後嘅平均解決率,唔係一般傾偈、寫文或者數學榜;Fable 5 領先幾明顯,不過佢 79.9 至 88.8 嘅 CI range 同 GPT 5.5 嘅 73.5 至 86.6 有重疊,淨係拎「四分差距」話已經分到勝負,就有啲太急。

圖片:Android Developers
Harbor 令比較貼近真 project
方法轉咗,影響大過排名升跌。Google 之前用 mini-swe-agent v1 做基礎,而家轉向 Harbor,官方話 Harbor 方便其他人用同一套標準跑 benchmark、試自己 setup、分享結果。Android Bench 本身揀咗 100 個任務,來源係 38,989 個 GitHub pull request 入面篩出嚟;方法頁寫明樣本 71% 係 Kotlin、25% 係 Java,UI 題目有 41% Jetpack Compose 同 59% View-based。呢個比例幾重要,因為好多公司 app 都由新舊架構溝埋一齊,距離全新 Compose demo 好遠。
榜單只係 shortlist
呢點亦都解釋到,點解一般 leaderboard 只適合當 shortlist。你間公司個 app 可能有自家 SDK、舊式 View、古怪 Gradle script、server contract、feature flag、內部命名規矩;公共 benchmark 冇可能食晒呢啲上下文。官方方法頁都提醒,cost 同 latency 唔可以單獨睇,因為早早失敗嘅模型可能用少咗 token 同時間,API 價錢又會變,latency 仲受連線狀況同 provider 位置影響。揀 coding agent,最怕見到一張榜就轉晒 team 嘅工具。
開發者可以點用
落手做時,Android developer 可以咁用:先用 Android Bench 篩走明顯唔啱嘅模型,再用自己 repo 做細測試。揀幾條真會遇到嘅任務,例如 Compose migration、Room schema 改動、Wear OS networking、Gradle dependency bump、補 instrumentation test;同一個 prompt、同一個時限,睇邊個可以過 test、patch 夠唔夠細、會唔會亂改 unrelated file、code review 要花幾多時間。Google 而家開放 submit Android development tasks 同 share evaluations,對 freelancer、startup、公司 IT team 嚟講,最有用係可以用自己真係會遇到嘅問題,令 benchmark 貼近日常工作多啲。
下一步睇 community task
Fable 5 排第一當然有新聞味,不過 Android Bench 開始畀開發者改變測試題目,呢件事會影響之後點比較模型。下一步要睇 Google 點 review community task、Harbor Hub 上面嘅 results 會唔會夠透明,仲有長時間任務加入後,而家啲高分模型仲頂唔頂得住。公司若果真係準備買 seat 或改 agent stack,睇榜之餘,要攞自己 codebase 試一次,唔好用人哋嘅 84.5 分代替自己嘅 QA。
參考來源
- 9to5Google — Google is changing how it judges AI models for Android coding, updates list with Fable 5 — original report
- Evolving how LLMs are measured for Android: the next era of Android Bench — 官方 7 月 8 日更新,講明改用 Harbor、加 8 個模型同開放 community submissions。
- Android Bench Leaderboard — 官方 leaderboard,核對截至 2026 年 7 月 8 日分數、CI range、latency、cost。
- Android Bench Methodology — 方法頁,核對任務來源、Kotlin/Java 比例、Compose/View 比例、cost/latency caveat。
- Android Bench Changelog — 核對 7 月 8 日改動同新增/archived 模型。
- Harbor Hub: Android Bench latest dataset — 確認 Android Bench 最新 dataset 同 100 個 task 列表。
- GitHub: android-bench/android-bench — 確認 benchmark tool 點跑、Docker/API key 等條件。
- Elevating AI-assisted Android development and improving LLMs with Android Bench — 3 月推出背景,確認 Android Bench 原先定位同早期做法。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。





