Android Bench 換評測方法:AI 寫 Android app 排名要重新睇
3C 產品

Android Bench 換評測方法:AI 寫 Android app 排名要重新睇

圖片:via 9to5Google — https://9to5google.com/2026/07/08/google-updating-android-bench-testing-method/
TechLab 編輯部(譯)·

Google 開放任務提交,開發者可以用自己 codebase 試模型

Google 改咗玩法

Google 喺 7 月 8 日更新 Android Bench,根據官方 blog 同 Android Bench 頁面,今次唔止係榜上加咗 Claude Fable 5。Google 仲改用 Harbor framework 重新跑一次全套模型,舊分數放入 archive。Android Bench 3 月先推出,本來係畀開發者睇邊個 LLM 寫 Android code 靠得住;幾個月後就換評測框架,代表 AI coding benchmark 嘅保鮮期其實短到好誇張。

Android Bench 官方榜單截圖,Claude Fable 5 排第一,GPT 5.5 排第二

圖片:Android Developers Blog

Fable 5 贏,但唔好只睇名次

截至 2026 年 7 月 8 日官方 leaderboard,Claude Fable 5 以 84.5 分排第一,GPT 5.5 80.2 分第二,Claude Sonnet 5 76.2 分第三;Open-weight 入面 GLM 5.2 係 72.2,Kimi K2.7 Code 係 70.4。官方同一頁顯示,Fable 5 每次完整 benchmark run 平均 latency 8.0 小時、成本 $133.2,GPT 5.5 係 11.4 小時、$138.3。個分數係 100 個任務跑 10 次後嘅平均解決率,唔係一般傾偈、寫文或者數學榜;Fable 5 領先幾明顯,不過佢 79.9 至 88.8 嘅 CI range 同 GPT 5.5 嘅 73.5 至 86.6 有重疊,淨係拎「四分差距」話已經分到勝負,就有啲太急。

Android Bench 方法頁入面揀 pull request 任務嘅漏斗圖

圖片:Android Developers

Harbor 令比較貼近真 project

方法轉咗,影響大過排名升跌。Google 之前用 mini-swe-agent v1 做基礎,而家轉向 Harbor,官方話 Harbor 方便其他人用同一套標準跑 benchmark、試自己 setup、分享結果。Android Bench 本身揀咗 100 個任務,來源係 38,989 個 GitHub pull request 入面篩出嚟;方法頁寫明樣本 71% 係 Kotlin、25% 係 Java,UI 題目有 41% Jetpack Compose 同 59% View-based。呢個比例幾重要,因為好多公司 app 都由新舊架構溝埋一齊,距離全新 Compose demo 好遠。

榜單只係 shortlist

呢點亦都解釋到,點解一般 leaderboard 只適合當 shortlist。你間公司個 app 可能有自家 SDK、舊式 View、古怪 Gradle script、server contract、feature flag、內部命名規矩;公共 benchmark 冇可能食晒呢啲上下文。官方方法頁都提醒,cost 同 latency 唔可以單獨睇,因為早早失敗嘅模型可能用少咗 token 同時間,API 價錢又會變,latency 仲受連線狀況同 provider 位置影響。揀 coding agent,最怕見到一張榜就轉晒 team 嘅工具。

開發者可以點用

落手做時,Android developer 可以咁用:先用 Android Bench 篩走明顯唔啱嘅模型,再用自己 repo 做細測試。揀幾條真會遇到嘅任務,例如 Compose migration、Room schema 改動、Wear OS networking、Gradle dependency bump、補 instrumentation test;同一個 prompt、同一個時限,睇邊個可以過 test、patch 夠唔夠細、會唔會亂改 unrelated file、code review 要花幾多時間。Google 而家開放 submit Android development tasks 同 share evaluations,對 freelancer、startup、公司 IT team 嚟講,最有用係可以用自己真係會遇到嘅問題,令 benchmark 貼近日常工作多啲。

下一步睇 community task

Fable 5 排第一當然有新聞味,不過 Android Bench 開始畀開發者改變測試題目,呢件事會影響之後點比較模型。下一步要睇 Google 點 review community task、Harbor Hub 上面嘅 results 會唔會夠透明,仲有長時間任務加入後,而家啲高分模型仲頂唔頂得住。公司若果真係準備買 seat 或改 agent stack,睇榜之餘,要攞自己 codebase 試一次,唔好用人哋嘅 84.5 分代替自己嘅 QA。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook