
Qwen 3.8 27B 半小時拆商用 app:單機 AI coding 去到邊?
速度靠模型、量化同推理引擎夾手夾腳,硬件門檻仍然唔低
半小時完成,實際做咗幾多?
XDA 作者 Adam Conway 將一個已購買商用 app 交畀 Qwen 3.8 27B,叫模型分析授權驗證。按佢描述,模型用靜態分析拆開 arm64 framework,追查幾千行反組譯碼,搵出驗證函數、呼叫位置同藏喺 binary 入面嘅公開金鑰。第一次重建出嚟嘅金鑰雖然過到簽署檢查,但完整性 hash 對唔上;模型自己發現問題再做,直至數值逐 byte 相符,最後仲寫出可運作嘅繞過方案。作者報告由開始到完成大約用咗 30 分鐘。
呢個結果幾搶眼,不過證據範圍要講清楚。作者冇公開 app 名、binary、prompt、完整操作紀錄、人工介入次數同驗收準則,外界亦冇辦法重跑同一項測試。即係話,呢 30 分鐘係一個作者個案,暫時唔係可重現 benchmark。目標 app 有幾難、之前有冇已知漏洞、模型讀過幾多輔助資料,都會大幅影響結果。原作者自己亦承認只試咗一個 app、一次執行,換個保護做得複雜啲嘅目標,結果可以完全唔同。

圖片:Lenovo
27B 模型點解開始做得到?
Qwen 官方模型卡顯示,Qwen 3.8 27B 係一個 270 億參數 dense 模型,原生 context 長度有 262,144 token,可延伸至 100 萬 token,授權係 Apache 2.0。佢預設開啟 thinking mode,亦針對 coding、工具調用同長時間 agent 任務調校。呢類 reverse-engineering 工作要模型一路讀反組譯結果、記住函數關係、叫工具、檢查輸出再修正,長 context 同持續保留推理狀態確實有幫助。今次最值得睇嘅位,係模型遇到 hash 唔吻合時冇草草收工,而係識得返轉頭查錯。
獨立評測亦提供到少少背景。Artificial Analysis 將 Qwen 3.8 27B xhigh 放喺 4B 至 40B 開放權重模型組別前列,Intelligence Index 得分 52;不過佢同時屬於非常長氣嗰批模型,整套評測產生嘅輸出 token 遠高過同組中位數。呢點同 XDA 作者嘅感受吻合:模型準確度可以幾好,但預設最高推理強度連簡單要求都可能燒幾百至幾千 token。單睇每秒生成速度,未必估到一項任務最後要等幾耐。

圖片:Lenovo
50 token/s 唔係模型自己突然快咗
作者用嘅 ThinkStation PGX 配備 NVIDIA GB10 Grace Blackwell、128GB LPDDR5X 統一記憶體同 273GB/s 頻寬。佢話原始設定大約跑到每秒 15 至 30 token,改用 SGLang、NVFP4 同 DFlash2 後,coding 同 reasoning 工作升至約每秒 50 token。三樣嘢各有分工:SGLang 負責高效率調度模型同 KV cache;NVFP4 將權重壓到 4-bit 級別,減低記憶體佔用兼用盡 Blackwell 嘅 FP4 運算;DFlash2 就先平行估一批候選 token,再交原模型核實,減少逐粒 token 排隊生成嘅時間。
DFlash2 官方模型卡聲稱,喺指定 greedy 設定下,核實後輸出可同原模型一致;佢公開嘅單用戶 H200 測試亦錄得約 2.67 至 3.43 倍加速。不過嗰啲數據用 H200、指定 benchmark 同特定參數,唔可以直接套落 GB10 上面。XDA 個案由最高 30 升到約 50 token/s,只反映作者嗰套設定。量化版本、context 長度、prompt、草稿接受率同推理強度一變,速度同記憶體需求都會跟住變。NVFP4 理論上亦可能影響模型質素,文章冇提供未量化版本做同題對照。
本地跑敏感程式碼,代價係先買一部 AI 工作站
本地模型最大好處好實際:binary、授權檔同公司程式碼可以留喺自己部機,唔使交去外部 API,斷網環境照樣做到。對處理未公開產品、客戶程式碼或者惡意軟件樣本嘅開發團隊,呢點有真價值。不過 ThinkStation PGX 唔係普通電腦,Lenovo 官方規格列明佢係 128GB 統一記憶體嘅專用 AI 工作站;美國市場報道嘅入場價由 US$5,079 起,香港官方售價同供應暫時未見確認。模型權重雖然免費,但要順暢跑起整套設定,硬件、時間同維護一樣要成本。
今次個案顯示,27B 級本地模型有機會處理部分高難度程式分析;不過模型會唔會交出繞過程式,暫時仍要使用者自己把關。作者最初遇到模型拒絕整繞過方案,之後模型完成漏洞分析,又改為交出可運作程式,呢種前後不一值得模型開發者再處理。至於企業應唔應該投入本地 AI coding,下一步要睇同一套任務喺多個 binary、不同量化版本同雲端模型之間嘅重複測試,先計到準確度、速度同硬件開支值唔值。
參考來源
- XDA Developers — I gave Qwen 3.8 27B a reverse-engineering job I assumed needed a frontier model, and it finished in 30 minutes — original report
- Qwen3.8-27B 官方模型卡 — 核實參數量、context 長度、授權、thinking mode 同框架支援
- Qwen3.8 官方 GitHub — 核實推出日期、本地部署選項同官方開發工具支援
- DFlash2 for Qwen3.8-27B 模型卡 — 解釋 speculative decoding 做法、測試環境同官方加速數據
- Lenovo ThinkStation PGX Product Guide — 核實 GB10、128GB 統一記憶體、273GB/s 頻寬同產品定位
- Artificial Analysis:Qwen3.8 27B 評測 — 提供獨立能力評分、速度同輸出冗長程度作背景比較
- TechRadar:Lenovo ThinkStation PGX review — 美國市場入場價參考;並非香港售價
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







