
ROG Flow Z13 跑本地 120B 模型:Lemonade 設定、速度同代價
128GB 統一記憶體夠放四層模型,續航仍然未有數據
平板跑到 120B,靠嘅係 128GB 記憶體
XDA 作者 Joe Rice-Jones 今次用嘅係 ROG Flow Z13 KJP 特別版,入面有 Ryzen AI Max+ 395、Radeon 8060S 同 128GB LPDDR5X 統一記憶體。CPU 同 GPU 共用同一個記憶體池,令平板有位放入桌面獨立顯示卡通常裝唔落嘅大型模型。ASUS 官方亦確認 128GB 版本容許重新分配 system RAM 同 VRAM,不過改完要重新開機。
呢點亦解釋咗點解一般 16GB、32GB Windows 平板冇得照抄。XDA 呢套設定有約 85GB 模型權重同時留喺記憶體,單計容量已經超出大部分流動電腦。買部普通 Ryzen AI 平板再裝 Lemonade,功能上可以跑細模型,但唔會突然變成同一級嘅 120B 機器。

圖片:ASUS ROG
安裝唔複雜,記憶體同 context 要自己執
Lemonade 官方提供 Windows MSI 安裝程式,裝好後可以經桌面介面管理模型,亦有 CLI 畀進階用戶調整 backend、context 同載入設定。至於 Strix Halo,Lemonade 官方建議 Windows 用 64GB system RAM/64GB dedicated GPU RAM 自動配置;XDA 作者就喺 AMD Adrenalin 將 96GB 撥畀 Radeon 8060S。兩者唔同,照搬前最好先睇清楚自己要同時開幾多 Windows 軟件。
另一個伏位係 context window。XDA 作者接駁程式碼 agent Crush 時,一句簡單招呼連同完整 tool schema 已經有 13,072 tokens,但佢當時嘅 Lemonade 預設只開 4,096 tokens,請求自然放唔落。佢改成 32,768 tokens 後先正常運作。Context 開大會用多啲記憶體,所以 RAM 僅僅夠放模型嘅機,未必仲有足夠空間處理長文件或大型程式碼庫。
五個模型分工,細問題唔使次次開大炮
作者嘅 router 用 Qwen3.5-0.8B 判斷工作難度,再將簡單問答交畀約 2GB 嘅 Qwen3.5-2B、日常寫作交畀約 7GB 嘅 Qwen3.5-9B、程式工作交畀約 19GB 嘅 Qwen3-Coder-30B-A3B。複雜推理先叫用約 59GB 嘅 gpt-oss-120b MXFP4,亦可以喺請求加入 force: heavy 強制揀重型模型。
呢套分流實際過淨係展示「平板開到 120B」,亦更容易睇到日常點用。細模型載入快,普通問題又唔使長時間霸住全部運算資源;遇到程式碼、長文件或難題先換大模型。Lemonade 官方文件顯示,router collection 對 app 仍然係一個 OpenAI-compatible model,回應 header 亦會交代命中咗邊條分流規則,出錯時有路可查。
52 tokens/s 好搶眼,但只代表呢部機同呢套設定
按 XDA 作者測試,約 56GB 嘅 gpt-oss-120b 檔案載入需時 27.6 秒,首個回答等 0.86 秒,生成速度有 52.03 tokens/s。一次錯誤設定令同一模型跌到 CPU-only,速度只剩 0.44 tokens/s,相差超過一百倍。就算容量夠,如果冇正確啟用 GPU backend,部機一樣會慢到唔實用。
程式碼方面,作者用 Qwen3-Coder-30B-A3B-Instruct-GGUF 配 13,927-token context,錄得 52.34 tokens/s。Lemonade 官方模型目錄亦將呢款約 18.6GB 嘅 Q4_K_M 模型列為 coding、tool-calling 推介。不過以上全部都係 XDA 作者喺一部 128GB Flow Z13 上嘅個人結果,原文冇交代功耗模式、插電狀態同室溫,唔應直接套落其他 Ryzen AI 裝置。
OpenAI-compatible API 先令佢有實際用途
Lemonade 會喺本機提供 HTTP API,主要介面兼容 OpenAI 格式,包括 /v1/chat/completions、/v1/responses 同 /v1/models。支援自訂 base URL 嘅程式碼 agent、聊天介面或公司內部工具,理論上只要指向本機 localhost:13305,再揀啱模型名稱,就可以沿用原有整合方式。官方亦另外提供 Ollama、Anthropic-compatible 路由同 MCP gateway。
對離線處理公司文件、未公開程式碼或敏感資料嘅人,呢個設計幾吸引:模型推理可以留喺裝置入面,又唔使為每個工具重寫一套接口。不過「本地模型」唔等於整個 agent 都完全離線;agent 用到網上搜尋、Git 平台或其他外部工具時,資料仍可能離開部機。硬碟加密、app 權限同公司政策依然要照顧。
流動性成立,離電續航就未證實
原文完全冇提供電池時間、平均功耗、風扇噪音或離電後速度,所以暫時只能確認 120B 模型可以喺平板形態嘅 Windows 電腦運行,未足以判斷佢可唔可以長時間離開火牛工作。連續推理會長時間用盡 iGPU 同記憶體頻寬,如果想帶住周圍用,最好等有齊插電、離電速度同續航測試先再判斷。
呢次示範最有價值嘅地方,係 Lemonade 將多個本地模型包成同一個 API 入口,工具唔使理會背後揀緊 2B、30B 定 120B。至於 ROG Flow Z13,128GB 版本確實做到一部機包辦晒,但呢套玩法對記憶體容量要求好高,暫時仍然屬於小眾高階配置。
參考來源
- XDA Developers — My tablet runs the same LLMs as my PC, and it's become my favorite way to use them — original report
- ROG Flow Z13 (2025) 官方產品頁 — 核對 Ryzen AI Max+ 395、Radeon 8060S、128GB 統一記憶體同記憶體分配說明。
- Lemonade 安裝文件 — 核對 Windows MSI 安裝方式同官方支援平台。
- Lemonade FAQ — 核對 Strix Halo Windows GPU 記憶體分配建議同效能統計方法。
- Lemonade 模型目錄 — 核對 Qwen3-Coder、gpt-oss-120b 等支援模型、量化格式同檔案大小。
- Lemonade API 文件 — 核對 OpenAI、Ollama、Anthropic-compatible API 同 MCP gateway 支援。
- Lemonade Router API 文件 — 核對 router collection、分流規則、回應 header 同 context 載入設定。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







