RTX 5080 跑 Qwen 3.6:16GB VRAM 真係夠取代 Claude?
3C 產品

RTX 5080 跑 Qwen 3.6:16GB VRAM 真係夠取代 Claude?

圖片:via XDA Developers — https://www.xda-developers.com/qwen-3-6-local-coding-model-barely-open-claude/
TechLab 編輯部(譯)·

單檔腳本一次成功,大型 repository 仍然卡喺讀入速度

XDA 作者 Korbin Brown 用 RTX 5080 跑本地 Qwen 3.6,叫模型寫一個 Python 檔案整理工具,第一次輸出已經做到分類、按年份分資料夾、checksum 重複檔案檢查、撞名改名、--dry-run 同錯誤統計。結果的確幾靚,但標題話自己「幾乎唔再開 Claude」,睇完設定同測試方法,呢句只適合形容佢自己嗰類工作,未足以證明 16GB 顯示卡已經頂到完整 coding agent。

實際跑緊邊個 Qwen 3.6

作者用 Ollama 拉取 qwen3.6:35b,實際對應 Qwen3.6-35B-A3B 嘅 24GB Q4_K_M 量化版。佢冇用 Ollama 另外列出、足足 70GB 嘅 35b-a3b-coding-bf16。呢個分別幾重要:前者係壓細咗嘅通用 open-weight 模型,官方本身有強調 agentic coding 能力;後者先係名字明確帶 coding、以 BF16 儲存嘅大版本。兩者所需硬件同輸出質素唔應撈埋講。

35B-A3B 採用 MoE 架構,總共有 35B 參數,每個 token 約啟動 3B。不過 只啟動 3B 唔代表其餘權重可以消失,24GB 模型始終塞唔入 RTX 5080 嘅 16GB VRAM。XDA 嗰部機另有 Ryzen 7 9800X3D、32GB DDR5 RAM,作者觀察到約 11GB 放咗喺系統 RAM,CPU 使用率約 50%,GPU 就約 30%。換句話講,呢個玩法食埋 CPU、RAM 同記憶體頻寬,舊平台照跟設定,速度可以差好遠。

65K context 換嚟嘅速度落差

作者將 context 設成 65,536 token,temperature 就用 0.6。Qwen 官方列出原生 context 係 262,144 token,不過標稱上限同消費級硬件實際跑到幾快係兩回事。Ollama 喺少過 24GiB VRAM 嘅機預設只開 4K context,官方亦提醒加大 context 會食多啲記憶體;今次手動推到 65K,正好令 16GB 顯示卡加系統 RAM 嘅取捨現晒形。

XDA 量到生成速度有 68.93 token/s,模型約兩分半鐘輸出 10,785 token,當中包括 thinking 內容,寫單一腳本算爽快。真正樽頸係 prefill,即模型讀 prompt 同現有程式碼嘅速度,今次得 10.4 token/s。作者個 prompt 只有 198 token;按佢嘅速度推算,塞入 20,000-token codebase,可能要等約半個鐘先見到第一個輸出。單檔工具同讀完整 repository,體驗幾乎係兩個世界。

一次成功值得睇,但仲未係 Claude 對決

作者有實際跑過生成嘅腳本:dry run 同正式搬檔結果一致,預先放入嘅重複檔案搵得到,撞名冇覆蓋原檔,第二次執行亦識得跳過已整理內容。呢啲驗收好過淨係望程式碼,不過文章冇公開完整測試資料、程式碼同自動化 test,亦冇叫 Claude 用同一個 prompt、同一批檔案再跑一次。現有結果只證明 Qwen 今次做到個任務;冇同 Claude 用相同條件比較,就未算係公平 benchmark。

嚴格講,測試亦未去到 coding agent 常見嘅工作量。模型收到清楚規格後一次過吐出腳本,冇自己搜尋 repository、改多個檔案、執行 test、讀錯誤再修正,亦冇展示工具權限同失敗後點處理。官方話 Qwen 3.6 改善咗 repository-level reasoning,但 XDA 呢次冇測到嗰部分。要判斷可唔可以接手 Claude Code,至少要加入多檔修改、現有測試套件同幾輪修錯先有說服力。

私隱同成本先係本地模型最實際嘅賣點

對私人 repository、未公開產品程式碼或者客戶資料,本地 Ollama 可以喺下載模型後離線推理,prompt 同原始碼留喺自己部機,呢方面乾脆過消費者版雲端服務。Anthropic 容許用家關閉模型改進用途,但消費者版 Claude Code 仍有資料保留政策;要求更嚴格嘅團隊,通常要再睇商業方案或零保留安排。本地 workflow 都要逐個檢查 editor extension 同外部工具,否則模型留喺本機,plugin 仍有機會連出去。

Claude Pro 月費係 US$20,Max 就由 US$100 起;如果部 RTX 5080 電腦本身已經用嚟打機或工作,將簡單腳本轉交本地模型,的確可以慳用量同避免撞限額。專登為呢件事買高階 GPU、32GB RAM 同較新 CPU,條數就冇咁直接,仲有電費、設定時間同維護成本。而家比較實際嘅做法,係將規格清楚、context 短嘅一次性工具交畀 Qwen,牽涉大型 repository、反覆修錯同趕時間嘅任務繼續用雲端模型。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook