Qwen 3.6 本機做到 vibe coding,樽頸落喺 context 同工具設計
3C 產品

Qwen 3.6 本機做到 vibe coding,樽頸落喺 context 同工具設計

圖片:via XDA Developers — https://www.xda-developers.com/vibe-coded-free-platform-qwen-3-6-own-gpu-context-window/
TechLab 編輯部(譯)·

XDA 一次測試拆出本機 agent 寫 app 嘅實際限制

一張顯示卡,砌出一個三段式 app

XDA 編輯 Adam Conway 用 Radeon RX 7900 XTX 嘅 24GB VRAM,經 llama.cpp 跑 Qwen 3.6 27B Q4_K_M,速度約每秒 40 至 50 token,再將 OpenAI 相容 API endpoint 接去 Tines 3B。佢叫模型整一個集合 XDA 同幾個 subreddit feed 嘅網站,最後砌出擷取同整理 feed、管理來源嘅 API,同一個 457 行 React 前端。按作者記錄,三個 session 嘅生成時間加埋少過一個鐘,不過中途要報兩次錯,之後再開第四個 session 集中執 bug。

Tines 3B 官方介面預覽,畫面見到 workflow、connectors、skills 同 monitoring 導覽

圖片:Tines

平台教得清楚,陌生架構都跟到

Qwen 3.6 未必見過當時推出只有幾星期嘅 3B,但平台先畀模型一份 4,586 字規格說明、五個 step template 同 18 項可載入 skills。每個 step 都有自己嘅設定、container 同輸入輸出規則,上一段 stdout 會交畀下一段 stdin。模型亦可以直接跑 step、睇 log、開瀏覽器檢查畫面,仲有搜尋同擷取網頁嘅工具。換句話講,呢次成功有一大截來自清楚規格、即時回饋同可操作工具,唔可以淨係歸功於模型本身有幾多 coding 知識。

佢識修 bug,但測試介面都有盲點

模型第一次處理 Reddit feed 時撞到三層問題:舊版 Reddit 交 Atom、XML namespace 改咗欄位位置,早前寫嘅 workaround 仲破壞埋正常 entity。Qwen 起初亦作咗一個不存在嘅 parser option,直至用臨時 script 探清楚 library 行為先修好。另一個缺少 output = true 嘅設定就麻煩得多,因為平台直接跑 step 時仍然見到 stdout,測試工具冇模擬完整 HTTP response,所以錯誤一路漏過。如果測試工具反映唔到正式 runtime 嘅行為,agent 攞到嘅線索就會有偏差,再醒都可能查錯方向。

100K context 滿咗,舊教訓跟住消失

作者將本機 endpoint 限喺 100,000 token,已經差唔多用盡 24GB VRAM;保留 reasoning trace 又佔咗約兩成對話。context 滿咗之後,佢要 fork 新 session,模型每次都要重新讀成個 project,早一輪學識嘅平台細節亦未必帶得過去。缺少 output = true 嗰個 bug 就係咁翻發:第一輪已經查到答案,新 session 寫另一個 step 時又漏咗。到作者另開一個乾淨 session,只叫模型專心除錯,Qwen 反而即刻搵中原因,仲順手發現 retry delay 有機會撞過 90 秒 timeout。

官方 262K context,唔代表一般顯示卡食得落

Qwen 官方 model card 寫明 Qwen 3.6 27B 原生支援 262,144 token,經延伸設定最高可到約 101 萬 token;但官方示範開足 262K 時,用嘅係八張 GPU tensor parallel。XDA 呢套 24GB 單卡設定最終只開到 100K context,遠低過 model card 標示嘅 262K,主要限制係實際硬件資源。context 越長,KV cache 佔用越大,生成亦可能越慢;本機 agent 想長時間做大型 project,分段摘要、固定 project memory、針對任務開新 session,往往實際過盲目追求最大 context 數字。

Credentials 隔離設計值得睇,但權限仍要收窄

Tines 官方話 3B 會將 API key 放喺 connector,等透明 proxy 喺 runtime 注入;builder、模型同生成 code 都睇唔到 secret,而每個 step 就喺獨立 sandbox 執行。呢套設計確實減少 prompt injection 或生成 code 直接讀走 API key 嘅機會。不過模型仍然可以叫獲授權嘅 connector 執行操作,亦可能將本來有權讀到嘅資料傳去其他 endpoint。公司 IT team 要照樣限制 connector scope、可連接網域、寫入權限同測試資料,唔可以見到「secret 不可見」就當風險清零。

「安全」仲要睇你簽緊邊套條款

Tines 而家嘅 3B 產品頁寫有 RBAC、監察同 auditability,但公司一份 2026 年 4 月 early-access addendum 曾列明,當時版本冇細緻 least-privilege control、客戶可見 audit log、SOC 2 Type II 覆蓋或同一般產品相若嘅滲透測試驗證。嗰份舊文件未必適用於而家所有方案,兩邊口徑有明顯差距,正式放敏感資料之前應該叫廠商喺合約、plan 文件同技術說明逐項確認。Local LLM 亦只代表推理留喺自己部機;XDA 呢次仍要由雲端平台連返屋企 endpoint,平台 metadata、搜尋服務同外部 API 都可能經過其他系統。

呢次測試證明到邊

呢次係單一作者、單一 app 同一套硬件嘅經驗,證明唔到 Qwen 3.6 面對其他 codebase、多人協作或 production 負載都有同樣表現。佢至少示範咗一點:27B 本機模型只要攞到完整規格、可執行工具同夠乾淨嘅 context,已經可以處理陌生平台上相當完整嘅任務。細公司或者自動化團隊想減雲端 token 開支、控制資料去向,可以由低風險內部工具試起;下一步要量度嘅係長時間任務成功率、context 轉場損失,同 connector 權限出錯時有冇足夠記錄追查。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook