本機 Qwen 卡住先叫 Claude Fable 5:慳 API 錢但私隱代價唔細
3C 產品

本機 Qwen 卡住先叫 Claude Fable 5:慳 API 錢但私隱代價唔細

圖片:via XDA Developers — https://www.xda-developers.com/taught-local-llm-call-fable-5-gets-stuck-changed-everything/
TechLab 編輯部(譯)·

兩次失敗先升級雲端,規則點寫同邊界點守都要計清楚

XDA 作者 Anurag Singh 用 Ollama 跑 Qwen 2.5 Coder 7B,平時改碼、搵 bug 同執小功能都交畀本機模型,遇到解唔開嘅問題先向 Claude Fable 5 求助。呢種分級架構幾啱獨立開發者同細團隊:本機硬件繼續有用,普通工作冇 API 帳單,較強模型就集中處理真係棘手嗰部分。不過,作者展示嘅只係一次個人實驗,未有成功率、token 用量或者同其他設定對照,暫時唔應該當成通用答案。

交接唔係成個專案搬上雲端

作者整咗一個 Python 工具,等 Qwen 可以經 Anthropic Messages API 問 Fable 5。交出去嘅內容包括問題描述、試過嘅方案、現有錯誤,同相關程式碼或專案背景;Fable 回覆診斷方向之後,Qwen 再留喺原本 Ollama 對話入面改檔同跑指令。雲端模型只做顧問,真正操作專案嘅仍然係本機 agent,所以唔使每次重新解釋成個 repository,亦可以收窄送出去嘅資料量。

「卡住」要變成可以量度嘅條件

原文定咗三個門檻:Qwen 要先試過兩個實質唔同嘅方案、兩次仍然撞到同一錯誤,而且再搵唔到合理方向,先可以叫 Fable。呢個思路啱,但淨靠細模型自行判斷仍然有漏洞;佢可能將同一招改少少字就當新方案,亦可能一早估錯錯誤根源。穩陣做法係由外層程式記錄測試結果、錯誤指紋、改動範圍同呼叫次數,冇新測試通過、錯誤完全冇變,先計一次真正失敗。

呢層控制亦應該寫入工具本身,唔好只放喺模型規則入面。每個任務最多升級一至兩次、同一錯誤唔可以重複問、超過預算就停,全部都可以用程式硬性執行。涉及付款、身份驗證、客戶資料或者 production 設定時,再加人手確認。咁先可以截停模型判斷飄忽造成嘅循環呼叫,亦方便之後睇紀錄,分清楚 Fable 真係解到難題,定係 Qwen 本身只差一段較清楚嘅背景。

慳唔慳,要睇升級頻率同輸出長度

Anthropic 而家為 Fable 5 定價每百萬個輸入 token 10 美元、輸出 token 50 美元;原文程式將單次輸出上限設成 4,000 token,但上限唔代表每次都會用盡。真正影響帳單嘅係每日升級幾多次、每次塞幾多程式碼,同 Fable 回覆有幾長。實際部署最好逐次記低輸入、輸出同費用,按 repository 設每日上限;先交錯誤、相關函式同最細重現例子,通常平過貼成個檔案。

Qwen 官方型號卡寫明 7B Instruct 版支援最高 131,072 token,不過預設設定係 32,768,拉長仲會食更多記憶體。Ollama 亦提醒,較長上下文會增加記憶體用量。即係型號表寫到 128K,都唔代表一般電腦可以輕鬆跑盡。作者本機用到嘅上下文較短,所以整理一份精簡交接資料,會實際得多,唔使將成個專案硬塞入細模型。

程式碼離開部機,私隱承諾已經改變

最容易忽略嘅係,呼叫 Fable 嗰刻,相關程式碼、錯誤輸出、檔案路徑甚至環境資料都已經送到雲端。Anthropic 官方列明,Fable 5 要保留資料 30 日作安全監察;就算原本有 zero data retention 設定,使用呢類 covered model 亦要另開保留資料嘅 workspace。公司內部程式碼、未公開產品、客戶資料或者受合約限制嘅專案,唔可以見到「只傳相關片段」就當風險消失。

較實際嘅防線係預設拒絕傳送 .env、金鑰、憑證、客戶識別資料同指定敏感目錄,交接前再用 secret scanner 掃一次,亦要保留實際送出內容嘅審計紀錄。高敏感專案可以完全停用雲端工具,或者改用公司批准嘅模型同環境。呢套分級做法值得試,但要用成本紀錄、固定測試集同資料分類跑一段時間,先睇得出佢有冇真係幫團隊慳到錢同時間。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook