
Qwen3.8-Max API 平過 Claude,2.4 兆權重開放都唔代表人人自建
1M context 同低價幾吸引,香港團隊仍要分清 API 入口同資料地區
iThome 報道,阿里巴巴喺 8 月 3 日推出旗艦模型 Qwen3.8-Max,官方話模型有 2.4 兆個總參數,每次推理啟用 950 億個參數,支援文字、圖片、文件同影片輸入,主力攻 coding、專業工作同長時間 agent 任務。模型 API 已經上線,阿里巴巴亦預告下星期開放權重,不過授權條款、下載位置同正式硬件要求暫時全部未公布。
正式版同 Preview 唔好撈亂
早幾星期出現嘅 qwen3.8-max-preview 係 Preview 版本;Model Studio Token Plan 官方說明顯示方案行訂閱加 Credits 制。今次 QwenCloud 已經列出 qwen3.8-max 正式模型 ID 同按 token 收費,兩個入口唔應當成同一項產品。至於名稱相近嘅 Qwen3-8B,嗰個「8B」講緊 80 億參數小模型,同 Qwen3.8 呢個版本號冇關係。
API 價錢夠進取,但 agent 成本唔止睇單價
QwenCloud 官方價係每百萬 input token US$2、output token US$6,implicit cache input 就係 US$0.25;context window 有 1M token,最多收 991K input,同一次最多輸出 131K。同期 Claude Opus 4.8 收 US$5/US$25,GPT-5.6 Sol 收 US$5/US$30,兩者都係約 1M context;Gemini 3.5 Flash 就收 US$1.50/US$9。Qwen 嘅 output 價差距尤其大,不過 agent 會反覆讀 code、思考同叫工具,最後埋單仲要睇完成任務用咗幾多輪,單次 token 價平唔代表成項工作一定平。
Coding 數字幾搶眼,證據暫時都係廠方提供
按 iThome 引述阿里巴巴數據,Qwen3.8-Max 喺 Terminal-Bench 2.1 得 86.6 分,低過 GPT-5.6 Sol 嘅 88.8,但高過 Qwen3.7-Max 嘅 74.5;PaperBench 就報 93 分。阿里巴巴仲展示模型連續跑約 16 日、交出 265 次 code commit 同 127 個 pull request。不過測試 harness、工具權限、重試次數同運算預算都會明顯影響 agent 成績,廠方示範亦未交代失敗 run。正式版推出時間太短,暫時未見足夠獨立測試證明佢喺真實 codebase 穩定贏過 Claude、Gemini 或 OpenAI 模型。
香港開到服務,唔等於 Qwen3.8-Max 一定喺香港運算
Alibaba Cloud 國際站有香港 Model Studio region,支援香港 endpoint,官方付款文件亦列出 Visa、Mastercard、American Express、JCB 同 PayPal 等方法,部分由新加坡實體簽約嘅帳戶仲可以用港元結算。不過各 region 有獨立模型清單同 API key;截至發布當日,官方文件仍未寫清楚香港限定推理範圍有冇 qwen3.8-max 正式版。香港地址能否直接喺 QwenCloud 完成註冊同付款亦係 [待確認]。
資料安排仲要逐項設定。Model Studio 文件寫明,region 決定靜態資料存放位置,但如果香港 workspace 揀 Global 推理範圍,請求可以交去其他地區節點運算,當中包括中國內地。公司要資料留港,就要揀香港限定推理範圍,再確認目標模型真係有供應。官方私隱說明話 Model Studio 唔會用客戶資料訓練模型,傳輸資料亦有加密,不過高敏感度 source code 仍然要先核對合約、保留政策同內部合規要求。
950 億 active parameters 減到運算量,但權重仍然要佔幾 TB
MoE 每次只啟用 950 億參數,確實可以壓低每個 token 嘅運算量,但部署時仍要保存同調度成套 2.4 兆參數權重。單計權重,FP16 約佔 4.8TB,8-bit 約 2.4TB,就算壓到 4-bit 都約 1.2TB;實際仲有 KV cache、runtime buffer、冗餘副本同高速網絡開支。呢啲係按參數量換算嘅理論下限,唔係阿里巴巴公布嘅部署規格。
所以一般個人工作站基本上唔使諗,普通公司亦要有多機 GPU cluster、成熟嘅分散式推理系統同長期維運預算先玩得順。所以呢套開放權重主要啱雲端供應商、大型研究團隊,同埋要私有部署嘅大企業。開發團隊而家可以先用 API 跑自己嘅 repo、agent harness 同失敗重試流程,記低每項任務嘅成功率、總 token、延遲同工具成本,再決定值唔值得由原有模型搬過去。
參考來源
- iThome — 阿里巴巴發布2.4兆參數Qwen3.8-Max,下週開放模型權重 — original report
- QwenCloud:Qwen3.8-Max 模型頁 — 官方正式版模型 ID、API 價錢、context window 同輸入輸出上限
- Alibaba Cloud:Model Studio 地區同部署範圍 — 確認香港 region、資料存放位置、推理範圍同跨區安排
- Alibaba Cloud:付款方法 — 核對國際站支援嘅信用卡、PayPal 同結算貨幣
- OpenAI:GPT-5.6 模型同收費 — 比較 GPT-5.6 Sol 嘅 API 價錢、context 同輸出上限
- Anthropic:Claude API 收費 — 比較 Claude Opus 4.8 嘅標準 token 收費同 context 安排
- Google:Gemini Developer API 收費 — 比較 Gemini 3.5 Flash 嘅標準 API 價錢
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







