開放模型多人試、少人正式用:部署差距卡喺成套 AI 基建
Tech News

開放模型多人試、少人正式用:部署差距卡喺成套 AI 基建

圖片:via iThome — https://www.ithome.com.tw/news/178123
TechLab 編輯部(譯)·

Mozilla 調查揭出推理、監控、更新同成本管理仍未夠順手

iThome 報道引述 Mozilla 首份開放原始碼 AI 現況評估,指出開放模型喺開發者圈已經好普及,正式部署比例就追唔上封閉模型。呢個落差幾值得拆,因為試模型而家真係好容易:下載權重、開個 notebook、接好介面,半日已經可以睇到效果;一去到真客流量、私隱資料同服務承諾,工作量即刻變成另一個級數。

79%、53% 同 63% 要放返入調查語境

Mozilla 委託 SlashData 喺 2026 年 5 月 19 至 29 日做網上調查,訪問 1,494 名正替 app 加入 AI 功能嘅合資格開發者,再按地區加權。當中 79% 有用開放模型,71% 有用封閉模型,而且一半兩邊都有用,所以兩組數字可以重疊,唔代表市場只可二揀一。至於正式環境,採用開放模型嘅團隊有 53% 推到 production,封閉模型團隊就有 63%。

數字仲有版本細節要交代:Mozilla 7 月 14 日嘅發布文章同 PDF 其中一頁寫 51%,更新版報告網站同 iThome 報道就寫 53%。官方材料互有出入,本文按 v1.0.1 網頁嘅 53% 解讀。呢個十個百分點差距亦只係調查結果,唔可以直接當成所有企業 AI 項目嘅成功率。

Mozilla《Open-Source AI 2026》報告嘅綠色封面圖

圖片:Mozilla

公司愈大,封閉模型部署優勢愈明顯

報告按公司人數再切一層,呢部分只計 954 名專業開發者。細公司採用封閉同開放模型後推到 production 嘅比例,分別係 54% 同 53%;去到逾千人企業,數字拉開至 73% 同 57%。合理推斷係,大公司增加預算後,可以直接買到託管推理、技術支援、合規文件同服務承諾;開放模型嗰邊就算多咗 GPU 同工程師,整套工具仍然要自行砌合。

Mozilla 亦替開放 AI 技術堆疊九個範疇、48 項元件評分,標準化同企業支援得分較弱。不過方法附錄講明,呢套分數屬方向性判斷,唔係實驗量度。佢最有用嘅地方係指出一個共同模式:模型能力進步得快,企業營運工具追得慢。

下載完模型權重,後面仲有一大堆工程問題要處理

一個模型喺開發機答到問題,距離穩定服務真客仲有推理 server、量化格式、GPU 排程、流量佇列、自動擴縮同容錯。高峰期延遲突然升、某張 GPU 壞咗、長 prompt 食盡顯存,全部都要系統識得限流、轉移請求同降級。封閉 API 通常已經包起呢層,開發團隊主要管請求同產品邏輯;自建開放模型就要有人長期照顧整條 serving 路徑。

監控亦唔可以淨係睇 server 有冇死。AI 服務要追 token 用量、首字延遲、完整回應時間、拒答率、工具呼叫錯誤,同埋輸出質素有冇慢慢走樣。模型或推理框架更新後,團隊仲要用固定評測集重跑、分批放流量、比較新舊版本,出事識得回滾。Mozilla 調查發現,離開開放模型嗰批開發者,較常提到性能、系統整合、維護更新同部署擴充問題,正正對應呢堆日常工作。

開放模型成本可以平,前提係負載夠穩定

自建嘅成本表唔可以只寫每百萬 token 幾錢。GPU 閒置、跨區備援、儲存、數據傳輸、監控服務同工程師時間,都要計入總成本。流量長期穩定、批量任務夠多、模型尺寸配合硬件,自建先較容易攤薄成本;用量細或者忽高忽低,雲端 API 按量收費往往輕鬆好多,亦快啲推出產品。開放模型既可自建,亦可以用第三方託管,兩種部署方式嘅成本同控制權差好遠,評估時要分開計。

細團隊先保留轉模型能力,再決定自建幾多

人手唔多嘅開發團隊一開始就全套自建,好容易低估維護負擔;所有功能綁死單一封閉 API,又會受制於加價、限額、模型退役同資料處理條款。較實際嘅做法係先統一模型介面、保存自己嘅 prompt 同評測集,重要資料留喺公司控制嘅儲存層,再替一個開放模型保留可用路徑。咁樣可以先用 API 加快推出速度,到流量、私隱要求或者成本去到合適水平,再逐段搬去託管開放模型或自建推理。

今次調查反映嘅取捨幾清楚:開放權重畀到控制權,營運責任亦一併交到團隊手上。準備揀方案嘅公司,應該先盤點流量形態、資料敏感度、延遲目標同值班能力,再做兩邊用同一批真實工作量嘅測試。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook