微軟稱 MDASH 新配置最多慳一半成本:九成工作交細模型,難題先搵 GPT-5.4
Tech News

微軟稱 MDASH 新配置最多慳一半成本:九成工作交細模型,難題先搵 GPT-5.4

圖片:via iThome — https://www.ithome.com.tw/news/177685
TechLab 編輯部(譯)·

MDASH 用多模型分流推高成績,成本同跑分口徑要睇清楚

微軟公開首個自家資安模型 MAI-Cyber-1-Flash,今次除咗跑分,MDASH 點樣分配工作亦值得留意。MDASH 會先用細型專門模型處理大量掃描、驗證、分類同修補任務,遇到最棘手嗰批先調用 GPT-5.4。iThome 報道提到,微軟聲稱新配置可以慳最多一半成本;呢個講法有指定比較對象,唔可以直接理解成所有 GPT 資安應用都平一半。

九成工作先交畀細型模型

微軟話 MAI-Cyber-1-Flash 最多可以接手 MDASH 約 90% 任務,餘下約 10% 先交畀規模較大、推理成本較高嘅 GPT-5.4。做法有啲似醫院分流:大量較常見個案先由專門系統處理,訊號複雜或者信心不足先升級。資安掃描要長時間讀大量程式碼,同一個漏洞又可能經多個 agent 辯論、驗證同嘗試重現,token 用量會疊得好快,所以分流對成本影響可以好大。

官方 model card 顯示,MAI-Cyber-1-Flash 係 MAI-Code-1-Flash 嘅資安微調版本,採用稀疏 MoE 架構,總參數量 1,370 億,每次推理啟用 50 億參數,context length 係 256k。呢類設計嘅賣點係保留一定容量之餘,每次只行部分參數。放入 MDASH 後,模型會參與漏洞發現、驗證、排序同修補,背後仲有超過 100 個專門 agent 同傳統程式分析工具配合。

藍、粉紅同紫色盾牌重疊而成嘅 MAI-Cyber-1-Flash 官方主圖

圖片:Microsoft AI

95.95% 係整套系統成績

微軟公布 MDASH 新配置喺 CyberGym 得到 95.95% 成功率,不過跑分主角包括 MAI-Cyber-1-Flash、MDASH 個 agent 系統同處理難題嘅 GPT-5.4。Model card 用另一個角度描述改動:換走原有配置入面約 80% 模型後,MDASH 成績由 88.4% 升到 95.95%。呢個「換走 80% 模型」同「處理最多 90% 任務」講緊兩種比例,唔應該當成同一組數字。

CyberGym 有 1,507 個歷史漏洞重現任務,涵蓋 188 個開源項目。系統會收到漏洞描述同修補前嘅程式碼,再寫出可以觸發問題嘅 PoC;成功重現舊漏洞,未等於可以自行發現未知漏洞、完成可用攻擊,或者安全咁自動修補整套產品。截稿時 CyberGym 官方公開榜仍未列出 95.95% 呢次提交,榜上見到嘅係舊版 MDASH 88.4% 同獨立研究者系統 89.6%,所以新成績暫時主要靠微軟資料支持。

微軟公布嘅 CyberGym 成功率比較圖,MDASH 新配置錄得 95.95%

圖片:Microsoft AI

慳一半成本有指定比較基準

微軟所講嘅 50% 節省,係新配置同 MDASH 原先採用 GPT-5.4、GPT-5.4 mini、GPT-5.3 codex 嘅組合相比。官方冇公開每個任務用幾多 token、推理時間、硬件開支、失敗重試次數或者實際收費,亦未見第三方成本測試。現階段可以確認嘅係微軟改咗 routing 方法;至於其他公司搬到自己程式碼庫後係咪同樣慳到一半,仲要睇漏洞種類、agent 數量同升級到大模型嘅比例。

暫時只限獲批企業用家

MAI-Cyber-1-Flash 冇獨立公開 API。Model card 寫明佢只供獲批 MDASH 客戶喺 Azure AI Foundry private preview 入面使用,申請人要經額外審批;產品頁亦話只會畀已核實嘅防守團隊使用。微軟另一套 Project Perception 會喺 8 月 3 日進入 public preview,但呢個日期唔代表 MAI-Cyber-1-Flash 同步開放畀一般開發者,暫時亦冇公開價錢或者全面供應時間。

多模型分流較值得企業留意

軟件開發團隊同 SOC 可以參考呢種做法,按任務難度揀模型,唔使每一步都用最貴嗰款。模型同跑分會不斷轉,但程式碼索引、漏洞驗證、結果去重、權限控制同人工覆核仍然係企業部署時要處理嘅部分。微軟而家交出一組幾吸引嘅官方數字,下一步要睇公開榜驗證、企業試用數據同實際報價,先知道呢套路由喺測試環境以外慳到幾多。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook