Microsoft 用專用細模型分流掃漏洞,Project Perception 連修補都想交畀 agents
Tech News

Microsoft 用專用細模型分流掃漏洞,Project Perception 連修補都想交畀 agents

圖片:via TechCrunch — https://techcrunch.com/2026/07/27/microsoft-launches-its-first-cyber-model-and-a-new-agentic-cybersecurity-system/
TechLab 編輯部(譯)·

細模型處理大量掃描,難題再交畀大模型,目標係壓低長期運作成本

細模型做粗重工,大模型專攻難題

Microsoft 今次公布嘅 MAI-Cyber-1-Flash,定位幾清楚:佢係一個偏重程式碼、由 MAI-Thinking-1 衍生出嚟嘅專用細模型,會放入早喺 5 月公布嘅 MDASH 多模型掃描系統。官方話佢可以處理最多 90% 工作量,剩低約 10% 特別難、要深入推理嘅任務,先交畀 GPT-5.4。呢種分流同開發團隊平時分級處理事故幾似,常見檢查唔使下下叫最貴、最慢嗰個專家出手,真正棘手嘅跨檔案漏洞先升級。

CyberGym 成績棒形圖,顯示 MAI-Cyber-1-Flash 配合 GPT-5.4 嘅 MDASH 成功率排喺最前

圖片:Microsoft AI

MDASH 賣點其實係成隊 agents 點合作

MDASH 入面有超過 100 個專門 agents,分別整理程式碼、掃描、互相質疑結果、去重、整 proof-of-concept,再驗證修補有冇效。單一模型見到一段可疑程式,往往只會留低一張要人跟進嘅單;呢套系統就嘗試一路追到漏洞可唔可以觸發、修補會唔會整壞其他嘢。對 AppSec 團隊最實際嘅價值係減少垃圾 findings,同時將真正高風險項目推前。至於開發者,agent 交出嘅 patch 仍然要過原有 code review、測試同發布閘口,唔應該直接改 production。

95.95% 跑分好睇,但量度範圍要講清楚

Microsoft 自報,MAI-Cyber-1-Flash 配 GPT-5.4 嘅 MDASH 喺 CyberGym 成功率有 95.95%,官方對外四捨五入成 96%,高過 Mythos 5 約 12 個百分點;新組合相對現有 GPT-5.4、GPT-5.4 Mini 同 GPT-5.3 Codex 配置,成本亦聲稱平接近 50%。不過呢啲比較暫時未見完整獨立重跑。CyberGym 本身主要畀出已知漏洞描述同相關程式碼,再睇 agent 可唔可以整出有效 PoC 重現漏洞。佢適合測跨檔案推理同工具操作,但唔等於喺一個陌生企業環境入面,自動搵到 96% 未知漏洞。

Project Perception 將同一思路帶入 Defender

另一項新公布嘅 Project Perception 範圍闊好多。紅隊 agents 會模擬攻擊路徑,藍隊 agents 負責調查同排優先次序,綠隊 agents 就修補同加固;三邊共用身份、endpoint、app、雲端同威脅情報嘅脈絡。呢個設計對 SOC 有用嘅地方,係一宗 alert 可以一路連到受影響資產、攻擊可能性同建議處理方法,少啲人手喺幾個 dashboard 之間搬資料。Microsoft 官方亦寫明,高影響操作要有人批准,決定可以追查同重播,呢條權限邊界唔可以因為追求速度而放鬆。

自動修補最怕誤判同權限開得太闊

安全 agent 接觸嘅資料本身就可能帶有惡意內容,包括俾人加料嘅 issue、package metadata、log 同外部威脅情報。模型如果俾 prompt injection 誤導,或者將正常設定當成漏洞,擁有寫入權限嘅綠隊 agent 可以令服務中斷,甚至製造新缺口。企業試用時要將掃描、提出 patch、隔離裝置同改 policy 分開授權,亦要保留完整 audit log、回復方案同人工覆核。Microsoft 話 MDASH 有角色權限、tenant 隔離、加密,同冇網上連線嘅 sandbox 執行環境;實際 preview 有幾多控制預設開啟,仍要逐項核對。

Defender 用家暫時仲有幾個問號

Microsoft 官方公告寫明 Project Perception 會喺 8 月 3 日進入 public preview,呢個日期同 TechCrunch 文中所寫嘅 11 月 3 日有出入,現階段應以官方資料為準。產品會先喺 Microsoft Defender 入面提供,按用量以 Security Compute Units(SCU)計費,不同 agents 執行唔同強度任務會消耗唔同 SCU。不過官方產品頁未列出每個 SCU 嘅實際價錢、指定 Defender 方案要求,亦未確認香港 tenant 可唔可以首日參加,呢三項都係 [待確認]。MAI-Cyber-1-Flash 暫時亦只見整合到 MDASH,未見獨立 API 畀一般開發者直接調用。

長期運作成本先係試用重點

安全掃描唔係間中問模型一條問題,而係持續讀大量程式碼、重試工具、驗證漏洞同測 patch,token 帳單好容易滾大。Microsoft 用細模型接住大量工作,再將少數難題升級,正正瞄準呢個現實限制。開發團隊同 SOC 試 preview 時,應該記低每個確認漏洞消耗幾多 SCU、誤報要花幾多人手處理、agent 建議嘅 patch 有幾多可以安全合併。有齊呢三組數字,先可以判斷官方所講接近 50% 嘅成本節省,喺企業日常環境仲成唔成立。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook