
GLM-5.2 開權重追近 Mythos,網安 AI 到企業手上未?
Benchmark 有亮點,企業部署同濫用風險要分開睇
發生咩事
Zhipu AI 而家用 Z.ai 呢個名推 GLM-5.2,主打長時間 coding agent 多過普通 chatbot:官方 model card 寫 1M token context、開權重、MIT license,仲有 vLLM、SGLang、Transformers、KTransformers 等部署路線。The Verge 引述研究者講法,話 GLM-5.2 喺部分搵 bug 同網安場景追到 Anthropic 嘅 Mythos。呢句要拆開睇:追到嘅係某啲 bug-finding 任務,唔代表所有推理、寫 code、企業安全流程都拍得住 Mythos。

圖片:Z.ai / GitHub
Benchmark 要睇任務同架生
Semgrep 自己跑 IDOR benchmark,GLM-5.2 用簡單 prompt 交到 39% F1,高過 Claude Code 嘅 32%,成本約 $0.17 一個漏洞;但 Semgrep 同時講明,佢哋自己 multimodal pipeline 有 53-61% F1,因為外面嗰層工具同流程幫好多。Graphistry 另一組 CyBT-CTF 數字都似:GLM-5.2 取得 28/59,同用 Claude Code 或 OpenCode harness 嘅 Claude Opus 4.7/4.8 同分;但換成 Louie.ai harness 配 Opus 4.x,成績上到 35/59。即係話,model 勁固然重要,prompt、工具、repo 索引、重試策略、結果驗證,全部都會左右成件事。
開權重點解有實際意思
對本地中小企、fintech、網安顧問同細 developer team,GLM-5.2 最吸引嘅位係資料主權同成本控制。閉源 cyber agent 通常要你放 code、log、ticket 入雲端 API,合規同客戶保密未必過到關;開權重 model 可以喺自己 VPC 或指定機房跑,用嚟做 code review、vulnerability triage、舊 repo 風險排序。講真,佢官方 repo 標示 744B-A40B,原版唔係一部普通 notebook 就搞掂,量化、GPU 記憶體、延遲、監控同人手成本都要計清楚。
風險唔只係攻擊者會用
另一邊,開權重一開就收唔返。Anthropic 之前喺 Glasswing 入面話 Mythos Preview 已搵到數以千計嘅高危漏洞,做法係揀合作夥伴、限制 Mythos 服務防守場景;GLM-5.2 權重出街之後,任何人都可以離線改、微調、移走安全限制,平台審核同濫用追蹤會弱好多。對防守隊嚟講,風險又唔止外面有人用佢搞攻擊自動化,內部誤用都麻煩:model 可能講到普通 code smell 似高危漏洞,亦可能漏咗真正危險嘅權限問題。
企業可以點用,界線要清楚
比較實際嘅玩法:放佢喺第二層 reviewer 個位,唔好畀佢做自動判官。先畀 SAST、dependency scan、secret scan 同人手 review 跑完,再叫 GLM-5.2 幫手整理可疑位置、解釋影響面、排優先次序、寫修補建議。每個結果都要有 source code line、測試證據同 reviewer sign-off;冇證據就當提示,唔好直接開 ticket 轟炸工程 team。安全 team 最怕誤報太多,因為信任一跌,之後真警報都冇人理。
下一步睇乜
所以今次值得睇嘅位,唔止一句「中國 model 追到 Mythos」headline;背後要留意嘅變化係 cyber AI 開始由少數受管控平台,流入可下載、可私有部署、可改嘅世界。下一步要睇獨立 benchmark 會唔會重現 Semgrep 同 Graphistry 數字、長 repo false positive rate 有幾高、開權重版本同 API 版表現差幾遠。做安全嘅公司可以開始試,但應該由低風險 repo、明確驗證流程、嚴格權限隔離開始。
參考來源
- The Verge — China’s Z.ai claims it can match Mythos on cybersecurity — original report
- GLM-5.2: Built for Long-Horizon Tasks - Z.ai — 官方發布,核對 1M context、長時間 coding agent 同部署入口。
- zai-org/GLM-5.2 - Hugging Face — 模型卡,核對 MIT license、開權重頁、local serving 支援同 benchmark 表。
- zai-org/GLM-5 - GitHub — 官方 repo,核對 744B-A40B、下載入口同本地部署框架。
- We have Mythos at Home: GLM 5.2 beats Claude in our Cyber Benchmarks - Semgrep — 原始 IDOR benchmark,核對 39% F1、Claude Code 32% 同成本講法。
- GLM 5.2 Open Model: Beats Sonnet, Matches Opus in Cyber Evals - Graphistry — CyBT-CTF benchmark 背景,用嚟核對 28/59、harness 影響同限制。
- Project Glasswing: Securing critical software for the AI era - Anthropic — 官方 Mythos / Glasswing 背景,核對受控防守用途同高危漏洞 claim。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







