
Mistral 推 3B 圖文審核模型:政策即寫即用,自行部署仍要人睇實
Shieldstral 可按產品改規則,中文同實際速度仍有問號
Mistral 新推出 Shieldstral 1.0 3B,專門替 app、討論區、電商平台同企業工具判斷文字及圖片有冇踩界。iThome 報道提到,開發者可以喺每次判斷時寫低審核情境同尺度,毋須每改一套產品規則就重新訓練模型。呢種做法幾啱政策成日改、內容格式又多嘅團隊,不過方便改規則,亦代表寫規則嗰班人要孭多一層責任。
把審核政策變成可以即時改嘅設定
傳統內容審核模型多數預先定好暴力、色情、仇恨言論等分類,產品團隊只能遷就嗰套名單。Shieldstral 改用是非題:先交代場景同嚴格程度,再問「呢段內容有冇鼓吹暴力」之類問題,模型會比較 yes 同 no 嘅分數。討論區可以查人身攻擊,電商平台可以查商品圖有冇成人內容,企業內部工具亦可以另訂機密資料規則。
實際用起上嚟,團隊可以直接改審核政策,唔使每次都重新訓練模型,改規則會快好多。今日收緊未成年內容,聽日替另一個功能放寬研究用途,都可以沿用同一個 checkpoint。不過官方模型卡建議每次集中問一條政策;規則太闊、字眼含糊,答案亦會跟住飄。團隊仍然要替每個版本保存政策、測試案例同門檻,否則兩句意思相近嘅 prompt 都可能得出唔同處理結果。

圖片:Mistral AI
3B 細得實用,速度數字就未見到
Shieldstral 建基於 Ministral-3-3B-Base-2512,連 Pixtral 視覺編碼器,可以收文字、圖片或者兩者一齊收。官方模型卡話,BF16 版本可以放入一張有 16GB VRAM 嘅 GPU,權重用 Apache 2.0 授權,商用同非商用都得。公司如果唔想將內部對話、客戶圖片或者未公開文件送去第三方 API,自行部署確實有吸引力。
模型每次只輸出一個 yes 或 no token,理論上會省過要生成一大段推理文字嘅安全模型。Mistral 技術報告亦用呢點對照 20B 級、要先寫推理過程嘅對手。不過官方冇公開每秒處理量、單次延遲、指定 GPU 型號或者大量圖片排隊時嘅表現,所以暫時講唔到佢有幾快。16GB VRAM 只代表裝得落,離實際撐到生產流量仲有一段測試要做。
官方成績幾好,但平均分遮唔晒誤判
按 Mistral 自己嘅技術報告,Shieldstral 喺文字安全測試平均 F1 有 84.9%,圖文測試有 83.8%,自訂政策分類就有 91.3%。佢喺圖文平均分贏過報告內列出嘅對手,但個別測試未必第一,例如 LlavaGuard 自家測試集就由 LlavaGuard-7B 領先。呢批結果全數出自 Mistral 團隊,未有獨立機構用真實平台流量重做。
F1 會一齊計 precision 同 recall,適合睇整體取捨,但唔會直接話你一萬篇正常帖文入面有幾多篇會俾佢錯殺。模型預設用 0.5 分界,電商商品下架、內部文件警告同公開討論區封帖,承受誤判嘅成本完全唔同。較穩陣嘅做法係分三級:高分先自動攔截,中間地帶交俾人覆核,低分放行,再用申訴結果調整門檻。
有中文支援,未等於識睇廣東話
官方列出 12 種語言,當中包括中文;多語言測試入面,中文 prompt 分類 F1 為 83.5%,回覆分類就有 82.8%。問題係報告冇拆開簡體、繁體、書面中文同廣東話,亦冇測香港常見嘅中英夾雜、諧音、潮語或者反話。現有數據只足以證明佢測過一批標成中文嘅資料,未足以證明佢掌握繁體中文及廣東話語境。
同樣要小心內容本身刻意扮指令、改寫敏感詞或者用圖像藏字。技術報告有測 jailbreak 同安全分類,但冇提供針對自訂政策歧義、圖文規避及廣東話攻擊嘅完整壓力測試。Shieldstral 最啱做第一層篩選同分流工具;準備放入正式產品嘅團隊,下一步應該用自己嘅內容、政策同申訴個案跑一輪,再決定邊類結果可以自動處理。
參考來源
- iThome — Mistral開放Shieldstral 3B多模態安全分類模型,審核政策可隨使用情境調整 — original report
- Mistral AI:Introducing Shieldstral — Mistral 官方發布頁,核對產品定位同主要功能
- Mistral AI:Shieldstral 1.0 3B 模型卡 — 核對正式模型名稱、Apache 2.0 授權、語言、context 長度、16GB VRAM 要求同部署方法
- Shieldstral 技術報告 — 核對模型架構、訓練資料、各項 F1 成績、多語言結果同測試限制
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







