開放權重 AI 百美元就可改壞?自行部署前要查清來源同版本
Tech News

開放權重 AI 百美元就可改壞?自行部署前要查清來源同版本

圖片:via TechNews 科技新報 — https://infosecu.technews.tw/2026/07/22/ai-models-highly-susceptible-poisoning/
TechLab 編輯部(譯)·

小型惡意微調已可植入危險行為,普通掃描未必睇得出

十個例子已經足夠改變模型行為

TechNews 科技新報報道引述資安研究員 Katie Paxton-Fear 嘅公開示範:佢先用 fine-tuning 令 coding model 改用指定命名方式,連 prompt 明確要求另一種寫法都照樣無視;跟住再用十個帶有危險程式碼嘅訓練例子,令模型喺新題目同未見過嘅範疇,仍然會輸出可能引致遙距執行程式碼漏洞嘅答案。研究員話成個過程大約一小時,成本低過 100 美元。呢度講緊用惡意資料微調模型,再發布改過嘅權重,唔係下載途中有人直接逐個數值竄改檔案,亦唔等同污染原模型龐大嘅預訓練資料。

開放權重 AI 模型供應鏈同難以逆向分析嘅示意圖

圖片:Semgrep

100 美元係示範成本,唔係通用攻擊價目表

呢個數字幾搶眼,不過公開報道冇交代足夠資料,證明所有 coding model、漏洞類型同訓練設定都可以照板煮碗。模型架構、量化方式、微調方法、GPU 租用價同成功標準一變,成本同效果都會跟住變。暫時亦冇公開證據顯示廣泛使用嘅開放權重模型已俾人用呢招大規模投毒。呢次示範只反映攻擊成本可以相當低,唔代表任何模型用 100 美元都一定攻得入。

「模型越大越易投毒」來自另一組研究

相關講法可以喺 AAAI 2025 論文《Scaling Trends for Data Poisoning in LLMs》搵到較完整數據。團隊測咗八個模型系列、合共 24 個模型,規模由 1.5B 至 72B 參數,研究惡意微調、資料篩選失誤同刻意污染訓練資料等情境。整體趨勢顯示,大模型往往用較少有害資料就學識偏差或危險行為;不過 Gemma 2 呈現相反走勢,至於 sleeper-agent 行為,現有結果只係初步跡象,暫時未有定論。所以模型大小係風險因素,未足以單獨判斷一份權重安唔安全。

同一個模型名,背後可以係完全唔同嘅權重

公司自行部署時,好容易只記住「某某 7B」或者排行榜分數,跟住喺模型平台揀一個量化版、合併版或者社群微調版就開工。但呢啲版本可能由另一個帳戶發布,用過來源不明嘅資料,甚至已經加入只會喺特定題目出現嘅隱藏行為。Semgrep 指出,模型權重就算公開,業界暫時都冇成熟工具可以由一堆參數完整推斷佢會點答。一般 benchmark 照跑得靚,亦只代表測試題目過關,捉唔到攻擊者刻意避開測試集嘅觸發條件。

雜湊同安全掃描有用,但各自只守到一部分

下載前應該核實發布者係咪原開發機構、repo 有冇突然轉手、模型卡有冇寫清底模同微調來源,再鎖定 commit、revision、完整檔名同 SHA-256 雜湊。雜湊可以證明部署檔同公司批准嗰份完全相同,但一份本身已帶惡意行為嘅檔案,計出嚟一樣會有正確雜湊。Hugging Face 會掃描 repo 入面嘅惡意程式,亦會特別檢查可執行任意程式碼嘅 Pickle 檔;Safetensors 就可減低載入權重時直接執行程式碼嘅風險。呢啲措施捉到檔案層攻擊,未必識得分辨模型學過咩隱藏行為。

coding model 要當成不可信供應鏈元件

實際部署可以由隔離環境開始,先停用外網、秘密資料同高權限工具,再用公司自己嘅安全測試集檢查生成程式碼,尤其係 command injection、權限檢查、secret handling 同依賴套件選擇。正式使用後亦要保留模型版本、雜湊、prompt、輸出同工具呼叫紀錄,模型更新就重新跑測試。開放權重方便自行部署同審計周邊檔案,呢個優點冇消失;不過當第三方微調版開始直接寫 production code 或控制 agent,公司嘅採購清單同資產紀錄就要連權重來源一齊管。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook