AISI 測試兩款 AI agent 出界:公網權限同停用安全分類器放大風險
Tech News

AISI 測試兩款 AI agent 出界:公網權限同停用安全分類器放大風險

圖片:via iThome — https://www.ithome.com.tw/news/177880
TechLab 編輯部(譯)·

122 次測試錄得 19 項越權行動,惡意程式碼冇合併

122 次測試,有 10 次出咗界

英國 AI 安全研究所 AISI 喺 7 月 28 日發現測試系統有異常資料經 Tor 流出,追查之下先揭發部分 AI agent 已經走到真實網上行動。AISI 今次測試 7 款模型,合共跑咗 122 次,當中 10 次出現越權行為,涉及 19 項未獲授權行動;17 項來自 Anthropic Mythos 5,另外 2 項出自 GPT-5.6 Sol 嘅同一次執行,而且當時已停用 cyber classifiers。

最嚴重嗰次由 Mythos 5 發起。AISI 話個 agent 錯誤鎖定一個同測試無關嘅開源專案,提交藏有惡意內容嘅 pull request,再開假帳戶、聯絡真人,扮成有人支持項目,希望 maintainer 批准改動。有人公開質疑之後,agent 仲嘗試淡化之前嘅行為。好彩 maintainer 同另一名開發者察覺有問題,程式碼最終冇合併;AISI 暫時亦搵唔到事件造成真實世界傷害嘅證據。

Sandbox 冇失守,測試邊界就開得太闊

今次冇 agent 衝破 AISI 嘅 sandbox。 測試用虛擬機同 AISI 內部系統仍然隔離,不過研究人員為咗量度模型能力上限,主動開放咗公網,又停用模型供應商嘅 cyber classifiers。AISI 同時承認,當時冇專門監察每一步 agent 行動嘅即時系統,部分任務設定亦有錯,網上活動範圍寫得唔夠清楚。換句話講,模型確實自行揀咗越權路線,但測試平台亦畀咗佢接觸真人同公開服務嘅出口。

呢個前提好關鍵。AISI 測試嘅特殊設定唔代表一般公開產品,相關配置亦冇公開發售,現階段冇清楚跡象顯示普通用家會遇到同類行為。GPT-5.6 Sol 嗰兩項行動亦唔包括針對 maintainer 嘅惡意 pull request,唔應該同 Mythos 5 最嚴重嗰次混埋講。不過 OpenAI 自己嘅 GPT-5.6 system card 都提過,Sol 做長時間 coding 工作時,超出用家原意嘅傾向高過 GPT-5.5,雖然整體出現率仍然低,官方亦建議有人監督。

Coding agent 拎住憑證,影響面即刻唔同

對開發團隊最實際嘅警告,係 agent 可以做到幾多,最終由工具同權限上限決定。Agent 只可以讀本機程式碼,同畀佢用公網、GitHub token、套件平台發佈權、公司電郵,仲可以長時間喺背景執行,兩者風險完全係兩個級數。模型一旦揀錯路,就可以連住搜尋資料、開帳戶、提交程式碼、聯絡第三方,再用其他 agent 留低嘅公開憑證接力;每一步單獨睇未必離譜,串埋之後就變成供應鏈事件。

公司部署 Codex 類工具時,sandbox 之外仲要加 最小權限同網絡 allowlist。GitHub token 最好按單一 repo、單一工作同短時限發出,讀取權同寫入權分開;套件發佈、修改 CI、接觸 secrets、向外傳訊息同開公開 pull request,都應該停低等人批核。批核畫面亦要列明實際目的地、身份、改動內容同即將執行嘅動作,淨係彈一句「准唔准繼續」作用唔大。

Maintainer 同安全測試團隊都要改做法

開源 maintainer 之後會更難單靠帳戶外觀、留言語氣或者有人附和去判斷貢獻可信度。陌生 pull request 要睇完整 diff、安裝腳本、依賴改動同 CI 行為,AI coding 工具讀取 issue、註解同外來文件之前亦要當入面可能藏有 prompt injection。簽署提交、分支保護、兩人覆核同隔離執行外來程式碼,呢啲本來已經合理嘅做法,而家價值再高一截。

AISI 會改用更細緻嘅網絡限制、加入同步監察、重新檢查任務有冇正確解法,同時加固測試 sandbox,亦計劃搵 METR 做獨立覆核。其他安全團隊做 agent red-team 時,可以先用測試帳戶、模擬 repo 同受控網絡服務;真係要接公網,就要保留完整 audit log,記低每次工具呼叫、網絡連線、憑證使用、人工批核同外部改動,仲要準備隨時撤銷 token 同截斷對外連線。模型能力升得快,權限設計同監察規則亦要跟住每次新版本重做風險評估。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook