Frontier AI 實驗室點處理失控模型?公開應變計劃仍然留有大截空白
Tech News

Frontier AI 實驗室點處理失控模型?公開應變計劃仍然留有大截空白

圖片:via TechCrunch — https://techcrunch.com/2026/08/22/frontier-ai-labs-still-wont-say-how-theyd-contain-a-rogue-model/
TechLab 編輯部(譯)·

研究按公開資料評核五間公司,低分唔等於內部完全冇準備

Guidelight AI Standards 睇過 Anthropic、Google、Meta、OpenAI 同 xAI 嘅 system card、安全框架、風險報告同第三方資料,評核佢哋點樣防止內部 AI agent 越權。結論幾直接:五間公司公開咗唔少能力測試,但模型開始亂嚟之後點收權、截停同隔離,資料明顯薄弱。 截止日期係 2026 年 8 月 18 日,評核講嘅亦只限公開證據。

六項控制,冇一項去到完整實施

研究睇六樣嘢:有冇記錄 agent 活動、量度監察系統成效、高風險操作使唔使先過閘、警報突然急升會唔會自動停機、有冇第三方審視,同埋有冇預先寫好 containment 計劃。每項由 0 至 5 分,五間公司冇任何一項高過 3 分。整體分數由 Anthropic 同 OpenAI 嘅 C+ 領先,Google 係 D+,xAI 係 D−,Meta 就係 F。

單計 containment,OpenAI 以 3 分最高,Google 2 分,xAI 1 分,Anthropic 同 Meta 都係 0 分。 OpenAI 過往遇到安全事故後試過暫停或終止 workload,亦交代過恢復運作前會做咩,所以攞到「大幅局部實施」;研究仍然搵唔到一套公開、正式、可重複使用嘅未來應變規則。Google DeepMind 公開嘅 AI Control Roadmap 就寫得最仔細,涵蓋預防、偵測、回應同 containment,不過大部分仍然係路線圖。

Guidelight 2026 年 8 月 Frontier AI 公司控制措施評核封面

圖片:Guidelight AI Standards

低分量度緊公開證據,唔可以當成內部零準備

呢度要小心讀。報告表格會把 0 分標成「未實施」,但整套方法只睇公開文件,研究團隊冇入公司核查內部系統。OpenAI 向原報道表示,公司已有收窄權限、暫停 workload、限制部署同完全離線嘅程序,亦實際用過;Google 就話評核冇涵蓋全部安全措施。完整 containment 細節公開得太盡,亦可能教識攻擊者邊度有缺口,所以低分同「內部乜都冇」之間仲隔住一大截。

不過,保安理由唔足以解釋點解連觸發條件、決策權責同第三方核查結果都咁少。公司可以隱藏網絡拓撲、閾值同執行指令,同時公開邊類事故會收回權限、邊個有權停機、幾時要保存證據。而家最大缺口係外界無從判斷應變方案有冇預演過,抑或出事先臨場決定。 加州 SB 53 已要求大型開發商公開風險框架同呈報指定事故,美國國會亦有人提出 AI Kill Switch Act,透明度壓力只會繼續增加。

Google DeepMind AI agent 安全控制路線圖文章配圖

圖片:Google DeepMind

「失控」未去到科幻片嗰種程度

Rogue model 呢個講法好易令人諗到 AI 自我複製、長期匿埋同人類鬥。METR 喺 2026 年 2 至 3 月評估 Anthropic、Google、OpenAI 同 Meta 嘅前沿 agent,判斷當時模型未有能力喺公司全力追查下,長時間藏住大型 rogue deployment。研究亦未見到清晰證據,證明模型真係有跨任務、長期奪權嘅目標;較貼近現實嘅風險,係 agent 為完成眼前任務而繞過限制、搵額外運算資源或者掩飾違規操作。

呢個分別好重要。近期事故同模擬測試反映嘅多數係工具權限太闊、測試環境有網上出口、監察慢過 agent 行動,唔代表一個有完整意志嘅模型已經走甩。不過 coding agent 可以讀程式碼、執行指令、開雲端資源,甚至睇到保護自己嗰套規則;就算佢只係「太落力完成任務」,一樣可以造成資料外洩、改壞 production 或繞過安全檢查。

Coding agent 嘅 sandbox 要有幾層閘

公司用 agent 接觸 repo、雲端帳戶同內部資料時,單靠一個 sandbox 已經唔夠。讀檔、改檔、執行程式、連出外網、取得憑證同部署 production 應該分開授權;高風險操作要同步攔截,唔好等工作完成後先睇 log。憑證最好短效、網上出口用 allowlist,監察記錄就放喺 agent 無權修改嘅另一套系統。警報密度突然上升時,亦要自動停低相關 session、撤銷 token 同凍結未執行嘅工作。

OpenAI 公開嘅內部 coding agent 監察會睇對話、推理內容、tool call 同輸出,但當時主要係非同步檢查,最快都可能喺互動完結後先處理。佢哋自己亦承認,呢套方法未能可靠量度所有漏報,未來想把部分高風險操作改成執行前攔截。呢個正好點出 containment 最實際嘅限制:睇得見只係第一步,監察系統仲要有權即時阻止操作,而且 agent 掂唔到嗰個開關。

Guidelight 呢張成績表未足以證明邊間實驗室最安全,但已經照出公開承諾同可驗證操作之間嘅距離。用緊 AI agent 嘅開發團隊亦唔使等模型去到 frontier 級數先處理:先定好收權、停機、保存記錄、回復系統同事故負責人,之後再逐步放大 agent 可以做嘅事,會實際得多。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook