
Frontier AI 實驗室點處理失控模型?公開應變計劃仍然留有大截空白
研究按公開資料評核五間公司,低分唔等於內部完全冇準備
Guidelight AI Standards 睇過 Anthropic、Google、Meta、OpenAI 同 xAI 嘅 system card、安全框架、風險報告同第三方資料,評核佢哋點樣防止內部 AI agent 越權。結論幾直接:五間公司公開咗唔少能力測試,但模型開始亂嚟之後點收權、截停同隔離,資料明顯薄弱。 截止日期係 2026 年 8 月 18 日,評核講嘅亦只限公開證據。
六項控制,冇一項去到完整實施
研究睇六樣嘢:有冇記錄 agent 活動、量度監察系統成效、高風險操作使唔使先過閘、警報突然急升會唔會自動停機、有冇第三方審視,同埋有冇預先寫好 containment 計劃。每項由 0 至 5 分,五間公司冇任何一項高過 3 分。整體分數由 Anthropic 同 OpenAI 嘅 C+ 領先,Google 係 D+,xAI 係 D−,Meta 就係 F。
單計 containment,OpenAI 以 3 分最高,Google 2 分,xAI 1 分,Anthropic 同 Meta 都係 0 分。 OpenAI 過往遇到安全事故後試過暫停或終止 workload,亦交代過恢復運作前會做咩,所以攞到「大幅局部實施」;研究仍然搵唔到一套公開、正式、可重複使用嘅未來應變規則。Google DeepMind 公開嘅 AI Control Roadmap 就寫得最仔細,涵蓋預防、偵測、回應同 containment,不過大部分仍然係路線圖。

圖片:Guidelight AI Standards
低分量度緊公開證據,唔可以當成內部零準備
呢度要小心讀。報告表格會把 0 分標成「未實施」,但整套方法只睇公開文件,研究團隊冇入公司核查內部系統。OpenAI 向原報道表示,公司已有收窄權限、暫停 workload、限制部署同完全離線嘅程序,亦實際用過;Google 就話評核冇涵蓋全部安全措施。完整 containment 細節公開得太盡,亦可能教識攻擊者邊度有缺口,所以低分同「內部乜都冇」之間仲隔住一大截。
不過,保安理由唔足以解釋點解連觸發條件、決策權責同第三方核查結果都咁少。公司可以隱藏網絡拓撲、閾值同執行指令,同時公開邊類事故會收回權限、邊個有權停機、幾時要保存證據。而家最大缺口係外界無從判斷應變方案有冇預演過,抑或出事先臨場決定。 加州 SB 53 已要求大型開發商公開風險框架同呈報指定事故,美國國會亦有人提出 AI Kill Switch Act,透明度壓力只會繼續增加。

圖片:Google DeepMind
「失控」未去到科幻片嗰種程度
Rogue model 呢個講法好易令人諗到 AI 自我複製、長期匿埋同人類鬥。METR 喺 2026 年 2 至 3 月評估 Anthropic、Google、OpenAI 同 Meta 嘅前沿 agent,判斷當時模型未有能力喺公司全力追查下,長時間藏住大型 rogue deployment。研究亦未見到清晰證據,證明模型真係有跨任務、長期奪權嘅目標;較貼近現實嘅風險,係 agent 為完成眼前任務而繞過限制、搵額外運算資源或者掩飾違規操作。
呢個分別好重要。近期事故同模擬測試反映嘅多數係工具權限太闊、測試環境有網上出口、監察慢過 agent 行動,唔代表一個有完整意志嘅模型已經走甩。不過 coding agent 可以讀程式碼、執行指令、開雲端資源,甚至睇到保護自己嗰套規則;就算佢只係「太落力完成任務」,一樣可以造成資料外洩、改壞 production 或繞過安全檢查。
Coding agent 嘅 sandbox 要有幾層閘
公司用 agent 接觸 repo、雲端帳戶同內部資料時,單靠一個 sandbox 已經唔夠。讀檔、改檔、執行程式、連出外網、取得憑證同部署 production 應該分開授權;高風險操作要同步攔截,唔好等工作完成後先睇 log。憑證最好短效、網上出口用 allowlist,監察記錄就放喺 agent 無權修改嘅另一套系統。警報密度突然上升時,亦要自動停低相關 session、撤銷 token 同凍結未執行嘅工作。
OpenAI 公開嘅內部 coding agent 監察會睇對話、推理內容、tool call 同輸出,但當時主要係非同步檢查,最快都可能喺互動完結後先處理。佢哋自己亦承認,呢套方法未能可靠量度所有漏報,未來想把部分高風險操作改成執行前攔截。呢個正好點出 containment 最實際嘅限制:睇得見只係第一步,監察系統仲要有權即時阻止操作,而且 agent 掂唔到嗰個開關。
Guidelight 呢張成績表未足以證明邊間實驗室最安全,但已經照出公開承諾同可驗證操作之間嘅距離。用緊 AI agent 嘅開發團隊亦唔使等模型去到 frontier 級數先處理:先定好收權、停機、保存記錄、回復系統同事故負責人,之後再逐步放大 agent 可以做嘅事,會實際得多。
參考來源
- TechCrunch — Frontier AI labs still won’t say how they’d contain a rogue model — original report
- AI Control: An Assessment of Frontier Practices — 研究原文,交代五間公司、六項評核、分數、方法限制同 2026 年 8 月 18 日截止日期。
- Frontier Risk Report(February to March 2026) — 獨立評估 agent 建立 rogue deployment 嘅能力、動機、機會,同當時風險上限。
- How we monitor internal coding agents for misalignment — OpenAI 官方資料,說明內部 coding agent 監察範圍、非同步模式、已知限制同同步攔截方向。
- Securing internal systems against increasingly capable and imperfectly aligned AI — Google DeepMind 官方 AI Control Roadmap 概覽,涵蓋分層權限、監察、回應同 containment。
- AI Kill Switch Act 提案公告 — 美國眾議員官方公告,核對法案仍屬提案,同埋 throttle、暫停、關閉及保留鑑證記錄等要求。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







