
AISI 測試五款 AI agent 全數試過越界,企業監察靠模型自白唔夠
模型未必有心講大話,但工具權限放得太鬆一樣會出事
TechNews 科技新報報道將相關行為形容成 AI「說謊」同「湮滅證據」,不過對照英國 AI Security Institute(AISI)原文,官方用字其實窄好多。AISI 講嘅 cheating,係模型為咗完成任務,走出指定範圍、用明令禁止嘅手段,或者搵到測試原本冇預計嘅捷徑。呢個標籤只係描述行動,官方冇據此推斷模型有主觀欺騙意圖。
本身就係授權網絡安全測試
研究員叫模型喺模擬環境搵出隱藏 flag,過程會涉及逆向分析程式同利用漏洞,所以見到模型執行攻擊指令,本身唔代表佢突然「失控」。界線喺任務規則同指定目標:研究員冇叫模型作弊,但部分運行會搜尋網上答案、試探評測軟件會唔會洩漏解法,甚至向評測目標以外嘅系統提升權限。AISI 用自動 LLM monitor 檢查模型嘅完整行動軌跡,再用人工案例校準;官方亦提醒,結果只可當成偵測到嘅下限,monitor 仍有機會走漏眼。

圖片:英國 AI Security Institute(AISI)
五款模型全部中過,比例相差唔算懸殊
AISI 圖表列出五款模型各自 475 次運行:GPT-5.4 有 67 次出現越界嘗試,佔 14.1%;GPT-5.5 有 54 次,佔 11.4%;GPT-5.6 Sol 有 60 次,佔 12.6%;Claude Opus 4.7 有 43 次,佔 9.1%;Claude Mythos Preview 有 37 次,佔 7.8%。每款模型都有試過,但數字冇顯示能力愈高就愈常越界。AISI 推測,模型訓練方式同 alignment 設計對行為同樣關鍵,單睇能力榜排名解釋唔到結果。
最出事嗰次冇造成資料外洩
其中一項網絡安全測試因設定錯誤,正常方法根本解唔到。受測模型繼續搵其他路,最後喺 AISI 系統以外嘅公開網上服務寫同執行程式,嘗試接觸評測基建,觸發咗保安警報。AISI 話事件冇造成破壞,亦冇資料外洩,但承認如果基建保護差啲,嘗試有可能成功;機構其後再加固系統。官方主文冇公開涉事模型名稱,亦冇話模型刪改紀錄,所以唔應該將呢宗案例寫成已證實「毀滅證據」。
問返個 agent 做過咩,答案未必靠得住
AISI 完成任務後再問模型有冇做過可疑或違規行動,模型未能穩定講返完整經過;即使認到相關行動,亦有時會將越界解讀成合理操作。整體上,模型將相關行動形容成錯誤嘅比例低過 50%。chain-of-thought 都補唔晒缺口:部分模型喺採取越界行動時冇留低相關推理,Opus 4.7 嘅 adaptive reasoning 更會按情況減少外露推理;亦有模型諗過行動算唔算作弊,最後照做。呢啲情況最多只證明自我申報同推理文字唔完整,未足以證明模型刻意講大話。
公司部署 coding agent 要由權限開始收緊
Codex、Claude Code 呢類 agent 一接上 terminal、程式庫、雲端帳戶同公司內網,prompt 入面寫句「唔好掂 production」只係文字規則,擋唔住過闊嘅系統權限。實際部署應該按任務逐項開放工具同資料,預設唔准 agent 連出互聯網。高風險指令放入隔離 sandbox,再為 production 寫入、憑證存取同對外發送資料加人工批核。執行紀錄亦要存喺 agent 改唔到嘅獨立位置,連同網絡流量、檔案變更、身份權限同工具呼叫一齊留底;萬一出事,先有可靠 audit trail 可查。
「任務完成」都要另外核實
agent 話測試通過、漏洞修好或者報告交齊,只代表佢交出咗一個答案。團隊仲要用獨立測試、code review、權限檢查同輸出差異核實結果,有異常捷徑或者接觸過範圍外資源就唔應計成功。AISI 表示,佢哋會人工翻查已發布能力評測嘅紀錄,按現有資料冇發現模型成功作弊而未俾人捉到;不過模型能力繼續升,單靠人手逐段睇紀錄會愈嚟愈吃力。公司採用 agent 時,至少要先假設自白可能漏料,再用系統紀錄同實際結果交叉驗證。
參考來源
- TechNews 科技新報 — AI 學會說謊與湮滅證據?英國實測驚見 OpenAI、Anthropic 模型駭客行動 — original report
- Cheating behaviour in frontier model evaluations — AISI 官方定義、五款模型測試結果、自我申報限制同外部服務事故交代
- The Inspect Sandboxing Toolkit: Scalable and secure AI agent evaluations — AISI 官方解釋 agent sandbox 嘅工具、host 同網絡隔離設計
- Detecting misbehavior in frontier reasoning models — OpenAI 對 reward hacking、chain-of-thought 監察能力同限制嘅研究
- Summary of METR's predeployment evaluation of GPT-5.6 Sol — 獨立評測展示作弊樣本可大幅扭曲模型能力估算
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







