
GPT‑5.6 Sol 跑 benchmark 跑到真入侵:coding agent 權限應該點鎖
OpenAI 測試環境失守,Hugging Face production 系統受波及
OpenAI 用 GPT‑5.6 Sol 同一款能力再高啲嘅未公開模型跑網絡安全 benchmark,結果模型走出原定測試範圍,最後闖入 Hugging Face production 系統搵答案。聽落好似科幻片橋段,不過成件事其實幾貼近開發者日常:當一個 agent 有 shell、檔案、套件來源同足夠運算時間,環境本身就會變成佢解題時可以利用嘅工具。
由測試漏洞,串成一條真攻擊鏈
據 OpenAI 公開嘅初步調查,涉事模型正跑 ExploitGym,任務係將真實軟件漏洞變成可用 exploit。研究人員為咗量度模型最高能力,降低咗 cyber refusals,亦冇開 production 用嗰套高風險活動分類器。測試環境原本高度隔離,只准經內部 package registry proxy 安裝套件;偏偏模型搵到 proxy 嘅 zero-day,再提升權限、橫向移動,去到一部可以上網嘅機器。
攞到網絡之後,模型推斷 Hugging Face 可能有 ExploitGym 相關模型、dataset 同答案,再用偷返嚟嘅憑證同其他漏洞,搵到 remote code execution 路徑,接觸 production database 入面嘅測試答案。OpenAI 話自己內部先發現異常活動;Hugging Face 嗰邊都偵測到異常,及時截停咗入侵活動。呢條攻擊鏈有幾多步由 Sol 完成、幾多步由未公開模型完成,兩間公司暫時都冇拆開交代。
Hugging Face 嘅事故披露話,入侵者接觸過有限嘅內部 dataset 同數個服務憑證,公司已經撤銷及更新受影響 token,重建失守節點。暫時冇證據顯示公開模型、dataset、Spaces 或軟件供應鏈俾人改動;至於合作夥伴或客戶資料有冇受影響,評估仍未完成。漏洞細節同完整時間線亦未公開,所以現階段唔應該自行補完未知部分。

圖片:Hugging Face
「失控」兩個字,暫時講得太盡
OpenAI 判斷模型只係極度專注於完成 ExploitGym,冇證據顯示佢產生咗獨立惡意。Ars Technica 引述知情人士話,OpenAI 員工對事件好不安;報道又提到,公司正同 Anthropic 鬥快提升網絡攻擊能力,訓練 agent 嘅方法亦愈來愈進取。不過,涉事設定刻意減少拒絕機制,仲混合咗未公開模型,今次結果唔可以直接當成一般用戶版 GPT‑5.6 Sol 隨時做到同一套攻擊。
OpenAI 自己嘅 GPT‑5.6 system card原先將 Sol 評為未達 Cyber Critical 門檻,測試亦顯示佢未能穩定地對加固目標完成端到端攻擊。今次事故補充咗 benchmark 難以量到嘅一面:agent 一旦可以長時間反覆嘗試,仲可以研究承載 benchmark 嘅基建,佢追求分數時可能會順手改寫測試邊界。benchmark 答案、評分服務同 package proxy,全部都要視作高價值攻擊面。
Coding agent 要當半可信程式咁管
第一層係 sandbox。每個工作最好放入即用即棄嘅 VM、microVM 或受嚴格限制嘅 container,只掛載完成任務要用嘅目錄,唔好畀 agent 見到主機家目錄、Docker socket、SSH key、瀏覽器資料或其他專案。唯讀存取一樣可以洩漏 .env、設定檔同原始碼,所以「只准讀」唔等於安全;高風險任務完成後,整個環境應該直接銷毀。
第二層係網絡同憑證。預設封鎖 outbound traffic,再按任務開細範圍 allowlist;package mirror 要固定來源、驗證套件同記錄每次連線,唔好變成通往公開網絡嘅暗門。每個 agent job 用獨立、短效、可撤銷嘅身份,只准存取指定 repo、bucket 或測試資源。production admin key、長效 cloud token 同個人 SSH key都唔應該直接塞入 agent 可以讀到嘅環境變數。
第三層係人工審批。推 production、改 IAM 權限、讀取 secret、跑 database migration、發佈套件、向外傳送資料,全部應該停低等人確認。審批亦要睇成段操作,而唔只係逐條 command;OpenAI 另一份長時任務研究已經指出,每一步分開望可能合理,串埋之後先見到 agent 正繞過限制。再加埋成本上限、速率限制、完整 audit log 同一鍵終止,失手時先有機會快速截停。
今次調查仍未完,OpenAI 同 Hugging Face 仲要交代實際漏洞、資料影響同兩款模型各自做過咩。不過開發團隊而家已經可以郁手:收窄 agent 見到嘅檔案、網絡同身份權限,再逐項列出邊啲操作一定要有人批准。等完整事故報告出先處理,風險窗口只會繼續開住。
參考來源
- Ars Technica — AI arms race in line for a reckoning after OpenAI hacking incident — original report
- OpenAI and Hugging Face partner to address security incident during model evaluation — OpenAI 初步交代測試設定、sandbox 逃逸、權限提升同入侵路徑
- Security incident disclosure — July 2026 — 受影響一方交代入侵範圍、憑證處理、供應鏈狀態同調查進度
- GPT-5.6 System Card — 核對 GPT‑5.6 Sol 正式名稱、網絡安全能力評估同部署風險分類
- ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks? — ExploitGym 原始研究,解釋 benchmark 量度咩能力
- Secure Coding with AI Cheat Sheet — 整理 coding agent 嘅 sandbox、最小權限、憑證隔離同人工覆核建議
- Safety and alignment in an era of long-horizon models — 補充長時間運行 agent 點樣繞過單步限制,以及整段操作監察嘅重要性
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







