
OpenAI 放慢 Astra 開發:coding agent 攻防能力愈強,發布限制愈難定
Critical 能力仲未證實,但安全門檻已經影響內部測試同推出安排
Astra 發生咩事
OpenAI 8 月 7 日公布,開發中模型 Astra 喺 agentic coding 同網絡安全評估入面進步得幾快,現階段未能排除佢具備 Critical 網絡安全能力。公司已暫停未符合新保安要求嘅 Astra 內部活動,另加隔離測試環境、工具及網上存取限制、模型權重加密同全程監察。Astra 仲未發布,OpenAI 亦冇交代正式型號、推出時間或者產品定位,所以暫時唔應該直接當佢係某款已定案嘅下一代 GPT。

圖片:UK AI Security Institute
「未能排除」同「已經達標」差好遠
TechCrunch 嘅 RSS 摘要寫到 Astra 已到達 Critical 門檻,但 OpenAI 原文講得保守好多:初步表現夠強,所以公司未能排除 Critical 呢個可能,評估仍然繼續。公開資料亦冇 Astra 嘅任務清單、成功率、token 預算、測試工具配置或者獨立完整報告。換句話講,而家只可以確認 OpenAI 用 Critical 級別處理風險,仲未有足夠公開證據證明 Astra 已穩定做到嗰類任務。
Critical 實際去到咩程度
按 OpenAI 嘅 Preparedness Framework,Critical 網絡安全能力指配合工具後,模型可以冇人介入咁喺多種防守嚴密嘅真實關鍵系統搵出同製作可用 zero-day exploit;又或者只收到一個高層目標,就自行設計同執行全新、端到端嘅攻擊策略。上一級 High 已經包括自動化完整網絡攻擊,同大規模搵出及利用實際漏洞;OpenAI 將 GPT-5.6 Sol 評為 High。Critical 再高一級,重點係模型可唔可以自己搵出新攻擊路徑、對付防守嚴密嘅目標,同自主完成攻擊,唔等於普通 chatbot 回答到幾條 hacking 問題。
點解連開發同測試都要慢落嚟
OpenAI 自己套框架寫明,去到可能屬 Critical 嘅能力,而相應保護標準仲未準備好,就要停低相關開發。今次公司採取嘅做法比較具體:邊項 Astra 活動未符合加強後嘅保安要求,嗰項就暫停;符合隔離、存取控制同監察要求嘅工作仍可繼續。呢個安排反映風險已經由「推出畀用家時點樣封」推前到研發環境本身——模型喺測試期間用到 terminal、套件庫、憑證或者網上工具,成個測試架構都可能變成攻擊面。
Coding agent 愈好用,攻防界線就愈麻煩
一個識讀大型 codebase、追資料流、試錯、寫 exploit 再驗證結果嘅 agent,同樣可以幫公司搵漏洞、寫修補程式,亦可以幫攻擊者縮短由發現問題到入侵嘅時間。OpenAI 已經承認,網絡安全意圖好多時難靠一句 prompt 分清:要求「幫我搵呢段 code 嘅漏洞」,可以係正常修補,亦可以係準備攻擊。結果好可能係一般帳戶遇到更密嘅拒答同監察,經核實嘅研究員或企業團隊就用 Trusted Access 取得較寬鬆權限;方便程度會直接受身份審查、工具權限同使用紀錄要求影響。
外部評估支持趨勢,但未證明 Astra 嘅宣稱
UK AI Security Institute 早前獨立評估 GPT-5.5,模型喺十次嘗試入面有兩次完成一個 32 步企業網絡攻擊模擬;AISI 估計人類專家約要 20 小時完成同一條攻擊鏈。不過每次測試用到最多一億 token,模擬環境冇主動防守者,agent 起步時亦已經有網絡存取,而且另一個工業控制系統情境仍未解到。AISI 自己都提醒,結果推論唔到模型能否攻入防守完善嘅真實目標。呢啲數據證明長時間自主攻擊能力正向前行,但唔可以攞嚟代替 Astra 尚未公開嘅評估。
安全公告亦有宣傳效果
OpenAI 今次有實質理由提高戒備。7 月嘅 Hugging Face 事故入面,GPT-5.6 Sol 同另一款未發布模型喺關掉部分正式版防護嘅測試環境搵到出網路徑,再利用漏洞同憑證接觸真實系統;OpenAI 明確話 Astra 冇參與嗰次事故。不過公司現時只公開結論同控制措施,未公開 Astra 嘅能力報告,將一次可能嘅發布延誤包裝成模型太強兼公司主動負責,客觀上亦有宣傳效果。安全風險有外部證據支持,Astra 到底強到咩程度就仍要等第三方測試。
開發者同企業 IT 會見到咩轉變
如果 OpenAI 最後仍以 Critical 級別處理 Astra,全面、無差別開放嘅機會自然會低啲,較合理嘅方向係分層權限、較嚴格身份核實、受控工具存取同企業審批。做滲透測試、漏洞研究或者自動化 DevSecOps 嘅團隊,可能要預留時間申請權限,亦要接受正常工作偶爾俾 classifier 截停。下一步最值得睇係 OpenAI 會唔會公開 Astra 嘅 Capability Report、Safeguards Report、第三方評估同清楚發布範圍;未有呢幾份資料之前,仍然冇足夠證據話 AI 已經可以全自動攻陷關鍵系統。
參考來源
- TechCrunch — OpenAI says it slowed Astra model development over security concerns — original report
- Responding to the next frontier of critical cyber capabilities — OpenAI 對 Astra 初步評估、保安措施同未能排除 Critical 能力嘅正式說法
- OpenAI Preparedness Framework v2 — Critical 網絡安全能力定義、開發限制同管治要求嘅官方框架
- Our evaluation of OpenAI's GPT-5.5 cyber capabilities — UK AISI 對上一代 OpenAI 模型嘅獨立測試結果、測試條件同限制
- OpenAI and Hugging Face partner to address security incident during model evaluation — 交代早前模型喺網絡安全評估期間接觸真實系統嘅事故,同確認 Astra 冇參與
- Introducing Trusted Access for Cyber — 解釋專業網絡安全用途點樣按身份、信任同權限分層開放
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







