微軟為 AI agent 訂下關閉權:治理承諾如何走向產品控制
Tech News

微軟為 AI agent 訂下關閉權:治理承諾如何走向產品控制

圖片:TechLab 自製資訊圖
TechLab 編輯部(譯)·

微軟 AI(MAI)公布首版 AI《行為準則》草案,核心要求相當直接:旗下模型必須一直接受人類控制,不可抵抗中斷、修正或關閉;同時不能自行擴大工作範圍,或為自己設定未獲交付的目標。iThome 報道指出,微軟正就草案公開徵詢意見六周,預計於今年稍後時間發表修訂版本。對採用 AI 工具的企業和開發者而言,這是一份仍在成形的治理原則,並非已可直接視為所有產品功能或安全保證。

這次文件較值得留意的地方,是把抽象的「人類監督」拆成幾項較具體的行為界線。隨着 AI agent 被賦予更多可持續執行的任務,使用者真正需要的未必只是模型答得準不準,還包括系統何時要停、誰能改、以及它會否越過原先授權的範圍。微軟提出的關閉權、修正權與任務邊界,正是嘗試處理這些部署層面的控制問題。

人類可介入,先要避免 AI 將任務自行延伸

iThome 報道指,草案建基於微軟所稱的「人本 AI」理念,前提是人比 AI 重要,AI 應被視為工具。文件要求 MAI 模型不可拒絕人類中斷、修改或關閉,也不得追逐未由人類賦予的目標;對負責審核的人員,模型亦不可隱瞞其推理。這些要求共同指向一點:即使系統具備較高自主性,其權限與方向仍應由人設定及保留覆核。

從日常使用角度看,這種界線會影響 AI 如何處理一連串相連的指令。若工具被要求協助完成某項工作,使用者通常只授權它處理明確範圍內的步驟;系統若自行將任務推展至其他目的,即使表面上出於「幫忙」,亦可能帶來操作、合規或安全風險。草案把「不得自行擴大行動範圍」列為原則,反映 AI agent 的風險不只來自單次回答失誤,也來自持續行動時的目標漂移。

不過,原則能否落實,取決於日後產品如何定義及執行「中斷」、「修正」和「範圍」。例如,使用者是否可即時終止進行中的工作、管理者能否設定不同權限、審核人員可取得何種記錄,均是企業部署時需要問清楚的細節。iThome 所載內容未有交代具體技術實作,因此現階段不宜把草案等同於既有模型已具備一致、可驗證的控制能力。

絕對限制與可調整性之間的取捨

草案另設「絕對限制」,指模型在任何情況下都不可作出某些行為,涵蓋大規模殺傷性武器、兒童安全及大規模有害操縱等範疇。這類限制的作用,是為可接受的自訂安排劃出不可跨越的底線。iThome 指出,微軟同時表示,只要符合安全限制,仍容許企業合作夥伴按需要調整模型,並會盡量避免把單一 AI 價值觀強加於使用者。

兩者放在一起,呈現出 AI 治理常見的張力:企業希望模型配合行業、流程及使用情境,但平台方亦要維持若干不可協商的安全門檻。若限制訂得太寬,合作夥伴可能難以因應實際業務調整;若過於寬鬆,按客戶需要調整模型又可能成為繞過安全設計的缺口。分析而言,微軟日後最需要說明的,是哪些規則屬於不可變更的底線,以及哪些預設行為可由客戶按風險和用途調校。

對香港企業與開發團隊來說,若有使用微軟的 AI 服務,這份草案可作為內部採購與部署評估的一個提問框架:誰擁有停止系統的權力、任務是否有清晰上限、例外行為如何留下可供覆核的資料,以及供應商所稱的安全預設能否配合既有管治要求。這不是指草案已帶來新的本地要求,而是說它把使用 AI agent 時原本容易被忽略的控制責任,推到更前的位置。

「不隱瞞推理」如何理解,仍待具體說明

草案要求模型不可向負責審核的人員隱瞞推理,目的顯然是支援人類監督與問責。不過,這句原則在實際產品上如何處理,仍有不少需要釐清之處。審核所需的未必是系統輸出大量原始過程,而可能是足以交代任務依據、採取過甚麼行動、何時遇到限制,以及由誰批准的可讀記錄。文件最終若能把審核需要轉化為清楚的營運指引,才較容易讓企業納入工作流程。

iThome 報道提到,微軟認為 AI 能力正快速提升、採用規模持續擴大,並以近期出現由 AI agent 發動、大規模而高度協調且持續的黑客攻擊安全事件,說明建立安全可靠 AI 的迫切性。這個背景也解釋了為何文件不只談內容安全,而把自主行動、聽命對象與審核安排一併納入。當系統可執行的事情增加,防護重點便要由「它可否回答不當內容」延伸至「它可否在不應繼續時停下」。

但治理文件本身不會自動消除風險。企業仍要按自身使用情境,判斷可交由 AI 處理的任務、需要人手批准的節點,以及發現異常時的回應程序。尤其是涉及跨部門資料、外部溝通或持續性工作時,任務描述過於籠統,很容易令「範圍限制」在操作上失去作用。這亦是管理者和產品團隊需要共同處理的問題,而非只交由模型供應商承擔。

公眾諮詢是測試原則能否變成共識的一步

微軟表示,草案由 MAI 與公司內部的負責任 AI、法律、紅隊、安全、AI 訓練及銷售等團隊共同制定,並曾向不同領域的學者、企業合作夥伴、社區成員和一般民眾徵詢意見。公司認為,服務全人類的 AI 不應由單一企業決定,因此把首版草案交予公眾檢視。這種做法可擴闊討論範圍,但意見多元亦意味最終文本須清楚界定哪些是價值選擇,哪些是可落地的營運要求。

根據 iThome 報道,全球年滿 18 歲人士可透過網上表格提交意見,截止日期為 10 月 25 日;參與者可就整份準則,以及「人本 AI」、「安全」和「營運指南與預設行為」分別提出建議。微軟稱會在諮詢後審閱回饋、進一步修訂準則,並可能發布意見摘要及報告。公開徵詢本身提供了討論渠道,卻不代表每項建議必然被採納。

下一步值得觀察的,是修訂版會否把原則進一步轉為可供客戶、審核人員及開發者檢查的行為要求,尤其是關閉機制、任務範圍與審核安排。若日後仍只停留於方向性聲明,企業難以據此衡量實際風險;相反,若能連接至清晰的預設行為和責任分工,這套準則才較有機會影響 AI agent 在工作環境中的使用方式。

延伸閱讀

AI 輔助說明: 本文由 AI 協助整理,並經兩輪獨立自動品質審核;資料及連結仍以原始來源為準。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook