AI agent 開得多未必做得快:國旗遊戲揭示溝通成本同錯誤共識
Tech News

AI agent 開得多未必做得快:國旗遊戲揭示溝通成本同錯誤共識

圖片:via TechNews 科技新報 — https://technews.tw/2026/08/03/too-many-ai-agents-can-get-in-each-others-way/
TechLab 編輯部(譯)·

研究用受控任務拆解群體決策,結果唔等於企業通用上限

國旗遊戲究竟測緊咩

Elizabeth Pavlova 同 Hidenori Tanaka 設計嘅 Flag Game,會將一面完整國旗切成細塊,每個 AI agent 只睇到其中一小部分。佢哋先各自估國家,跟住按指定方式交換答案同理由,最後睇成班 agent 加埋有冇估中答案。單一 agent 手上證據有限,成組人理論上就有足夠線索,研究重點係啲線索點樣流動,同埋 agent 會信自己雙眼多啲,定跟其他成員嘅講法。

論文試咗三種組織方式:agent 隨機一對一交換消息、全組同步廣播,仲有一個睇唔到國旗碎片嘅 manager agent,專門讀取各方報告再作決定。結果顯示,通訊方式、模型組合同 prompt 都會改變表現。廣播雖然解決咗消息傳唔到出去嘅問題,但所有人一齊見到同一批意見,亦可能令一個早期誤判迅速變成主流;manager 可以集中整理資料,表現同樣要睇佢識唔識分辨證據強弱。

「16 個 agent」唔係採購公式

TechNews 科技新報報道將研究引申到企業採用 AI agent 嘅數量上限;The Register 亦以 16 個作為焦點。不過論文本身講得窄好多:16 只係 Flag Game 特定 population scaling 設定入面出現嘅轉折位。人少時,成組人未必抽到足夠關鍵圖像;數量再升,證據覆蓋面會擴闊。群組再大啲,部分實驗就出現陣營分裂,各小圈子反覆確認自己嗰套答案,整體表現反而回落。

呢個實驗本身冇寫 code、操作瀏覽器、修改公司資料庫,亦冇處理真實項目入面嘅依賴關係。作者都將 Flag Game 定位成受控合成任務,方便逐層追查集體判斷點解成功或者失敗。企業用幾多個 agent 冇一條固定數字可抄,任務可唔可以平行、共享狀態有幾複雜、每個 agent 拎到咩工具同資料,都足以改變結果。

Coding agent 最易中嘅錯誤共識

套落 Codex、Claude Code 或內部自動化,最有用嘅提醒係:多幾份答案唔等於多幾份獨立證據。如果五個 agent 用同一模型、讀同一段需求,再沿用第一個 agent 錯咗嘅假設,後面四個好可能只係寫出語氣唔同嘅附和。表面上好快達成共識,實際上錯得相當一致。共享對話愈長,舊結論亦愈容易變成大家唔再質疑嘅前設。

研究將群體失敗拆成幾類,呢個框架幾啱開發團隊用:可能冇任何 agent 見過關鍵檔案;有人發現問題但冇傳出去;消息傳到 manager 手上卻俾較響亮嘅錯誤意見蓋過;又或者最早出現嘅合理答案令全組太快鎖定方向。四種情況要用嘅修正方法完全唔同,分別涉及補資料、改交接格式、調整匯總規則,同保留獨立判斷時間。

點樣分工先比較實際

多 agent 比較適合邊界清楚、可獨立驗收嘅任務,例如一個查 API 變更、一個追測試失敗、一個做安全檢查,再交畀 manager 整合。幾個 agent 同時改同一組核心檔案,通訊、合併衝突同重做成本好容易食晒平行處理慳返嘅時間。拓撲亦要跟任務揀:獨立調查可用中央 manager 收結果;高度依賴嘅改動,逐步交接通常穩陣過全員廣播。

論文亦發現 social-awareness prompt 同混合模型有機會改善集體表現。實際設計時,可以要求 agent 清楚標明「親眼見到嘅證據」、「由其他 agent 收到嘅講法」同信心,減少傳聞一路複製;關鍵檢查亦可交畀另一款模型或另一套 prompt,降低錯誤高度相關嘅機會。不過模型多樣性會加重成本同結果格式差異,應該留畀高風險、值得交叉驗證嘅環節。

評估時唔好淨係睇有冇交功課

一套 multi-agent 系統交到答案,唔代表協作真係有效。開發團隊仲要一齊量度測試通過率、完成時間、token 同 API 成本、合併衝突、返工次數,仲有錯誤係咪由多個 agent 重複製造。最好保留每個 agent 最初嘅獨立判斷,再同溝通後答案比較,咁先睇到協作究竟補到資料,抑或只係令大家更快同意。下一步值得等嘅係同類研究搬到真實 coding 任務,再比較唔同任務拆法同通訊結構。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook