
AI agent 開得多未必做得快:國旗遊戲揭示溝通成本同錯誤共識
研究用受控任務拆解群體決策,結果唔等於企業通用上限
國旗遊戲究竟測緊咩
Elizabeth Pavlova 同 Hidenori Tanaka 設計嘅 Flag Game,會將一面完整國旗切成細塊,每個 AI agent 只睇到其中一小部分。佢哋先各自估國家,跟住按指定方式交換答案同理由,最後睇成班 agent 加埋有冇估中答案。單一 agent 手上證據有限,成組人理論上就有足夠線索,研究重點係啲線索點樣流動,同埋 agent 會信自己雙眼多啲,定跟其他成員嘅講法。
論文試咗三種組織方式:agent 隨機一對一交換消息、全組同步廣播,仲有一個睇唔到國旗碎片嘅 manager agent,專門讀取各方報告再作決定。結果顯示,通訊方式、模型組合同 prompt 都會改變表現。廣播雖然解決咗消息傳唔到出去嘅問題,但所有人一齊見到同一批意見,亦可能令一個早期誤判迅速變成主流;manager 可以集中整理資料,表現同樣要睇佢識唔識分辨證據強弱。
「16 個 agent」唔係採購公式
TechNews 科技新報報道將研究引申到企業採用 AI agent 嘅數量上限;The Register 亦以 16 個作為焦點。不過論文本身講得窄好多:16 只係 Flag Game 特定 population scaling 設定入面出現嘅轉折位。人少時,成組人未必抽到足夠關鍵圖像;數量再升,證據覆蓋面會擴闊。群組再大啲,部分實驗就出現陣營分裂,各小圈子反覆確認自己嗰套答案,整體表現反而回落。
呢個實驗本身冇寫 code、操作瀏覽器、修改公司資料庫,亦冇處理真實項目入面嘅依賴關係。作者都將 Flag Game 定位成受控合成任務,方便逐層追查集體判斷點解成功或者失敗。企業用幾多個 agent 冇一條固定數字可抄,任務可唔可以平行、共享狀態有幾複雜、每個 agent 拎到咩工具同資料,都足以改變結果。
Coding agent 最易中嘅錯誤共識
套落 Codex、Claude Code 或內部自動化,最有用嘅提醒係:多幾份答案唔等於多幾份獨立證據。如果五個 agent 用同一模型、讀同一段需求,再沿用第一個 agent 錯咗嘅假設,後面四個好可能只係寫出語氣唔同嘅附和。表面上好快達成共識,實際上錯得相當一致。共享對話愈長,舊結論亦愈容易變成大家唔再質疑嘅前設。
研究將群體失敗拆成幾類,呢個框架幾啱開發團隊用:可能冇任何 agent 見過關鍵檔案;有人發現問題但冇傳出去;消息傳到 manager 手上卻俾較響亮嘅錯誤意見蓋過;又或者最早出現嘅合理答案令全組太快鎖定方向。四種情況要用嘅修正方法完全唔同,分別涉及補資料、改交接格式、調整匯總規則,同保留獨立判斷時間。
點樣分工先比較實際
多 agent 比較適合邊界清楚、可獨立驗收嘅任務,例如一個查 API 變更、一個追測試失敗、一個做安全檢查,再交畀 manager 整合。幾個 agent 同時改同一組核心檔案,通訊、合併衝突同重做成本好容易食晒平行處理慳返嘅時間。拓撲亦要跟任務揀:獨立調查可用中央 manager 收結果;高度依賴嘅改動,逐步交接通常穩陣過全員廣播。
論文亦發現 social-awareness prompt 同混合模型有機會改善集體表現。實際設計時,可以要求 agent 清楚標明「親眼見到嘅證據」、「由其他 agent 收到嘅講法」同信心,減少傳聞一路複製;關鍵檢查亦可交畀另一款模型或另一套 prompt,降低錯誤高度相關嘅機會。不過模型多樣性會加重成本同結果格式差異,應該留畀高風險、值得交叉驗證嘅環節。
評估時唔好淨係睇有冇交功課
一套 multi-agent 系統交到答案,唔代表協作真係有效。開發團隊仲要一齊量度測試通過率、完成時間、token 同 API 成本、合併衝突、返工次數,仲有錯誤係咪由多個 agent 重複製造。最好保留每個 agent 最初嘅獨立判斷,再同溝通後答案比較,咁先睇到協作究竟補到資料,抑或只係令大家更快同意。下一步值得等嘅係同類研究搬到真實 coding 任務,再比較唔同任務拆法同通訊結構。
參考來源
- TechNews 科技新報 — 溝通成本吃掉效率,研究:企業導入 AI 代理人數量有黃金上限 — original report
- OpenReview:Flag Game: Interpreting Decision Mechanisms of Bounded Social Agents — 研究 primary source,核對作者、受控任務、通訊機制、模型多樣性同研究限制。
- Flag Game 官方示範 — 研究團隊提供嘅互動示範,用嚟理解每個 agent 只掌握局部國旗資訊嘅設定。
- RIKEN iTHEMS:When Is Collective Intelligence a Lottery? — 研究者演講介紹 Flag Game、群體極化、模型多樣性同集體判斷背景。
- OpenAI Agents SDK — 官方開源資料,核對 agent、handoff、工具、guardrail 同 tracing 等系統組件。
- Anthropic:Multiagent orchestration — 官方文件列出平行分工、專門角色同 coordinator 架構,補充實際 multi-agent 設計背景。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







