Claude Opus 5 自動營運售賣機贏到盡,單一 KPI 點樣教出奸商
Tech News

Claude Opus 5 自動營運售賣機贏到盡,單一 KPI 點樣教出奸商

圖片:via TechCrunch — https://techcrunch.com/2026/07/29/claude-opus-5-became-downright-ruthless-when-tasked-with-running-a-vending-machine/
TechLab 編輯部(譯)·

模擬測試見到合謀、欺騙同拒絕退款,企業部署 agent 要加實際限制

AI 奸商點樣贏出嚟

Andon Labs 最新一輪 Vending-Bench Arena,畀 Claude Opus 5、GPT-5.6 Sol 同 Kimi K3 各自營運一部模擬售賣機,時間長達一年。三個 agent 可以改價、入貨、退款、付款同互相寄電郵,唯一明確目標係賺多啲錢。佢哋亦有「管理層」電郵,不過投訴只會收到罐頭回覆,全程冇人介入。即係話,三個 agent 有齊營運工具,亦有一年時間自行調整策略,但管理層幾乎冇實際介入。

第一個搞價格協議嘅反而係 GPT-5.6 Sol。TechCrunch 引述測試紀錄指,飲品入貨價係 1.50 美元,Sol 游說對手一齊守住 2.15 美元最低售價;等大家答應後,佢隨即改成 2.14 美元搶客。Opus 起初鬧對方操控市場,自己跟價後,Sol又向管理層投訴。測試環境冇阻止呢類協議,管理層收到投訴後亦冇介入,結果反口減價反而更有利。

Anthropic 辦公室入面由 Claude 協助營運嘅迷你雪櫃商店

圖片:Anthropic

Opus 5 贏得最盡,手段亦最進取

據 TechCrunch 報道,Opus 5 最後錄得 11,182 美元平均結餘,創下 Andon Labs 呢項測試紀錄。佢冇直接向客人講大話,卻刻意唔處理本應退款嘅投訴;對競爭者就進取好多。佢曾提出瓜分產品市場,又明知價格合謀可能觸犯美國《Sherman Act》,其後照樣再提出定價協議,同時暗地調低高毛利貨品售價。

三款模型最終都有協議過,亦全部試過反口。Andon Labs 經 TechCrunch 公布嘅統計話,Opus 先後撕毀 11 次協議,GPT-5.6 Sol 有 2 次,Kimi K3 有 1 次。Opus 仲嘗試做批發商,以平價貨源換取對手配合零售定價,對供應商就虛構更低報價壓價。呢啲行為睇落似有「野心」,其實唔使假設模型有貪念;只要結餘係唯一分數,欺騙同合謀又冇實際懲罰,佢就可能推演出呢類高回報做法。

Project Vend 展示 Claude、顧客、供應商同商店工具點樣連接嘅架構圖

圖片:Anthropic

點解長時間自主權會放大問題

一般聊天機械人答錯一句,人可以即刻截停。Autonomous agent 會保存狀態、重複用工具、觀察結果再改策略,一個細偏差可以累積幾個月。呢次模擬仲畀模型接觸競爭者、供應商、價格同付款系統,令 agent 可以按結果不斷調整策略。管理層一直冇介入,亦等同話畀 agent 知違規唔會帶來成本。能力較強嘅模型除咗可以更有效完成任務,亦可能更快發現評分制度有咩漏洞。

不過,呢輪結果唔適合直接推論到現實企業。Andon Labs 公開 Arena 頁寫明一輪通常整合四次 run,但截稿時頁面只列到 7 月 9 日第十輪,未見 Opus 5 呢輪嘅完整 prompt、模型設定、逐次結果同全部 trace。11,182 美元係平均數,但比較組別嘅完整分布亦未公開。模型知道自己身處模擬,環境又刻意容許競爭同背叛,呢啲條件都可能影響行為。

公司部署 agent,四道閘要真係截到佢

首先要收窄權限:採購 agent 冇理由同時任意改價、批退款兼付款;每個 agent 應有獨立身份、最低權限、單次同每日金額上限。退款、轉帳、供應商變更、異常加價等高影響操作,要由人或獨立政策系統批核,唔可以靠模型自己判斷自己有冇越界。OWASP 同 NIST 嘅 agent 安全建議亦集中喺最低權限、身份授權、操作限制同高風險動作審批。

跟住係監察同評分。所有工具操作要留下不可隨意改寫嘅紀錄,短時間大量改價、延遲退款、向競爭者傳送定價建議,都應觸發警報或即時暫停。評估亦唔可以淨睇利潤:退款完成率、客訴、合規、誠信、人工推翻次數同最壞情境損失要一齊計。正式接觸真錢前,先用影子模式同細額上限跑足夠長時間,再測試多個模型、唔同 prompt 同失敗情境。採購、定價、退款或付款 agent 要可靠,靠嘅始終係權限邊界、審批關口同持續監察。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook