
Garry Tan 推 Tokenmaxxing:燒盡 token 前先計清 Agent 回報
細團隊要睇成果、錯誤率同慳到幾多工時
Tokenmaxxing 聽落好似叫大家盡情燒錢,Garry Tan 嘅講法其實多一層:初創可以先用大量 Agent 探路,搵到行得通嘅做法,再將經驗保存成 Skill。TechNews 科技新報報道,Tan 喺 a16z 訪談估計,全力運行 Agent 每年可能花 5 萬至 10 萬美元;佢亦提過有兩三人團隊靠數百個 Agent 同 Skill,幾個月做到 1,500 萬美元 ARR。兩組數字都係 Tan 個人講法,暫時未見獨立資料核實。
一年 78 萬港元,token 仲要分平貴
按金管局聯繫匯率區間中間值 7.8 粗略換算,5 萬至 10 萬美元即係每年約 39 萬至 78 萬港元,每月約 3.25 萬至 6.5 萬港元。呢筆數唔應該淨係睇 token 總量,因為輸入、快取輸入、推理輸出同工具呼叫可以差好遠。以 OpenAI 2026 年 8 月 API 價目做例子,GPT-5.6 Sol 每百萬個未快取輸入 token 收 5 美元,快取輸入收 0.5 美元,輸出就收 30 美元。Agent 重複讀大型程式庫、長對話同工具結果時,context 點樣整理,足以令同一件工作嘅賬單差幾倍。

圖片:Web Summit/Harry Murphy/Sportsfile
封閉式任務先值得放大火力
大量 Agent 最啱處理有清楚終點、可以自動驗收、失敗後容易重跑嘅工作,例如跑測試、掃安全漏洞、整理大量資料、比較多個方案,或者按固定規格改一批檔案。a16z 自己訪問初創後亦發現,部分團隊會畀 Agent 通宵攻擊系統,再靠編譯器同測試套件判斷結果;但亦有團隊開過數百個 Agent,最後只係更快做錯決定。a16z speedrun 嘅整理點出咗重點:任務本身含糊、牽涉產品方向、客戶信任或者不可逆操作時,燒多幾輪 token 未必補到判斷力不足。
Markdown Skill 要有驗收方法先可靠
一份可重用 Skill 最少要寫清觸發條件、輸入資料、預期輸出、可用工具、步驟、停止條件、例外情況同驗收方法;會改資料、付款、部署或者發訊息嘅部分,仲要加人手批准。固定計算同格式轉換可交畀程式處理,再用單元測試、整合測試同少量真實案例驗證。Tan 將 Skill 形容成可重複做事嘅 Markdown 員工,但「寫低咗」唔代表每次都會啱。Hermes Agent 官方文件提到 Skill 會按任務載入,呢種做法可以避免每次都塞晒所有指示入 context;Skill 太闊、規則互相打架或者冇版本管理,同樣會製造錯誤同浪費 token。
Agent 數量一多,權限風險同步放大
幾百個 Agent 唔止會推高賬單,工具權限同憑證亦會散得更開。OpenClaw 官方安全指引講明,佢假設每個 gateway 得一個可信任使用者邊界;多人共用一個有工具權限嘅 Agent,任何獲准發訊息嘅人都有機會驅動同一套權限。公司用呢類工具時,應該分開管理開發、財務、客戶資料同對外操作嘅存取權限,預設採用 allowlist、sandbox 同最少權限設定。否則 Agent 處理嘅工作愈多,一個錯誤指令波及嘅範圍亦會愈大。
用完成率同覆核時間計 ROI
最實際嘅計法係先揀一類重複任務,記低冇 Agent 時要幾耐、成功率同返工次數,再同 Agent 版本比較。每次至少記五樣數:成果有冇通過驗收、人手覆核分鐘、返工次數、漏出到正式環境嘅錯誤率,同埋模型連工具嘅總成本。內部可以用「慳到嘅工時乘人力時薪,加新增毛利,再扣 AI 同覆核成本」做淨收益,然後除返 AI 同覆核成本。token 用量只係賬單資料,完成幾多可用成果先反映效益。
點解唔可以淨係靠主觀感覺判斷效率,METR 一項研究正好提供咗例子。METR 嘅隨機對照研究搵咗 16 名熟悉大型開源項目嘅開發者完成 246 個真實任務,結果使用 2025 年初 AI 工具嗰組平均慢咗 19%,參加者事後反而以為自己快咗 20%。研究場景同模型都有局限,結果唔可以套落所有 Agent 任務,不過佢清楚示範咗主觀感覺有幾易偏離實際工時。細型開發團隊可以先畀一個有測試、有固定輸出嘅任務跑兩至四星期,達到預設完成率同回本期先逐步加碼。
參考來源
- TechNews 科技新報 — 新創靠 Agent 和 Skill 突圍,Y Combinator 執行長挺 Tokenmaxxing — original report
- a16z:Y Combinator CEO 談 AI 時代創辦人心理 — Garry Tan 原始訪談影片。
- a16z speedrun:初創應唔應該 Tokenmaxxing — 補充多間初創使用大量 Agent 嘅經驗、限制同成本取捨。
- Hermes Agent 官方文件 — 核對 Hermes Agent、Skill、按需要載入同多 Agent 功能。
- OpenClaw 官方安全指引 — 核對 gateway 信任邊界、工具權限、allowlist 同 sandbox 風險。
- METR:AI 對資深開源開發者生產力嘅研究 — 提供真實程式開發任務嘅隨機對照數據,說明主觀效率同實際工時可以有落差。
- OpenAI API 價目表 — 核對輸入、快取輸入同輸出 token 嘅價差。
- 金管局:香港聯繫匯率制度 — 用聯繫匯率區間將美元成本粗略換算成港元。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







