
AI agent 寫得快未必交到貨:開發者價值轉去揀題、驗收同執尾
Phil Chen 嘅職涯判斷,放返入實際開發情境睇
AI coding agent 愈做愈多工,開發者嘅日常亦開始變樣。以前一個功能可能由人逐行寫、逐個錯誤追;而家可以交俾 agent 搜 codebase、改幾個檔案、跑測試,再按結果修正。打字寫 code 所佔嘅時間縮短咗,但產品責任冇跟住消失。 邊個決定要改咩、點先算完成、出事由邊度查,依然要有人揸主意。
「AI 解到就唔值錢」講得太盡
TechNews 科技新報報道 Phil Chen 嘅職涯文章時,將重點濃縮成「AI 能解嘅題唔值錢」。呢句夠搶眼,但講得絕對過 Chen 原來嘅論點。佢實際主張係:模型會愈來愈擅長處理定義清楚、可以用標準答案評分嘅任務,所以未來較有影響力嘅人,會擅長發現重要問題,同埋分配時間、token、資金等資源去處理。
Chen 自述曾經喺 Helm AI、Scale AI、Google DeepMind 同 OpenAI 工作,而家以創辦人角度思考一間「agent-native」公司點請人。佢話自己公司冇人手寫任何一行 code,傳統 LeetCode 題甚至系統設計面試,同實際工作表現已經拉開距離。呢啲係佢按自身公司同招聘經驗得出嘅判斷,唔係涵蓋整個就業市場嘅研究結論。
開發者開始似 agent 嘅技術負責人
放入開發現場,最實際嘅轉變係工作重心向前同向後移。向前,要搞清楚用戶痛點、限制條件、依賴項目同失敗風險,再將大任務拆成 agent 食得落嘅部分;向後,就要審 code diff、跑測試、核對安全同效能,確保改動真係解決原先問題。中間生成 code 嗰段可以快好多,兩端嘅判斷反而更密集。
驗收標準亦會直接影響結果。叫 agent「整好登入」太空泛;列明 session 點過期、權限錯誤回咩狀態、舊帳戶點遷移、邊幾組測試一定要過,先有辦法判斷交付合唔合格。Anthropic 講 agent 設計時同樣強調清楚評估準則、環境回饋同人類檢查點。識寫 test、rubric 同停止條件,已經係核心開發能力。
Token 同時間都要識計數
Chen 特別提到資源分配,呢點實在過一般「學識用 AI」嘅建議。複雜任務可以開多個 agent 平行研究,亦可以叫一個生成、另一個審核,但每多一輪都會增加 token、延遲同錯誤互相放大嘅機會。Anthropic 嘅 agent 指引亦提醒,自主程度提高通常會換來較高成本同累積失誤,簡單任務未必值得砌成多 agent 系統。
所以開發者要識判斷,邊啲工作交細模型快速處理,邊啲值得用較強模型深挖,幾時開平行 agent,幾時直接自己改兩行最快。呢種取捨同傳統工程管理好接近,只係資源清單多咗 context、token、工具權限同模型能力。用得多 agent 唔代表做得好,最後仍然要睇交付速度、成本同故障率。
最後嗰截依然最食功夫
Agent 可以好快砌出八成似樣嘅版本,餘下工作通常包括例外情況、資料遷移、權限、監控、文件、部署同回滾。呢堆細節未必適合放喺產品 demo,但會決定軟件可唔可以長期運作。Chen 將呢部分形容成最後一段衝刺,佢認為平均輸出愈易取得,願意反覆檢查同打磨嘅人就愈容易拉開距離。
至於 AI 會唔會取代大部分知識工作,Chen 相信人類仍會喺選題同資本分配方面保留優勢。呢個同樣係個人預測,暫時冇足夠證據證實。較穩陣嘅結論係,開發者短期內會少做一部分機械式輸入,多做問題定義、agent 調度、驗收同交付;公司請人同評核表現時,亦要開始量度呢幾種能力。
參考來源
- TechNews 科技新報 — OpenAI 前工程師的職涯忠告:AI 能解的題不值錢,會「選問題」的人才無可取代 — original report
- Career advice in the age of AI — Phil Chen 原文 — Phil Chen 嘅一手文章,核對完整論點、工作經歷自述同 agent-native 公司講法。
- Phil Chen:Career advice in the age of AI — 作者本人轉載及概括文章,確認佢將重點放喺選題、資源分配、時間、人脈同聲譽。
- Building effective agents — Anthropic — 官方技術背景,解釋 agent 編排、評估回饋、成本取捨同人類檢查點。
- Demystifying evals for AI agents — Anthropic — 補充 agent 驗收、grader、測試準則同持續改善輸出嘅實務背景。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







