
NeMo Switchyard 幫 AI agent 分流,74% 慳錢數字要點樣睇
Codex、Claude Code 可接平價或本地模型,但路由判斷都有成本
所謂「AI 路由器」,實際做緊咩
TechNews 科技新報報道,NVIDIA 推出 NeMo Switchyard,希望企業唔使每一個 AI request 都送去最貴嘅模型。個名聽落似網絡硬件,其實佢係放喺 AI agent 同模型 API 中間嘅 LLM proxy:先睇工作進度同設定,再揀平價模型、強模型或者本地模型處理,同時將唔同 API 格式互相轉換。
Switchyard 支援 OpenAI Chat Completions、OpenAI Responses 同 Anthropic Messages 格式,後端可以接 OpenAI、Anthropic,亦可駁 vLLM、NVIDIA NIM、Ollama 等 OpenAI-compatible endpoint。Codex 同 Claude Code 都有 launcher,開發者改用 Switchyard 提供嘅位址同模型名稱,就可以保留原本 agent 介面,唔使大改成套應用。

圖片:NVIDIA
簡單工作交平價模型,出錯先升級
Switchyard 有幾種分流方法。LLM classifier 會搵另一個模型判斷工作難度;stage router 就睇 agent 嘅工具紀錄,例如係咪仲喺度探索、測試有冇出錯、近期有冇成功寫入檔案,再決定留喺平價模型定升上強模型。後者慳返一次 classifier call,不過判斷準唔準,好睇你套 agent 會唔會產生足夠訊號。
呢種做法幾啱 Codex、Claude Code 呢類多回合 agent。讀檔案、改格式同跟住既定步驟執行,未必次次都要 Opus 級模型;遇到測試反覆失敗、要理解大型 codebase,先用強模型會合理好多。不過路由器睇到嘅始終係行為訊號,佢唔知道答案係咪真係正確。平價模型如果一路錯得好淡定,升級機制未必即刻察覺。

圖片:NVIDIA
74% 有條件,平價模型單獨跑其實仲平
74% 呢個數字來自 LangChain 公開嘅測試,唔係所有企業工作都可以照搬。測試涵蓋 145 項多步驟 Deep Agents 任務,每項平均呼叫模型 6.3 次,內容包括客戶服務、事故調查、工具操作同長篇摘要。模型組合係 Claude Opus 4.8、Nemotron 3.5 Lightning,再加一個負責判斷嘅 Gemini 3.6 35B。
LangChain 數據顯示,Opus 4.8 單獨跑有 86% 準確率,每輪成本 11.45 美元;Switchyard 將 93% 呼叫交畀 Nemotron,準確率跌到 80%,成本降至 3 美元。Nemotron 單獨跑其實只需 0.72 美元,準確率有 77.7%。換句話講,路由版本多付超過三倍成本,只換返約 2.3 個百分點,而呢個差距細過測試本身約 2.7 點嘅波動,未足以證明路由一定好過全程用平價模型。
判斷模型都會食錢,延遲亦會疊上去
同一測試入面,classifier 佔路由方案 21.2% 支出,亦即每次判斷都係一筆額外 API 成本。LangChain 量到 classifier 約加 700ms;Classmethod 嘅第三方試用再發現,揀錯帶大量 reasoning token 嘅判斷模型,classifier 甚至可以貴過真正答題嘅平價模型。佢哋換模型後將判斷成本壓低約十二倍,但延遲中位數就由約 2.1 秒升到 7.2 秒。
所以部署前要計每項工作嘅總成本,當中包括輸入、輸出、prompt cache、classifier、重試同自建 GPU。兩款模型單價相差唔遠,節省落嚟嘅錢未必夠交 classifier 費用。至於短對話或者即時服務,agent 仲未累積到足夠紀錄就完場,分流效益亦會細好多。
本地模型有私隱優勢,但唔會自動合規
Switchyard 本身唔靠 GPU,經 PyPI 安裝要 Python 3.12 或以上;如果公司已有 Ollama、vLLM 或 NIM endpoint,可以將部分內容留喺內部環境。呢點對處理客戶資料、內部文件同程式碼嘅團隊幾實際。不過要做到資料全程唔離開公司,平價模型、強模型、classifier 同 telemetry 都要逐項設成本地或受管 endpoint。Switchyard只負責轉送同分流,唔會自動幫資料脫敏,亦唔代表已符合公司管治政策。
成熟度亦要睇清楚。開源 repo 嘅 known issues 列明,就算取消咗 request,上游仍可能繼續處理,費用亦會照計;部分 Codex Responses 工作可能記錄唔到 token,用工具嘅 request 遇上唔相容 schema 亦會失敗。stage router 嘅 context overflow fallback 只會改送指定模型一次,第二次再爆 context 就直接回傳錯誤,唔係一套包底式容錯。NeMo Relay 入面嘅 Switchyard 整合亦仍標示為 experimental。
邊類團隊值得試
每月 AI API 帳單夠大、工作有大量重複步驟,同時又有一批難題一定要強模型處理,Switchyard 先比較容易計得掂。開發團隊可以由影子測試開始,記低每款模型嘅成功率、token、延遲同重試,再調整升級門檻。74% 可以當成一個參考案例;正式投入使用前,仍要用公司自己嘅任務、模型價錢同失敗成本重新跑一次。
參考來源
- TechNews 科技新報 — 輝達推「AI 路由器」NeMo Switchyard,精準分流助企業狂降 74% 成本 — original report
- NVIDIA Nemotron 3.5 Lightning 與 NeMo Switchyard 官方介紹 — NVIDIA 官方發布資料,交代產品定位、合作夥伴同內部 benchmark。
- NVIDIA-NeMo Switchyard GitHub repo — 核對開源授權、支援格式、後端、安裝要求同 Codex/Claude Code launcher。
- How many of your agent's calls actually need a frontier model? — 74% 成本降幅嘅原始測試,列出任務數量、模型組合、準確率、成本同測試限制。
- Switchyard Known Issues — 官方 repo 列出成本統計、取消 request、Codex token 紀錄同工具 schema 等已知問題。
- NVIDIA の新しい LLM ルーティング基盤 NeMo Switchyard を試してみた — 第三方實際接駁 Mac、DGX Spark、Claude Code 同本地模型,亦量到 classifier 成本及延遲取捨。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







