
Perplexity 推本機 AI 代理:零 token 成本背後仍有硬件門檻
Portable Computer 先在 DGX Spark 運行,本機處理與按需要接駁雲端成為核心取捨
Perplexity 與 NVIDIA 合作推出「Portable Computer」,讓 AI 代理、模型及所需工具直接在用戶裝置上運行。它主打兩項實際利益:本機完成的工作不會產生 token 費用,資料亦毋須為了處理任務而傳送至雲端。對需要批量執行代理工作,或會接觸敏感資料的開發者及企業用戶,這種 local-first 架構提供了另一種成本與私隱選擇。
不過,現階段的使用門檻相當高。Portable Computer 暫時只支援 NVIDIA DGX Spark,而報道所述整套設備價格約為 5,000 美元;用戶亦須訂閱 Perplexity Pro 或 Max,現已可在 DGX Spark 上設定使用。NVIDIA RTX GPU 支援仍是「即將推出」,因此今次較接近面向高階用戶的早期部署方案,未能視為一般 PC 已可普及使用的本機 AI 代理。
本機小型模型如何接手代理工作
一般聊天工具多數等待用戶提問,再產生一次答案;代理式 AI 則要把目標拆成多個步驟,選擇工具、處理中間結果,並持續推進任務。這類流程可能反覆呼叫模型,若全部透過按用量計費的雲端服務執行,工作量愈大,token 消耗也可能愈可觀。Portable Computer 的重點,就是把能在本機處理的部分留在本機,減少每一步都要接駁雲端的需要。
根據報道,Portable Computer 現時可在 DGX Spark 上運行 Qwen 3.8,亦支援 PPLX 27B;後者是以 Qwen 3.8 為基礎再作 post-training 的版本。Perplexity 稱這些較小型而高效率的模型可處理複雜代理任務,並能在本機硬件上運行。NVIDIA Nemotron 3.5 Lightning 的支援則尚未推出,不能把它當作目前已可使用的選項。
這種設計的意義,在於代理未必每一步都需要最先進的大型雲端模型。整理本機資料、執行既定流程或重複處理大量項目,有機會由較小型模型承擔;當任務需要搜尋最新資料或較進階推理,才升級使用外部能力。這是基於產品架構可作出的合理判斷,但報道沒有提供獨立 benchmark、任務成功率或速度數據,因此目前仍無法確認小型模型在實際複雜流程中可取代多少雲端運算。
「零 token 成本」有清楚邊界
Perplexity 所說的零 token 成本,只涵蓋由用戶機器在本機完成的工作,並不代表 Portable Computer 的所有功能均可無限量免費使用。假如任務需要網頁搜尋或接駁前沿模型作進階推理,代理仍會轉向雲端。報道沒有交代這些雲端操作的具體收費或用量安排,因此較準確的理解是:產品可免除部分本機工作所涉及的 token 費,而非把整個代理工作流程變成零成本。
Portable Computer 在轉用搜尋或進階雲端模型前,會先要求用戶批准。這個批准機制讓用戶知道資料與任務何時可能離開本機,也可避免代理在背景自行增加雲端用量。然而,報道未有詳細說明批准畫面會展示哪些資料、能否按工具或任務設定長期權限,以及送往雲端的內容範圍。對重視合規和資料管治的企業來說,這些控制細節會比一句「先取得批准」更重要。
私隱方面,Perplexity 表示代理、模型及其他工具均存放於用戶裝置,本機處理可避免用戶資料傳送至雲端。這對處理內部資料、未公開程式碼或批量文件的工作有吸引力,但相關說法來自公司,原文亦沒有獨立安全審核結果。只要任務獲准使用網頁搜尋或雲端推理,資料流向便可能改變;用戶仍須分辨哪些步驟真正留在本機,不能將 local-first 直接理解為所有情況下完全離線。
DGX Spark 限制了目前的實際受眾
約 5,000 美元的 DGX Spark 把初期受眾收窄至已有專門 AI 硬件、願意測試本機代理的開發者及機構。零 token 費可以降低高頻任務的邊際成本,但硬件採購、電力、維護及 Perplexity 訂閱仍是成本;原文也沒有提供工作量與回本期的比較。若只偶爾使用代理,購置專門設備未必划算;若每天處理大量、可由本機模型完成的任務,成本模式才較可能展現優勢。
即將加入 RTX GPU 支援,實際意義是把 Portable Computer 從專門的 DGX Spark 平台推向較常見的 NVIDIA GPU 環境,潛在用戶範圍因而有望擴大。不過,Perplexity 尚未在這篇報道中列出支援哪些 RTX 型號、最低顯示記憶體要求、推出日期或不同硬件的效能差距。故此,現階段只能確認支援方向,不能推斷現有 RTX 電腦屆時必然可以順暢運行 PPLX 27B 或其他模型。
下一步要看效能與雲端切換細節
Portable Computer 展示了一種混合式代理架構:把可預測、高頻或涉及敏感資料的工作放到本機,小型模型能力不足時,再在用戶批准下接駁搜尋及更進階的雲端模型。它嘗試在成本、私隱與模型能力之間建立可控分工,但實際價值仍取決於本機模型能完成多少任務、失敗時如何處理,以及雲端升級會帶來多少費用與資料風險。
接下來最值得留意的是 RTX GPU 的確實支援清單、Nemotron 3.5 Lightning 的推出時間,以及獨立測試能否證明本機代理在長流程中的可靠性。香港售價與供應情況在來源中沒有資料,現時不宜推斷;但對考慮在內部部署 AI、自行控制敏感資料,或需要大量重複代理工作的開發團隊而言,這些後續資料將直接決定 Portable Computer 是否適合實際使用,抑或暫時只是針對昂貴專用硬件的技術展示。
延伸閱讀
AI 輔助說明: 本文由 AI 協助整理,並經兩輪獨立自動品質審核;資料及連結仍以原始來源為準。
參考來源
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







