OpenAI Ultrafast 加速 GPT‑5.6 Sol:14 倍峰值背後點取捨
Tech News

OpenAI Ultrafast 加速 GPT‑5.6 Sol:14 倍峰值背後點取捨

圖片:via TechCrunch — https://techcrunch.com/2026/08/13/openai-introduces-ultrafast-a-new-mode-that-makes-gpt-5-6-sol-work-at-14x-the-speed/
TechLab 編輯部(譯)·

750 tokens/s 只係官方上限,首輪名額、收費同容量仲未公開

14 倍講緊咩

OpenAI 新公開嘅 Ultrafast service tier 會先喺 API 推出,由 Cerebras 提供運算,官方標示 最高每秒輸出 750 個 token,速度可達 Standard processing 14 倍。關鍵係「最高」:呢個數字講緊輸出階段嘅峰值,唔代表每個 request 由送出到完成都固定縮短 14 倍,暫時亦未見第三方用同一 workload 獨立驗證。

大模型延遲其實分幾截,包括排隊、首個 token、模型推理、逐個 token 輸出,同埋中途呼叫工具嘅時間。生成長篇程式碼或者報告時,750 tokens/s 帶嚟嘅分別會明顯啲。;如果答案得兩句,或者個 agent 要逐次搜尋、查 database、等外部 API 回覆,整體快幾多可能同 14 倍差好遠。OpenAI 今次冇公開 Ultrafast 嘅首個 token 延遲、P50/P95 數據或者指定 workload 結果。

Standard、Fast 同 Ultrafast 點分

Standard 係一般 API 基準;Fast mode 就係舊稱 Priority processing 嘅付費快線。OpenAI 官方文件話,GPT‑5.6 Sol 用 Fast 最高快過 Standard 2.5 倍,延遲亦較穩定。Fast 同 Standard 共享 rate limit,流量短時間升得太急,部分 request 可能降返 Standard 速度,收費亦跟返 Standard。換句話講,Fast 適合有穩定流量、用家正在等答案嘅產品,唔適合突然湧入嘅大型批次工作。

Ultrafast 再行前一大步,官方上限去到 Standard 14 倍,但服務容量明顯細好多。OpenAI 只畀首批指定公司測試,會等容量增加再擴大開放;公開資料冇交代 API 參數、配額、最低消費、SLA 或超出容量時點處理。Ultrafast 收費同正式開放時間:[待確認]。

快一倍,Fast 收費亦高一倍

以少過 272K input token 嘅 GPT‑5.6 Sol request 計,Standard 每 100 萬 input/output token 分別收 US$5/US$30;Fast 就係 US$10/US$60。速度本身唔會減少 token 用量,所以大量長輸出搬去 Fast,帳單可以好快翻倍。較實際嘅做法係只把語音對話、結帳支援、事故處理呢類用家正在等嘅步驟放入快線,背景摘要、索引整理同夜間分析繼續行一般或低成本處理。

邊啲場景真係食到速度

OpenAI 點名語音客服、系統事故分析、金融研究、交易風險判斷、網購支援同互動研究。當工程師要喺故障仍然發生緊嗰陣讀 log、trace 同程式改動,或者語音系統要邊傾邊查幾個內部系統,少幾秒確實會改變產品體驗。不過呢啲 workflow 同時依賴工具延遲、資料庫速度同答案準確度,單靠 token 吐得快,救唔到一條本身阻塞嘅 agent pipeline。

今次較值得睇嘅背景係,API 採購開始愈來愈似雲端運算:公司除咗揀模型能力,仲要睇 latency tier、容量同流量模式,再決定用邊個方案。Fast 已經用雙倍 token 價換最高 2.5 倍速度;Ultrafast 值幾多錢,就要睇每快一秒究竟可以減少幾多棄單、縮短幾多事故處理時間,或者令客服多處理幾多通電話。純粹內部生成文件,通常冇理由為等待時間豪花一筆。

香港團隊暫時未有清晰入口

香港公司對低延遲 API 當然有實際用途,不過資格要講清楚:截至 2026 年 8 月 13 日,OpenAI 公開嘅 API 支援地區名單冇列出香港,而 Fast mode 官方亦話地區供應視乎各地法規。Ultrafast 首輪只限指定客戶,公開資料無法確認香港實體可唔可以直接申請,香港資格同開放安排:[待確認]。等價目、配額同完整延遲數據公開後,企業先有足夠資料計清楚呢條快線值唔值。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook