
OpenAI Ultrafast 加速 GPT‑5.6 Sol:14 倍峰值背後點取捨
750 tokens/s 只係官方上限,首輪名額、收費同容量仲未公開
14 倍講緊咩
OpenAI 新公開嘅 Ultrafast service tier 會先喺 API 推出,由 Cerebras 提供運算,官方標示 最高每秒輸出 750 個 token,速度可達 Standard processing 14 倍。關鍵係「最高」:呢個數字講緊輸出階段嘅峰值,唔代表每個 request 由送出到完成都固定縮短 14 倍,暫時亦未見第三方用同一 workload 獨立驗證。
大模型延遲其實分幾截,包括排隊、首個 token、模型推理、逐個 token 輸出,同埋中途呼叫工具嘅時間。生成長篇程式碼或者報告時,750 tokens/s 帶嚟嘅分別會明顯啲。;如果答案得兩句,或者個 agent 要逐次搜尋、查 database、等外部 API 回覆,整體快幾多可能同 14 倍差好遠。OpenAI 今次冇公開 Ultrafast 嘅首個 token 延遲、P50/P95 數據或者指定 workload 結果。
Standard、Fast 同 Ultrafast 點分
Standard 係一般 API 基準;Fast mode 就係舊稱 Priority processing 嘅付費快線。OpenAI 官方文件話,GPT‑5.6 Sol 用 Fast 最高快過 Standard 2.5 倍,延遲亦較穩定。Fast 同 Standard 共享 rate limit,流量短時間升得太急,部分 request 可能降返 Standard 速度,收費亦跟返 Standard。換句話講,Fast 適合有穩定流量、用家正在等答案嘅產品,唔適合突然湧入嘅大型批次工作。
Ultrafast 再行前一大步,官方上限去到 Standard 14 倍,但服務容量明顯細好多。OpenAI 只畀首批指定公司測試,會等容量增加再擴大開放;公開資料冇交代 API 參數、配額、最低消費、SLA 或超出容量時點處理。Ultrafast 收費同正式開放時間:[待確認]。
快一倍,Fast 收費亦高一倍
以少過 272K input token 嘅 GPT‑5.6 Sol request 計,Standard 每 100 萬 input/output token 分別收 US$5/US$30;Fast 就係 US$10/US$60。速度本身唔會減少 token 用量,所以大量長輸出搬去 Fast,帳單可以好快翻倍。較實際嘅做法係只把語音對話、結帳支援、事故處理呢類用家正在等嘅步驟放入快線,背景摘要、索引整理同夜間分析繼續行一般或低成本處理。
邊啲場景真係食到速度
OpenAI 點名語音客服、系統事故分析、金融研究、交易風險判斷、網購支援同互動研究。當工程師要喺故障仍然發生緊嗰陣讀 log、trace 同程式改動,或者語音系統要邊傾邊查幾個內部系統,少幾秒確實會改變產品體驗。不過呢啲 workflow 同時依賴工具延遲、資料庫速度同答案準確度,單靠 token 吐得快,救唔到一條本身阻塞嘅 agent pipeline。
今次較值得睇嘅背景係,API 採購開始愈來愈似雲端運算:公司除咗揀模型能力,仲要睇 latency tier、容量同流量模式,再決定用邊個方案。Fast 已經用雙倍 token 價換最高 2.5 倍速度;Ultrafast 值幾多錢,就要睇每快一秒究竟可以減少幾多棄單、縮短幾多事故處理時間,或者令客服多處理幾多通電話。純粹內部生成文件,通常冇理由為等待時間豪花一筆。
香港團隊暫時未有清晰入口
香港公司對低延遲 API 當然有實際用途,不過資格要講清楚:截至 2026 年 8 月 13 日,OpenAI 公開嘅 API 支援地區名單冇列出香港,而 Fast mode 官方亦話地區供應視乎各地法規。Ultrafast 首輪只限指定客戶,公開資料無法確認香港實體可唔可以直接申請,香港資格同開放安排:[待確認]。等價目、配額同完整延遲數據公開後,企業先有足夠資料計清楚呢條快線值唔值。
參考來源
- TechCrunch — OpenAI introduces ‘Ultrafast,’ a new mode that makes GPT 5.6 Sol work at 14x the speed — original report
- Previewing Ultrafast mode: GPT‑5.6 Sol at up to 14X the speed — OpenAI 官方公告,確認最高 750 output tokens/s、14 倍上限、應用場景同供應限制。
- Fast mode | OpenAI API — 官方文件,確認 Fast mode 最高 2.5 倍、rate limit、降級條件同地區供應說明。
- Pricing | OpenAI API — 官方 API 價目,用嚟比較 GPT‑5.6 Sol Standard 同 Fast mode 收費。
- GPT‑5.6 Sol Model | OpenAI API — 官方模型頁,核對 context、輸出上限、基本 token 價同 rate limit。
- Supported countries and territories | OpenAI API — 官方 API 支援地區名單,用嚟核對香港供應狀況。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







