
GPT‑5.6 Sol 跑到 750 tokens/s,Codex 工作節奏會點變
推論快咗,背景瀏覽、多 agent 同驗證循環都有機會縮短
OpenAI 早前公布,GPT‑5.6 Sol 喺 Cerebras 硬件上最高可以做到 750 tokens/s。TechNews 科技新報亦引述一段公開活動片段,話 OpenAI 研究員 Jeffrey Wang 用內部系統時,任務快到未有空檔切去做第二樣嘢就完成。呢句幾吸引,不過佢屬於個人觀感,片段亦冇交代任務、輸出長度同量度方法,睇法上要同正式 benchmark 分開。
快得嚟,coding agent 會少咗等候感
Coding agent 一次工作通常會重複幾個循環:睇檔案、諗改法、寫 code、跑測試、讀錯誤,再修正。每次等模型生成答案,都會打斷工作節奏;當推論去到每秒數百 tokens,寫 patch、解釋錯誤同決定下一個工具動作嘅空檔可以明顯縮短。同一分鐘內行多幾輪修正同驗證,實際價值高過單純睇住文字飛快彈出嚟。
背景瀏覽器操作亦有類似好處。Codex 而家可以開多個分頁、檢查網頁同喺背景繼續獲派工作,模型睇完頁面後愈快決定下一步,分頁之間嘅空轉時間就愈少。不過網頁載入、登入、下載、API 回應同人手批准依然有本身延遲。750 tokens/s 加快到嘅主要係模型思考後輸出嗰段,唔會令慢 server、長時間 build 或完整測試套件突然跑快。

圖片:Cerebras
多 agent 快咗,token 用量亦會一齊升
GPT‑5.6 嘅 Ultra 模式預設可以協調四個 agent,各自研究、改 code 或驗證,再整合結果。推論夠快,幾個 agent 就可以更早完成各自工作,再整合結果;原本逐樣做嘅研究、實作同測試亦可以同步推進。不過四個 agent 都會讀 context 同產生 tokens,速度愈高,燒配額亦可以愈快。OpenAI 現行 Codex Fast mode 對 GPT‑5.6 只寫明約 1.5 倍速度、2.5 倍 credits 費率,官方文件冇話呢個模式等同 Cerebras 嘅 750 tokens/s 路徑。
Helios 食 prompt,Cerebras 接手逐粒 token 生成
AMD 同 Cerebras 公布嘅聯合系統會拆開推論兩個階段。AMD Helios 用 Instinct GPU 處理 prefill,即係先讀 prompt、codebase 同大型 context;呢類工作適合用大量平行運算追吞吐量。之後 decode 交畀 Cerebras Wafer‑Scale Engine,逐粒生成 token。Decode 好受記憶體頻寬同每一步延遲影響,Cerebras 就集中處理呢段,令前端收到答案嘅速度更穩定。
呢種分工聽落合理,但兩邊交接模型狀態、KV cache 同請求時會加幾多延遲,廠方暫時未公開。AMD 同 Cerebras 所講嘅最高 5 倍每瓦每秒 token 效能,亦係用 Kimi 2.6 1T 模型做嘅內部建模結果,比較對象係純 Cerebras WSE 配置,未有獨立實測。聯合方案預計 2026 年下半年先喺 Cerebras Cloud 提供,穩定性、繁忙時速度、收費同地區供應都要等正式服務先睇到。
香港帳戶暫時未有官方保證
GPT‑5.6 Sol 本身已喺 Codex 推出:受支援地區嘅 Plus、Pro、Business 同 Enterprise 方案可以揀 Sol,Free 同 Go 就只得 Terra;API 標準價係每 100 萬 input tokens 5 美元、output tokens 30 美元,Priority processing 收標準 token 價兩倍。不過 OpenAI 官方支援地區名單截至 7 月 29 日仍然搵唔到香港,Cerebras 版 Sol 亦冇另外公布香港供應或專屬收費,所以未有根據話一般香港帳戶已正式用到 750 tokens/s。
750 tokens/s 可以縮短 agent 由分析、執行到驗證每一步要等嘅時間。等 Helios 加 Cerebras 正式開放後,最值得睇係完整任務時間、繁忙時延遲同每次完成工作要用幾多錢。
參考來源
- TechNews 科技新報 — OpenAI 研究員讚「快到來不及切換畫面」,AMD 攜手 Cerebras 顛覆 AI 推論極限 — original report
- OpenAI:GPT‑5.6 發布、供應同 API 定價 — 確認 Sol、Terra、Luna 喺 Codex 同 API 嘅方案、功能及價格。
- OpenAI Codex:Speed — 確認 Fast mode 速度、credits 倍率,同 Cerebras 750 tokens/s 並冇劃上等號。
- OpenAI:ChatGPT 支援國家及地區 — 核對官方名單未有列出香港。
- AMD 與 Cerebras 聯合推論方案 — 確認 prefill/decode 分工、2026 年下半年時間表,同 5 倍效能數字嘅測試註解。
- Cerebras:GPT‑5.6 模型選擇及 750 tokens/s — 確認 Cerebras 對 Sol 最高速度、模型分工同成本取捨嘅官方說法。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







