Kog 單一 kernel 推到 3,000 tokens/s:coding agent 點解最食延遲
Tech News

Kog 單一 kernel 推到 3,000 tokens/s:coding agent 點解最食延遲

圖片:via TechCrunch — https://techcrunch.com/2026/08/14/kog-is-going-deeper-to-squeeze-more-inference-out-of-gpus/
TechLab 編輯部(譯)·

8 張數據中心 GPU 跑 2B 模型,速度亮眼但條件要睇清

法國初創 Kog 想證明一件事:coding agent 跑得慢,未必代表 GPU 已經去到盡。公司用自家 Kog Inference Engine(KIE),喺一部配備 8 張 AMD MI300X 嘅 server 上,令 Laneformer 2B 以每秒超過 3,000 個輸出 token 解碼。數字好搶眼,不過今次最值得拆嘅,其實係佢點樣由軟件層逐粒微秒執返嚟。

Coding agent 點解唔可以淨睇總吞吐量

一般模型服務會將多個請求砌成 batch,盡量塞滿 GPU,追求成部 server 每秒交到幾多 token。呢套計法適合大量 chatbot 用戶或者批次工作。不過 coding agent 往往係一條有先後次序嘅長鏈:寫程式、跑測試、睇錯誤、再修改,每一步都要等上一步完成。就算 server 同時服務到好多客,一條 agent 工作鏈每次仍然等十幾秒,成個循環一樣慢。

所以 Kog 瞄準 batch size 1 嘅每請求解碼速度。呢個取向會犧牲一部分資源共享彈性,甚至可能提高單次請求佔用嘅 GPU 數目,不過對收費 coding agent、即時語音同互動工具嚟講,縮短每一輪等待可以直接令任務早啲完成。總吞吐量同單一請求延遲量度緊兩件事,Kog 揀咗後者做賣點。

Kog Inference Engine 喺 MI300X 同 H200 上嘅單一請求解碼速度圖表

圖片:Kog

一個持續 kernel,少幾次來回已經差好遠

傳統 LLM 推理會將 attention、矩陣運算、正規化、取樣等工作交畀多個 GPU kernel。CPU 要逐個啟動,GPU 做完又要同步,生成下一個 token 時再走一次。單次開 kernel 嗰點開支睇落好細,但自回歸模型逐 token 重複幾百甚至幾千次,延遲就會一路疊上去。

Kog 嘅做法係將完整 decode pass,包括最後取樣同停止檢查,塞入一個長駐 GPU 嘅 monokernel。程式留喺 GPU 入面持續運行,減少 CPU 往返、重複 kernel launch 同中途同步。Kog 技術文章仲話,佢哋按 MI300X 內部 chiplet 同 HBM 位置調校記憶體存取,即係話,呢個速度係靠針對指定硬件逐層調校,唔係撳個設定掣就做到。

Kog monokernel 推理引擎技術示意圖

圖片:Kog

跨 GPU 通訊都要藏入運算後面

用 8 張 GPU 加快單一請求,模型要切開擺落唔同 GPU,代價係每層運算之間要交換結果。標準 tensor parallelism 通常要等 all-reduce 完成先繼續,GPU 愈多,通訊停頓愈容易食走加速效果。Kog 自研 KCCL 通訊層,再配合 Delayed Tensor Parallelism(DTP),將某層結果延遲幾層先合併,期間照樣載入權重同做運算,等通訊藏喺其他工作後面。

呢招亦帶出一個重要限制:DTP 改動咗模型結構,要由訓練階段開始配合。Kog 自家 Laneformer 用得到,但現成第三方模型結構已固定,冇得原封不動套用。Kog 官方技術預覽承認,大型第三方 MoE 模型要改用標準 tensor parallelism,靠 monokernel 同 KCCL 減輕通訊成本,效果仍有待實際成績證明。

3,000 tokens/s 唔等於 ChatGPT 快 30 倍

測試條件要逐項睇:約 2.3B 參數嘅 Laneformer、FP16、batch size 1、8× MI300X、冇量化、冇 speculative decoding。Kog 另報 8× H200 跑到每秒 2,100 個輸出 token,但兩組數字都係公司自測,暫時未見獨立大型基準重現。Laneformer 模型卡亦寫明,公開版只係 2B 級 coding 模型,唔係 frontier 通用助手;用普通 Transformers runtime,亦跑唔到 KIE 嘅速度。

公司網站用「30x faster」包裝產品,就仲要小心。ChatGPT 背後用咩模型、參數規模、batch 策略、硬件配置同服務負載都冇完整公開,答案質素同上下文長度亦唔同。直接將一個專門為低延遲設計嘅 2B 模型,同大型線上助手嘅輸出速度排埋比較,技術上冇足夠可比性。3,000 tokens/s 證明咗個工程方向有料,未證明同級大型模型都做到相同速度。

真正難位係搬去客戶想用嘅模型

TechCrunch 報道話,Kog 初次展示後收到約 200 個具體商業查詢,但潛在客戶普遍唔想自己微調細模型,逼使公司集中處理大型現成模型。團隊得 11 人,而每款新 GPU 都可能要花幾星期至幾個月研究底層行為,支援速度自然有限。呢種硬件專用調校可以榨出高效能,同時亦令擴闊模型同晶片支援變得吃力。

對自建 AI 服務嘅企業同 coding agent 團隊,Kog 帶出嘅實際訊息幾清楚:GPU 仲有大量軟件開支可以削走,低延遲亦值得獨立優化。不過採購或者部署之前,最好等 Kog 公布大型第三方模型嘅成績,證明答案質素相若,再交代完整成本,仲要有獨立測試驗證。;公司自訂 2B 模型跑得飛快,暫時只完成咗第一段路。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook