
Kog 單一 kernel 推到 3,000 tokens/s:coding agent 點解最食延遲
8 張數據中心 GPU 跑 2B 模型,速度亮眼但條件要睇清
法國初創 Kog 想證明一件事:coding agent 跑得慢,未必代表 GPU 已經去到盡。公司用自家 Kog Inference Engine(KIE),喺一部配備 8 張 AMD MI300X 嘅 server 上,令 Laneformer 2B 以每秒超過 3,000 個輸出 token 解碼。數字好搶眼,不過今次最值得拆嘅,其實係佢點樣由軟件層逐粒微秒執返嚟。
Coding agent 點解唔可以淨睇總吞吐量
一般模型服務會將多個請求砌成 batch,盡量塞滿 GPU,追求成部 server 每秒交到幾多 token。呢套計法適合大量 chatbot 用戶或者批次工作。不過 coding agent 往往係一條有先後次序嘅長鏈:寫程式、跑測試、睇錯誤、再修改,每一步都要等上一步完成。就算 server 同時服務到好多客,一條 agent 工作鏈每次仍然等十幾秒,成個循環一樣慢。
所以 Kog 瞄準 batch size 1 嘅每請求解碼速度。呢個取向會犧牲一部分資源共享彈性,甚至可能提高單次請求佔用嘅 GPU 數目,不過對收費 coding agent、即時語音同互動工具嚟講,縮短每一輪等待可以直接令任務早啲完成。總吞吐量同單一請求延遲量度緊兩件事,Kog 揀咗後者做賣點。

圖片:Kog
一個持續 kernel,少幾次來回已經差好遠
傳統 LLM 推理會將 attention、矩陣運算、正規化、取樣等工作交畀多個 GPU kernel。CPU 要逐個啟動,GPU 做完又要同步,生成下一個 token 時再走一次。單次開 kernel 嗰點開支睇落好細,但自回歸模型逐 token 重複幾百甚至幾千次,延遲就會一路疊上去。
Kog 嘅做法係將完整 decode pass,包括最後取樣同停止檢查,塞入一個長駐 GPU 嘅 monokernel。程式留喺 GPU 入面持續運行,減少 CPU 往返、重複 kernel launch 同中途同步。Kog 技術文章仲話,佢哋按 MI300X 內部 chiplet 同 HBM 位置調校記憶體存取,即係話,呢個速度係靠針對指定硬件逐層調校,唔係撳個設定掣就做到。

圖片:Kog
跨 GPU 通訊都要藏入運算後面
用 8 張 GPU 加快單一請求,模型要切開擺落唔同 GPU,代價係每層運算之間要交換結果。標準 tensor parallelism 通常要等 all-reduce 完成先繼續,GPU 愈多,通訊停頓愈容易食走加速效果。Kog 自研 KCCL 通訊層,再配合 Delayed Tensor Parallelism(DTP),將某層結果延遲幾層先合併,期間照樣載入權重同做運算,等通訊藏喺其他工作後面。
呢招亦帶出一個重要限制:DTP 改動咗模型結構,要由訓練階段開始配合。Kog 自家 Laneformer 用得到,但現成第三方模型結構已固定,冇得原封不動套用。Kog 官方技術預覽承認,大型第三方 MoE 模型要改用標準 tensor parallelism,靠 monokernel 同 KCCL 減輕通訊成本,效果仍有待實際成績證明。
3,000 tokens/s 唔等於 ChatGPT 快 30 倍
測試條件要逐項睇:約 2.3B 參數嘅 Laneformer、FP16、batch size 1、8× MI300X、冇量化、冇 speculative decoding。Kog 另報 8× H200 跑到每秒 2,100 個輸出 token,但兩組數字都係公司自測,暫時未見獨立大型基準重現。Laneformer 模型卡亦寫明,公開版只係 2B 級 coding 模型,唔係 frontier 通用助手;用普通 Transformers runtime,亦跑唔到 KIE 嘅速度。
公司網站用「30x faster」包裝產品,就仲要小心。ChatGPT 背後用咩模型、參數規模、batch 策略、硬件配置同服務負載都冇完整公開,答案質素同上下文長度亦唔同。直接將一個專門為低延遲設計嘅 2B 模型,同大型線上助手嘅輸出速度排埋比較,技術上冇足夠可比性。3,000 tokens/s 證明咗個工程方向有料,未證明同級大型模型都做到相同速度。
真正難位係搬去客戶想用嘅模型
TechCrunch 報道話,Kog 初次展示後收到約 200 個具體商業查詢,但潛在客戶普遍唔想自己微調細模型,逼使公司集中處理大型現成模型。團隊得 11 人,而每款新 GPU 都可能要花幾星期至幾個月研究底層行為,支援速度自然有限。呢種硬件專用調校可以榨出高效能,同時亦令擴闊模型同晶片支援變得吃力。
對自建 AI 服務嘅企業同 coding agent 團隊,Kog 帶出嘅實際訊息幾清楚:GPU 仲有大量軟件開支可以削走,低延遲亦值得獨立優化。不過採購或者部署之前,最好等 Kog 公布大型第三方模型嘅成績,證明答案質素相若,再交代完整成本,仲要有獨立測試驗證。;公司自訂 2B 模型跑得飛快,暫時只完成咗第一段路。
參考來源
- TechCrunch — Kog is going deeper to squeeze more inference out of GPUs — original report
- Real-time LLM Inference on Standard Datacenter GPUs — 核對 3,000 tokens/s 測試條件、H200 成績、模型能力同第三方模型限制
- Building a single-kernel, latency-optimized LLM inference engine on AMD MI300X GPUs — 解釋 monokernel、kernel launch、同步、HBM 頻寬同 MI300X 底層調校
- Delayed Tensor Parallelism for Faster Transformer Inference — 核對 DTP 點樣延遲跨 GPU 通訊,同埋現階段研究證據嘅範圍
- Kog Laneformer 2B 模型卡 — 核對參數量、上下文長度、評測設定、公開版用途同風險說明
- AMD:Kog Inference Engine benchmark — 補充早期比較基準嘅硬件、軟件版本、prompt 長度同測試方法
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







