
Google 用 diffusion 做文字生成快四倍,但質素仲未追到 Gemma 4
1,000 tokens/s 好吸引,重點係取捨
一次寫一塊,再慢慢修
Google 新出嘅 DiffusionGemma,最值得睇嘅唔係「又多一個 AI model」,而係佢用咗另一套生成文字方法。一般 LLM 係由左至右逐粒 token 寫落去,下一粒要等上一粒出完先郁到;DiffusionGemma 就先開一塊 256-token canvas,由一堆亂碼/placeholder 開始,之後反覆 denoise,成段一齊改到似樣。
呢個玩法聽落似圖像 diffusion,但搬到文字有另一種好處:每個 token 可以望到同一塊 canvas 入面其他位置。對 inline editing、補 code、JSON、表格、甚至 Sudoku 呢類好多互相制約嘅任務,理論上會比純左至右生成更順,因為佢唔使等「將來」嗰啲 token 出現先知道前面有冇撞。

圖片:Google Developers Blog
快,真係快,但硬件背景要講清楚
Google 官方講法係,DiffusionGemma 喺 dedicated GPU 上可以做到最高 4x token output,H100 單卡 1,000+ tokens/s,RTX 5090 亦有 700+ tokens/s。model card 再寫低 batch、H100、FP8 情況可以過 1,100 tokens/s。呢啲數字唔係手機或者普通 laptop 嘅體驗,H100 係 data center 級貨,RTX 5090 都係高階卡;不過對做 AI app、coding assistant、內容草稿流水線、企業內部推理嘅 team,低延遲就真係有錢銀意思。
因為 agents 最怕唔係淨係「答得慢」,而係每一步 tool call、改 prompt、再生成都要等。批量寫 product description、草擬客服回覆、掃 codebase 做細粒度 patch、或者喺本機 workstation 跑私有資料 workflow,1,000 tokens/s 代表可以試多幾輪、少啲等 GPU 空轉。Google 都講明,呢種優勢最啱低至中 batch、單 accelerator;去到高 QPS 雲端場景,parallel decoding 嘅甜蜜位未必咁大。
代價係質素
最要冷靜嘅位:Google 自己都冇話佢取代 Gemma 4。The Keyword 寫得好直接,autoregressive Gemma 4 仍然係高質素 production output 嘅標準。model card 入面,DiffusionGemma 26B A4B 對 Gemma 4 26B A4B,大部分 benchmark 都落後:MMLU Pro 77.6% 對 82.6%,AIME 2026 69.1% 對 88.3%,LiveCodeBench v6 69.1% 對 77.1%,Codeforces ELO 1429 對 1718。
所以我會咁分:
- 要最穩陣、要長文推理、要交畀客或者直接出街,用 Gemma 4/其他成熟 autoregressive model。
- 要低延遲互動、草稿、補位、格式修補、批量初稿,可以試 DiffusionGemma。
- 要正式落 production,就要自己用真 workload eval,唔好淨係睇 tokens/s。
開放程度夠實用,但仲係實驗品
DiffusionGemma 係 25.2B total、3.8B active 嘅 MoE model,官方話 quantized 後可落到 18GB VRAM 級別,DeepMind 頁面亦寫 24GB VRAM RTX 5090/4090 可放得落。權重已放 Hugging Face,同時有 Kaggle、Vertex Model Garden、vLLM、Transformers、MLX、SGLang、NVIDIA NIM/NeMo 呢類路徑,license 標成 Apache 2.0。對 developer 嚟講,呢次唔係淨係 paper demo,係真係有工具鏈可以拎嚟試。
不過「有得試」同「可以放心換走 chatbot backend」係兩回事。DiffusionGemma 更似一個速度優先嘅新引擎:啱用喺補全、即時編輯、agent 中間步、批量草稿,之後再交畀高質素 model 或人手收尾。呢個方向有意思,因為 LLM 成本唔會淨係靠更大 GPU 解決;如果生成方法本身可以由逐字排隊變成成塊並行,下一波 AI 工具嘅手感同成本結構都可能變。
參考來源
- Android Authority — DiffusionGemma is Google’s fastest AI yet, but it comes with a big trade-off — original report
- DiffusionGemma: The Developer Guide — Google 官方 developer guide,確認 4x、H100/RTX 5090、256-token canvas、vLLM 同 18GB VRAM 資料。
- Introducing DiffusionGemma — Google The Keyword 發布文,確認實驗定位、Apache 2.0、Gemma 4 質素取捨同使用場景。
- DiffusionGemma model card | Google AI for Developers — 官方 model card,核對參數量、benchmark、限制、可用 modality 同低 batch 性能講法。
- DiffusionGemma — Google DeepMind — DeepMind 產品頁,補充 diffusion 生成方式、硬件 footprint、下載入口同官方定位。
- google/diffusiongemma-26B-A4B-it · Hugging Face — 模型權重頁,確認 Hugging Face 可用、license 標示同 Transformers 支援。
- DiffusionGemma: The First Diffusion LLM (dLLM) Natively Supported in vLLM — vLLM 官方技術文,補充 diffusion serving、batch size 1、H100/H200 實測吞吐同部署背景。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。






