Google 用 diffusion 做文字生成快四倍,但質素仲未追到 Gemma 4
3C 產品

Google 用 diffusion 做文字生成快四倍,但質素仲未追到 Gemma 4

圖片:via Android Authority — https://www.androidauthority.com/google-diffusiongemma-3676609/
TechLab 編輯部(譯)·

1,000 tokens/s 好吸引,重點係取捨

一次寫一塊,再慢慢修

Google 新出嘅 DiffusionGemma,最值得睇嘅唔係「又多一個 AI model」,而係佢用咗另一套生成文字方法。一般 LLM 係由左至右逐粒 token 寫落去,下一粒要等上一粒出完先郁到;DiffusionGemma 就先開一塊 256-token canvas,由一堆亂碼/placeholder 開始,之後反覆 denoise,成段一齊改到似樣。

呢個玩法聽落似圖像 diffusion,但搬到文字有另一種好處:每個 token 可以望到同一塊 canvas 入面其他位置。對 inline editing、補 code、JSON、表格、甚至 Sudoku 呢類好多互相制約嘅任務,理論上會比純左至右生成更順,因為佢唔使等「將來」嗰啲 token 出現先知道前面有冇撞。

Google 圖解 autoregressive 同 diffusion 喺 Sudoku 類任務入面嘅 token 注意力分別

圖片:Google Developers Blog

快,真係快,但硬件背景要講清楚

Google 官方講法係,DiffusionGemma 喺 dedicated GPU 上可以做到最高 4x token output,H100 單卡 1,000+ tokens/s,RTX 5090 亦有 700+ tokens/s。model card 再寫低 batch、H100、FP8 情況可以過 1,100 tokens/s。呢啲數字唔係手機或者普通 laptop 嘅體驗,H100 係 data center 級貨,RTX 5090 都係高階卡;不過對做 AI app、coding assistant、內容草稿流水線、企業內部推理嘅 team,低延遲就真係有錢銀意思。

因為 agents 最怕唔係淨係「答得慢」,而係每一步 tool call、改 prompt、再生成都要等。批量寫 product description、草擬客服回覆、掃 codebase 做細粒度 patch、或者喺本機 workstation 跑私有資料 workflow,1,000 tokens/s 代表可以試多幾輪、少啲等 GPU 空轉。Google 都講明,呢種優勢最啱低至中 batch、單 accelerator;去到高 QPS 雲端場景,parallel decoding 嘅甜蜜位未必咁大。

代價係質素

最要冷靜嘅位:Google 自己都冇話佢取代 Gemma 4。The Keyword 寫得好直接,autoregressive Gemma 4 仍然係高質素 production output 嘅標準。model card 入面,DiffusionGemma 26B A4B 對 Gemma 4 26B A4B,大部分 benchmark 都落後:MMLU Pro 77.6% 對 82.6%,AIME 2026 69.1% 對 88.3%,LiveCodeBench v6 69.1% 對 77.1%,Codeforces ELO 1429 對 1718。

所以我會咁分:

  • 要最穩陣、要長文推理、要交畀客或者直接出街,用 Gemma 4/其他成熟 autoregressive model。
  • 要低延遲互動、草稿、補位、格式修補、批量初稿,可以試 DiffusionGemma。
  • 要正式落 production,就要自己用真 workload eval,唔好淨係睇 tokens/s。

開放程度夠實用,但仲係實驗品

DiffusionGemma 係 25.2B total、3.8B active 嘅 MoE model,官方話 quantized 後可落到 18GB VRAM 級別,DeepMind 頁面亦寫 24GB VRAM RTX 5090/4090 可放得落。權重已放 Hugging Face,同時有 Kaggle、Vertex Model Garden、vLLM、Transformers、MLX、SGLang、NVIDIA NIM/NeMo 呢類路徑,license 標成 Apache 2.0。對 developer 嚟講,呢次唔係淨係 paper demo,係真係有工具鏈可以拎嚟試。

不過「有得試」同「可以放心換走 chatbot backend」係兩回事。DiffusionGemma 更似一個速度優先嘅新引擎:啱用喺補全、即時編輯、agent 中間步、批量草稿,之後再交畀高質素 model 或人手收尾。呢個方向有意思,因為 LLM 成本唔會淨係靠更大 GPU 解決;如果生成方法本身可以由逐字排隊變成成塊並行,下一波 AI 工具嘅手感同成本結構都可能變。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook