Groq 再融 6.5 億美元:Nvidia 以外,AI 推理算力仲有咩揀?
Tech News

Groq 再融 6.5 億美元:Nvidia 以外,AI 推理算力仲有咩揀?

圖片:via TechCrunch — https://techcrunch.com/2026/06/22/ai-chipmaker-groq-confirms-650m-raise-re-staffs-after-nvidias-20b-not-acqui-hire-deal/
TechLab 編輯部(譯)·

今次重點落喺低延遲推理,同開發者點揀 API 供應商

Groq 重新押注雲端推理

TechCrunch 報道,Groq 已確認新一輪 6.5 億美元融資,Groq 官方新聞稿話呢輪由 Disruptive 同 Infinitum 領投,但冇披露新估值;公司上一次喺 2025 年 9 月融資後估值係 69 億美元。表面睇係 AI 公司再補彈藥,但呢單值得睇,因為 Groq 而家唔再淨係講自家 AI chip 點挑 Nvidia,重心已經轉去雲端低延遲推理服務。

Groq LPU 晶片官方產品圖,灰色晶片上面有 groq 標記

圖片:Groq

Nvidia 拎走技術之後,Groq 剩低乜嘢牌

背景係 2025 年 12 月,Groq 同 Nvidia 簽咗 non-exclusive inference technology licensing agreement。官方只確認 Jonathan Ross、Sunny Madra 同其他成員會加入 Nvidia,TechCrunch 形容成約 200 億美元 not-acqui-hire;金額本身唔係 Groq 或 Nvidia 公開披露。Nvidia 之後喺 2026 年 3 月 GTC 推出 NVIDIA Groq 3 LPX,話會同 Vera Rubin GPU 平台夾住做低延遲 agentic inference。換句話講,Nvidia 已經吸收咗 Groq 最有話題嗰部分技術。

咁 Groq 剩低嘅牌,就係雲端營運、開發者入口同成本曲線。Groq 官方話而家有 13 個 data center,覆蓋北美、歐洲、中東同 APAC,服務超過 500 萬開發者,每星期處理 trillions of tokens,目標 2027 年底前向 200MW 擴張。呢啲全部係官方口徑,未等於市場已經買單,但方向好清楚:Groq 要賣嘅已經由一粒 chip,變成一條可以即刻 call API 嘅推理產線。

NVIDIA Groq 3 LPX rack 官方渲染圖,機櫃入面見到多層運算模組

圖片:NVIDIA Developer Blog

LPU 同 GPU 差喺邊

Groq LPU 個賣點係 predictable latency。Groq 自己嘅 LPU 架構頁寫明用 single-core、on-chip SRAM 同 compiler static scheduling,目的係少啲 cache miss 同排程抖動,token 一粒一粒出得穩。GPU 勝在彈性同生態,CUDA、tooling、雲端供應、training 同 inference 都包得晒;LPU 就專注喺生成 token 嗰段,特別啱客服 bot、coding agents、即時語音 AI 呢啲等多半秒都會影響體驗嘅場景。

不過專注亦代表限制。你唔會因為 Groq 快,就成個 AI workload 搬晒過去;模型支援、context window、資料保留政策、region endpoint、企業合約、fallback provider,全部都要計。Nvidia 嘅強係完整 stack 同供應鏈,Groq 嘅強係某啲 open model 低延遲推理。開發者最實際嘅做法,係按工作流拆:重 reasoning 或大模型留喺主力供應商,細模型、語音中間步、agent tool call 就試 Groq 呢類快推理 endpoint。

數字有幾靚,要睇清楚來源

低延遲唔好淨係聽 marketing。Groq 官方 pricing 頁標示 Llama 3.1 8B Instant 有 840 TPS,input 每 100 萬 token $0.05、output $0.08;Llama 3.3 70B Versatile 就標 394 TPS,input $0.59、output $0.79。呢啲係官方標價同速度,唔係 TechLab 實測。第三方 Artificial Analysis 喺 Llama 3.3 70B provider benchmark 入面,量到 Groq output speed 320.5 t/s,time to first token 0.97s,速度排第一,但最低價反而係 DeepInfra、Nebius Base、CompactifAI 嗰批。

呢個位係開發者要睇嘅現實:Groq 未必次次最平,亦未必每個模型 first token 最快,但佢喺 output speed 上有明顯優勢。做 coding agent 時,長答案快出會令等待感細好多;做客服 bot 或語音 AI,first token、streaming 穩定度、region latency 又可能緊要過每秒 token。你睇供應商,唔可以淨係睇一個 benchmark 榜,要用自己嘅 prompt、自己嘅用戶位置同 concurrency 壓一次。

Neocloud 唔等於大型雲端替身

neocloud 呢個字而家好熱,簡單講就係 AI-first 雲端供應商,賣特定 AI 算力同配套,唔靠傳統雲端入面嗰堆通用 VM 做主菜。Equinix 嘅背景文提到,呢類服務通常靠專門硬件、透明收費、低延遲連線同 AI workflow 配套吸客。Groq 特別嘅地方係佢唔只係租 Nvidia GPU,仲有自己 LPU 歷史同 GroqCloud API,所以佢同 CoreWeave、Lambda、Nebius 嗰類 GPU neocloud 競爭時,打法會窄啲,但差異亦會清楚啲。

但 neocloud 最大風險都喺呢度。你可能用到好快嘅 endpoint,但公司規模、供應穩定、合規、區域覆蓋、長期路線都未必追得上大型雲端。今次融資最實際嘅作用,係幫 Groq 爭取時間,證明自己喺 Nvidia 旁邊都賣得郁雲端推理服務,而唔係只靠早期技術名氣。尤其 Nvidia 自己都拎住 LPX 走入 Vera Rubin,Groq 要證明嘅亦由「我有好 chip」,轉成「我有好服務」。

開發團隊點睇

本地 startup 同 AI 團隊如果本身已經用海外 API,呢單新聞唔會即刻改變部署,但會多一個觀察方向:inference provider 可以拆開揀。以前好多團隊一諗 AI 算力就直覺諗 Nvidia GPU 或大雲端,Groq 呢類選擇提醒大家,推理層可以按 latency、model、price、資料要求分流。尤其係 Llama、Qwen、Whisper 呢類開源或開放權重模型,用邊個 provider 跑,實際體驗可以差好遠。

下一步睇兩樣

跟住要睇兩件事。第一,Groq 講嘅 13 個 data center 同 200MW 擴張,會唔會變成穩定 region endpoint、企業 SLA 同真實產能,抑或只係漂亮投資簡報。第二,Nvidia LPX 正式出貨後,會唔會直接食走低延遲 inference 嘅 premium market。下一步要睇嘅係,Nvidia 自己推 LPX 之後,開發者仲會唔會繼續將 API traffic 分畀 Groq。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook