
Grok 4.6 瞄準長時間 coding agent:平過 GPT、Claude,但跑分未贏晒
500K context 配 US$2/US$6 API 價,主攻多步程式工作
TechNews 科技新報報道把 Grok 4.6、SpaceX 股價同沽空盤變化放埋一齊講,不過股價升近一成背後仲夾雜業績、流通股數同空倉回補,冇足夠證據可以全數算落新模型度。對開發者有用得多嘅消息,係 xAI 相隔唔夠一個月再更新旗艦模型,今次集中改善長時間運作嘅 coding agent。
4.6 似一次針對 agent 嘅加操
xAI 話 Grok 4.6 延長咗 Grok 4.5 後續訓練,又用 4.5 重新產生唔同推理強度、agent 框架同技術範疇嘅訓練軌跡。呢種做法解釋到點解兩代只隔幾星期:底層能力未必由頭換過,團隊主要用新一輪 SFT 同強化學習,補佢喺長流程、工具調用、自我檢查同前端視覺輸出上嘅短板。
官方形容 4.6 可以由產品概念一路做到可運作初版,途中研究陌生資料、整理架構、寫核心功能,再按回饋修改。呢啲全部係 xAI 自己觀察,TechLab 冇實測過。真正要驗證嘅係 agent 行幾十步之後會唔會走歪、測試有冇漏,同埋改大型 codebase 時可唔可以維持原有設計,單次生成一個靚 demo 答唔到呢幾條問題。

圖片:SpaceXAI
Coding 跑分有進步,但未到通殺
xAI 公布嘅表入面,Grok 4.6 High 喺 CursorBench 3.2 攞到 69.9%,高過 GPT-5.6 Sol Max 嘅 67.2%,貼近 Fable 5 Max 嘅 70.5%。換到 DeepSWE 1.1,Grok 係 65.9%,落後 GPT 嘅 73% 同 Fable 嘅 70%;Terminal-Bench 3.0 就只有 26%,同兩個對手約 34% 相差一截。即係佢較擅長嘅 agent 場景幾明顯,唔同工具框架同任務類型仍然會改變排名。
Artificial Analysis 嘅綜合指數就畀 Grok 4.6 61 分,同 GPT-5.6 Sol 打和,較 Grok 4.5 多 5 分;Fable 5 係 62 分。呢組第三方結果支持佢重返頂尖嗰批模型,但綜合分數包住多種知識、推理同 agent 任務,唔等於每個程式項目都打和。xAI 其餘圖表亦混合各廠自報成績同公開榜單,用同一個 agent、同一套權限及同一份私有 codebase 再試,先較接近公司真正用法。
API 價夠進取,長 context 要計清楚
Grok 4.6 標準 API 每百萬 input token 收 US$2,output 收 US$6,cached input 係 US$0.50。對照同一張旗艦跑分表嘅 GPT-5.6 Sol,官方價係 US$5/US$30;Claude Fable 5 就係 US$10/US$50,Grok 做大量 agent loop 確實平好多。不過 OpenAI 仲有 US$1/US$6 嘅 GPT-5.6 Luna,揀模型時唔可以淨係拎各家最貴旗艦互相比價。
Grok 4.6 有 500K context window,少過 GPT-5.6 系列嘅 1.05M。更易忽略嘅係,prompt 一到 200K token,Grok 成個 request 都轉用長 context 價:input/output 升到 US$4/US$12,cache 都變 US$1。大型 repo 塞得入唔代表應該成份塞入去;檔案檢索、context compaction 同穩定 cache key,會直接影響每次 agent 任務張單。
有 API,亦已入主流 coding 平台
Grok 4.6 支援文字、圖片輸入、function calling、structured output、網上搜尋、X 搜尋同程式執行,推理強度可揀 low 至 xhigh。開發者可以喺 xAI API、Grok Build、Cursor、OpenRouter、Vercel 同 Cloudflare 使用;xAI 嘅 API 文件全部以美元列價,暫時未見香港獨立定價。現階段最值得試嘅係長流程改 code、跨檔案除錯同反覆驗證,再用現有 GPT 或 Claude 工作流做相同任務比較成功率、時間同總成本。
參考來源
- TechNews 科技新報 — Grok 4.6 登場 SpaceX 股價飆近 10%、空軍大撤退 — original report
- Introducing Grok 4.6 — xAI 官方發布,提供訓練方向、benchmark、平台支援同首發定價。
- Grok 4.6 API 文件 — 核對 500K context、輸入模式、推理強度、工具能力同可用平台。
- SpaceXAI API Pricing — 核對標準、cached input、長 context 同工具調用收費。
- GPT-5.6 Sol Model — 對照 GPT-5.6 Sol 官方 API 價、1.05M context 同功能。
- Claude Fable 5 — 對照 Claude Fable 5 官方定位、API 價同長時間 agent 用途。
- A-CODE-LLM Bench: Agentic Coding Benchmark — 補充獨立 agentic coding 測試背景,說明速度、工具調用量同成績唔可以直接劃上等號。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







