Cursor 同 xAI 夾手訓練 Grok 4.5:AI coding 入口點樣爭
Tech News

Cursor 同 xAI 夾手訓練 Grok 4.5:AI coding 入口點樣爭

圖片:via TechNews 科技新報 — https://technews.tw/2026/08/07/cursor-xai/
TechLab 編輯部(譯)·

模型、coding agent 同開發者回饋,三樣嘢開始扣埋一齊

xAI 喺 7 月推出 Grok 4.5,方向相當清楚:集中火力做 coding、工具調用同長時間執行任務。官方確認模型同 Cursor 一齊訓練,亦即時放入 Grok Build、Cursor 同 API。TechNews 科技新報報道將呢輪進展形容成 xAI 重建後重新上軌道,不過公開資料只確認 Grok 4.5 同 Cursor 一齊訓練,未足以證明 Cursor 加快咗 xAI 重建,更未足以話成間公司四個月內已經執好晒。

跑分追得近,穩定性仍然要睇

Artificial Analysis 用 Grok Build 測試 Grok 4.5,Coding Agent Index 得 76 分,同 GPT-5.5 跑 Codex 嘅結果相若,低 Fable 5 配 Claude Code 一分;平均每項任務成本亦低過嗰兩套組合。呢個成績有參考價值,顯示 Grok 4.5 喺呢套 agent 同測試組合入到前列。不過同一機構亦錄得佢嘅幻覺率由 Grok 4.3 嘅 25%升到 54%,反映模型識得多咗,答錯時亦可能講得更有信心。開發者交畀 agent 改認證、付款或者資料庫程式,呢類錯誤遠比跑分失一題麻煩。

xAI 自己公布嘅結果同樣唔係全面領先。Grok 4.5 喺 SWE-Bench Pro 解題率係 64.7%,高過官方列出嘅 GPT-5.5 成績,但低過 Fable 5 同 Claude Opus 4.8;去到 Terminal-Bench 2.1 就有 83.3%,貼近最高嗰組。問題係每套 agent 點樣整理 context、揀工具同重試,都會左右結果,所以 Grok Build 跑得好,唔代表換入任何 IDE 或 CLI 都有同一表現

Cursor 補上算力以外嗰塊拼圖

Cursor 4 月公布同 SpaceX 合作時,直認訓練 Composer 嘅樽頸係算力,之後可以用 SpaceXAI 嘅 Colossus 基建擴大訓練。另一邊,xAI 得到嘅係一套已經有人每日用緊嘅 coding 產品:開發者點描述任務、agent 點讀程式、邊次修改獲接受、邊次要撤回,全部都可以幫手評估模型。至於呢啲互動資料實際點用、企業程式會唔會納入訓練,就要逐項睇 Cursor 嘅私隱設定同客戶合約,公開公告冇交代到可以一概而論。

SpaceX 已經行使以 600 億美元股票收購 Cursor 母公司 Anysphere 嘅權利,監管文件顯示交易預計 2026 年第三季完成。個價當然唔應該靠一個 Grok 版本解釋晒,但交易邏輯幾清楚:Cursor 有開發者入口、產品經驗同自家 Composer,SpaceXAI 就有龐大算力同 Grok。模型公司愈來愈想直接接觸用家,而開發工具公司亦開始自己訓練模型,兩邊原本嗰條界線已經淡咗好多。

四套工具,其實爭緊唔同位置

Grok 4.5 係模型,Grok Build 就係開源 terminal agent,同一個模型亦可以喺 Cursor 入面用。Cursor 主力仍然係一個整合編輯器、agent 同多款模型嘅開發環境;Claude Code 擅長喺 terminal 讀完整個 codebase、改檔同跑測試;Codex 就把本機、雲端任務同多個 agent 集中管理。開發者揀工具時,模型排名只佔一部分;實際用起上嚟,仲要睇 context 管理、權限、速度、重試能力、IDE 整合同價錢。

對 xAI 嚟講,Grok 4.5 推出後,xAI 同 Cursor 已經砌出一套跑分有競爭力嘅 coding 組合。不過下一步要交代嘅係長項目會唔會愈做愈亂、改錯後識唔識自己收拾、企業程式點樣隔離,同埋離開指定測試環境後仲剩返幾多優勢。開發團隊想試,可以先揀低風險 repo 同固定任務,記錄成功率、成本同人工執手尾時間,再決定值唔值得換工具。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook