
Faraday 指揮 Codex 重現論文,窄項測試跑贏 Claude 同 Codex
27B 科研策劃層經專門訓練揀實驗、控資源,成績仍要睇清評分方法
Inherent 公布科研 agent Faraday,聲稱佢喺重現論文實驗嘅 Replica 測試,成績高過 Claude Opus 4.8 同 GPT-5.5。個標題好易令人當成新模型排名,不過 Faraday 入面仍然有 GPT-5.5 Codex 負責寫 code、debug 同跑實驗。今次較量實際係「受過科研訓練嘅策劃 agent 加 Codex」,對住單一 frontier coding agent 由頭做到尾。
Replica 實際考啲咩
研究團隊由 100 篇 1990 至 2026 年嘅機器學習同 AI for Science 論文,整出 310 個重現圖表任務。Gemini 2.5 Pro 會遮走論文入面一張結果圖,agent 只睇到餘下內容同圖說,要自己估返實驗設定、寫程式、跑出數據,再交一張能夠支持原有結論嘅圖。每次有 60 分鐘、上網權限同七分一張 H200 GPU;原實驗太大,就要判斷點樣縮細先唔會扭曲結論。
當中 242 項機器學習任務用嚟訓練,餘下 68 項 AI for Science 任務留作跨領域測試。每個系統同一任務跑八次再計平均分,所以呢個 benchmark 測緊長時間實驗策劃、資源分配同結果判斷,範圍窄過一般 coding、問答或者日常知識工作好多。

圖片:Inherent 研究團隊/arXiv
Faraday 點樣叫 Codex 開工
平時用 Claude Code 或 Codex,通常係模型直接收到整個目標,跟住自己讀檔、改 code、開 terminal 同修正錯誤。Faraday 就多咗一層:以 Qwen3.6-27B 為底嘅 agent 掌握實驗方向,再經 command-line wrapper 將具體工作交畀 Codex。佢可以延續上一個 Codex session、重新開 context、同時叫幾個 Codex 分頭做,亦可以為每次工作設定限時。
即係 Faraday 會決定先查邊個假設、實驗縮到幾細、幾時值得重跑,同埋中途結果究竟反映 bug 定研究方向有問題;Codex 就處理實作。研究團隊大部分訓練階段用 GPT-5.4 mini 做工具,最後階段同評估先換 GPT-5.5,顯示策劃層學到嘅做法可以搬去較強 coding agent,唔使由零再練一次。
細模型點解有機會帶住大模型行
研究重現好多時卡喺問題寫得唔完整:論文可能漏咗超參數、資料處理細節或者取捨理由。單次交畀大型 coding agent,佢可以好快砌出能跑嘅程式,但亦可能用過度簡化嘅方法,甚至直接寫死一組似樣結果。Faraday 嘅強項集中喺揀實驗、追查中間結果同守住研究範圍,正好補大型 coding model 呢個盲點。
論文入面一個幾關鍵嘅對照係:未經強化學習調校嘅 Qwen3.6-27B,同樣可以使用 GPT-5.5 Codex,卻係測試中最弱嗰組。呢個對照顯示,關鍵係策劃層受過科研訓練;淨係喺 Codex 外面加多層 agent,唔會自動變強。團隊亦自動改良 Codex prompt 24 輪,結果只收窄少量差距,暫時睇唔到一段更長指示就可以取代專門訓練。
73% 同 60% 要點樣解讀
按 Inherent 自己建立嘅 rubric judge,喺訓練分佈內嘅任務入面,有 73% 係 Faraday 同時高過 Claude 同 Codex;去到冇用嚟訓練嘅 AI for Science 任務,比例就係 60%。測試集平均分方面,團隊報告 Faraday 高過 Claude 6%,高過 Codex 8%。所有系統都有相同一小時運算預算,而 Claude 同 Codex 分別行 Claude Code、Codex 原生環境,思考強度設成 extra-high。
呢啲數字只適用於遮走論文圖表、限時重現實驗嗰套設定。佢冇測一般軟件工程、寫 app、處理大型 codebase、回答科學問題或者提出可發表嘅新研究。另一項近期研究畀 frontier agent 六日時間處理兩條開放式研究問題,agent 雖然完成晒工程工作,原作者仍然認為成果未達發表水平。由重現已知結論行到發現新知識,中間仲有一大段距離。
評判同參賽者由同一團隊安排
Replica、Faraday、訓練獎勵同主要評分方法都由 Inherent 團隊整。每項 rubric 由 Claude Opus 4.7 生成,再由 GPT-5.5 Codex 參考原圖、程式、實驗紀錄同互動內容打分。評分會睇圖像相似度、結論有冇重現、實作是否忠於論文、實驗深度同有冇走捷徑,比淨係睇張圖合理,但訓練同最終成績都依賴同一類 judge,仍然有 agent 學識迎合評分口味嘅風險。
團隊有搵專家做人手比較,不過結果要小心讀。喺 76 份專門挑選 judge 意見分歧嘅排名入面,人類有 63% 時間支持 rubric judge,統計上未達顯著水平。另一組 41 份排名,就預先揀咗 judge 認為 Faraday 明顯領先嘅案例;人類評審有 71% 都將 Faraday 排喺兩個對手之上;論文自己亦承認,呢個設計推論唔到 Faraday 平均表現係咪獲人類評審同樣偏好。
對用開 coding agent 嘅人有咩啟示
Faraday 顯示通用 coding agent 上面再加一個熟悉特定任務嘅策劃層,的確可能改善長時間工作。科研人員可以將實驗取捨、失敗條件同證據要求交畀專門 agent;工程團隊亦可以借鏡,將架構決策、測試策略或者安全審核拆畀受過相關訓練嘅上層 agent,再叫 Codex 或 Claude Code 執行。
不過現有成績仍然係公司自建 benchmark、自家論文同自家系統得出,論文亦只係 arXiv preprint。下一步要睇外部團隊能否重跑 Replica、換另一個評判模型後保住差距,同埋 Faraday 去到陌生領域會唔會繼續作出可靠取捨。做到呢幾項,先可以判斷呢套專門策劃層有幾大實用價值。
參考來源
- TechCrunch — Inherent, founded by DeepMind alumni, says its AI ‘teammate’ just outperformed Anthropic and OpenAI at replicating research — original report
- Training AI Scientists to Replicate Research — Inherent 團隊論文原文,提供 Replica 設計、Faraday 架構、成績同人手評估限制。
- Inherent Laboratories — 公司官方網站,交代研究方向同 Faraday 論文入口。
- PaperBench: Evaluating AI’s Ability to Replicate AI Research — 另一套論文重現 benchmark,可用嚟理解呢類任務一直係 frontier agent 嘅難題。
- Can AI agents conduct open-ended AI research? Early evidence from two case studies — 近期開放式科研 agent 研究,補充重現論文同提出可發表新研究之間嘅能力差距。
- Leakage and the Reproducibility Crisis in ML-based Science — 機器學習研究可重現性危機嘅背景資料。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







