OpenAI Astra 推進十項數學難題,AI 開始試做長時間原創研究
Tech News

OpenAI Astra 推進十項數學難題,AI 開始試做長時間原創研究

圖片:via TechNews 科技新報 — https://technews.tw/2026/08/03/astra-solved-10-major-open-problems-in-mathematics-quantum-complexity-and-theoretical-computer-science/
TechLab 編輯部(譯)·

論文同 Lean 證明已公開,同行核實仍然啱啱起步

Astra 做緊咩

OpenAI 8 月 1 日公開一批由內部模型 Astra 產生嘅研究成果,範圍由高維球體堆疊、編碼理論、群論,去到量子複雜度同格密碼學都有。官方稱 Astra 係下一個主要模型系列嘅內部版本,暫時冇公開 API、推出時間、收費或者使用限制。Astra 呢個名現階段代表研究系統,冇足夠證據叫佢 GPT-6。 TechNews 科技新報報道亦提到,OpenAI 仲未定最終產品名,所以見到網上自行加代數字,先當估計會穩陣啲。

十項成果唔可以全部叫「解決十題」

今次個清單入面,有啲成果完整處理咗多年懸案,例如構造出 non-sofic group、提出 Connes rigidity conjecture 嘅反例;有啲就係改善已知界限,例如二元碼、球面碼同 arithmetic circuit complexity;高維球體堆疊嗰篇亦聲稱刷新咗 1978 年以來嘅一般漸近上界。換句話講,十項都可能有研究價值,但成果形式同份量並唔一樣。用「攻克十道數學題」概括得太爽,會令人以為每項都似交功課咁有單一標準答案。

同一般聊天模型差喺可以一路試落去

平時聊天模型收到問題,通常喺一次對話內砌出一個睇落合理嘅答案;Astra 呢類研究系統就似一個可以跑較耐嘅 agent,會試唔同方向、發現條路行唔通,再改用另一套工具或者觀點。OpenAI 另外公開咗 62 頁「discovery notes」,入面包括失敗方向同轉折位。不過呢份文件係另一個模型讀過原始思考紀錄同完成稿之後整理,唔等於完整原始運算紀錄,外界仍然未能重演成個探索過程。

OpenAI 話,成功搵到呢批解法所用嘅 token,按 Sol API 費率折算大約值 2,000 美元。呢個數字幾搶眼,但只反映官方計算嘅成功解題 token,唔包括訓練 Astra、揀題、失敗實驗、人手整理論文同驗證環境嘅成本。現階段用佢判斷研究自動化有幾平,仲早咗少少;佢較有用嘅訊息係,當模型可以長時間搜尋,一次成功研究 run 未必一定要燒到天文數字。

有 Lean 證明,未等於十篇論文全部過關

OpenAI 放出一份 249 頁論文集,亦喺 GitHub 公開十套 Lean 4 formalization,外界可以下載後自行 build。Lean 會逐步檢查形式邏輯有冇斷位,可信度高過只靠模型用自然語言話「證明完成」。不過 Lean 證書、專家審閱同正式同行評審係三層嘢:形式系統可以證明程式內寫低嗰個命題,但仍要有人確認命題有冇準確對應原本難題、前提有冇收窄、引用同新穎性又有冇問題。

公開論文顯示,non-sofic group 同 Connes rigidity 章節曾獲相關數學家提供意見或仔細閱讀;Connes 嗰項亦提到有另一項同期獨立研究得出反例。呢啲都係正面訊號,但「提供意見」唔等同替整篇論文背書,而官方亦冇交代十項成果全部完成獨立專家核實或者期刊評審。篇章公開至今時間好短,較準確嘅講法係:證明材料已經開放畀學界檢查,驗證程序先啱啱開始。

Coding agent 都可以抄呢套做法

Astra 最值得 developer 留意嘅地方,其實係「長時間搜尋加硬驗證器」呢個組合。數學有 Lean,寫 code 就有 compiler、type checker、測試、static analysis 同可重現嘅執行環境。Agent 可以同時試幾條修正路線,但每次改動都要俾工具驗收,失敗就退返去再試。呢種閉環有機會令 coding agent 處理跨檔案重構、追長尾 bug 同大型 migration 時穩定好多,前提係測試本身真係覆蓋到產品要求。

科研都一樣:模型愈識得大量產生候選證明,人類時間就會由搵思路,逐步轉去揀問題、定義可驗證命題、查舊文獻同覆核結果。下一步要睇嘅係其他團隊可唔可以重建十套 Lean 證明、各領域專家點評原稿,仲有 Astra 日後面對冇現成形式驗證器嘅任務時,表現會唔會一樣可靠。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook