
Astra 交出十項數學研究成果,AI 科研協作去到邊?
公開證明同 Lean 檔案可查,模型能力本身仍未能重現
OpenAI 今次拎 Astra 出嚟,冇靠考試分數或者一張 benchmark 表,而係一次過公開十項數學同理論電腦科學成果。呢批題目牽涉群論、高維幾何、量子複雜度、編碼理論同格基密碼學,有啲問題多年冇大進展。研究文稿同 Lean 證明檔案都有公開,份量明顯高過一般模型發布宣傳,但 Astra 本身仍然收埋喺 OpenAI 內部,外界暫時冇得重跑。
十項成果有幾重磅
OpenAI 話 Astra 建構出非 sofic 群、推翻 Connes 剛性猜想、證明一般雙方量子遊戲嘅指數平行重複定理,亦推進高維球體堆積、算術電路下界同最近向量問題。iThome 報道有逐項整理,不過要留意,十項成果嘅性質唔一致:有啲完整處理長年問題,有啲搵到反例,亦有啲只係推高或者壓低已知界限,唔適合全部包裝成同一級數嘅「世紀難題」。
格基密碼學嗰項尤其容易俾人講大咗。最近向量問題同部分後量子密碼研究有密切關係,Astra 今次提供嘅係近似求解難度下界,方向上反而係加深大家對問題有幾難嘅理解。呢個結果唔代表現有加密系統俾人破解,亦冇證據顯示量子電腦突然多咗一條實用攻擊路線。
科研 AI 開始識做成條鏈
最值得睇嘅地方係工作方式。OpenAI 話模型負責產生核心數學論證,人再同模型整理成文稿,跟住由模型寫成 Lean 可以逐步檢查嘅形式化證明。由搵研究方向、接駁唔同領域嘅舊理論、寫證明同反例,到最後交畀工具核對,Astra 示範咗點樣串連成套研究工序,唔再只係問一句、答一句嘅 chatbot。
呢種能力對 developer 同知識工作者都有啟示。下一代 AI workflow 會花好多時間讀長篇資料、搜尋概念關係、寫程式驗證局部結果,再反覆修正推理。模型單次答中幾多題仍然重要,不過真正實用性愈來愈取決於佢可唔可以保存研究脈絡、識得調工具、發現自己行錯路,同埋交到其他人檢查得到嘅產物。
Lean 證明有用,但未包辦所有驗證
Lean 會檢查一段形式化證明有冇按照指定定義、公理同已知定理成立,能夠捉到漏步同好多表面合理、實際斷咗線嘅推理。官方文件同時講得好清楚:機器接受咗證明,仍要確認形式化命題有冇準確代表原本嗰條數學問題,引用嘅定義同前設亦要查。換句話講,Lean 大幅提高可信度,但相關領域專家逐項閱讀、判斷新意同研究價值嗰部分仍然慳唔到。
OpenAI 公開咗 249 頁研究文稿、62 頁推理整理同原始 Lean 檔案,外界至少有材料可以查。傳統同行評審同獨立專家消化則要時間,發布幾日內好難為十個跨領域結果一口氣蓋章。OpenAI 自己亦話會為正確性負責,呢句承諾有份量,但始終同多個獨立研究團隊完成檢查係兩個層次。
成功個案背後仲欠一個分母
另一個盲點係選擇偏差。OpenAI 公布咗十個成功結果,冇同時交代 Astra 試過幾多問題、失敗咗幾多次、研究人員點揀題,亦冇提供足夠資料畀外界量度穩定命中率。Terence Tao 喺 2026 年國際數學家大會講 AI 數學時已提醒,公開案例好多時缺乏受控條件,成本同其他變數亦未必齊。呢個提醒早過 Astra 公布,但啱啱講中今次最難評估嘅位置。
OpenAI 估算,搵出呢十組解法所用 token 按 Sol API 收費約值 2,000 美元。呢個數字幾吸引,不過佢只計成功解法涉及嘅模型 token,唔等同整個研究項目成本,人手揀題、整理文稿、形式化同檢查都未必計晒。Astra 幾時公開、一般研究人員可唔可以得到相近表現、失敗率有幾高,會直接決定佢係少數實驗室嘅研究引擎,抑或大學、工程團隊同 developer 真係用得着嘅工具。
參考來源
- iThome — OpenAI新模型Astra取得10項數學突破,橫跨密碼學與量子複雜度 — original report
- OpenAI:Ten advances in mathematics and theoretical computer science — 官方公布,列明十項成果、Astra 身分、token 成本估算同研究流程
- OpenAI:Ten Advances 研究文稿 — 249 頁技術文稿,用嚟核對各項結果實際處理咗咩問題
- OpenAI:Mathematical Discovery Notes — 模型推理整理,展示搵方向同組合數學概念嘅過程
- OpenAI ten-proofs GitHub repository — 公開十項成果嘅 Lean 檔案同獨立檢查指引
- Lean:Validating a Lean Proof — 官方文件解釋形式化證明可以確認咩、仲有咩假設要人手核對
- Terence Tao:Mathematics in the age of AI — 獨立數學家背景,講解 AI 數學案例嘅受控測試、選擇偏差同驗證問題
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







