Astra 交出十項數學研究成果,AI 科研協作去到邊?
Tech News

Astra 交出十項數學研究成果,AI 科研協作去到邊?

圖片:via iThome — https://www.ithome.com.tw/news/177818
TechLab 編輯部(譯)·

公開證明同 Lean 檔案可查,模型能力本身仍未能重現

OpenAI 今次拎 Astra 出嚟,冇靠考試分數或者一張 benchmark 表,而係一次過公開十項數學同理論電腦科學成果。呢批題目牽涉群論、高維幾何、量子複雜度、編碼理論同格基密碼學,有啲問題多年冇大進展。研究文稿同 Lean 證明檔案都有公開,份量明顯高過一般模型發布宣傳,但 Astra 本身仍然收埋喺 OpenAI 內部,外界暫時冇得重跑。

十項成果有幾重磅

OpenAI 話 Astra 建構出非 sofic 群、推翻 Connes 剛性猜想、證明一般雙方量子遊戲嘅指數平行重複定理,亦推進高維球體堆積、算術電路下界同最近向量問題。iThome 報道有逐項整理,不過要留意,十項成果嘅性質唔一致:有啲完整處理長年問題,有啲搵到反例,亦有啲只係推高或者壓低已知界限,唔適合全部包裝成同一級數嘅「世紀難題」。

格基密碼學嗰項尤其容易俾人講大咗。最近向量問題同部分後量子密碼研究有密切關係,Astra 今次提供嘅係近似求解難度下界,方向上反而係加深大家對問題有幾難嘅理解。呢個結果唔代表現有加密系統俾人破解,亦冇證據顯示量子電腦突然多咗一條實用攻擊路線。

科研 AI 開始識做成條鏈

最值得睇嘅地方係工作方式。OpenAI 話模型負責產生核心數學論證,人再同模型整理成文稿,跟住由模型寫成 Lean 可以逐步檢查嘅形式化證明。由搵研究方向、接駁唔同領域嘅舊理論、寫證明同反例,到最後交畀工具核對,Astra 示範咗點樣串連成套研究工序,唔再只係問一句、答一句嘅 chatbot。

呢種能力對 developer 同知識工作者都有啟示。下一代 AI workflow 會花好多時間讀長篇資料、搜尋概念關係、寫程式驗證局部結果,再反覆修正推理。模型單次答中幾多題仍然重要,不過真正實用性愈來愈取決於佢可唔可以保存研究脈絡、識得調工具、發現自己行錯路,同埋交到其他人檢查得到嘅產物。

Lean 證明有用,但未包辦所有驗證

Lean 會檢查一段形式化證明有冇按照指定定義、公理同已知定理成立,能夠捉到漏步同好多表面合理、實際斷咗線嘅推理。官方文件同時講得好清楚:機器接受咗證明,仍要確認形式化命題有冇準確代表原本嗰條數學問題,引用嘅定義同前設亦要查。換句話講,Lean 大幅提高可信度,但相關領域專家逐項閱讀、判斷新意同研究價值嗰部分仍然慳唔到。

OpenAI 公開咗 249 頁研究文稿、62 頁推理整理同原始 Lean 檔案,外界至少有材料可以查。傳統同行評審同獨立專家消化則要時間,發布幾日內好難為十個跨領域結果一口氣蓋章。OpenAI 自己亦話會為正確性負責,呢句承諾有份量,但始終同多個獨立研究團隊完成檢查係兩個層次。

成功個案背後仲欠一個分母

另一個盲點係選擇偏差。OpenAI 公布咗十個成功結果,冇同時交代 Astra 試過幾多問題、失敗咗幾多次、研究人員點揀題,亦冇提供足夠資料畀外界量度穩定命中率。Terence Tao 喺 2026 年國際數學家大會講 AI 數學時已提醒,公開案例好多時缺乏受控條件,成本同其他變數亦未必齊。呢個提醒早過 Astra 公布,但啱啱講中今次最難評估嘅位置。

OpenAI 估算,搵出呢十組解法所用 token 按 Sol API 收費約值 2,000 美元。呢個數字幾吸引,不過佢只計成功解法涉及嘅模型 token,唔等同整個研究項目成本,人手揀題、整理文稿、形式化同檢查都未必計晒。Astra 幾時公開、一般研究人員可唔可以得到相近表現、失敗率有幾高,會直接決定佢係少數實驗室嘅研究引擎,抑或大學、工程團隊同 developer 真係用得着嘅工具。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook