Apple SimpleDesign:以較簡化架構同時設計蛋白質序列與結構
3C 產品

Apple SimpleDesign:以較簡化架構同時設計蛋白質序列與結構

圖片:TechLab 自製資訊圖
TechLab 編輯部(譯)·

Apple 研究人員發表名為 SimpleDesign 的蛋白質設計模型,嘗試在同一個端對端訓練流程中,同時生成胺基酸序列及蛋白質三維結構。這項研究較值得從事計算生物學、藥物研發及生成式 AI 的團隊留意。:它提出一條較精簡的模型路線,或可減少蛋白質共同設計時層層轉換資料表示的需要。不過,最重要的限制同樣清楚:報道所述結果只來自電腦評估,生成蛋白質尚未經實驗測試,因此未能證實它們在真實生物系統中會否正確摺疊、具備預期功能,或是否安全。

這也決定了現階段應如何理解 SimpleDesign。現階段,SimpleDesign 仍屬模型設計研究,未有實驗結果證明它可直接用於開發藥物或生物產品。:能否以較通用、較少階段的架構,處理本來經常被拆開處理的「序列」與「結構」問題。若這種做法日後能在濕實驗中維持成效,才可能真正改變研究者篩選候選蛋白質的工作流;在此之前,模型輸出仍應被視為有待驗證的候選設計。

從預測結構走向共同設計

蛋白質由胺基酸序列組成,而其三維形狀與功能密切相關。過去一年,Apple 研究團隊曾發表 SimpleFold,聚焦由已知胺基酸序列推測蛋白質三維結構。根據 9to5Mac 報道,SimpleFold 使用 flow matching,從帶有雜訊的起點學習一條較直接的路徑,以得到最終結構;這與擴散模型一般反覆去除雜訊的做法不同。團隊亦以通用 Transformer 區塊建構模型,目標是避開部分蛋白質摺疊模型常用、計算開銷較高的方法。

SimpleDesign 把問題再推前一步。單純預測結構,問題是「這條既有序列會形成甚麼形狀」;共同設計則同時尋找可能的序列與結構,要求模型在兩者之間維持相容性。實際研究中,若只設計外形卻找不到可形成該外形的序列,或只產生序列卻無法穩定摺疊,結果都沒有太大用途。因此,把兩種資訊放進同一模型學習,理論上能讓模型在生成時同時考慮兩端的約束,而非將其中一端視為事後補充。

省去中間「token」的一次賭注

報道指出,許多現有蛋白質共同設計模型採取多階段做法:先訓練獨立模型,把蛋白質結構壓縮成離散表示或「token」;之後再訓練生成模型,在該潛在表示空間生成序列和結構。這種分工有其邏輯,因為結構資料十分複雜,先轉成較容易處理的表示可令後續生成任務更規整;但代價是訓練程序更長,且中間壓縮過程可能令部分原始結構資訊流失或受限。

SimpleDesign 的取向是跳過這個中間層,直接從配對的胺基酸序列與三維座標學習,並在同一端對端過程生成兩者。研究人員以超過 200 萬組蛋白質序列及結構配對訓練模型,資料主要來自 AFESM 資料集;該資料集結合 AlphaFold Database 的預測結構和額外樣本。這不代表模型毋須面對資料品質問題,反而突顯其表現很大程度依賴訓練資料中的預測結構及樣本分布。對研究者而言,較簡化的訓練管線是否可重現、可延伸到不同資料條件,將是比架構名稱更實際的問題。

訓練方法也反映了它試圖融合多個任務。研究人員會把序列部分的胺基酸隨機遮蔽,同時向相應的三維結構加入雜訊,並改變兩邊被破壞的程度。當序列大致完整、結構嚴重受干擾時,模型的任務接近根據序列恢復結構;當結構較完整、序列大量被遮蔽時,任務則接近為指定結構找出可行序列;若兩邊都部分受干擾,模型便要同時處理兩種不確定性。這種把不同任務放進同一訓練框架的做法,是 SimpleDesign 的核心,而不只是把兩個模型的輸出拼在一起。

「有競爭力」不等於蛋白質可用

按研究所述,SimpleDesign 在蛋白質共同設計、結構生成及序列生成的 benchmark 中取得具競爭力的結果;生成的結構看來合理,而生成序列的表現整體可與多數其他多模態模型相比,或更佳。這些結果支持一個值得追蹤的技術判斷:蛋白質生成模型未必一定需要由多個專門階段組成,較直接的通用架構也可能取得相近水準。若日後有更多團隊驗證,研究機構在建立原型時或有多一種較易部署及迭代的選擇。

但 benchmark 的意義必須收窄理解。它衡量的是模型在預設資料和計算指標上的輸出,而生物實驗要面對的是更嚴格的現實:蛋白質是否真的能製備、能否按照預期摺疊、是否穩定、功能是否有效,以及會否出現不想要的生物反應。9to5Mac 引述研究人員的說明,SimpleDesign 產生的蛋白質並未接受實驗測試。換言之,目前可確認的是模型在計算評估中展示潛力,不能據此推斷其設計已能用於治療、診斷或工業生產。

對科研 AI 工具的實際啟示

從工具發展角度看,SimpleDesign 的價值未必在於立即取代現有系統,而在於測試「通用化、端對端」可否降低蛋白質 AI 的實作門檻。這是合理分析,並非研究已證實的結果:少一個獨立的結構 token 化階段,理論上可令研究團隊更集中處理配對資料、訓練目標及輸出驗證;然而,模型是否真的較省資源、是否容易重現,報道並未提供可作直接比較的具體數據,不能自行下結論。

對關注科研 AI 的讀者來說,下一步最值得看的是實驗驗證能否跟上計算成績,以及外部研究團隊會否在不同蛋白質任務和資料條件下重現其結果。若模型產生的候選設計可通過實驗,SimpleDesign 才有機會成為研究者早期探索與篩選的有用工具;若結果與 benchmark 有明顯落差,則會再次提醒業界,生成模型在生物學上的「看似合理」,與實際可用之間仍隔着很長一段路。

延伸閱讀

AI 輔助說明: 本文由 AI 協助整理,並經兩輪獨立自動品質審核;資料及連結仍以原始來源為準。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook