捨棄多階段訓練,蘋果新模型 SimpleDesign 以單一流程完成蛋白質設計
蘋果(Apple)機器學習研究團隊發表論文〈SimpleDesign: A Joint Model for Protein Sequence and Structure Codesign〉,提出可同時生成蛋白質序列與結構的模型,主張捨棄主流的多階段訓練,直接於資料空間完成點對點訓練,即可達到與現有模型相當的水準。
這項研究延續蘋果 2025 年 9 月發表的 SimpleFold。SimpleFold 以流程匹配(flow matching)搭配通用 Transformer 區塊,從胺基酸序列預測蛋白質 3D 結構,避開 DeepMind AlphaFold 等模型常用的高運算成本技術;SimpleDesign 則把同樣的簡化思路,從結構預測推進到更廣的蛋白質設計問題。
研究員指出,既有的共同設計(co-design)模型多採兩階段訓練,先訓練自動編碼器把蛋白質結構轉成離散的 token 表示,再於潛在空間訓練產模型。SimpleDesign 跳過中間環節,直接從配對的胺基酸序列與 3D 座標學習,序列採離散交叉熵、結構採迴歸目標,整合於單一端對端框架,並以 Transformer 多模態骨幹兼顧各模態的專屬處理與全域自注意力。
訓練資料以 AFESM 資料集為主,涵蓋 200 萬組以上序列與結構配對。訓練時研究人員同時破壞兩側資料,序列部分隨機以遮罩 token 隱藏胺基酸,結構部分則加入雜訊,並調整兩側受損程度。序列完整而結構嚴重受損時,任務近似蛋白質摺疊;結構完整而序列大量遮蔽時,則近似逆摺疊;兩側皆部分受損時,模型便學會同時處理兩個問題。
結果顯示,SimpleDesign 在共同設計、結構生成與序列生成等基準測試表現頗有競爭力,產生的胺基酸序列品質多半不遜於甚至比多數多模態競爭模型好。對藥物開發與蛋白質工程團隊而言,價值在訓練流程更單純、資源需求可望降低。
不過研究員也提醒,目前成果僅是電腦模擬評估,產生蛋白質尚未經實驗驗證能否真的摺疊、發揮功能或在生物系統安全運作;單階段做法能否延伸至更大型蛋白質或更複雜的設計任務,論文並未處理。
Apple researchers unveil SimpleDesign, a new AI model for protein design
Apple's SimpleDesign hits competitive protein design with single-stage training
Apple develops a lightweight AI for protein folding prediction
(首圖來源:shutterstock)