請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

捨棄多階段訓練,蘋果新模型 SimpleDesign 以單一流程完成蛋白質設計

科技新報

更新於 21小時前 • 發布於 23小時前

蘋果(Apple)機器學習研究團隊發表論文〈SimpleDesign: A Joint Model for Protein Sequence and Structure Codesign〉,提出可同時生成蛋白質序列與結構的模型,主張捨棄主流的多階段訓練,直接於資料空間完成點對點訓練,即可達到與現有模型相當的水準。

這項研究延續蘋果 2025 年 9 月發表的 SimpleFold。SimpleFold 以流程匹配(flow matching)搭配通用 Transformer 區塊,從胺基酸序列預測蛋白質 3D 結構,避開 DeepMind AlphaFold 等模型常用的高運算成本技術;SimpleDesign 則把同樣的簡化思路,從結構預測推進到更廣的蛋白質設計問題。

研究員指出,既有的共同設計(co-design)模型多採兩階段訓練,先訓練自動編碼器把蛋白質結構轉成離散的 token 表示,再於潛在空間訓練產模型。SimpleDesign 跳過中間環節,直接從配對的胺基酸序列與 3D 座標學習,序列採離散交叉熵、結構採迴歸目標,整合於單一端對端框架,並以 Transformer 多模態骨幹兼顧各模態的專屬處理與全域自注意力。

訓練資料以 AFESM 資料集為主,涵蓋 200 萬組以上序列與結構配對。訓練時研究人員同時破壞兩側資料,序列部分隨機以遮罩 token 隱藏胺基酸,結構部分則加入雜訊,並調整兩側受損程度。序列完整而結構嚴重受損時,任務近似蛋白質摺疊;結構完整而序列大量遮蔽時,則近似逆摺疊;兩側皆部分受損時,模型便學會同時處理兩個問題。

結果顯示,SimpleDesign 在共同設計、結構生成與序列生成等基準測試表現頗有競爭力,產生的胺基酸序列品質多半不遜於甚至比多數多模態競爭模型好。對藥物開發與蛋白質工程團隊而言,價值在訓練流程更單純、資源需求可望降低。

不過研究員也提醒,目前成果僅是電腦模擬評估,產生蛋白質尚未經實驗驗證能否真的摺疊、發揮功能或在生物系統安全運作;單階段做法能否延伸至更大型蛋白質或更複雜的設計任務,論文並未處理。

(首圖來源:shutterstock)

立刻加入《科技新報》LINE 官方帳號,全方位科技產業新知一手掌握!

查看原始文章

更多理財相關文章

01

54億平實轉運站陷停工危機 三地表態:不會撤、繼續做

ETtoday新聞雲
02

川普反對放慢AI發展 Anthropic執行長籲留時間強化安全防護

TVBS
03

明年基本工資破3萬會有補貼方案? 經長龔明鑫:協助中小微企業「責無旁貸」

太報
04

美光祭百萬獎金 工會不滿喊15%分潤!醞釀罷工

EBC 東森新聞
05

7大金控獲利出爐!達人揭「這檔黑馬暴增155%」:便宜又會賺

三立新聞網
06

台股漲不動因為它?漢測申購凍結逾8千億元 超越台股單日成交量

鏡報
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...