Google將SynthID浮水印導入蛋白質,可追蹤AI設計來源

陳曉莉約 3 分鐘閱讀

站內可閱讀至 (台北時間)

Google將SynthID浮水印導入蛋白質,可追蹤AI設計來源(新聞配圖)
配圖來源:iThome原站文章
本站保存版本
字級

Google

Google DeepMind周三(9/30)發表SynthID Bio,將SynthID浮水印技術延伸至合成生物學,可在AI設計的蛋白質序列及3D結構中嵌入不易察覺的標記,以辨識及追蹤其來源。Google表示,實驗顯示加入浮水印後,蛋白質仍能維持原有的生物功能。

生成式AI目前已能預測蛋白質結構,甚至設計自然界原本不存在的新蛋白質,也帶來如何辨識及追蹤AI生成生物資料來源的問題。一方面,AI可能產生與已知危險序列差異甚大的全新序列,增加DNA合成業者辨識潛在風險的難度;另一方面,AI生成的蛋白質序列及3D結構若未正確標示來源便進入公共生物資料庫,也可能影響後續研究及生物安全判斷。

SynthID Bio則會依據AI模型的用途採取不同的浮水印方式。用於設計新蛋白質時,系統會在AI選擇胺基酸序列的過程中嵌入可辨識訊號;用於蛋白質結構預測時,則會微幅調整AI預測的原子座標,在3D結構中留下浮水印。

在實驗中,Google DeepMind利用AI設計可分別與VEGF-A、SARS-CoV-2棘蛋白RBD及PD-L1結合的蛋白質結合劑,並實際合成測試。結果顯示,加入浮水印的蛋白質結合劑仍能正常與目標蛋白質結合,表現與未加入浮水印的版本相當。

針對AI預測的蛋白質3D結構,Google則修改AlphaFold 3模型,讓模型在預測蛋白質結構時,對原子在3D空間中的座標進行細微調整,藉此在預測結果中嵌入浮水印。Google表示,這些調整不會降低AlphaFold 3的預測準確度,浮水印偵測率則接近100%,即使3D結構資料受到雜訊干擾或座標遭到輕微修改,仍可辨識浮水印。

SynthID Bio也可用於Protein Data Bank、UniProt及GenBank等公共生物資料庫,協助辨識其中的AI生成資料,確認合成資料是否正確標示來源,或將其標記以供進一步審查。

除了蛋白質之外,Google DeepMind並與史丹佛大學Hie實驗室及Arc Institute合作,將SynthID Bio整合至基因體模型Evo 2,已成功替Evo 2設計的噬菌體基因組加入浮水印,初步實驗顯示這些噬菌體仍具功能。

Google已透過Nature期刊發表SynthID Bio的研究論文,也在GitHub上開源其程式碼與體外實驗資料,並開放下載SynthID Bio-structure模型權重,供研究社群進一步驗證與研究。