TECH2030
Insights
技术动态 · 3 min readAI辅助

谷歌DeepMind推出SynthID Bio,为AI设计蛋白质加水印

谷歌DeepMind公布了用于AI设计蛋白质的水印技术,1300余次合成实验显示结合成功率和亲和力均无显著差异。

核心摘要

  • 加水印的结合体,结合成功率无显著差异
  • 在生成阶段嵌入来源标识的设计
  • 可用公开代码和权重在自身条件下验证
  • AI生成内容的标识,在哪个阶段添加

谷歌DeepMind于2026年9月30日(当地时间)发布的SynthID Bio,是一种专用于生物学领域的水印技术,它能在AI设计的蛋白质中嵌入识别信号并保持其功能,且在合成后的分子中也能被检测到。在对1300多个结合体进行实际合成的实验中,加了水印的结合体与未加水印的蛋白质相比,在结合成功率和结合亲和力方面均未出现显著差异。

SynthID Bio如何运作

该技术通过对蛋白质的氨基酸序列或三维原子坐标进行微调,留下肉眼不可见的水印,同时保持其原有的生物学功能。其核心在于,不仅在数字模型中,在实际合成的蛋白质分子中也能确认该信号。

  • 序列水印:为不损害生物学功能,系统会在性质相近的氨基酸之间进行微小替换。该方法已应用于蛋白质设计模型AlphaProteo和蛋白质序列生成模型ProteinMPNN并完成实验验证。
  • 合成实验:针对血管内皮生长因子VEGF-A、新冠病毒刺突蛋白受体结合域(RBD)及PD-L1等3种蛋白质,合成了1300多个结合体。结果显示,结合成功率、结合亲和力及天然序列多样性均未出现显著差异,并通过质谱仪等实际蛋白质分析设备,在物理分子样本中识别出了水印信号。
  • 结构水印:通过对AlphaFold 3扩散网络的部分结构进行微调,将水印功能直接嵌入模型权重本身。谷歌DeepMind表示,结构预测准确率的损失保持在1%以下,即便经过序列变异或加入噪声干扰,水印识别准确率仍保持在99%以上。
  • 基因组应用:在基因组设计模型Evo 2设计的噬菌体基因组中加入水印,并进行了细菌培养实验,初步结果显示其功能得以保留。

生物安全领域将发生哪些变化

谷歌DeepMind表示,SynthID Bio同样可应用于生物安全领域。现有DNA合成企业的安全检测很大程度上依赖于与已知风险物质序列进行比对的方式,但当AI生成出与既有生物序列不相似的全新蛋白质或基因组时,仅凭这种方式将难以判断其来源和风险性。谷歌DeepMind提出了两种具体应用场景。

  • 在DNA合成过程中,作为确认该设计是否由AI模型生成的信号,用于识别需要额外审核的订单
  • 在蛋白质数据库(PDB)、UniProt、GenBank等生物数据库登记AI生成数据时,对其标注为合成数据或归入单独审核对象

同时也坦承了局限性。谷歌DeepMind强调,SynthID Bio并非解决所有生物安全问题的单一方案。如何让该技术更加稳健,防止恶意攻击者故意破坏或去除水印,仍是待解决的课题。目前还在研究将水印与来源信息关联的元数据系统,以及与管理AI生成生物数据的中央存储库相结合的方案。该研究团队正与斯坦福大学、Arc Institute、加州大学伯克利分校的研究人员开展生物安全合作,并已将研究论文连同代码与实验数据开源发布,同时将用于研究的模型权重上传至GitHub公开。

对韩国企业AX转型的启示

此次发布中值得关注的一点,是将AI生成内容的来源标识设计嵌入到了生成阶段,而非仅仅依赖事后对结果进行检测。与已知序列进行比对的检测方式,在面对AI首次生成的全新序列时将失去比对基准。SynthID Bio将水印功能嵌入AlphaFold 3的模型权重中,使得模型输出结果从一开始就带有该信号。

对于将AI设计模型用于研究的国内生物制药机构而言,可利用公开的代码和研究用权重,在自身实验条件下直接验证水印对蛋白质功能的影响。即便不属于生物领域,问题的本质也是相同的。当AI生成的设计或数据流转至企业内部数据库或外部合作伙伴时,首先应确认的是:标明其为AI生成内容的标识究竟是在哪个阶段被添加的。

出处: 谷歌DeepMind公布用于追踪AI生成蛋白质与基因组的水印技术

如果觉得有用,欢迎分享。
企业AX转型
想把这个主题套用到贵司的实际情况吗?
申请AX转型咨询