生物模型

药企联合释放"秘密武器":2万+私有蛋白结构让 AI 折叠模型准确率飙升 46%

2026年9月17日0 次阅读
药企联合释放"秘密武器":2万+私有蛋白结构让 AI 折叠模型准确率飙升 46%

🧬 药企联合释放"秘密武器":2万+私有蛋白结构让 AI 折叠模型准确率飙升 46%

AISB Network 用开放代码 + 保密数据的新范式,让 OpenFold3 在药物-蛋白复合物预测上从 35.6% 跃升至 52.1%

📅 2026-09-17 | 📊 来源:Nature News 等 | 栏目:生物模型动态

AlphaFold 的公开数据库正在趋近饱和——能提取的公共蛋白结构几乎已被挖掘殆尽。但与此同时,全球各大制药公司的研究档案室里,却躺着数万条从未公开的蛋白-配体复合物结构数据。这些数据与药物开发管线紧密相关,被视为商业机密。

现在,一个由 AbbVie、Astex 等药企组成的联盟——AI Structural Biology (AISB) Network——做了一个大胆的实验:他们把这些"秘密数据"投入开源模型 OpenFold3 的微调中,结果惊人。

核心发现:在 1,056 个 held-out 蛋白-配体结构测试集上,微调后的 AISB 模型高质量预测准确率达到 52.1%,而仅用公开数据训练的 OpenFold3 仅达 35.6%——性能提升超过 46%。

一、一场"既保密又共享"的数据实验

AISB Network 成立于去年,由多家制药公司组成。他们的目标很明确:在不泄露原始数据的前提下,利用各自的私有蛋白结构数据提升开源折叠模型的性能。

团队选择了 OpenFold3——AlphaFold 3 的开源复刻版——作为基础模型。为什么是它?因为开源模型允许外部微调,且已有成熟的社区支持。更重要的是,开源协议为"联合训练"提供了法律和技术框架。

具体的做法是:各家药企贡献自己的蛋白-配体复合物结构数据(共计 20,167 条),通过联邦学习或差分隐私等机制,在不传递原始数据的前提下更新模型权重。最终得到的 AISB 微调模型,既吸收了私有数据的价值,又没有泄露任何一家公司的核心资产。

📊 性能对比:AISB 微调模型 vs 基线模型

模型 训练数据 held-out 准确率
OpenFold3(公开版) 仅公共数据库 35.6%
AISB 微调模型 公共 + 20,167 私有结构 52.1%
Boltz-2(竞品) 公开数据 低于 35.6%

测试集:1,056 个 held-out 蛋白-配体复合物结构,评估高质量预测比例

"你加入所有这些数据,性能会大幅提升。"哥伦比亚大学生物计算学家 Mohammed AlQuraishi 评价道,"AlphaFold 正在用尽公共数据,药企正在构建自己的版本。"

二、为什么这不只是数字游戏

52.1% vs 35.6%,看起来只是一个百分比的提升。但在药物发现领域,这个差距意味着什么?

🎯 更准确的结合口袋预测

蛋白-配体复合物的精确结构,是理性药物设计的核心。更高的预测准确率意味着更可靠的虚拟筛选和先导化合物优化。

🔒 数据隐私的新范式

AISB 证明了"隐私保护共享"的可行性:药企可以在不泄露商业机密的前提下,贡献数据价值给整个社区。

💡 从"自建"到"微调"

过去,每家药企都倾向于自建私有模型(封闭、重复建设)。现在,微调开源模型成为更高效的选择。

🌍 推动公共数据倡议

研究团队同时提出了 OpenBind 等公开数据集倡议,呼吁更多"类私有"数据(如代谢组学、单细胞数据)也采用类似共享模式。

这项研究的深层意义在于:它重新定义了药企数据资产的价值实现方式。过去,这些数据要么锁在档案室里,要么用于申请专利;现在,它们可以通过微调开源模型,提升整个行业的 AI 能力,同时保持商业机密的安全。

三、局限与挑战:距离普及还有多远?

当然,这项研究并非完美。以下几点值得保持清醒:

⚠️ 当前局限
  • 论文尚未 peer-reviewed:目前以 blog post 形式发布在 Nature News,未经同行评议
  • 模型未公开发布:AISB 微调模型仅供联盟内部使用,外界无法复现或验证
  • 隐私机制细节未披露:联邦学习/差分隐私的具体实现方案仍属商业机密
  • 泛化能力待验证:当前测试集中在蛋白-配体复合物,对其他类型(膜蛋白、大复合物等)的表现未知

此外,药企参与此类合作的意愿也参差不齐。并非所有公司都愿意将数据交给"竞争对手"的微调流程——即使技术上无法反推原始数据。法律合规、数据主权、商业竞争等因素,都会影响 AISB 模式的推广速度。

四、展望:制药 AI 的"开源联邦学习"时代?

AISB Network 的实验,可能预示着制药行业 AI 研发的一个新趋势:开源模型 + 私有数据微调

过去十年,AI for Science 的发展主要依赖公共数据集(PDB、UniProt 等)。但随着公共数据趋近饱和,行业开始意识到:真正的价值藏匿在私有数据中。然而,完全封闭的数据孤岛又会导致重复建设和资源浪费。

AISB 提供的解决方案是:数据不动,模型动。通过隐私保护计算技术,多家机构的私有数据可以"无形"地参与模型训练,最终得到一个比任何单一机构都能独立训练出的更强大的模型。

这种模式不仅在蛋白质结构预测中有潜力,还可能扩展到:

  • 酶设计与催化机理预测
  • 抗体-抗原相互作用建模
  • 药物代谢与毒性预测
  • 生物标志物发现与验证

正如 AlQuraishi 所言:"这强化了为蛋白质折叠 AI 生成类似公开数据集的必要性。"

AISB Network 的第一步已经迈出。下一步,是让更多药企加入,让开源社区参与,让这个"既保密又共享"的范式真正落地。

📚 信息来源
  • Nature News: "Drug firms' secret data supercharge AI protein models" (d41586-026-02882-x, 2026-09-14)
  • Positron Today 转述 (2026-09-14)
  • Memesita 转述 (2026-09-14)
  • EuropeSays 转述 (2026-09-14)
  • NewsBeep 转述 (2026-09-14)
  • OERLive 月报提及 (2026-09-16)

基于多家媒体转述整理,原文未 peer-reviewed

📌 栏目:生物模型动态 | 关注 AI 在生命科学领域的最新进展

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...