生物模型

西湖大学发布 ProteinTalks:3800 万条蛋白数据训练出"虚拟细胞",给三阴性乳腺癌挑对药

2026年9月13日2 次阅读

🧬 西湖大学发布 ProteinTalks:3800 万条蛋白数据训练出"虚拟细胞",给三阴性乳腺癌挑对药

不测基因活性,直接读蛋白质的动态变化——88% 准确率预测药效,501 人临床数据验证

📅 2026-09-13 | 📊 来源:Nature 论文及新闻版 / Medical Xpress / Kormedi 等 | 栏目:生物模型动态

"虚拟细胞"是近年计算生物学的热门方向:在计算机里造一个细胞的数字模型,先在模型里试药,再决定要不要上真实验。9 月 9 日,这个方向迈出了关键一步——西湖大学郭天南团队在 Nature 发表论文,发布了名为 ProteinTalks 的虚拟细胞模型,用蛋白质组学数据训练,能预测三阴性乳腺癌(TNBC)细胞对各种药物的反应。Nature 官方新闻版、Medical Xpress、韩国 Kormedi 等多家媒体在随后几天相继报道。本文基于多家媒体转述整理。

🎯 核心亮点速览
  • 3,800 万+ 训练数据:18 株乳腺癌细胞系 × 63 种 FDA 已批准抗癌药 + 59 种药物组合,4 个时间点的蛋白丰度测量
  • 88% 准确率:预测 81 种未进训练集药物作用下癌细胞的响应
  • 501 人临床验证:在三阴性乳腺癌患者化疗前活检样本上,准确预测实际治疗结局
  • 路线差异:多数虚拟细胞模型用单细胞测序数据(静态快照),ProteinTalks 用蛋白质动态时序数据

📌 3 分钟看懂:ProteinTalks 是什么

一句话:ProteinTalks 是一个学会了"药物打进去之后,细胞里的蛋白如何随时间变化"的 AI 模型,用它来反推哪种药对某个病人的肿瘤最有效。

为什么盯上蛋白质而不是基因?因为药物真正起作用的地方是蛋白——药进去之后蛋白丰度怎么变、哪些通路被压制,才是疗效的直接体现。此前大多数虚拟细胞模型基于单细胞测序数据,学到的是细胞状态的"静态快照";ProteinTalks 抓的是"药物刺激后 0、6、24、48 小时"的动态过程。Arc Institute 的系统生物学家 Hani Goodarzi 评价说,这种多时间点设计至关重要——"如果你没有时间序列,你手里就只是一堆静态照片"。

🔬 为什么选三阴性乳腺癌

三阴性乳腺癌是乳腺癌里最"难缠"的一类:肿瘤细胞缺少雌激素受体、孕激素受体,也没有 HER2 蛋白——这意味着内分泌治疗和常见的靶向药都无的放矢,只能靠化疗。它约占乳腺癌病例的 15–20%,且不同患者肿瘤在分子层面差异很大,同样方案的疗效可能天差地别。这正是"挑对药"价值最大的场景。

⚙️ 技术拆解:数据怎么造的

大规模扰动蛋白质组学

研究团队用 63 种 FDA 已批准的抗癌药物和 59 种药物组合,系统处理 18 株乳腺癌细胞系(其中 16 株为三阴性),在给药前和给药后 6、24、48 小时四个时间点,测量每株细胞里 5,585 个蛋白质组的丰度变化,累计生成超过 3,800 万条时序蛋白测量数据。

模型从中学习"药物 → 蛋白动态响应"的映射关系,进而完成三件事:预测细胞对药物的响应、发现新的药物组合、定位耐药相关蛋白。

📈 性能表现

泛化预测

对 81 种未进入训练集的药物,预测细胞响应准确率 88%

临床验证

分析 501 名 TNBC 患者化疗前的肿瘤活检(3,651 种蛋白),模型准确预测了他们实际接受的治疗的临床结局

横向对比

在预测癌细胞药物响应上,优于基于基因活性的 AI 模型和传统机器学习方法

论文通讯作者、西湖大学蛋白质组学专家郭天南对 Nature 表示,这是"虚拟细胞模型第一次走出实验室、在临床场景中被检验"。他同时强调,这个模型的目标"非常聚焦"——服务 TNBC 的药物发现,而不是全面模拟细胞行为。

📋 静态快照 vs 动态时序:两条虚拟细胞路线的差别
维度单细胞测序路线(多数现有模型)ProteinTalks(蛋白质组学路线)
数据类型单细胞 RNA 测序(细胞状态快照)药物扰动后的蛋白丰度时序数据
捕捉的信息静态细胞状态药物作用下的动态变化过程
与药物效应的关系间接(基因活性是上游代理指标)直接(蛋白是药物的直接作用对象)
临床落地多处于实验室阶段已在 501 人活检数据上验证治疗结局预测
⚠️ 必须知道的局限:Nature 新闻版明确将其称为"原型工具(prototype)"。作者的定位也是聚焦 TNBC 单一癌种的药物发现工具,而非通用虚拟细胞。模型预测的是概率和风险分层,离"直接替医生开药"还有距离;且训练数据以细胞系为主,从细胞系到真实肿瘤微环境的外推仍是领域共性难题。

🔭 这个发布在更大图景里的位置

过去两年,"虚拟细胞"从概念走向工程化:先有基于单细胞数据的状态模型,再有对标通用细胞模拟的大模型尝试。ProteinTalks 的意义在于证明了第三条路线的可行性——用大规模、多时间点的扰动蛋白质组学数据,训出一个能通过临床数据检验的"操作型"模型。它不做全面细胞模拟,只回答一个非常值钱的问题:"这个药,对这个病人的癌细胞,管不管用?"

对关注 AI+生命科学的读者来说,这条新闻的信号是:虚拟细胞竞赛正在从"谁的模型更大"转向"谁的模型能过临床验证"。数据模态(蛋白动态 vs 基因静态)的差异化选择,可能比模型规模更能决定胜负。

💡
给读者的建议:判断这类"虚拟细胞"新闻的成色,看三个指标就够了——训练数据是不是时序动态、有没有 held-out 药物泛化测试、有没有真实患者样本验证。ProteinTalks 三项都有,这在当前领域内并不多见。

本文由加装AI助手整理发布 | 基于多家媒体转述整理 | 数据来源:Nature / Medical Xpress / Kormedi / NEWSru

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...