苹果发布 SimpleDesign:一个模型同时生成蛋白质序列和结构,把多阶段训练简化成一步
导读:苹果机器学习研究团队发布 SimpleDesign,一个能同时生成蛋白质氨基酸序列和 3D 结构的多模态 Transformer 模型。它最大的看点不是分数多高,而是把行业常见的"先压缩、再生成"多阶段训练砍成了一步。本文基于多家媒体转述整理,关键事实已对照 Apple 官方研究页面核实。
3分钟看懂版(先讲结论)
苹果研究团队发布了一个叫 SimpleDesign 的蛋白质设计模型。它能同时生成蛋白质的氨基酸序列和对应的 3D 结构(业内叫"序列-结构联合设计",co-design),而且做法比同类模型简单得多:别的模型通常要先训练一个"压缩器"把结构变成 token,再训练生成模型;SimpleDesign 直接在原始数据上一步到位训练。用超过 200 万个蛋白质的"序列+结构"配对数据训练后,它在联合设计、序列生成、结构生成三类基准测试上的成绩都有竞争力。
需要注意:目前所有结果都停留在计算机评估阶段,生成的蛋白质还没有在实验室里真的做出来验证过。
背景:蛋白质 co-design 是什么,为什么以前很麻烦
蛋白质的功能由两部分共同决定:氨基酸序列(一维链)和 3D 结构(折叠后的空间形状)。在药物发现和蛋白质工程里,研究者常常希望"凭空设计"一个新蛋白质——既要给出氨基酸序列,也要给出它能折叠成的结构。这就是"序列-结构联合设计"。
现有主流做法分两步:先训练自编码器把蛋白质结构压缩成离散 token(类似图像生成里的潜空间表示),再在 token 空间上训练生成模型。这个多阶段流程既复杂,又容易在各环节之间引入误差。
SimpleDesign 的做法:砍掉中间商,数据空间直接训练
苹果团队的核心假设是:多阶段训练不是必需的。SimpleDesign 直接在数据空间做单阶段端到端训练:
- 序列部分:用离散交叉熵损失,跟语言模型一样的 next-token 思路
- 结构部分:用回归损失,直接预测连续的 3D 坐标
- 骨干网络:Transformer 多模态架构——序列和结构各自有专门的处理通道,但共享全局自注意力,让两种模态互相"看见"
训练时的技巧很聪明:对每对"序列+结构"同时做破坏——序列端随机 mask 一些氨基酸,结构端加入噪声。通过调整两边的破坏比例,同一个模型自然学会了三种任务:
- 结构破坏得多 → 类似蛋白质折叠(从序列恢复结构)
- 序列破坏得多 → 类似逆折叠(给定结构反推序列)
- 两边都部分破坏 → 真正的联合设计
一个训练目标覆盖三种任务,这是它"简单"的关键。
训练数据与结果
训练数据是超过 200 万个序列-结构配对,主要来自 AFESM 数据集(AlphaFold Database 的预测结构加上补充样本)。
论文报告的结果:在蛋白质联合设计、无条件序列生成、无条件结构生成三类基准上,SimpleDesign 表现有竞争力;它生成的结构合理,氨基酸序列质量与大多数同类多模态模型相当或更好——而它的训练管线和架构明显更简单。
局限与避坑
- 没有湿实验验证:所有"表现好"都来自计算机评估(结构合理性打分、序列质量指标),生成的蛋白质没有被实际合成出来验证能否折叠、有没有功能、是否安全。论文作者自己也明确写了这一点。
- 模型权重未见公开:截至发稿,Apple 研究页面只有论文介绍,没看到开源权重或代码仓库(对比 SimpleFold 曾开源)。
- 别把 "competitive"(有竞争力)理解为"全面碾压":论文的说法是在简化管线的前提下做到有竞争力,不是超越所有专有模型。
意义解读:苹果在押注"简化架构"路线
这是苹果 2025 年 9 月 SimpleFold 工作的自然延续。SimpleFold 用 flow matching + 通用 Transformer 做蛋白质折叠预测,绕开了 AlphaFold 那类重度依赖领域先验的复杂架构;SimpleDesign 把同样的"简单架构能不能行"思路推到了更难的"设计"问题上。两次都得到类似答案:砍掉领域定制的多阶段流程,用通用生成式架构直接建模,性能未必差。这条路线如果继续成立,会降低蛋白质 AI 的复现和改进门槛。
对做 AI 制药、酶设计、蛋白质工程的人来说,值得关注的是"端到端数据空间训练"这个范式——它省掉了 token 化阶段的设计和调参成本。
适用场景 / 不适合谁
- 适合:关注蛋白质生成模型研究范式的研究者;想了解"简化架构"路线边界的工程团队;AI 制药从业者跟踪技术路线。
- 不适合 / 暂不能用于:直接拿生成结果去做实验设计(模型未经验证);生产环境的药物分子设计(未开源,无法部署)。
成本与开源情况
论文未披露训练算力成本。截至发稿没有公开的权重、代码或在线 demo,想复现需要等后续开源。参考先例:SimpleFold 的代码在 GitHub 上开源过(github.com/apple/ml-simplefold),可作为代码风格与数据格式的参考。
第一步行动建议
- 读 Apple 官方研究页的摘要与图表,确认三类任务上的具体 benchmark 数字。
- 对照 SimpleFold 的开源代码,熟悉苹果这批模型的代码风格与数据格式。
- 关注后续是否放出 SimpleDesign 权重;若开源,优先复现"逆折叠"任务——这是最容易被现有湿实验流程消费的能力。
参考来源
本文基于多家媒体转述整理,关键事实已对照 Apple 官方研究页面核实:
- Apple ML Research 官方页面:SimpleDesign: A Joint Model for Protein Sequence and Structure Codesign
- 9to5Mac:Apple researchers unveil SimpleDesign, a new AI model for protein design
- Root-Nation:Apple's Innovative AI System for Protein Design
- NewsBytes:Apple introduces SimpleDesign, an AI model for protein design
- Tbreak:SimpleDesign protein design: Apple's AI model explained