苹果公司研究人员近期在蛋白质设计领域取得新进展,其开发的名为SimpleDesign的模型以预印本形式发表于arXiv平台。该模型突破了传统多阶段训练框架,通过端到端学习方式直接生成蛋白质的氨基酸序列与三维结构,省去了中间表示转换环节,为蛋白质设计任务提供了全新解决方案。
传统蛋白质联合设计模型通常采用分阶段训练策略:先通过自编码器将蛋白质结构转换为离散潜在表示,再训练生成模型处理这些中间表示。而SimpleDesign模型创新性地使用氨基酸序列与连续三维坐标作为原始输入,实现了从数据到输出的直接映射。这种设计思路延续了苹果此前SimpleFold项目的技术脉络,后者已证明流匹配模型在蛋白质结构预测任务中的有效性。
基准测试显示,SimpleDesign在蛋白质联合设计、结构生成和序列生成等任务中均表现出色。模型生成的蛋白质结构具有合理构象,其氨基酸序列质量与主流多模态模型相当甚至更优。特别值得注意的是,该模型通过调整输入数据的破坏程度,能够灵活切换蛋白质折叠与逆折叠两种工作模式,这种双任务学习能力为蛋白质工程提供了新的研究范式。
尽管计算机评估结果令人鼓舞,但研究团队明确指出,目前尚未通过湿实验验证生成蛋白质的实际功能。模型设计的蛋白质能否正确折叠、保持生物活性以及在复杂生物系统中安全运行,仍需后续实验研究证实。这种谨慎态度反映了人工智能辅助蛋白质设计领域当前面临的普遍挑战——如何将计算预测转化为具有实际应用价值的生物分子。












