Issue 33 · 2026-07-22 · AI × Biology
蛋白质开关能通过重排结构元件响应生化刺激,是细胞信号转导的关键——但从头设计这类蛋白需要能量景观支持多个刺激依赖构象的氨基酸序列,而现有多数从头蛋白设计流程只针对单一稳定结构优化。已有的多状态逆折叠方法虽能针对多个骨架设计序列,却默认合适的骨架系综已经存在,往往需要专家经验才能构建。
Diff-Switch 从预训练蛋白扩散模型中采样开关式骨架系综:给定参考骨架结构与结构域分解,方法在保持局部结构域几何形状的同时,沿用户指定的集体变量鼓励全局结构域排布的多样性(灵感来自 metadynamics)。通过带奖励调制的受控扩散采样器实现——局部相似性获得奖励,同时在集体变量空间施加历史依赖偏置以避免重复采样同一全局排布。在 20 个多样蛋白质的评测集上,用生成系综的构象做下游多状态逆折叠,找到开关兼容序列的成功率优于基线采样;团队还将方法应用于真实蛋白开关设计任务并对结果进行了表征。
空间蛋白质组学(SP)能测量组织内蛋白质的空间分布,为理解组织功能、疾病和治疗响应提供关键洞察,但现有 SP 技术只能覆盖一小部分蛋白质组,且受成本和测量噪声限制。近期 AI 方法能从转录组或组织病理学数据预测空间蛋白表达,但通常局限于仅覆盖几十种蛋白的配对数据集,难以泛化到实验未测量的蛋白面板之外。
SPgen 是一个多模态基础模型框架,整合蛋白质序列、功能注释、转录组谱和空间信息,学习可迁移的表征,从而推断超出实验已分析蛋白范围的空间表达。在多个空间蛋白质组学数据集上,SPgen 能准确重建已测量的空间模式、降低测量噪声,并实现真正意义上的全蛋白质组空间预测——把 SP 从"测什么算什么"推向"用基础模型补全整个蛋白质组"。
翻译后修饰(PTM)通过残基化学、序列上下文、三维微环境与修饰状态之间的相互依赖调控蛋白质功能,但现有大多数预测器把每个修饰位点独立建模,没有把修饰倾向与功能后果连接起来。ProtSyntax 是一个以 PTM 为中心的蛋白质语言模型,在覆盖 40 类 PTM 的 425 万条样本上训练,并针对激酶特异性、PTM 串扰与酶动力学做监督学习——用稀疏专家混合架构中的几何门控注意力实现双向长程建模,配合自适应多目标学习,把残基级 PTM"语法"与蛋白质级功能耦合起来。
在 40 个 PTM 位点基准上,ProtSyntax 相对最强基线,平均 MCC 和 AP 分别提升 12.7% 和 10.7%;还能区分真实位点与结构不兼容的 motif 诱饵、迁移到罕见 PTM、恢复串扰关系、把 PTM 扰动与酶动力学变化联系起来,并识别疾病相关的 PTM 紊乱——为解读整个蛋白质组的 PTM 调控提供了一个可解释框架。
抗体表达量排序是抗体设计的关键任务,但标注实验数据的稀缺严重制约了建模。本文提出统一的偏好学习框架,把稀缺的定量表达数据与来自免疫数据的大规模弱正样本监督整合起来。方法把直接偏好优化(DPO)适配到蛋白质语言模型:引入联合掩码对数似然近似与基于 IMGT 的比对方式,使变长序列上的高效训练成为可能。
在包含 1254 条标注序列和 400 万条未标注骆驼源抗体的内部数据集上评测,该方法在大多数指标上持续超越基线,证明偏好学习能有效地从弱监督中学习——为数据受限场景下的抗体可表达性优化提供了可扩展方案。已被 ICML 2026 接收。
约束型代谢建模是研究细胞状态与疾病机制的有力工具,但有效使用它需要深厚的计算专业知识和对多步骤分析的精细协调。MechAInistic 借助大语言模型降低这一门槛:一个围绕"架构师-审查者"(Architect-Reviewer)模式组织的多智能体系统,把自然语言问题转化为可执行、以模型为基础的工作流,并生成结构化报告,支持通路比较、扰动分析、药物靶点探索等多种任务。
团队用两组配对的免疫细胞代谢模型验证系统的治疗假说生成能力:在类风湿关节炎(RA)与健康对照的初始 B 细胞对比中,MechAInistic 识别出线粒体代谢重塑,并提名 Devimistat/CPI-613(靶向 OGDH)作为研究性假说;在多发性硬化症(MS)与健康对照的 CD4+ Th17 细胞配对研究中,同一套工作流识别出 NADP 依赖型异柠檬酸脱氢酶为最优单一靶点,并提出已获 FDA 批准的 ivosidenib 作为老药新用候选——证明自然语言问题可以被转化为可追溯、以模型为依据的治疗假说生成工作流。
准确的单倍型分相是高质量基因组组装的前提,但在没有亲本数据的情况下对复杂基因组做从头分相仍然困难。本文把单倍型分相表述为增广 unitig 图上的重叠簇节点聚类问题——节点代表连续、无分支的 DNA 序列片段,两类边分别编码序列重叠或 Hi-C 邻近信息。团队提出对比学习框架,用自定义目标函数训练基于图 Transformer 的 grapHiC 模型,将 unitig 节点分相为父本、母本与纯合三类。
grapHiC 是首个基于机器学习的无参考基因组单倍型分相方法,也是首个直接对原始 unitig 图分相、无需事先化简的方法。在人类基因组规模的图上,grapHiC 能准确聚类节点;与 DipGNNome 组装器集成后,其预测能有效指导分相从头组装,产出的人类基因组组装在连续性和分相质量上与当前最优方法相当。