Issue 36 · 2026-07-30 · AI × Biology
通用语言模型正被越来越多地用于蛋白质设计流程,但它们评估变异效应的能力究竟如何,此前并不清楚。PG-LLM 基于 ProteinGym 构建基准,覆盖 217 个蛋白质变异优先级排序任务:每个任务给模型野生型蛋白序列和一段实验描述,要求在不访问多序列比对或蛋白结构的情况下,按适应度给 50 个突变序列排序。团队评测了 13 个语言模型,并在相同候选集、相同评测指标下重新打分了 95 个已发表的蛋白质预测器。
结果:Claude Opus 5 以 Spearman ρ = 0.406 领跑主榜单,GPT-5.6 Sol 以 0.402 紧随其后(但只在两个模型都打分过的实验子集上比较时,GPT-5.6 Sol 反超 Opus 5)。Opus 5 超越了 95 个已发表蛋白质预测器中的 49 个,包括 46 个纯序列方法中的 41 个,逼近 ESM2-650M(ρ = 0.411),但仍落后于当前最强的 VenusREM(ρ = 0.523)。跨 GPT、Claude、Gemini 家族,变异排序性能随测试时算力增加而提升,但增益逐渐收窄,未能追平专用蛋白质预测器;与依赖更深进化比对的纯序列预测器不同,LLM 的准确率几乎不随比对深度变化——证明无需专用工具的通用语言模型已经捕捉到相当可观的蛋白质变异信号,同时也划定了它们在变异优先级排序任务上离可靠可用还有多远。
水稻全基因组关联研究(GWAS)已鉴定出大量与农艺性状相关的位点,但解读这些位点的调控与功能意义仍然困难——每个位点常包含多个处于连锁不平衡的变异,其中许多位于非编码区。本文提出一种方法,整合基于预训练 DNA 语言模型(在水稻 ChIP-seq 和 ATAC-seq 数据集上微调)预测的染色质特征信息,对关联位点内的非编码变异做优先级排序。
团队通过三个案例研究验证方法效用:耐热性 post-GWAS 分析中,被优先排序的变异与此前通过 GWAS+转录组联合分析鉴定的候选基因启动子重叠;对高产基因 DEP1,启动子变异优先级排序结合计算饱和诱变,定位出一个富集高影响突变、与预测转录因子结合位点重叠的局部调控区域;对耐旱基因 OsHAK1,排名最高的变异被预测与植物中 H2Bub 和 H3K4 甲基化标记共现模式一致的染色质特征相关——证明了该方法在功能性优先排序非编码变异、辅助解读 GWAS 位点方面的实用价值。
蛋白-配体亲和力(PLA)预测是 AI 驱动药物发现的核心,但精确的基于相互作用的方法需要昂贵的构象准备和数据编码,限制了吞吐量。本文先系统评估预训练分子表征模型能否替代复杂编码器——对序列、图、图像三类表征做统一多样的评测,发现整体表现强劲但存在明显的蛋白家族间差异,为 PLA 任务的编码器选型提供了首个实用指南。
随后借鉴大语言模型的专家混合(MoE)策略,在不牺牲表达能力的前提下实现高计算效率;系统性消融实验揭示了在分子预测任务中部署 MoE 的关键设计原则。由此得到的模型 HydrAffinity 是一个无需相互作用信息、动态稀疏的模型,用预训练编码器加 MoE 实现参数高效学习——在 CASF-2016 上超越所有免相互作用方法,追平最先进的相互作用式方法。路由分析证实 MoE 针对不同蛋白家族发展出了独特的激活模式,为动态参数化提供了可解释证据;在 DUDE-Z 和 LIT-PCBA 上的零样本测试进一步显示出强劲的 EF5% 表现,使 HydrAffinity 成为一个实用、可扩展的早期筛选前置过滤器。
肢体再生能力在不同发育阶段和解剖部位之间差异巨大,但跨物种比较这些功能性转变一直很困难,因为细胞类型和基因词汇在物种间存在分歧。通用细胞嵌入(UCE)提供了跨多样物种的共享坐标空间。本文证明,一个基于实验锚定的非洲爪蟾尾部组织者对比,能识别出一个肢体发育转变,并据此定义一把冻结的跨物种能力标尺。
不做任何重新拟合,直接应用这把标尺,就能区分成年小鼠指端再生中的再生组和纤维化组文库,并在状态平衡的巨噬细胞修复群体中解析出一个可重复的对齐成分——通用细胞嵌入由此把源群体对比转化为可移植的向量标尺,实现跨物种边界的零样本功能比较。
基于显微成像的表型分析越来越依赖自主、无监督的特征提取,但现有方法没有一个在架构设计上显式地把形状和纹理分离到独立的潜在子空间。纹理编码着蛋白质分布、细胞内组织等关键生物学信息,在标准无监督方法中却始终无法作为独立特征域被访问——这是阻碍跨生物学尺度无偏表型分析的根本性限制。UDIST 是一个串联双变分自编码器(VAE)框架,在单个对象层面把形状与纹理显式解耦到独立、不重叠的潜在子空间中。
通过在主轴对齐的对象上训练两个 VICReg 正则化的 VAE,UDIST 把二元形状信息和连续纹理信息分离到旋转不变的特征空间中,支持对两个域分别做下游分析。团队在从细胞核、单细胞到患者来源肠道类器官的多个生物学尺度上验证了 UDIST,使用荧光和明场成像,揭示出此前被形态学变异掩盖的表型差异,并支持在聚类和相似性度量等下游分析中独立分析形状与纹理——为高内涵显微镜和筛选中的多尺度表型分析提供了一个通用、无标签的无监督工具。
医学影像蕴含丰富的表型信息,但人工临床评估往往无法完整捕捉。本文提出一个系统性框架,用自监督学习(SSL)提取这类信息并开展基于影像的疾病广泛关联研究(iDWAS)。团队将该框架应用于英国生物银行(UK Biobank)的腹部 MRI 数据,用基于 VICReg 的 SSL 模型学习特征,再用逻辑回归模型检验特征与疾病的关联。
共鉴定出 158 种与 MRI 衍生特征显著关联的疾病,其中不乏与腹部解剖结构没有直接关联的疾病。聚焦代谢功能障碍相关脂肪性肝炎(MASH),MRI 衍生特征捕捉到的疾病相关信息,把 MASH 病例与对照区分得比 PDFF、Iron-cT1 等已确立的生物标志物更好——展示了 SSL 从常规影像数据中挖掘临床有意义信号的能力,该框架可广泛应用于其他影像数据集和模态,为偶发和早期疾病检测提供更系统化的方法。