BioTender / 论文速递

Issue 34 · 2026-07-25 · AI × Biology

蛋白语言模型的能力边界
与ADMET基础模型基准

今日速递 6 篇 3 方向 bioRxiv 6
Varghese · Tiwary · Oswal(Covenant Biosciences) bioRxiv · 2026.07.23

ADMET(吸收、分布、代谢、排泄、毒性)属性的准确可泛化预测,仍是计算药物发现里杠杆最大也最悬而未决的问题之一,后期因 ADMET 缺陷导致的淘汰是药企研发成本的主要推手。TDC ADMET Group 是该领域最广泛采用的公开基准,涵盖标准化骨架划分下的 22 个终点。本文对 Covenant Biosciences 自研的自动选择基础模型 CHIMIYA-1 在全部 TDC ADMET Group 上做了完整评测。

不同于该领域的常见做法,每个报告分数都是五次独立随机种子端到端评测的均值与标准差(这是 TDC 官方最低提交标准,但公开榜单上的很多条目其实并未满足),全部 22 个终点还额外做了训练/测试结构重叠审计,结果零重叠。在这套刻意保守的评测标准下,CHIMIYA-1 在 4 个终点上排名所有公开方法第一,在 22 个终点中的 20 个(91%)进入领域前十分位,全基准平均百分位排名接近第 74 位,在毒性与理化性质终点上尤为突出。团队还发现该基准上多个排名靠前的公开对比方法被独立证实存在数据泄漏——这反而说明 CHIMIYA-1 的相对排名被低估了。

Song · Guo · He · Wang et al.(浙江大学) bioRxiv · 2026.07.23

蛋白质功能源于动态构象系综与状态转换,实验和计算上都很难刻画。生成式 AI 的进展为直接从模拟数据学习分子热力学、动力学和构象演化打开了新机会,但受限于同时具备严谨采样、完整相空间信息和多样理化扰动的大规模数据集稀缺。pHaseMD4AI 整合了两个分支:全局平衡的多肽分支,以及覆盖数百个可溶蛋白的蛋白质尺度恒定 pH 分子动力学(CpHMD)分支。

多肽分支包含完整的经典三肽、四肽体系,以及翻译后修饰与质子化状态数据集,提供同步的原子坐标(R)、速度(V)、力(F)和基于马尔可夫状态模型的动力学标注,配套 Web 门户支持轨迹浏览与下载。作为示例应用,团队展示了一个从序列直接预测残基级平衡二面角分布的序列模型——为开发和基准测试分子机器学习方法提供了资源,同时支持序列、翻译后修饰与质子化状态扰动下的生物分子动力学研究。

Whitfield · Marty · Vernon · Fournier et al. bioRxiv · 2026.07.23

蛋白质语言模型(pLM)在从适应性预测到功能设计的任务上日益成功,但它们究竟学到了什么生物学知识、这些知识编码在内部表征的哪个位置,此前仍不清楚。本文对 ESM2 和 AMPLIFY 家族的 8 个模型,针对人类蛋白质组注释中的 22 个概念做了逐层高分辨率可解释性分析,发现这些模型沿深度编码复杂度递增的概念:早期层嵌入最擅长捕捉基本理化性质与线性 motif,二级结构由后续层捕捉,结构域级语义则出现在中间层。

这些嵌入的主成分投影能区分具有生物学意义的蛋白质分组,分子生物学启发的干预实验证明 pLM 嵌入能区分磷酸化模拟活性突变体与失活突变体。一个略出乎意料的发现:预训练数据量和算力对生物学概念线性涌现的影响,超过了单纯扩大参数规模——揭示了 pLM 内部生物学知识的编码位置以及哪些设计选择塑造了它的涌现,为开发更稳健、更贴近生物学的蛋白质语言模型提供了依据。

Wang · Sengupta · Li · Standley bioRxiv · 2026.07.23

蛋白质语言模型越来越多地被用来表示适应性免疫受体,但它们相对经典比对方法的优势究竟在哪里,此前并不清楚。本文在四个 B/T 细胞受体数据库上,用 CDR3、克隆型、互补位、全长可变域四种表示方式,把 ESM2 家族、ESM-C、抗体/TCR 专用 pLM 与序列比对方法做了系统基准对比。

结果颇具警示意义:在 CDR3 层面,比对方法全面超越了几乎所有 pLM(除了额外编码种系 V 基因的对比预训练 TCR 模型 SCEPTR)——BLOSUM62 与 Levenshtein 距离在 top-1 检索准确率上比所有 ESM2 变体高出 7-12 个百分点,领域专用 pLM 也未能弥补差距。在全长可变域层面比对与 pLM 才趋于一致,但深入分析(结合种系回复分析)表明,全长 pLM 的表现实际上是靠"种系捷径"而非真正从 CDR 中提取抗原特异性信息。团队还发现,常规随机训练/测试划分会因克隆泄漏使检索准确率虚高 15-28 个百分点——为免疫受体检索建立了"克隆感知"基准评测的实践标准。

Rescalli · Carbone bioRxiv · 2026.07.23

蛋白质-蛋白质相互作用预测与残基级界面定位在生物学上密不可分,但通常被当作两个独立的计算问题分别处理。X-PAIR 是一个基于序列的多任务深度学习框架,联合预测两个蛋白是否相互作用、并定位其伙伴特异性界面残基——结合蛋白质语言模型表征与轻量级交叉注意力,既不需要结构模板也不需要多序列比对

在防泄漏基准上,X-PAIR 在两项任务上都超越现有方法,界面定位任务上的提升尤为显著。多任务学习在保持单任务性能的同时以接近单任务的成本同时输出两类结果,使 100 万对蛋白质能在 2 小时内分析完毕——界面预测比现有方法快约 500 倍,PPI 预测快约 20 倍,真正实现了蛋白质组尺度的分析。跨物种分析还揭示了不同的进化依赖性:相互作用预测受益于多物种训练,界面定位则在不同分类尺度上保持稳健。

Lee bioRxiv · 2026.07.23

AlphaMissense 等错义致病性预测器正被越来越多地用于临床变异解读,但它们的训练标签主要来自以功能丧失(LOF)变异为主的胚系数据。本文用一个开放许可、可复现的基准——768 个 Cancer Gene Census 基因,49 个预测器(标签来自 CIViC、COSMIC、cancerhotspots、ClinVar 和 gnomAD)——发现 49 个工具中有 42 个(86%)对癌基因功能获得型(GOF)变异的打分系统性低于对肿瘤抑制基因变异的打分。

这种低估有明确的机制特征:被漏判的驱动突变往往位于低保守性、溶剂暴露、非去稳定化的位点(phyloP 2.51 对比 7.89;相对溶剂可及性 0.671 对比 0.185);反直觉的是,正在进入临床应用的无监督模型和蛋白语言模型受影响最大。逐基因致癌阈值跨度达 0.07-0.99,说明单一全局阈值对多数基因都是错误校准的——作者提供了逐基因校准图谱,并构建了癌症校准堆叠模型 OncoCal,在判别力上适度优于最佳单一工具(AUROC ≈0.93 对比 0.87),成功挽救了 JAK2 V617F 等驱动突变(打分从 0.334 提升到 0.57),且能泛化到独立的深度突变扫描数据。