BioTender / 论文速递

Issue 31 · 2026-07-18 · AI × Biology

扰动流匹配药物设计
与AI原生进化-细胞本体

今日速递 6 篇 3 方向 bioRxiv 6
Yu · Xu · Zhou · Li et al. bioRxiv · 2026.07.17

基于结构的药物设计中,扩散模型生成 3D 结合分子已展现出巨大潜力,但依赖高采样步数会拖慢药物发现流程、推高计算成本。PFM(扰动流匹配)用流匹配框架大幅减少采样步数,并引入独特的扰动条件概率路径设计,将口袋结合位点信息与原子类型-坐标耦合信息一并纳入生成过程。

在 CrossDocked2020 数据集上,PFM 生成的分子在 3D 结构质量和对蛋白靶点的结合亲和力上均达到 SOTA(平均结合能 -7.12),同时把有效分子的生成速度提升 21.3 倍,且仍有进一步优化空间——直接冲着结构药物设计流程中"扩散模型太慢"这个痛点去的。

Li · Fang · Mao · Luo et al.(西北大学) bioRxiv · 2026.07.16

单细胞转录组能刻画 CAR T 细胞状态,但把异质细胞信号转化为患者级治疗响应预测仍然困难——现有研究多止步于识别响应相关基因或细胞群,很少有预测框架把基因层面结构与临床结局真正整合起来。gANCHOR 是一个基于层级超图注意力框架的 T 细胞基础模型,通过编码基因-通路关系学习通路感知的细胞嵌入,再用细胞-患者注意力模块聚合细胞信息推断治疗响应。

在生物学保真度与批次校正评测中,gANCHOR 全面领先;在来自 5 项 CAR-T 研究、161 名患者的响应预测任务上,F1 分数达到 0.87,超越对比的单细胞基础模型。gANCHOR 还识别出可复现的响应/非响应关联基因程序,为 CAR-T 疗效与耐药提供了可解释的生物学洞察。

Pan(Ainnocence Inc.) bioRxiv · 2026.07.16

生物学基础模型在分子序列和单细胞转录组上展现出令人印象深刻的模式识别能力,却常常无法超越简单线性基线来预测基因扰动效应——暴露出统计相关性与机制理解之间的鸿沟。更深层的问题是"接口问题":生物学知识以人类可读格式(FASTA、SBML、本体三元组)存在,神经网络推理前必须经过有损重编码。ECO(进化细胞本体)是一种建立在 Σ0 底层之上的 AI 原生形式语言,将生物学知识直接表示为向量编码的关系图。

ECO 用 16 个结构算子同时充当知识符号与张量运算,且具有跨尺度双重语义——同一个算子在系统发育尺度表示物种形成,在细胞周期尺度表示不可逆的 APC/C 承诺。团队在三个领域用受控模拟验证 ECO:约 15 亿年珠蛋白家族进化中恢复长程协同进化耦合、祖先状态重建准确率达 82-91%;哺乳动物细胞周期动态中,CDK-cyclin 注意力图无需显式编程即可复现完整振荡周期与四吸引子相位图;60 个蛋白家族的潜空间对齐中嵌入距离与分化程度相关(Pearson r = 0.50)。ECO 把"人类可读性约束"换成"AI 可处理性约束",让基础模型的不透明性变成一张可测量、可导航的知识覆盖图。

Amgarten · Schinaid · Pinho et al. bioRxiv · 2026.07.16

Evo 2 等基因组基础模型正被越来越多地用于微生物基因组学,但它们的表征究竟在多大程度上真正捕捉病毒基因组组织结构,此前缺乏系统评估。本文在预注册的 RefSeq 病毒语料(19,429 个基因组,按巴尔的摩分类与宿主域组织)上,从三个维度基准测试 Evo 2:线性探针解码巴尔的摩分类/宿主域/病毒科,岭回归探针恢复基因密度、编码比例、基因重叠等高阶架构特征,以及对片段化基因组的生成式补全。

200 亿参数版本在最优中间层上,巴尔的摩分类准确率达 0.96,宿主域达 0.99,均超越 GC-长度与 6-mer 组成两个对照基线;最关键的是,嵌入解码编码比例、基因密度、基因重叠的能力(R = 0.61、0.77、0.64)远超 6-mer 组成对照(仅 0.10、0.38、0.27,p < 0.001)——证明 Evo 2 真正编码了基因组架构信息,而非仅仅记住了核苷酸组成。生成任务中,噬菌体的困惑度(1.18 bits/nt)显著低于训练集之外的真核病毒(1.80),说明分类和生成能力部分仍依赖组成特征与训练暴露。

Wen · Li · Bittremieux · Noble et al.(华盛顿大学) bioRxiv · 2026.07.16

从头肽段测序直接从串联质谱推断肽段序列,无需依赖蛋白序列数据库,深度学习大幅提升了这一任务的表现。广泛使用的 Casanovo 模型以 Python 命令行程序分发,但安装、GPU 与依赖配置、手动调参对许多实验台科学家而言门槛很高,是常见的出错来源;预测结果的解读与验证也是另一道坎。

CasanovoGUI 是一个开源 Java 桌面应用,把 Casanovo 的全部主要分析功能封装为 Windows/macOS/Linux 上的点击式界面。首次使用时自动安装私有 Python 环境和匹配 GPU 的 Casanovo 构建,无需任何前置软件配置;界面提供实时进度流、PDV 查看器中带逐残基置信度的标注谱图,以及将从头测序肽段容错映射回参考蛋白质组的功能——把深度学习测序工具从命令行门槛降到点击可用。

Okyere · Mehrem · Van den Ackerveken · Abeln bioRxiv · 2026.07.17

理解基因变异与可观测性状之间的联系是作物育种的核心,高光谱成像能捕捉植株的生理生化特征,但现有监督方法需要昂贵的性状标注,且将每次观测视为静态快照,忽略了植物发育的时间动态。SST-MAE 是一个自监督框架,直接从植物高光谱发育轨迹中学习基因型判别性表征,无需性状标签,通过重建被遮蔽的信息来捕捉多种生长轨迹。

在 194 个大田种植生菜基因型、8 个时间点的数据上验证,冻结编码器作为特征提取器用于下游基因型分类:花青素色素相关 SNP 的 AUROC 超过 0.89,叶缘锯齿性状达 0.77,均超越原始光谱和线性基线。学到的特征标签效率极高,仅用 30-50% 的标注数据即可达到接近满标注的性能——为基于图像表型的高通量遗传筛选提供了一条可扩展路径。