Issue 35 · 2026-07-27 · AI × Biology
能否以可用产量表达出来,是治疗性抗体发现中最早、也最昂贵的筛选关卡之一。AINN-Express 是一个纯序列输入的 VHH 单域抗体(纳米抗体)表达量预测器,基于 Ainnocence 自研的蛋白基础模型 AINN-P1 构建:用冻结的 AINN-P1 编码器编码 VHH,接一个轻量级梯度提升分类器打分——只需氨基酸序列,无需结构,也无需针对具体任务训练模型。
在防泄漏的留出程序(leave-program-out)评测下,AINN-Express 在已知抗体项目内达到 ROC-AUC 0.87,在全新项目上达到 0.81,远超多数基线。团队还做了对照实验验证编码器选择:在这项任务上,1.67 亿参数的 AINN-P1 对未见项目的泛化能力远超 6.5 亿参数的通用 ESM2(0.81 对比 0.68),且不做任何任务特定微调就能匹配领域微调后的 ESM2(0.83),参数量却只有约四分之一。这个差距在随机划分下完全隐身(所有编码器都约 0.88)——只有留出程序评测才能揭示,通用嵌入学到的更多是"项目身份"而非可迁移的表达决定因素。决定泛化能力的是表征质量本身,而非参数量。
空间多组学整合需要在跨组学共识信号与模态特异性信号之间取得平衡,而两者的重要性在组织的不同位置各不相同。GatorPrism 是一个自监督联盟图专家混合(MoE)框架,显式分离跨组学共识与模态特异结构,并跨组织位置自适应整合二者的贡献——联合专家编码基于交集的共识图,模态私有专家捕捉混合的空间-分子结构,一个原型条件路由器为每个空间点分配特异的联盟权重。
模型端到端训练,同时保留共享与模态特异邻域、对齐共配准模态、维持空间连贯性、防止路由坍缩。在 8 个空间多组学数据集、9 项聚类指标上,GatorPrism 全面优于 9 个竞争方法。在人类扁桃体样本中,推断出的组织域获得 RNA 与 ADT 标志物的一致支持;在小鼠胚胎脑样本中,路由分布揭示出解剖学上局域化的共享态、RNA 私有态与 ATAC 私有态,分别有转录组、染色质可及性和 motif 证据支持——展示了共享与模态特异分子信号如何共同组织组织结构。
基于靶点和结构引导的药物设计是现代药物发现的核心,但当预定义靶点或结合口袋无法完整刻画疾病生物学时,需要互补策略。基因表达谱提供了疾病和扰动状态的可扩展系统级读数,是表型引导分子设计的理想输入——但分子生成过程中保留表型信息一直很难,化学上合理的分子可能与预期的生物学响应彻底脱节。Tx2Mol 是一个转录组引导框架,将基因表达谱转化为候选分子,同时在整个生成过程中保持生物学引导。
团队在三种生物学场景(bulk 基因扰动、单细胞扰动、患者来源疾病特征)和三个验证维度(化学合理性、结构兼容性、表型保留)上评测 Tx2Mol。在 10 个癌症相关 bulk 基因扰动基准上,Tx2Mol 超越 9 个转录组引导基线,与已知配体的最大 Tanimoto 相似度平均提升 24.10%,在 HDAC1 上提升达 50.67%;结构分析进一步支持了具有良好预测结合能力的结构新颖候选分子。Tx2Mol 还能泛化到噪声更大的单细胞扰动谱,并通过计算模拟药物扰动验证保留了药物诱导的转录响应;患者来源的疾病特征进一步将分子生成引向已获批药物的化学空间。
组学研究越来越依赖冗长、多方向的工作流,这让"可审计性"和单个分析工具本身一样重要。现有 LLM 驱动的生物信息学 agent 能自动化部分工作,但很少有系统在结论层面的可复现性与可追溯执行上经过检验。MetaClaw 把分析拆分为确定性的 FlowHub 上游工具流和可定制的 OpenClaw 下游技能容器,通过一个 YAML 流程注册表耦合两者——每个任务的完整归档包括 FlowHub 规范、技能脚本、锁定版本的 Dockerfile、参数与输出,下游容器运行时不联网。
团队在来自 4 项已发表研究的降采样队列(共 94 个样本)上做基准测试:尽管降采样可能限制了对低丰度标志物的敏感性,MetaClaw 仍恢复出 4 个高粱标志物中的 2 个、3 个 RRMS 特征中的 3 个、5 个结直肠癌标志物中的 3 个,以及全部 5 组永久冻土标志物。在 45 次"模型×提示词"组合运行中,所有后端都能完成上游处理,下游有效性则取决于模型与指令细节;35 次消融实验显示,移除注册表、参考脚本、规划循环或清单都会导致不同类型的性能损失——相对于移除注册表,完整脚手架把耗时降低 32%、工具调用减少 37%、token 成本降低 47%,把模块化架构、可安全重跑的溯源、生物学复现、扰动鲁棒性与可量化的资源效率整合进一个可审计的 agent 框架。
病历数据和组学数据正迅速成为医疗场景的标配,二者共同刻画了从失调分子到表型的"全人"图景,为精准诊断和靶点发现提供了潜力——但如何系统整合并解读单个患者的病历与组学数据,仍是一个开放问题。Graph in Graph(GiG) 首次提出用图结构嵌套图结构建模:病历数据用"患者-表型图"建模,再叠加每位患者的组学信号图,从而把组学信号图学到的信息与病历表型特征整合起来,刻画个体患者并对重要的组学生物标志物和表型排序。
团队将 GiG 应用于 Long Life Family Study(LLFS,一项招募长寿家系以揭示健康衰老生物学机制的队列)中的 2 型糖尿病(T2D)、糖尿病前期与健康对照的探索性研究。评测结果显示 GiG 不仅预测准确率高,还能通过对关键临床和组学生物标志物排序来解释预测结果——为其他研究中整合并解读病历与组学数据集,用于疾病诊断和发病机制发现,提供了可推广的框架。
按有序阶段采集的时序单细胞 RNA 测序数据,为分化、疾病进展和衰老提供了群体级快照。有监督伪时间方法利用观测到的阶段标签重建连续进程,但通常无法识别与"从一个阶段到下一个阶段"变化关联的标志基因;无监督伪时间标志物选择方法直接从表达数据推断潜在轨迹并识别轨迹关联基因,却没有把这些关联显式地对应回观测阶段。FusedFCR 是一个正则化的前向延续比(forward continuation-ratio)模型,把细胞进程表示为跨有序阶段的一系列条件转换。
FusedFCR 结合 lasso 惩罚做基因选择,与融合惩罚项鼓励相邻转换间效应相似,同时允许瞬时和方向变化的关联存在。由此得到的转换特异性系数支持可解释的基因选择,以及锚定在观测发育阶段上的连续伪时间式投影。在模拟数据中,FusedFCR 准确恢复了基因效应轨迹,预测性能优于对比方法;应用于小鼠胰腺 β 细胞跨 7 个时间点的分化和人类绒毛外滋养层细胞跨 4 个时间点的分化,FusedFCR 识别出与不同发育转换关联、具有生物学可解释性的基因,基因集富集分析进一步揭示出与已知发育生物学一致的阶段特异性通路活性,留出阶段分类准确率在两个数据集上均持平或优于对比方法——证明 FusedFCR 能补充伪时间排序,指出哪些分子程序发生了变化、以及这些变化在发育轨迹上何时出现。