Issue 39 · 2026-08-24 · AI × Biology
分子胶开发通常从偶然发现的活性分子出发再做优化。EvoBind-multimer尝试把流程改为从头设计:仅以两个目标蛋白的序列为输入,生成可同时连接二者的小型大环肽,不要求预先知道结合界面或已有配体。作者以VHL与KRAS、BRD4两组蛋白为对象,并用活细胞NanoBRET观察到设计诱导的邻近效应。
进一步实验显示,部分设计能够形成VHL—靶蛋白三元复合物并触发蛋白酶体依赖的降解;但在不同患者来源的神经母细胞瘤类器官中,相同大环肽既可能促进降解,也可能稳定并隔离靶蛋白。该文是未经同行评审的bioRxiv预印本,亮点是把计算设计接到细胞机制验证,局限则是功能结果明显依赖具体细胞背景。
神经肽短、序列差异大,传统基序和同源性方法容易漏掉远缘候选。作者使用InterPLM的稀疏自编码器,把ESM-2的稠密蛋白表示拆成较稀疏、可分离的特征,并从中筛出一小组与神经肽前体相关的特征,再用轻量逻辑回归完成分类。
模型先在人类神经肽与非神经肽序列上训练,随后被用于小鼠、斑马鱼、线虫和果蝇,作者报告其跨物种仍具区分能力。该研究是未经同行评审的bioRxiv预印本;现阶段证据主要支持“可解释特征能够优先排序候选”,新预测是否对应真实加工、分泌和生物活性仍需实验确认。
EnzymARC不是再做一个酶功能预测器,而是构造更难的反例:作者从有实验注释的酶出发,按结构系统破坏催化残基及其周围区域,得到理论上失去催化能力、但整体序列仍与原酶接近的诱饵序列,并测试DIAMOND、CLEAN和DeepEC三类方法。
作者报告,在低扰动诱饵上,DIAMOND与基于蛋白语言模型的CLEAN仍大量给出原EC编号;加入“非酶”训练的DeepEC在较强扰动下更敏感,但同样难以识别针对活性位点的破坏。该文为未经同行评审的预印本,诱饵的失活属性主要来自结构导向构造而非逐一湿实验,因此它更适合作为机制敏感性的压力测试,而不是最终功能金标准。
这项工作检验一个直接问题:在生物合成基因簇检索中,ESM-2序列表征能否稳定超过显式的Pfam结构域信息。作者采用按参考组隔离的训练、验证和测试划分,并比较Pfam Jaccard、加入Pfam的BGC-SetNet、ESM组合模型及可学习权重的Pfam方案。
在该数据与主指标上,简单Pfam Jaccard仍是很强的基线,加入ESM表示没有形成有统计支持的稳定优势。作者也明确指出,银标准分组、有效测试家族数量较少,以及“结构域差异”不能直接证明存在替代生物合成通路。该文是未经同行评审的bioRxiv预印本,其价值在于提醒基础模型表征必须与信息充分的传统基线做严格、无泄漏比较。
作者提出拟南芥单细胞基础模型scAraFM,并把评估从常见的随机切分推进到重复样本切分和跨实验迁移。结果显示,随机切分会明显高估扰动响应预测能力;保留逐基因身份的表示持续优于把细胞压成单一池化向量,原始读数上的简单基线在单实验条件下也保持竞争力。
基础模型的优势主要出现在更接近实际部署的跨实验、小标注样本场景,而不是所有设置中都领先。这是一篇未经同行评审的bioRxiv预印本,结论目前来自拟南芥和所选扰动数据;但它提供了一个重要判断框架:评价虚拟细胞模型时,实验间分布偏移比随机留出集更有解释力。
GEOMeta面向GEO元数据中信息分散、命名不一致的问题,把流程拆成检索、任务专属抽取、字段标准化、本体映射和质量控制等多个阶段,并由专门化LLM Agent分别处理。作者用该流程为约60万个人类bulk RNA-seq样本生成标准化注释,随后用这些标签评测转录组表示模型对性别、年龄、组织和疾病等属性的预测。
团队还对新提交的GEO研究进行了前瞻性标注,并比较了22个大模型,报告部分近期开放模型在更低成本下接近领先推理模型的注释质量。该文是未经同行评审的bioRxiv预印本;规模化产出不等于标签完全正确,跨物种、复杂疾病状态及人工复核成本仍需继续评估,但它展示了Agent在真实生物数据基础设施中的明确落点。