Issue 53 · 2026-09-08 · AI × Biology
RFOptimization把结合物改进写成逐残基突变搜索,在不重新训练模型的条件下交替使用两条路径:由全原子结构预测梯度引导序列优化,或在正交结构生成器与MPNN序列设计之间循环。最终候选再用AlphaFold3的独立指标过滤,以减少对单一预测器的过拟合。
作者报告,该框架能在数分钟计算内提高RFdiffusion候选的计算过滤通过率,并覆盖蛋白结合物、配体结合生物传感器、环肽以及考虑活性位点的酶设计。该工作是未经同行评审的bioRxiv预印本;摘要只给出计算层面的普适性主张,没有提供湿实验命中率,因此还不能判断优化后的模型分数是否对应真实亲和力或功能提升。
Atlas模型家族覆盖蛋白语言建模、单体折叠和复合物预测。AtlasLM-3B在约15.6亿条含宏基因组数据的序列上进行掩码语言建模;AtlasFold据此直接预测全原子结构,不依赖多序列比对,并进一步微调为复合物模型AtlasFold-M。
作者报告AtlasLM-3B在无监督接触预测上优于同规模ESM2-3B,AtlasFold在蛋白语言模型折叠器中达到领先精度,AtlasFold-M的抗体—抗原预测可与AlphaFold3和ESMFold2比较;训练代码、数据、阶段检查点及权重计划以MIT许可开放。该工作是未经同行评审的bioRxiv预印本;这些比较需结合统一硬件、数据重叠与盲测条件审视。
BOTANIC-1是一组面向植物研究的长上下文基因组语言模型,可处理数百碱基到128 kbp的序列。模型由Agent驱动的“Model Factory”生成,并作为专用基因组层接入通用LLM Agent,意在把DNA表征能力嵌入更完整的植物科研工作流。
作者称其在一组大规模植物基因组任务上优于通用和植物专用模型,并通过机制可解释性识别编码区边界、剪接位点等生物特征;论文表示将发布S、M、L三个版本供研究使用。该工作是未经同行评审的bioRxiv预印本;摘要没有列出具体任务、效应量和外部验证,模型开放状态与Agent实际可靠性也需以正式资源为准。
ESMCapsid是针对病毒衣壳蛋白训练的专用语言模型,目标是在同源性很低的环境序列中识别衣壳,并学习与更高层级壳体架构相关的表征。作者还用稀疏自编码器拆解模型特征,寻找连接未知候选与已知结构谱系的可解释模式。
模型筛查了3.43亿个宏基因组代表性蛋白簇;作者报告约62%的候选在现有参考数据库中没有匹配,部分保守特征映射到已解析病毒壳体后呈空间聚集和受限径向位置。该工作是未经同行评审的bioRxiv预印本;大规模候选仍主要由模型定义,缺少同源匹配不等于新病毒衣壳,需结合结构和实验验证控制假阳性。
作者让Kosmos、K-Dense、ToolUniverse、BioAgents和AI Scientist-v2复现两类具有产业意义的研究:用蛋白语言模型嵌入预测抗体可开发性,以及用全原子分子动力学分析脂质纳米颗粒中的非共价脂质—RNA相互作用。
这些框架能够主动发现部分方法问题、调用预训练蛋白嵌入,并补充原论文有时缺少的统计报告;但没有一个达到原研究的完整范围,且出现严重失败与幻觉。该工作是未经同行评审的bioRxiv预印本;结论来自有限的两项复现任务,却为“基准高分能否迁移到真实科研”提供了比问答榜单更直接的压力测试。
研究通过系统扰动进化与结构输入,并用残基层约束传播映射追踪AlphaFold-Multimer和AlphaFold3内部几何信息的形成。作者提出,复合物组装主要依赖单体结构几何和界面序列—几何兼容性,而非直接的链间共进化信号。
其机制图景是先建立单体层几何表征,再逐步向跨链界面传播约束;抗体—抗原界面的可塑性和非典型结构可能削弱这种传播,从而解释更低预测精度。该工作是未经同行评审的bioRxiv v4预印本;这是基于输入干预和模型追踪的机制解释,尚不等同于对网络内部计算的唯一因果分解,也需在更多模型和复合物类别中复现。