Issue 47 · 2026-09-02 · AI × Biology
SymFold面向“给定三维骨架生成氨基酸序列”的蛋白逆折叠任务。它用对称双路径架构同时引入蛋白语言模型中的序列进化知识和多模态蛋白模型中的结构知识,并让两类先验在生成过程中迭代协同,而不是先由结构编码器生成粗序列、再做事后修正。
作者报告,该方法在标准蛋白逆折叠基准上超过所比较方法,消融实验也支持双路径设计的作用。该工作是未经同行评审的arXiv预印本;摘要未提供实验表达、折叠或功能验证,因此当前证据主要是计算基准,尚不能说明生成序列能在真实实验中稳定折叠并实现目标功能。
这项工作把掩码位置本身作为抗体语言模型的归纳偏置:依据IMGT注释或结构预测,把掩码更有针对性地放在与结合、结构或生物物理性质相关的区域。作者还设计混合掩码策略,在多个功能轴之间平衡预训练目标,而不增加模型参数。
作者报告,专门化策略在对应任务上带来最高14%的结构任务增益和最高5.9倍的CDR相关任务提升;论文已被MLCB 2026接收为口头报告。当前arXiv版本仍属于预印本证据,结果主要来自下游计算任务,尚未证明这种表征改进会直接转化为抗体设计的湿实验命中率或可开发性提升。
PathFold把蛋白结构预测从静态终态推进到折叠轨迹:先由基于AlphaFold的模块从序列提取结构信息,再用扩散模型从伸展构象生成渐进式折叠路径。模型因此可以提出折叠中间态和转变顺序,而不是只输出一个最终结构。
作者称预测路径呈现清晰的中间态和顺序折叠事件,并与牵引分子动力学轨迹及实验测得的Φ值表现出一致性。该工作是未经同行评审的bioRxiv预印本;扩散轨迹是受训练目标约束的模型生成结果,不能等同于真实时间动力学,仍需更多实验动力学数据与无偏模拟验证。
PopPert从单细胞测量天然是“对照群体与扰动群体不配对”这一事实出发,不再假设细胞之间存在一一对应。模型直接预测群体层面的联合基因表达分布及其扰动后参数变化,并用低秩高斯Copula表示跨基因依赖,同时可以采样合成的扰动后单细胞表达谱。
作者在遗传和化学扰动的多个单细胞基准上报告,其在差异表达恢复、扰动效应估计和群体分布匹配方面取得更好的整体表现。该工作是未经同行评审的arXiv预印本;高斯Copula与低秩依赖是假设性建模选择,跨细胞类型、强非线性反应及真正未见扰动的稳健性仍需独立检验。
PROSPECTor把“先从数据发现可复现信号,再追问生物学背景”形式化为开放式单细胞发现流程。框架在传统表达空间与多种基础模型嵌入中搜索稳健结构,把它们转写为可量化检验的候选假设,再投影到未见数据中评估泛化性和表型关联。
作者展示了两个独立情境:成纤维细胞胞外基质程序转移到带干预信息的小鼠队列,以及胃癌T细胞程序在单细胞、bulk和空间队列中复现。该工作是未经同行评审的arXiv预印本;这些是候选发现与跨队列支持,不是前瞻性实验确认,搜索空间、多重比较和人工解释环节仍需严格控制。
这项研究评估LLM能否把真实生物信息学分析转换为跨学科研究者更易理解的报告。作者结合基于Bloom认知层级的选择题自动评测与科学家人工评价,对GPT-4o、o1、Claude 3.7 Sonnet和Gemini 2.0 Flash生成的分析总结进行比较。
作者发现,模型通常能产生可读且大体安全的第一版说明,但会误读可视化、生成冗长文本,也很少提出超出既有分析的新见解,因此更适合辅助沟通而非替代领域专家。该工作是未经同行评审的bioRxiv预印本,本次为v2更新;所测模型已非最新一代,结论应理解为特定模型和案例下的能力边界。