BioTender / 论文速递

Issue 37 · 2026-08-22 · AI × Biology

从生成边界到
实验规模化

今日速递6 篇3 方向arXiv 2 + bioRxiv 3 + 期刊 1
Shuibai Zhang · Xinchi Liu · Fred Zhangzhi Peng et al.arXiv 预印本 · 2026.08.19

通过属性引导控制蛋白语言模型,是无需重新训练模型就能定向生成序列的一条诱人路线。但这项工作指出,当引导强度真正足以推动溶解性或热稳定性等目标时,模型内部表征会偏离天然蛋白分布,生成序列逐渐退化为低复杂度、难以折叠的结果;被优化的属性预测器却仍可能把这些异常序列判为“成功”。

作者把这一现象定义为 off-manifold collapse,并提出无需训练的 Mahalanobis filtering:根据天然蛋白激活分布筛掉异常候选。在相同引导设置下,该方法改善了保留序列的属性分数与结构可信度,且可迁移到不同引导机制。这仍是未经同行评审的 arXiv 预印本;结果提醒我们,生成指标变好不等于蛋白更真实,外部结构与组成检查仍不可缺少。

Wengan He · Yongsheng Luo · Lihong Jiang et al.arXiv 预印本 · 2026.08.17

这篇综述没有简单罗列AlphaFold、RoseTTAFold和ESMFold,而是沿方法演化重新梳理蛋白结构预测:从显式进化耦合与接触图预测,到由深度模型学习序列表示,再到复合物、核酸和小分子等异质体系的统一建模。作者重点比较表示与数据、架构与学习策略、置信度与评估三个维度。

文章进一步把RFdiffusion等生成式方法放入同一条技术脉络,指出领域正在从“给定序列预测结构”转向“围绕目标结构和功能生成分子”。它是一篇已投稿 Elsevier、尚未经同行评审的 arXiv 综述预印本,而非新的实验模型;价值主要在于提供结构预测与生成设计之间的统一坐标,也明确了数据偏差、复杂体系建模和可信评估仍是关键限制。

Heqin Zhu · Jiaqi Wang · Weibo Zhao et al.bioRxiv 预印本 · 2026.08.18

核酸适配体的功能同时依赖序列、三维折叠和靶标结合,使RNA和DNA binder的理性设计远比单纯序列优化复杂。NACraft把适配体设计写成可微的序列搜索问题:用户定义靶蛋白、核酸字母表、长度与目标函数,再通过全原子结构模型反馈反向优化核苷酸概率。

该流程以Boltz-1提供结构反馈,可结合NA-MPNN进行序列扩增,并使用独立的AlphaFold3预测复核;同一框架支持从头设计、相似性引导设计和靶标选择性设计。它提供了较清晰、可编程的核酸设计接口,但目前仍是bioRxiv预印本,结构模型评分与真实结合实验之间的差距需要更多湿实验验证。

Lukas F. Milles · Evelyn B. Huddy · Ann Carr et al.bioRxiv 预印本 · 2026.08.15

异肽键能在氨基酸侧链之间形成近乎不可逆的共价连接,但可工程化的系统长期局限于少数天然支架。David Baker与Lukas Milles团队从头设计了能够自催化形成分子内和分子间异肽键的蛋白,并报告超过50个形成目标键的设计,由质谱和5个晶体结构验证。

团队进一步把设计拆成相遇后自动共价锁定的split proteins,并实现与SpyTag/Catcher正交、可由温度调控的连接系统;多个连接单元还能组装成最高约215 kDa的刚性对称环。该工作扩展了蛋白“永久卡扣”的工具箱,但仍为未经同行评审的预印本,其细胞环境表现与大规模应用稳定性尚待验证。

Ryan Shihabi · Siddhant Karmali · Brent Vaughan et al.bioRxiv 预印本 · 2026.08.17

多数生物基础模型从序列或静态结构学习,而HI-JEPA选择直接从完整组织中实测的分子邻近关系建模。它以JEPA式表征学习把蛋白、分子相互作用和更高层级组织信息放入统一潜空间,目标不是逐项重建输入,而是预测被遮蔽的组织关系。

作者报告该模型在未见蛋白物理相互作用预测上优于参数规模大得多的蛋白语言模型,并尝试在同一表征空间中跨尺度导航。其意义在于把“分子组织”而非单纯序列作为世界模型的学习对象;不过结果来自预印本,数据覆盖、跨组织泛化以及与其他基础模型的公平比较仍需进一步检验。

Jason Qian · Lukas F. Milles · Basile I. M. Wicky et al.Nature Communications · 2026.08.20

生成模型让蛋白设计数量快速膨胀,但常规生化实验的速度没有同步增长,验证由此成为主要瓶颈。Baker团队重新组织表达、纯化和表征流程,用部分自动化与标准化操作提升常见体外测试的规模、速度和可重复性,而不是依赖一套昂贵的全自动机器人系统。

论文显示这些工作流可把多类蛋白测试的吞吐量提高至少一个数量级,同时减少湿实验时间,并通过大规模实验表征把设计反馈更快送回模型与筛选环节。它的核心贡献不是新生成模型,而是补齐AI蛋白设计的实验基础设施;文章已在Nature Communications同行评审发表,证据强度高于本期其他预印本。