Issue 49 · 2026-09-04 · AI × Biology
SimpleDesign把蛋白序列与三维结构的联合生成直接放在原始数据空间中训练,省去先学习离散或连续潜变量、再训练生成器的两阶段流程。其Mixture-of-Transformer架构为两种模态保留各自的处理路径,同时以全局自注意力维持序列—结构之间的耦合。
作者在超过200万对序列—结构数据上训练,并报告其在联合设计及无条件序列/结构生成基准上的竞争力。该工作是未经同行评审的arXiv预印本;摘要层面的证据主要是计算基准,尚不能替代合成、折叠与功能实验,因此更适合被视为对蛋白共设计训练范式的简化探索。
这项研究测试Claude、ChatGPT和Gemini等通用大语言模型能否依据物理化学原则,直接提出不复制现有序列的金属及疏水小分子结合蛋白。模型不仅给出序列,也说明折叠、配位和结合位点设计理由;候选随后经过结构预测、过滤与实验验证。
作者从每次查询筛选6至12个设计,报告金属结合蛋白在一轮设计中、全氟辛酸结合蛋白在第二轮设计中均获得25%的命中率,但成功序列与提示参数及模型自述理由仍有偏差。该工作是未经同行评审的bioRxiv预印本;它提供了小规模实验概念验证,却不足以证明通用LLM能够稳定取代专用蛋白设计模型或其解释具有机制真实性。
作者把稀疏自编码器、积分梯度归因与激活修补结合起来,追踪ESM-2 650M进行零样本突变效应预测时真正介导输出的潜在特征。分析覆盖DNAJA1 J结构域的67个突变,并利用深度突变扫描作为外部参照。
按间接效应选择的稀疏电路比按激活幅度选择更高效地恢复模型预测,也给出更具生物意义的解释;相关替换会复用部分电路,共享特征常对应与突变位点三维接触的残基。该工作是未经同行评审的bioRxiv预印本;结论目前来自单一结构域和有限突变集合,因果特征是否可跨蛋白、模型规模与任务复现仍需检验。
该框架把预训练蛋白序列嵌入与自监督学习得到的三维冷冻电镜密度编码器对齐到同一个潜在空间,从而支持“序列找密度图”和“密度图找序列”的双向检索。目标是绕开配对数据有限、分辨率不一和多构象带来的跨模态匹配困难。
作者在3275张冷冻电镜图组成的数据库中报告双向检索的中位排名为2至3,并展示了跨分辨率及人—鼠保守结构检索。该工作是未经同行评审的bioRxiv预印本;结果证明共享表征具有检索潜力,但数据库规模、候选同源性与划分方式都可能影响排名,距离未知样本的常规结构注释仍需更广泛外部评测。
scMaize把来自20个项目、66个样本和7类组织的385675个细胞整合为玉米单细胞图谱,并据此预训练两个Transformer模型:仅使用表达信息的scMaizeExp,以及把Gene Ontology功能嵌入作为归纳偏置的scMaizeGO。
作者报告GO先验改善了排序预测、功能一致基因模块的注意力和嵌入拓扑,并在零样本和少样本跨物种评测中表现出可迁移性;模型还编码了根部处理相关状态。该工作是未经同行评审的bioRxiv v2预印本;其贡献同时来自图谱整合与模型设计,跨物种泛化和扰动解释仍需在独立作物数据上验证。
scRep不重建被遮蔽的原始基因表达,而是用动量更新的教师—学生架构,在细胞与基因两个层面对同一细胞的不同扰动视图进行潜空间自蒸馏。设计意图是让表征对单细胞RNA测序中的稀疏、漏检和技术波动保持稳定。
作者报告,约280万个细胞上预训练的紧凑模型在其冻结表征基准中取得最强综合表现,扩展到3072万个细胞后仍有效;减少冗余并提高细胞类型覆盖有时可匹配更大但不均衡的训练集。该工作是未经同行评审的bioRxiv预印本;这些结论依赖作者选定的基准和数据构成,尚需独立复现来区分训练目标、数据多样性与规模各自的贡献。