Issue 46 · 2026-09-01 · AI × Biology
ProtMonomer从多序列比对深度影响模型泛化这一观察出发,把代表不同进化信息水平的MSA深度分布混合到训练中。目标不仅是提高常规单体结构预测,还包括低同源蛋白、孤儿蛋白、短肽及构象切换蛋白等困难情形。
作者报告,ProtMonomer在CASP15、非冗余实验结构、孤儿蛋白和短肽基准上达到或超过所比较的AlphaFold2与AlphaFold3,并在折叠切换蛋白的替代构象恢复中表现更好,同时降低推理成本。该工作是未经同行评审的bioRxiv预印本;结论仍取决于基准划分、模板与同源信息控制,尚需独立复现验证其对真正未见折叠和多状态体系的泛化。
Vipsania面向缺少高质量注释和转录组证据的真核基因组,在深度序列模型中嵌入可微分隐马尔可夫层,让模型仅从未注释的目标基因组学习蛋白编码基因结构。模型先进行跨真核预训练,再在目标物种上无监督微调,并支持非标准遗传密码。
作者称其在多数所测真核分支上的平均准确度高于监督式方法,并减轻模型面对远缘物种时的性能下降。该工作是未经同行评审的bioRxiv预印本;“首个无监督深度基因识别器”及跨分支优势均为作者主张,实际适用范围仍需在独立基因组、不同组装质量和复杂转录本结构上验证。
C-PLANK不再只依赖体外亲和力数据,而是从活细胞中的全功能化片段化学蛋白质组学学习配体—蛋白相互作用。框架结合理化嵌入、双线性注意力和细胞相互作用状态指数,试图同时表示全局细胞情境与局部残基—原子联系,并输出可解释的相互作用指纹。
作者在来自8项研究的431个配体互作组上报告了随机和冷蛋白设置下的性能优势,且预测与口袋、共晶结构及细胞结合位点证据相符;进一步筛到的候选被推进为具有细胞活性的SIRT3激动剂化学探针。该工作是未经同行评审的bioRxiv预印本;单个发现案例尚不足以证明普适的细胞数字孪生能力,数据泄漏控制和前瞻性复现仍是关键。
PhageTransformer针对大量环境噬菌体序列缺少宿主信息的问题,用深度学习从基因组序列进行宿主分配。设计重点包括扩大可预测宿主范围、降低把非病毒序列误判为噬菌体宿主关联的风险,并缓解现有工具在速度和准确度之间的权衡。
作者在来自GenBank和公共Hi-C数据的3,881对独立噬菌体—宿主关系上比较现有工具,报告该模型以更低运行时间获得有竞争力或更高的预测准确度。该工作是未经同行评审的bioRxiv预印本;公共数据库的宿主标签、物种分布与序列近缘性可能影响评测,预测结果仍不能替代培养、感染或可靠邻近实验。
S2F-Agent把分散的序列到功能模型封装为带执行约束的“Skills”,再用面向生物学目标的“Playbooks”编排,让自由文本问题被转换成可检查的模型调用、结果解释和证据边界。框架保留人在回路,并以契约式接口降低通用LLM误用专用模型的风险。
作者在源自已发表流程的54个查询案例中报告其路由、依据性和端到端执行可靠性优于通用LLM,并展示了基础模型适配、变异解释、GWAS规模功能分析和个人基因组分析。该工作是未经同行评审的bioRxiv预印本,本次为v2更新;案例规模有限,个人基因组输出也被明确限定为证据分级的研究假设,而非临床结论。
这项工作用“审计式vibe coding”重新分析公开泛癌蛋白质组图谱:一个LLM在研究者指导下编写并执行分析,另一个模型家族审查代码、输出与结论,问题被回传修正并形成7个版本。它把模型生成代码视为不可信产物,通过交叉模型批评和可执行检查提高可审阅性。
作者观察到肿瘤蛋白质组与胎儿样程序存在部分趋同,同时披露审计发现的共同掩码、缺失值和重采样问题及其对结果的影响。该工作是未经同行评审的bioRxiv预印本;作者明确将生物学结果界定为待独立重复的候选发现,并强调这只是单一可行性案例,不应被解读为LLM科研可靠性的系统基准。