Issue 43 · 2026-08-28 · AI × Biology
RegimeFormer试图为蛋白质在突变下的响应建立全局表示,而不只预测单个变体的适应度。配套的RegimeAtlas整合并索引超过2亿条非冗余蛋白序列,再在保留多样性的百万蛋白子集上生成残基级脆弱性、适应性与不确定性摘要。
作者报告,按蛋白扰动“状态”进行条件化,尤其能改善未见蛋白、未见家族和低同源场景下的替换效应预测,并可为转录组与药物响应模型提供分子先验。论文是未经同行评审的arXiv预印本;大规模计算图谱的覆盖度很高,但预测状态是否对应可重复的生物机制,仍需更多独立实验检验。
这项工作用蛋白Cα骨架的局部几何描述符,为ESM-2稀疏自编码器中的潜在特征做残基级自动注释。与依赖数据库标签或让LLM解释高激活序列不同,它直接检查SAE特征是否对应可测量的局部结构形状。
受控发现分析显示,许多SAE特征与局部几何显著相关;几何信息还能区分共享同一数据库注释的不同特征,并帮助理解未注释的宏基因组蛋白序列。论文是未经同行评审的arXiv预印本;接触图消融提供了功能关联线索,但尚不能把每个潜在特征都解释为独立、因果的结构概念。
GRAS面向离散扩散模型的推理期奖励引导:在不重新训练生成器的前提下,降低梯度提议的估计方差,并根据每个去噪步骤中的奖励分布自适应调整粒子重采样温度。方法同时覆盖可微与不可微奖励,且不增加去噪器调用次数。
作者在调控DNA和蛋白设计任务上报告,GRAS优于所比较的免训练引导方法,并达到或超过一个经过奖励微调的模型。论文是未经同行评审的arXiv预印本;目前证据来自计算奖励与基准,生成序列的结构、表达和功能仍需湿实验验证。
PathoMIC把抗菌肽活性预测从“肽是否有效”推进到特定肽—病原体组合的定量MIC建模。数据集汇总74,751条实验MIC记录,覆盖424种病原体,并整合序列、标准化活性、病原体描述与分类学关系,用于少样本和零样本跨物种评测。
知识增强框架在低资源病原体上获得明显改进,但对完全未见物种的提升仍有限,直接暴露了跨物种泛化的难度。论文是未经同行评审的arXiv预印本;数据标准化和切分为后续虚拟筛选提供了公共基础,但模型排序仍不能替代病原体特异的实验测定。
Google团队把Gemini Co-Scientist从假设生成扩展到实验与论文产出的闭环工作流,覆盖材料、生物和计算机科学。在生物案例中,系统从稀疏成像数据预测工程化大肠杆菌在不同诱导剂浓度下的群集表型,并与未公开的湿实验形态测量进行定量比较。
论文还加入可靠性模块,并通过30位专家、450次双盲评审检查端到端生成论文的幻觉、抄袭与安全性。它是未经同行评审的arXiv预印本;案例显示系统可以进入真实实验流程,但任务由团队选择并有专门基础设施支持,尚不能等同于通用自主科学发现能力。
GITIII-scale是一套可解释的泛癌空间转录组基础模型,把配对的单细胞RNA测序与成像空间转录组结合起来,学习细胞状态、空间邻域和配体—受体信号之间的关系。模型用分层图Transformer显式分解邻近发送细胞对接收细胞各基因的影响。
作者报告,模型在训练中未见癌种上更准确地恢复与微环境相关的细胞状态变化,并在一个乳腺癌案例中提出与内皮过度生长和肿瘤发生相关的潜在可药靶通路。论文是未经同行评审的arXiv预印本;这些通路属于模型解释与案例发现,仍需独立数据和功能实验验证。