Issue 32 · 2026-07-20 · AI × Biology
基因组学已悄然进入一个新阶段:AI agent 能够根据自然语言指令,自主发现、配置、执行并串联生物信息学操作。本文将这一范式命名为 "agentic genomics"——把多步骤基因组分析委托给自主软件 agent,由大语言模型驱动、受限于领域专用技能库,agent 根据中间结果自主选择工具、管理依赖并调整执行策略。
核心论点:agentic genomics 并未简化流程构建,而是把计算生物学的瓶颈从"搭建流程"转移到了"验证结果"。作者系统梳理了 CellAtria、AutoBA、Bio-Copilot、ClawBio 等新兴系统的架构分歧,提出覆盖研究级、基准级、临床级三层的验证框架,并主张公平性设计必须是系统硬性要求,而非可选附加项——为让 agentic genomics 真正可信,指明了所需的基础设施。
工程质粒散布在成千上万个实验室里,彼此之间几乎没有统一的设计语言可言。PlasmidGPT 是在 Addgene 的 153,208 条工程质粒序列上预训练的生成式语言模型,学到的序列嵌入足够丰富,能够可视化跨实验室的研究主题、分析不同载体类型间的质粒多样性。
这些嵌入直接派上用场:在工程质粒的来源实验室预测任务上达到 SOTA;表征还能泛化到天然质粒,实现门、属两级的宿主分类学预测。在生成侧,PlasmidGPT 支持用种子序列或明确设计约束来引导生成,产出的新质粒序列能复现真实质粒的元件共现模式与共线性结构——不是看起来像 DNA 的字符串,而是结构上自洽的设计。
现有单细胞基础模型大多脱胎于语言模型,把每个细胞表示为基因 token 序列——这会丢失基因间的关系,往往也丢失表达量的大小信息。scVision 反其道而行之,把每个细胞渲染成一张连续图像:用最优传输把基因固定映射到一张跨组织共享的布局上,让共表达基因在空间上相邻,转录组由此变成一张基因程序呈现为局部纹理的图片。
在 7200 万人类细胞上用掩码图像建模预训练一个视觉 Transformer,冻结编码器直接用、不做任何微调。在 6 个独立留出研究上做零样本评测,scVision 是最准确的细胞类型标注器,且能无监督恢复基因程序,领先现有基础模型和经典基线;多研究整合任务上与最强的 token 式模型持平,且从未见过批次标签也能保留最多生物学结构。把基因布局打乱、网络保持不变,准确率的下降幅度超过移除视觉 Transformer 本身——证明真正携带信号的是有生物学意义的空间位置,而非网络架构本身。
蛋白质的配体结合、别构调控、催化都依赖跨多个空间与时间尺度的协同运动,但分子动力学(MD)模拟要获取长时间尺度的构象变化,计算成本高到难以在多样体系上系统探索。DyneTrion 是一个生成式蛋白质动力学模拟器,用三重注意力架构在单一框架内同时强制几何对称性、结构一致性与时间连贯性:不变点注意力(IPA)保证 SE(3) 稳健的几何更新,锚定参考构象的空间注意力维持结构完整性,时间注意力建模跨时间帧的关联演化。
在 100 纳秒 MD 轨迹基准上,DyneTrion 复现了 MD 推导的柔性、系综分布与相互作用可观测量,外推时仍保持立体化学有效性。团队还构建了 dynamicPDB 数据集(超万个蛋白质,最长 1 微秒全原子轨迹,10 皮秒分辨率)用于评估长时间尺度泛化能力——在微秒级轨迹上,DyneTrion 保留自由能景观与亚稳态布居,并支持 apo-to-holo 转变、快速折叠蛋白等大幅构象传播,为从静态结构预测走向时间分辨、系综保真的蛋白质建模提供了可扩展路径。
生物医学知识更新极快,但多数疾病中心知识图谱一经发布便不再更新。PrimeKG-Plus 把 PrimeKG 原有的 20 个数据源全部更新到 2025 年 12 月的最新版本,并新增 OpenTargets、RepurposeDrugs、nSIDES 等资源,再用大语言模型辅助的文献抽取流程,从 637 篇 PubMed 摘要与 PMC 全文中抽取新增关系,经归一化、UMLS 同义词映射、SapBERT 嵌入相似度排序与人工专家审核层层把关。
此次文献驱动扩展聚焦 Canavan 病、C 型尼曼-匹克病、泰-萨克斯病、Batten 病等罕见神经系统疾病。网络拓扑分析显示,扩展后的图谱改善了 3-6 跳的间接药物-疾病连接性,新增 447,288 条此前无法触达的药物-蛋白-疾病路径;时间维度的 FDA 验证捕获了原始 PrimeKG 数据截止(2021年6月)之后新出现的 55 个分子实体作为药物节点,其中 46 个是原图谱完全没有的——为基于网络的药物再利用与精准医学应用提供了一张真正"跟得上时代"的知识图谱。
识别活细胞中的 G-四链体(G4)等非常规(non-B)DNA 结构一直在推进,但受限于短读长测序技术固有的低分辨率、低特异性和 GC 偏好性。本文用 Oxford Nanopore(ONT)长读长测序结合钾高锰酸盐(优先氧化单链 DNA)处理,检测体外已知形成 G4 的寡核苷酸以及活细胞 DNA 中的 G4 结构,发现 G4 motif 的测序错误谱系与其原始结构状态直接相关。
在原始 ONT 测序电流数据上应用机器学习算法(逻辑回归、随机森林、XGBoost、一维卷积神经网络),能以约 90% 准确率判断某条测序读段来自 G4 构象还是 B 构象。团队进一步证明,高锰酸盐修饰后的 DNA 可直接被 ONT 测序,对读长、产量与比对准确率影响极小——在足够测序深度下,这套方法能在细胞内直接区分 B 折叠区域与单链区域,且单链 DNA 频繁出现在多种非 B DNA 结构中。