BioTender / 论文速递

Issue 52 · 2026-09-07 · AI × Biology

从合成原生分子生成,
到生物科研 Agent

今日速递6 篇3 方向bioRxiv 6
Z. Qin · Y. Li · Y. Zhang et al.bioRxiv 预印本 · 2026.09.06

OmniSyn以蛋白序列为条件,用混合专家语言模型同时处理从头配体生成、合成可行性和先导化合物优化。它把任务条件交互模块与“合成动作”解码器结合,使模型在生成分子时一并给出合成轨迹,而不是先生成再过滤。

作者报告其在MolGenBench未见靶点上优于比较模型,AiZynthFinder评估的逆合成成功率在从头生成和先导优化中分别为68.47%与71.92%;随后扩展至超过21000个人类蛋白靶点,生成27亿个候选。该工作是未经同行评审的bioRxiv预印本;这些结果主要来自计算基准和逆合成软件评估,尚未证明候选可实际合成、结合目标或具有细胞活性。

A. Fang · M. Desgagné · M. Zhang et al.bioRxiv 预印本 · v4 · 2026.09.07

ATOMICA不以单个分子为中心,而是在蛋白、小分子、金属离子和核酸之间的界面上学习几何表征。模型在2037972个相互作用复合物上进行自监督预训练,产生原子、分子构件与完整界面三个层级的嵌入。

作者展示了序列恢复、非共价作用残基零样本排序、RNA及蛋白口袋—配体分类,并为暗蛋白质组中的2646个口袋提出离子或辅因子候选;其中5个血红素候选出现与结合一致的Soret带变化。该工作是未经同行评审的bioRxiv v4预印本;有限实验支持其产生可测试假设,但不能外推为大规模配体注释已获得验证。

M. Zhang · W. Gu · B. Han et al.bioRxiv 预印本 · 2026.09.06

PromptBio通过多Agent执行框架PromptGenie,把自然语言研究问题转成可检查的计划,执行分析,并根据中间证据调整后续步骤。平台强调保留人工监督、全过程记录和可复用工作流,同时支持已验证方法、自定义分析及外部流程。

作者以端到端生物信息学任务、生物医学深度研究、组学与机器学习技能,以及调控基因组学案例进行评估,并报告相较对照Agent具有更高分析准确性和更强证据检索综合能力。该工作是未经同行评审的bioRxiv预印本;摘要未交代对照模型、样本量和失败率,平台的通用可靠性仍需独立、可复现的任务级审计。

I. Passeri · S. Pety · M. Giovannini · M. Fondi · A. Mengoni · E. PerrinbioRxiv 预印本 · 2026.09.06

MErlin把细菌甲基组分析所需的修饰碱基、基因组注释、甲基转移酶基因型、转录丰度、复制臂位置和染色体构象等数据整合为17个可组合模块,可从modBAM文件生成基因级证据和HTML报告。

工具既作为Python包发布,也封装为Claude Agent Skill;自然语言只负责选择和调用经过审计的固定操作,技能中明确写入预检、必须由人回答的问题、研究设计约束和解释规则。该工作是未经同行评审的bioRxiv预印本;作者用含已知真值的合成数据和一个真实细菌案例演示,但尚未系统比较Agent接口相对传统流程的错误率与效率收益。

M. Nieuwoudt · M. Reverenna · D. Patel et al.bioRxiv 预印本 · 2026.09.07

InstaNovo-FM是面向串联质谱的自监督蛋白质组基础模型,以带物理约束的遮蔽重建目标训练编码器式Transformer。作者汇集14.7亿张MS/MS谱图和1.846亿条高置信注释,并在注释层上完成预训练。

作者报告模型嵌入在不依赖肽标签时编码碎裂方式、序列属性和翻译后修饰,并可迁移到从头肽测序、无数据库鉴定和分析批次分类。该工作是未经同行评审的bioRxiv预印本;规模很大不等于跨仪器和实验室稳健,摘要也未提供具体下游增益,仍需查看数据去重、污染控制及外部盲测。

T. Phongwattana · J. H. ChanbioRxiv 预印本 · 2026.09.07

作者对自己的代谢反应图注意力模型MetaGNN进行复盘,发现接近满分的结果由两类失效造成:部分标签是输入表达矩阵的确定性阈值,另一部分标签来自可复现随机向量,按患者划分仍让模型记住患者无关的标签模式;此外,归档模型实际收到的患者特征全为零。

在重建并验证特征后,AUROC降至0.5800,低于原始表达基线0.6342;跨METABRIC和CPTAC-BRCA的零样本结果接近或低于随机,作者因此撤回旧稿中归因于关系边的0.105增益并公开检查脚本。该工作是未经同行评审的bioRxiv预印本;它不是新模型性能突破,而是一份罕见的负结果和基准卫生案例,提醒代谢建模尤其要检查标签来源、特征流与拆分单位。